Problem
現有的大型語言模型(LLM)代理人技能優化方法高度依賴昂貴的執行評估與大量任務資料,導致在實際應用中,難以在有限的預算與數據下,快速且有效地提升代理人處理複雜任務的專業技能。
Method
提出的 COBRA-Skills 框架將技能優化定義為受限預算下的動態循序優化問題。該架構結合了脈絡多臂老虎機(Contextual Bandit)技術來排定候選技能的優先權,並運用執行回饋進行「證據導向」的技能進化。透過選擇性地將評估資源分配給最具潛力或資訊價值的候選技能,該框架能持續精煉技能群體。
Results
在六項異質代理人基準測試與三種目標模型的實驗中,COBRA-Skills 均展現出最強的平均性能。與現有的 SkillOpt 相比,它減少了 55% 至 58% 的優化成本,且每個基準測試僅需 50 個不重複的範例。此外,該系統對於代理人架構的變動具有強健性,並能有效利用目標模型本身進行技能的生成與精煉。
Significance
此研究解決了 LLM 代理人技能優化中高昂成本與數據依賴的瓶頸。透過高效的資源分配機制,證明了在極少量的資料下也能大幅提升代理人的執行效率與準確度,為開發更具擴展性且經濟的自動化智慧代理人系統開闢了新路徑。