Problem

目前的自動代理人(Autonomous Agents)評估多侷限於靜態的任務解決能力,無法有效衡量模型「自我優化運行框架(Harness)」的潛力。現有測試難以將框架改進與基礎模型本身的強度分離,且容易產生特定任務的過度擬合,無法捕捉長期且迭代的自主研發過程。

Method

研究團隊開發了 Evo-Bench 基準測試,涵蓋搜尋、辦公及通用三大代理人領域。該測試採用創新的「框架引導建構」技術,透過輔助任務演化來識別對架構改進高度敏感的任務,並結合敏感度感知分層分割,確保生成的基準測試具有強大的跨套件類化與強健性。

Results

評測顯示頂尖模型透過自主演化可獲得高達 16.6 分的顯著進步,水準已逼近人工設計的基準線。雖然模型在通用與搜尋任務表現優異,但在需要特定工作流的辦公任務中仍面臨挑戰。此外,分析發現演化出的框架具有高度遷移性,能有效提升不同策略模型的推理效能。

Significance

本研究為代理人自主研究(Autonomous Research)領域提供了關鍵的量化指標,證明 LLM 不僅能執行任務,還具備優化自身執行環境的能力。這為未來開發具備自我迭代與長期演化能力的通用人工智慧(AGI)鋪平了道路。