Problem

目前的 AI 代理人研究多聚焦於任務產出,卻忽略了代理人對「執行基礎設施」(Agent Harness)的依賴。模型在固定參數下,執行環境的優劣會大幅影響表現,但目前缺乏評估 LLM 是否具備自主開發、迭代及優化這些基礎環境能力的標準。

Method

研究團隊開發了 HarnessDev 基準測試,將評估重點轉向「可執行的基礎設施」。測試分為兩個階段:第一是「創建」,模型需從極簡種子與少數案例出發,構建完整的執行系統;第二是「演化」,模型需根據執行回饋反饋,迭代修正其開發的環境以提升效能。測試範疇涵蓋六種大型語言模型、四大領域及五項下游基準測試。

Results

實驗發現,LLM 生成的環境在程式碼、搜尋與研究領域仍明顯落後於成熟的人工設計,但在寫作與機器學習實驗領域則能與人工參考方案媲美甚至超越。雖然自主演化能帶來效能增益,但過程極不穩定,且增益往往無法遷移到其他模型,顯示執行環境與特定模型之間存在高度耦合。

Significance

此研究將評估維度從「任務結果」提升至「系統建構能力」,揭示了 LLM 在自動化開發工具鏈上的潛力與局限性。這對於未來開發具備自我進化能力、能獨立適應複雜任務環境的自主代理人提供了關鍵的理論基礎與測試框架。