Problem
目前大型語言模型(LLM)的自我進化研究多半依賴人類預設的具體任務與評估指標,將進化過程簡化為對明確目標的優化。然而,真實的人類學習往往始於如「提升研究能力」等模糊目標,模型目前缺乏自主解釋目標、識別能力差距並定義學習路徑的能力。
Method
研究團隊開發了 ASPIRE 基準測試環境,僅提供模糊的能力目標,而隱藏下游的評估任務。Agent 必須自行操作化這些目標,包含選擇資料、決定更新方法、建構訓練與驗證訊號。此環境統一支援了模型權重(weight-level)與 Agent 工具鏈(harness-level)的進化,並透過 520 個專家撰寫的隱藏項目進行成效檢驗。
Results
實驗發現,Agent 雖能完成訓練循環,但模型權重的提升極其稀少且不穩定,最強的進化結果仍遜於人工設計的 Qwen-Agent。模型經常在不匹配的資料上訓練,並過度信任狹隘的自我評估結果,導致局部進步無法轉化為實質能力,甚至因持續搜尋與訓練而抹除早期的改進。
Significance
這項研究將自我進化的定義從單純的「目標優化」推向了「自主學習」,揭示了當前 AI 在缺乏明確指引時,於目標詮釋與自我評估上的重大缺陷。這為未來開發能真正如人類般自主成長的通用人工智慧(AGI)提供了關鍵的基準與反思。