Problem
現有的自我提升大型語言模型(LLM)代理大多僅能優化最終答案,而非產出答案的思維流程。當前的元層級(meta-level)系統通常是固定的,若嘗試讓模型修改自身的編輯機制,往往會因為穩定性問題而必須保留部分核心邏輯,導致自我進化的「元深度」通常被限制在兩層左右,難以實現真正的深層自我優化。
Method
研究團隊開發了 Meta^n 框架,其核心在於固定元操作(Ω)並對其輸入進行遞迴處理。Ω 操作會同時讀取下方執行堆疊的軌跡與產生這些軌跡的程式碼,隨後撰寫出下一層的策略性預處理邏輯與輔助函式庫。由於 Ω 本身保持不變,系統不會因自我修改而崩潰,且隨著輸入資訊的增長,每一層都能在比前一層更高的視角進行推理。系統深度由收斂情況決定,並利用演化存檔技術搜尋最佳的層級鏈。
Results
在兩款主流模型測試中,Meta^n 在所有八個基準測試系列(benchmark families)的表現均優於過往的自我提升代理。最顯著的突破出現在專為抗記憶化設計的 ARC-AGI-2 測試,Meta^n 是目前唯一得分高於零的系統。消融實驗顯示,遞迴的增益主要來自層級間的制約與傳遞,且隨著深度增加,系統會自發演化出不同的職能分工,即便提示詞並未預設這些角色。
Significance
這項研究為 LLM 代理的自主演化提供了新路徑,證明了透過遞迴而非直接修改機制,可以穩定地突破元深度的限制。這對於開發具備高階推理能力、能自主構建複雜策略以解決陌生問題的 AI 系統具有重大意義,特別是在需要抽象思考與邏輯推演的極限挑戰任務中展現了巨大潛力。