Problem
自我演進的大型語言模型(LLM)代理程式在學習過程中面臨兩大挑戰:首先,隨互動歷史增長的軌跡索引效用(Utility)會稀釋有限的反饋信號,導致學習效率低下;其次,由於獎勵往往被錯誤地分配給共同檢索到的無關記憶,導致代理程式陷入「記憶獎勵陷阱」,累積誤導性的經驗更新。
Method
研究團隊開發了「降階記憶強化學習」(RoMeRL),將持續增長的記憶空間簡化為固定維度的任務記憶狀態。該方法結合結果極性與記憶動態進行分解,透過一組固定的語義座標來更新或替換內容。這種降階參數化設計能將反饋集中在有限的空間內,從理論上增加每個座標獲得的平均反饋,並減少錯誤座標的佔用。
Results
在 ALFWorld 與 LifelongAgentBench 的實驗顯示,RoMeRL 成功將冷啟動效用(Cold-Q)比例降低 80.0%,反饋密度提升約 6 倍。此外,記憶維護體積減少了 84.4%,LLM 呼叫次數也精簡了 21.1%,在顯著提升任務執行表現的同時降低了運算成本。
Significance
此研究為自適應代理程式提供了高效的記憶管理方案,證明透過降階效用狀態不僅能提升學習效率,更能有效防止持久性的獎勵污染。這對於開發具備長期演進能力且需在有限資源下運作的 AI 代理程式具有高度的實務與理論價值。