Problem

訓練大語言模型代理人處理長程工具調用時,通常高度依賴建置成本高昂的真實環境,或難以精確對齊的外部模擬器。這種對外部環境的依賴性,成為了擴展代理人訓練規模與提升複雜任務處理能力的瓶頸。

Method

提出名為 EnvACE 的強化學習方法,引入「世界演練」(World Rehearsal)機制取代外部環境互動。模型在訓練中交替扮演代理人與環境角色:先生成工具呼叫指令,隨即自行模擬產出對應的環境回饋,並依此進行後續決策。代理人策略與內化的環境反應皆透過任務成功獎勵進行端到端同步優化,將動作與環境反應的關聯直接內化至模型參數中。

Results

在 BFCL-v4、tau^2-Bench 及 FinMCP-Bench 等多項基準測試中,EnvACE 的表現顯著優於透過擴展環境數據訓練的基準模型。受控實驗顯示,世界演練能一致地提升不同規模模型的學習成效。此外,在推論階段,內化的世界模型支援「私有演練」,在無需額外外部互動下能顯著提升決策準確度。

Significance

本研究為大語言模型代理人的訓練開闢了新路徑,證明代理人可以透過自我演練來學習複雜的環境邏輯。這有效解決了外部環境建置成本與接軌難題,為實現更具自主性、且能脫離昂貴模擬環境限制的代理人技術奠定了基礎。