Problem

電腦操作代理人的訓練長期受限於靜態且淺層的合成環境,這類環境難以模擬真實世界中具備登入機制、狀態保存及複雜互動邏輯的應用程式。由於缺乏行為深度,模型在處理真實網站時往往表現不佳,且環境生成的瓶頸已從數量轉移至其內容的質量與互動性。

Method

開發 Echoverse 系統,將規格說明編譯為具備狀態的應用程式,並建立「協同演化循環」(Co-evolution Loop)。此機制會重複讀取每次任務評分結果:一方面作為環境、任務與驗證器的修復依據,另一方面則作為模型的訓練訊號,讓環境與模型同步成長。

Results

在 12 個此類環境訓練後,一個 9B 參數的模型在 14 個測試集的成功率從 36.5% 大幅提升至 67.1%,表現逼近大型前瞻模型。實驗證實,深層環境能有效提升真實網站的操作準確率,且僅透過修復單一環境就能將模型性能從 16.2% 提升至 38.5%。

Significance

該研究證明了環境的行為深度與動態修復對於規模化訓練代理人的重要性。透過開放 Echoverse 基準測試與程式碼,為開發能處理複雜 UI 互動的中小型高效能模型提供了新的路徑,減少對昂貴封閉模型的依賴。