Problem
在強化學習(RL)訓練自主代理人處理長程任務時,經常面臨獎勵極度稀疏的難題。傳統上依賴監督式微調(SFT)來暖機的方法,受限於高品質訓練資料的匱乏與探索空間的侷限,導致模型難以在複雜環境中有效進化。
Method
提出「反饋豐富化環境(FEEs)」範式,將環境視為學習支架。研究建立了一套反饋設計策略,將環境從提供「動作引導」逐步轉變為「觀察增強」,並結合 GRPO、GSPO 及 DAPO 等多種強化學習算法,在 SciWorld 與 BFCL 基準測試中進行大規模驗證。
Results
實驗證明 FEEs 能顯著提升不同規模 Qwen3 模型的表現。關鍵發現包括:FEEs 透過降低熵波動來穩定訓練動態、在困難任務中促進主動的狀態空間探索,並確保環境導引能真正內化至策略權重中,而非僅作為推理時的提示詞。
Significance
這項研究為自主代理人的開發提供了新思維,證明透過調整「環境側」而非僅在「代理人側」下功夫,能有效克服長程任務的訓練障礙。此範式強化了代理人的自我進化能力,對於建構能在複雜現實場景中運作的 AI 具有高度價值。