Problem
在開放式的真實世界互動中,模型常有許多合法的行為路徑(如直接回答、詢問細節或提供進度更新)。然而,現有的強化學習(RL)機制假設所有被比較的行為都具備可比性,導致獎勵模型偏好特定的互動風格,而非根據情境選擇最合適的行為。這種「獎勵公平性」問題會扭曲優勢函數,引導模型產出偏向高分風格但未必適當的行為。
Method
研究團隊開發了 ARC(透過制約進行優勢正規化)訓練方案,透過「策略制約的 rollout 分組」來恢復公平的相對比較,並整合混合獎勵與熵正規化。同時提出了全新的 Inter 互動範式,將使用者可見的溝通與潛在的推理、工具調用解耦,並釋出包含 8.6 萬筆具備策略標註的 Inter-86K 訓練語料庫。
Results
實驗結果顯示,ARC 顯著增強了 τ/τ² 工具調用基準測試的表現。此外,相對於傳統的思考型基準模型,Inter 範式將首字產出時間(Time-to-first-token)從 4.91 秒大幅降低至 1.27 秒,並在維持行為多樣性的同時確保了更高的執行效率。
Significance
這項研究指出了開放式互動學習的核心瓶頸:關鍵不僅在於如何給予獎勵,更在於代理人的行為是否能在公平的基礎上進行比較。透過解決獎勵偏差與提升反應速度,此成果為建構具備執行感知能力、可靈活引導且反應敏捷的真實世界 AI 代理人奠定了重要基礎。