Problem
現有的工具整合推理(TIR)方法多仰賴軌跡級(Trajectory-level)監督,這在長程任務中難以實現精確的獎勵分配。此外,現有的自我蒸餾技術通常使用與實際執行狀態脫節的特權資訊,且 Token 級別的監督無法有效捕捉工具互動中特有的「回合」結構。
Method
研究團隊開發了 TurnSight 框架,這是一種回合級的事後自我蒸餾方法。它直接從執行後的狀態導出監督訊號,並構建多個具備不同前瞻時界(Lookahead Horizons)的事後視角。接著,透過「跨時界方向一致性」篩選出可靠的監督訊號,並將其標準化後用於動態調節強化學習的優勢函數,同時確保不偏離原始優化方向。
Results
在三個主流基準測試上的實驗結果顯示,TurnSight 能有效優化大型語言模型的推理路徑。相較於傳統的強化學習方法,該框架展現了更強的學習效率與任務達成率,相關程式碼也已在 GitHub 上開源供社群使用。
Significance
此研究為長程工具推理提供了一套更細緻且具備執行感知能力的監督機制。藉由將事後資訊轉化為即時的回合級回饋,解決了強化學習在複雜互動中獎勵稀疏與歸因困難的問題,為提升 LLM 自動化解決問題的能力開闢了新路徑。