Problem

在多輪互動環境中,學生模型的行動會不斷改變執行狀態。當學生偏離預設的參考軌跡時,傳統的特權蒸餾會提供與當前狀態無關或衝突的引導,產生「狀態與參考不匹配」的現象。這種無效的監督資訊會干擾模型的學習過程,使其難以在動態環境中維持一致的表現。

Method

開發「狀態匹配路由與脈絡化自蒸餾」(SMRC-SD)技術。該方法在每一輪互動中,會先判定學生目前的執行狀態是否能與成功軌跡中的狀態對應(State-Matched Routing),僅在匹配成功時才執行蒸餾。接著,系統會利用成功軌跡中的資訊為老師模型建立動態脈絡(Contextualized Self-Distillation),確保所提供的指導與學生實際到達的狀態高度相容。

Results

實驗證明 SMRC-SD 在 ALFWorld 與 WebShop 基準測試中均優於傳統的全路徑蒸餾。使用 Qwen3-1.7B 模型時,其在 ALFWorld 的任務成功率從 0.746 提升至 0.865,而在 WebShop 則從 0.574 增加至 0.693。消融實驗進一步證實,選擇性地篩選學習時機與構建狀態脈絡是提升性能的關鍵因素。

Significance

此研究為自主代理人的訓練提供了一套更精密且高效的指導機制,成功解決了互動式學習中長期存在的指導失調問題。透過精確過濾無效引導並強化狀態相關性,SMRC-SD 顯著增強了模型在複雜、多變的虛擬與網頁環境中的任務執行能力。