Problem
傳統同策略蒸餾(On-Policy Distillation, OPD)盲目採用教師模型的所有輸出。當教師模型在特定提示詞下給出錯誤答案時,其高信心的錯誤引導會透過逆向 KL 散度使學生模型產生偏差。現有的熵或相似度等代理指標僅能評估不確定性,無法直接驗證答案正確性,導致訓練品質受限。
Method
開發 Teacher-Gated On-Policy Distillation (TGOPD) 技術。系統會先針對每個提示詞執行少量教師模型採樣並由驗證器(Verifier)評分。若教師模型表現可靠,則執行密集的 OPD 監督;若不可靠,則將該提示詞路由至基於驗證器評分(Ground-Truth)的 GRPO 強化學習演算法。
Results
在數學、程式碼及指令遵循等領域,4B 與 35B 規模的學生模型在所有單領域及多領域基準測試中均優於傳統蒸餾。此外,該技術有效利用了原本在異步蒸餾中閒置的教師算力,將教師節點的 GPU 利用率從 9.8% 巨幅提升至 78.9%。
Significance
此研究成功解決了知識蒸餾中「教師出錯」誤導學生的核心瓶頸,並透過智慧化路由機制顯著優化了大規模分佈式訓練的硬體資源配置,為開發更精準且高運算效率的大型語言模型提供了關鍵技術路徑。