Problem
目前的同策略蒸餾(On-policy distillation)效能受限於教師模型的品質。外部教師常面臨分布不匹配(distribution mismatch)的問題,而基於特權條件的自我蒸餾則受限於模型的上下文學習能力,難以產生超越現有水準的高品質監督訊號。
Method
研究團隊提出 RISE 技術,直接從模型自身的強化學習(RLVR)訓練軌跡中建構合成教師。透過外推當前檢查點與落後錨點(trailing anchor)在參數空間或輸出邏輯空間的位移,將稀疏的結果獎勵轉換為密集的令牌級目標。此機制隨著學生模型的進步不斷更新教師,形成遞迴式的提升循環。
Results
在數學推理、多領域 STEM、程式碼生成及多輪代理任務的實驗中,RISE 的表現全面超越了單純的 RLVR 訓練與現有的同策略自我蒸餾方法。實驗證明,這種自我外推機制能有效地精煉令牌級的決策過程,並在多個複雜任務中展現強大的泛化能力。
Significance
本研究的重要性在於證明了語言模型可以不依賴外部強大模型或特權資訊,僅憑自身的訓練動態即可實現持續進化。RISE 成功將強化學習的結果回饋與蒸餾的密集監督結合,為模型自動化遞迴提升提供了一個具備高度擴展性的新範式。