Problem
在大型語言模型的強化學習(RLVR)中,傳統標量獎勵通常僅針對完整路徑給予評價,導致回饋訊號稀疏且難以精確進行 Token 等級的權重分配。既有的自我蒸餾方法雖然試圖提供更密集的監督,但往往面臨資訊洩漏、優化過程不穩定,或在推理失敗時無法提供明確修正方向等挑戰。
Method
H^2SD 採用「混合事後自我蒸餾」策略,根據路徑正確性採取差異化處理。對於成功的路徑,教師模型結合改寫指令,利用其機率分佈調節更新幅度而不改變梯度方向;對於失敗的路徑,則引導教師模型參考關鍵提示與正確答案,並透過最小化逆向 KL 散度,指引學生模型明確的修正方向。
Results
在多項具挑戰性的數學推理與程式碼生成基準測試中,H^2SD 的表現一致優於現有的 RLVR、OPSD 與 RLSD 等基基準模型。實驗數據顯示,該框架不僅在推理準確度上有顯著提升,更在優化穩定性與生成效率方面展現出強大優勢。
Significance
這項研究為強化學習中的權重分配問題提供了創新的解決方案。透過巧妙的自我蒸餾機制,H^2SD 克服了傳統方法在失敗案例中缺乏引導的弊端,顯著強化了語言模型處理複雜推理任務的學習效能,對於提升模型智慧具有高度的學術與實務價值。