Problem
當前大型語言模型常透過線上蒸餾(OPD)提升推理能力,但老師模型對學生生成的軌跡評分往往充滿雜訊且未必可靠。學界對 OPD 真正的進步來源,以及老師提供的監督訊號是否真的發揮作用,仍缺乏深入的定量分析與瞭解。
Method
研究團隊分析發現,學生模型對老師提供的雜訊極其不敏感,且進步核心在於抑制低對數機率(low log-probability)的標記。基於此,研究者提出「線上自我適應」(OPSA),這是一種完全無需老師監督的新方法。OPSA 利用熵自適應負優勢值(entropy-adaptive negative advantages),針對高熵位置給予更強的學習訊號,藉此有效抑制尾部標記,並將機率質量均勻重新分配給頭部標記。
Results
實驗顯示,在 AIME24 數學競賽測試中,搭載 OPSA 的 Qwen3-1.7B 模型 Avg@32 分數提升了 35.41 分,相對增長率達 263%,表現優於傳統 OPD 達 16.77 分。在三大基準測試中,其 Pass@32 表現均實現翻倍增長。此外,該方法在不同模型系列與任務中皆展現出強大的效能與泛化能力。
Significance
這項研究挑戰了「模型蒸餾必須依賴強大老師」的傳統觀念,證明模型具備無需外部監督即可自我進化的潛力。這不僅降低了訓練成本與對高品質標註資料的依賴,更為大型語言模型在強化學習框架下的自主效能優化開闢了全新路徑。