Problem

過去普遍認為參數規模在 70M 至 500M 之間的小型語言模型(SLM)進行近端策略優化(PPO)時極度不穩定,且容易訓練失敗。然而,學界對其背後的具體失效機制缺乏系統性研究,導致難以針對小型模型進行有效的偏好對齊。

Method

研究團隊識別出三種關鍵失效模式:標準 PEFT 管線中的 LoRA 參數凍結、bfloat16 的數值溢位,以及獎勵模型誤差引發的策略崩潰。針對這些問題,提出了「合併並重新初始化適配器」技術、PPO 更新時採用 float32 精確度,以及由獎勵白化、重要性比率守衛與權重回滾組成的三層安全機制,並提出「容量餘裕假設」。

Results

實驗結果顯示,該系統在所有測試配置中均能穩定收斂。在模型具備基礎流暢度且獎勵信號明確的條件下,SLM 的偏好勝率顯著超越 SFT 基準模型。此外,該方法在僅需極少量訓練資料的情況下,表現便能超越經過指令微調的強大基準模型。

Significance

此研究打破了「強化學習效果取決於模型參數大小」的迷思,證實 SLM 的訓練穩定性主要取決於模型流暢度與獎勵品質。這為資源受限環境下的邊緣運算與小型模型對齊技術提供了標準化的操作流程與關鍵技術路徑。