Problem
同策強化學習配合可驗證獎勵(RLVR)雖能有效提升特定目標的表現,卻常導致模型在其他潛在目標上的成功行為變得極難被採樣。這種現象稱為「驗證器誘導的支援重塑」,它使得模型在追求當前獎勵時,犧牲了維持未來可訓練性所需的有效行為空間。
Method
研究團隊針對數學推理與指令遵循任務,在 Qwen3 等模型家族上進行反覆的驗證器評分採樣與雙向序列訓練。分析方法包含權杖分布檢查、受控的開頭干預實驗(Opening Interventions),以及測試參考策略約束、路由先驗與同策蒸餾等技術對保留跨任務支援能力的效果。
Results
在 IFEval 測試中,Qwen3-8B-Base 的 pass@1 雖提升 6.5 個百分點,但 best@32 反而大幅下降 9.8 個百分點。實驗顯示 RLVR 主要是在重新排列模型既有的開頭行為,且選定的開頭會因果性地影響後續的搜尋空間。此外,現有的約束與蒸餾機制僅能部分緩解跨任務能力的流失,無法完全保證模型能同時兼顧正確性與指令遵循。
Significance
這項研究指出單純的終點指標提升,並不保證模型具備持續的可訓練性或聯合能力。在強化學習過程中,驗證器會過度窄化模型的行為分布,這提醒開發者在進行同策優化時,必須警惕當前增益可能對模型長期通用性造成的潛在負面影響。