Problem

大型語言模型通常依賴預先收集的完整推理軌跡進行後訓練,但這些軌跡往往包含過多冗餘的旁枝末節與複雜路徑。過去學界鮮少深入探討:學習這些完整的長路徑,是否真的能有效提升模型在監督式微調(SFT)中的推理能力。

Method

研究團隊首先透過先導實驗對比完整與局部軌跡的訓練效果,隨後利用注意力機制分析及受控的「標記移除」實驗,量化中間標記對最終推理品質的貢獻。此外,研究也將此發現應用於強化學習與線上策略蒸餾,驗證僅使用推理端點進行訓練的可行性。

Results

分析顯示,推理軌跡中的中間標記對最終品質貢獻極小。實驗證實即使大幅截斷軌跡,模型仍能憑藉內部知識推論出缺失的步驟。採用端點訓練不僅能產生更連貫的推理行為,還能在強化學習與蒸餾任務中帶來顯著的效能增益,證明了避免冗餘資訊的重要性。

Significance

這項研究重新定義了推理資料的處理策略,指出後訓練並不一定需要冗餘的完整紀錄。這不僅為開發更高效、精簡的推理模型提供了實證支持,也有助於降低訓練資源成本,並引導模型發展出更強大的內部邏輯推演能力。