Problem
目前的直接偏好優化(DPO)演算法預設所有訓練資料皆為可靠標籤,但現實中的偏好資料常包含反轉標籤、弱偏好或語意歧義,導致模型學習到錯誤的優化方向,損害對齊效果。
Method
提出「後驗標籤修正(PLC-DPO)」框架,將每對資料的訓練訊號動態分流為「乾淨」、「反轉」或「平手」三種情境。核心技術是將策略模型與參考模型的邊界差值作為線上校準依據,藉此主動修正監督訊號的方向與強度。
Results
在 57 個資料集與模型的測試組合中,PLC-DPO 取得了 60.5% 的平均勝率,優於次優方法的 55.5%。壓力測試與人工分歧分析顯示,此方法能穩定辨別並處理注入噪聲以及缺乏明確導向的資料對。
Significance
這項研究將偏好學習從單純的資料過濾轉向主動的監督修正,為處理不完美、具爭議性的真實訓練資料提供了一套強健的解決方案,能大幅提升大型語言模型在複雜偏好下的對齊品質。