Problem
傳統在線蒸餾(OPD)高度依賴預訓練的特定任務教師模型,這不僅產生龐大的運算成本,且教師與學生模型間的分佈差異常導致生成路徑中的誤差累積,限制了流匹配模型(Flow Matching Models)的對齊效率與品質。
Method
研究團隊開發了 Self-OPD 框架,利用學生模型的自我探索產生步進式監督信號。系統在每個時間步將預測狀態分支為多個隨機 SDE 候選路徑,並與確定性自參考基準比較以計算優勢值(Advantage)。接著透過「推拉機制」優化速度場,使高優勢分支吸引學生模型,低優勢分支則予以排斥,並結合方向感知衰減與變異數歸一化來穩定訓練。
Results
在單一及混合獎勵的基準測試中,Self-OPD 在不需特定任務教師模型的情況下,表現優於現有的強化學習(RL)與 OPD 方法。此外,該方法在多目標對齊任務中能有效融合多個獎勵評分,成功避免了直接的梯度衝突問題。
Significance
這項研究證明了流匹配模型可在無教師引導下實現高效對齊,顯著降低了開發專用教師模型的門檻。這為複雜的多目標生成任務提供了一種更低成本、更穩健且具擴展性的訓練範式,對生成式人工智慧的對齊技術具有重要貢獻。