Problem
現有的強化學習在處理開放式任務時,通常將複雜的評分準則壓縮為單一的純量獎勵值。這種做法會遺漏細緻的文字反饋,且難以區分不同特質的高品質回應,導致學習訊號過於稀疏,且模型容易產生無法真正提升品質的偏差行為。
Method
研究提出「經驗學習」(Experiential Learning, EL)框架,將 LLM 從單純的評鑑者轉型為「教練」。教練模型會將對回應的評估提煉成可轉移的「經驗知識」,並以此引導老師模型,最後透過在位脈絡蒸餾(on-policy context distillation)讓策略模型將這些知識內部化。
Results
實驗證明,EL 在多項開放式任務中的表現一致優於傳統基於準則的強化學習。該方法不僅在未見過的任務上具備更強的泛化能力,更能有效減輕模型為了追求高分而產生的「獎勵作弊」(reward hacking)現象。
Significance
這項研究確立了「經驗知識」作為一種更高頻寬、更具一般性的學習訊號。對於難以透過自動化程式驗證的複雜任務,此方法為模型後訓練階段提供了一個更精細且強健的優化方向,讓 AI 能從經驗中學習更深層的邏輯。