Problem

目前的強化學習高度仰賴可驗證的獎勵機制,這在數學或程式碼領域運作良好,但在開放式任務中卻難以取得可靠獎勵。隨著模型生成的經驗在複雜度與規模上迅速增長,傳統的人類直接監督已無法跟上模型進化的速度,成為制約推理模型進一步突破的瓶頸。

Method

研究團隊提出了雙維度演化架構:其一為「獎勵軸」,從人類判斷轉向自動驗證器;其二為「經驗軸」,從人工挑選任務演進至自我生成的課程與環境。透過 L0 到 L4 的五級階梯模型,系統性地定義了人類控制權如何逐步移交給模型,並建立涵蓋策略能力、回饋忠實度與經驗品質的三重評估體系。

Results

分析顯示,雖然自主化學習能推動模型超越人類水平,但也會引入獎勵入侵(Reward Hacking)、回饋偏移(Feedback Drift)、課程崩潰及環境錯誤等新型風險。研究並指出,建立自我持續學習系統的關鍵在於平衡自主經驗生成的質量與回饋機制的精準度。

Significance

這項研究為大規模推理模型超越人類監督提供了明確的技術路徑圖。透過結構化地梳理自我演化系統的開放性問題,不僅為實現超人工智慧奠定理論基礎,也為開發者提供了識別與緩解自主學習風險的實務指南。