Problem

AI 科學家在自動生成研究計畫時,面臨缺乏客觀驗證環境的困境。現有的強化學習(RL)方法多仰賴從論文中提取的評分準則(Rubric)作為批評者(Critic),但因問題與評分標準往往源自相同內容,導致模型易透過簡單的文字改寫來獲取獎勵,產生嚴重的「準則洩漏」與獎勵入侵問題。

Method

提出 PaperGym 統一框架,將每篇學術論文轉化為完整的訓練環境。該框架利用論文的結構特性:從研究目標與背景合成問題,並從方法與實驗中提煉評分準則,將準則洩漏率從過往的 11.9%–34.1% 降至 3.7%。訓練過程分為兩階段,先將準則作為 OPSD 自我教學的特權上下文,再將其作為 GRPO 的獎勵訊號。

Results

在 Qwen3 系列模型(1.7B/4B/8B)的實驗中,此訓練模式在五項基準測試的平均表現提升了 4.8 至 5.6 分,優於監督式微調(SFT)。採用 PaperGym-20k 訓練的模型在三方對比中勝率達 58.1%,遠超 RubricHub。其中 Qwen3-8B 在 ResearchQA 上的得分達 73.48,超越了規模更大的 Kimi K2.6。

Significance

本研究不僅釋出了包含 20,000 個實例的語料庫與創新/設計基準測試,更為 AI 自主研發(AI for Science)提供了更可靠的評估與訓練範式,解決了研究計畫生成中難以驗證與獎勵機制偏誤的關鍵瓶頸。