Problem
生成專業學術評論與答辯需要深度的領域推理與事實依據,但現有模型常面臨主觀偏誤或引用虛構(幻覺)的問題,缺乏客觀且嚴謹的自動化評估與優化機制。
Method
開發 InternReviewer 與 InternAdvocate 代理人,整合大規模高質量學術資料集與 arXiv 檢索工具。採用代理強化學習(Agentic RL),並設計一套多維度的客觀度量指標與獎勵系統,透過引用驗證機制比對即時互動紀錄,確保內容符合結構規範並消除幻覺。
Results
實驗證實,在此閉環框架下訓練的代理人,不論是在推理深度還是引用準確性上,皆較傳統模型有顯著提升,能有效產出高品質且具事實根據的學術文本。
Significance
本研究為學術領域的 AI 代理人開發提供了嚴謹的評估與訓練範式,透過客觀指標取代主觀判斷,對於提升學術自動化系統的可靠性與專業水準具有重要貢獻。