Problem
目前的程式代理人(Coding Agents)評測基準常面臨資料汙染風險,模型可能僅是憑藉記憶提取 GitHub 上的既有解法而非具備推理能力。此外,現有基準多侷限於單一程式碼修復,缺乏涵蓋前端開發、自動化辦公及網路資安等跨領域的真實業務情境評測。
Method
研究團隊開發了 WorkBuddy Bench 框架,核心採用「防汙染任務建構法」。從真實的 Commit 或 PR 中逆向工程提取邏輯,並將其改寫成非正式、角色扮演式的口語需求,使模型無法透過網頁搜尋找回原始問題。該基準包含程式倉庫、前端開發、辦公流程及紅藍隊資安四大子集,並開源所有環境映像檔、測試套件與參考答案,確保評測流程可受第三方稽核。
Results
本研究建立了跨模型的排行榜,涵蓋多個主流模型系列,並透過 CodeBuddy Code 與 Claude Code 兩種代理人架構進行驗證。結果顯示,各領域任務具備獨特的驗證模式與評分工具,因此採分項計分而非單一總分,以提供更精確的模型能力分佈圖。所有任務均具備端到端的可複現性,確保評測結果的客觀性。
Significance
WorkBuddy Bench 為程式開發 AI 的評估立下了新標竿,特別是在應對資料汙染與確保評測透明度方面。透過將研究重心從「保密資料集」轉向「結構性改寫與版本控制」,此基準能更真實地反映 AI 在複雜、動態的工作流程中解決實際問題的能力,協助開發者選擇最適合特定業務場景的模型。