Problem

現有的基準測試缺乏與真實電腦環境的互動,無法有效評估 AI 代理在處理包含資料清理、探索、建模與視覺化等長路徑工作流時,跨工具(如 IDE、終端機、資料庫)協調運作的能力,難以反映真實世界的資料科學實務需求。

Method

本研究開發了 DSAgentBench,這是第一個在真實運算環境中評估 AI 代理執行完整資料科學工作流的基準。該基準包含 275 個涵蓋整個生命週期的任務,要求代理根據中間輸出做出決策並協調多種工具,並利用確定性評估器來驗證分析正確性、視覺輸出及模型性能。

Results

針對 15 種閉源與開源模型的實驗顯示,最強大的模型 Claude-4.6-Sonnet 僅達到 56.70% 的成功率,而所有開源代理的成功率均低於 1%。模型在工具編排、作業系統落地(OS grounding)以及多步驟推理方面表現欠佳,存在明顯的效能瓶頸。

Significance

DSAgentBench 揭示了當前 AI 系統與真實資料科學工作流需求之間的巨大能力差距。該基準為開發具備驗證能力、能自主運行的資料科學代理提供了重要基礎,有助於推動更具實用價值的 AI 代理研究。