Problem
目前 3D 領域的基準測試多集中於純文字描述或單一物件的簡單操作,缺乏對於視覺語言模型(VLM)代理人在完整且具備多物件的 3D 場景中,如何根據視覺資訊執行實際動作的全面性評估。
Method
研發 SceneActBench 測試基準,涵蓋 5 種 3D 任務與 520 個測試案例。模型需根據 PNG 圖片或影片幀,在統一的代理人與環境互動迴圈中操作 3D 環境。系統最後利用特定的幾何指標,將模型的輸出與隱藏的真實數據(Ground Truth)進行比對評分。
Results
在測試 11 種主流商用 VLM 配置後,總體得分僅介於 38.6 至 50.2 之間,且沒有任何一個模型能在所有任務中維持穩定的優異表現。研究亦深入分析了模型在不同情境下失敗的具體模式與成因。
Significance
此基準測試為 VLM 從「觀察者」轉型為「行動者」提供了嚴謹的衡量標準。它揭示了當前頂尖模型在處理複雜 3D 空間任務時的侷限性,對於未來開發能與物理世界互動的 AI 代理人具有重要的指引作用。