Problem
現有的視覺空間基準測試大多侷限於單一或少數視角的局部感知,缺乏對連續、長時序視覺流的全域空間意識。這使得具身智能代理在面對需要從第一人稱觀察轉換為全域鳥瞰視圖,或推論未見視角等複雜任務時,面臨極大的理解挑戰。
Method
研究團隊開發了「全域空間時序基準測試」(GST-Bench),包含由 6,790 分鐘合成影片生成的真人驗證問答對。該基準要求模型根據第一人稱觀察重建全域場景,並進行跨視角空間推論。此外,亦同步釋出 GST-Bench-Local 對照組與 GST-Train 訓練資料集以供研究使用。
Results
在對 22 種先進視覺語言模型的評測中,表現最強的零樣本模型僅取得 42.68 分,遠低於人類的 79.08 分。實驗進一步證實,即便模型具備良好的局部空間理解力,仍難以將長時序的觀察資訊有效整合為具備全域一致性的場景表徵。
Significance
此研究精確定義了當前視覺語言模型在空間智能上的關鍵瓶頸。透過 GST-Bench 與配套的訓練資源,為未來開發具備自主導航、環境建模與複雜空間推論能力的具身智能系統奠定了重要的評估與發展基礎。