Problem

多模態大型語言模型(MLLM)目前過度偏重語義資訊,在處理視角變動劇烈的長影片時,難以從冗餘的觀測資料中整合出一致的空間證據,導致在執行導航導向任務或長影片問答時,推理效率低下且缺乏穩定性。

Method

提出 ConsiSpace 框架,建構包含隱含證據標記與顯式幾何線索的「幾何一致性記憶(GCM)」,精簡保留任務相關的空間證據。此外,在監督式微調後導入「統一一致性自監督強化學習(UC-SSRL)」,利用答案、度量及拓撲一致性獎勵來強化跨視角推理的穩定性。

Results

在 VSI-Bench、OSI-Bench 及 MMSI-Video-Bench 三大空間推理基準測試中,ConsiSpace 展現強大優勢,相較於現有最強基準模型,平均分數大幅提升了 12.6 分,顯著改善了模型在動態環境下的空間判別能力。

Significance

此研究成功將幾何一致性從抽象概念轉化為具體的學習訊號與記憶組織原則,為自主導航感知與長影片深度理解提供了更穩固的技術架構,有效補足了當前大型模型在物理空間邏輯推理上的技術缺陷。