Problem

目前的視覺空間感知與推理技術通常將 3D 重建、稠密對應(dense correspondence)與空間關係理解視為獨立任務處理。這種做法依賴特定任務的架構或外部幾何模組,導致同一物理場景中互補的表示形式之間難以進行知識轉移,限制了模型的通化能力。

Method

SPARGen 提出一套統一的多模態框架,將各類空間任務重新定義為指令式生成(instruction-conditioned generation)。該模型將結構化資訊與語言輸出序列化為 Token 序列,並以影像對齊(image-aligned)的形式生成稠密幾何場,讓空間監督訊號能在原生多模態生成模型中共同塑造共享的表示空間。

Results

在 3D 重建、影像對應及空間推理等多項基準測試中,SPARGen 展現了卓越的性能。實驗結果證實,即使在單一的原生多模態生成框架下,該模型也能在處理性質迥異的空間任務時,達到與專業化模型相媲美甚至更優的競爭力。

Significance

這項研究證明了透過生成式架構整合幾何結構與語意推理的可能性。SPARGen 的成功為開發具備深層空間理解能力的通用人工智慧奠定了基礎,簡化了複雜視覺任務的處理流程,並大幅提升了多模態模型在物理世界中的感知精度。