Problem
現有的幾何估計方法多改寫預訓練影像擴散模型,但面臨兩大困境:一是將深度與表面法線任務視為獨立學習,忽略了幾何目標間的內在關聯;二是微調模型架構時,往往需要海量的標記資料,導致訓練效率不彰且泛化能力受限。
Method
研究團隊開發了 GeoNeXt 框架,創新性地將幾何估計重新表述為「下一幀預測」(next-frames prediction)任務。透過重新封裝預訓練影片生成模型,使其在序列中同時處理影像與幾何目標(影像 <-> 幾何),藉此繼承影片模型中原生的結構化知識與豐富先驗,實現更高效率的聯合建模。
Results
實驗結果顯示,GeoNeXt 在多個資料集的零樣本(zero-shot)單目深度與表面法線估計中,表現均優於過往的生成式模型。令人驚艷的是,本方法僅使用極少量的訓練資料,效能便足以媲美甚至超越那些使用超過 100 倍資料量訓練的頂尖辨別式(discriminative)模型。
Significance
這項研究證實了影片生成模型在理解空間幾何關係上的巨大潛力,為電腦視覺任務提供了一種更具資料效率且能統一多項幾何預測任務的系統性架構。這對於資料稀缺領域的幾何學習與生成式 AI 的落地應用具有重要參考價值。