Problem

多模態大模型通常將視覺理解與生成視為互不相干的目標。現有框架多仰賴離散視覺標記(discrete tokenization)或擴散模型目標,其生成的目標值與視覺理解模型所消耗的連續表示法(continuous representations)存在落差,導致難以直接轉化生成能力來強化現有的預訓練模型。

Method

提出名為 GAS 的生成引導訓練框架,將視覺生成重新詮釋為表徵學習的輔助監督。GAS 在解耦的混合轉換器(MoT)架構中,採用「下一個嵌入預測」(NEP)作為跨模態生成範式。此架構維持共享的底層網路,但在高層將生成與理解路徑分離,確保生成損失能豐富共享的視覺路徑並提升空間精準度,同時保護理解層不受生成梯度的直接干擾。

Results

實驗證明 GAS 在多種模型規模與訓練階段下均能提升多模態理解能力,其中在「視覺感知」與「空間理解」上的進步最為顯著。最關鍵的是,由於輔助生成分支在訓練結束後即被捨棄,這些效能增長完全不會帶來任何推論負擔(Zero Inference Overhead)。

Significance

本研究為強化多模態理解提供了一條極具實踐價值的路徑,證明生成任務能有效充當理解能力的「磨刀石」。透過深入的表徵層級分析,展示了如何透過架構解耦與高相關性的生成任務,讓既有模型在不增加計算成本的情況下,獲得更深層的視覺認知與細節保留能力。