Problem

視覺語言模型(VLM)處理海量視覺標記(Visual Tokens)會產生龐大的運算延遲與記憶體開銷。現有的免訓練壓縮策略在高壓縮率下表現不佳,而基於訓練的方法往往需要引入額外的壓縮模組,導致昂貴的重新訓練成本並損害原有的預訓練權重知識。

Method

提出 VisCo 自我壓縮框架,將預訓練的 VLM 本身重複利用為內建壓縮器。VisCo 採用參數共享的自動編碼器架構,僅透過一組精簡的「記憶標記」(memory tokens)來捕捉視覺資訊,並在編碼與解碼過程中傳遞多層級的階層式資訊。

Results

實驗證明 VisCo 在各種壓縮比例下的表現均優於現有技術,且在極具挑戰性的高壓縮場景中優勢更為明顯,即便在極限的單一標記設定下也能維持穩定。此外,生成的記憶標記若與原始標記結合,甚至能超越原模型的基準效能。

Significance

本研究揭示了預訓練 VLM 具備強大的內在編碼潛力,無需外掛龐大模組即可實現高效壓縮。這為低資源環境下的大型模型部署提供了新途徑,並證明壓縮後的標記能捕捉更具互補性的特徵表示。