Problem
視覺語言模型(VLM)在處理長視覺上下文時面臨雙重挑戰:一是隨著干擾項增加,模型檢索效能會大幅下滑;二是運算量過大導致 GPU 記憶體不堪負荷,難以在有限資源下一次處理所有影像標記。
Method
開發名為 ReToken 的輕量化技術,透過訓練一個可學習的單一嵌入向量作為檢索目標,從預先填充的視覺鍵值快取(KV cache)中,篩選出與查詢語句最相關的稀疏標記集合,從而實現高效的內容擷取。
Results
ReToken 在 Visual Haystacks 基準測試中,將 Qwen3VL-8B 與 InternVL3.5 的效能分別提升了 13.4 與 12.4 分;在 LVBench 長影片任務中,亦展現出優秀的零樣本遷移能力,使 Qwen3VL-8B 獲得 8 分的顯著增長。
Significance
這項研究證明了透過極小規模的參數訓練與輕量化設計,即可在單張 H100 顯示卡上完成模型訓練與長影片推理。此方法顯著強化了模型處理海量影像資訊的能力,為資源受限環境下的長視覺檢索提供了新路徑。