Problem
目前的視覺語言模型(VLM)預訓練資料選取多依賴啟發式經驗,缺乏科學化的混合準則與可歸因性,且頂尖模型的資料配方往往不對外公開,使開發者難以系統化地決定新資料的加入標準。
Method
提出 DecoupleMix 框架,將資料混合優化解耦為兩個正交子問題:跨能力類別的比例採用單變數迭代搜索;類別內的資料組成則透過品質與難度評分,並以多樣性為目標進行受限凸優化分配。
Results
實驗證明此方法一致優於傳統啟發式基準。關鍵發現是,在小規模實驗中搜尋到的最佳比例可無縫遷移至大規模訓練,僅以 800 億個額外 Token 進行持續預訓練,效能即可媲美訓練量更大的開源模型。
Significance
此研究將資料配方從直覺經驗轉向可重複的工程學,不僅能指導資料蒐集方向,也讓資料驗證過程變得可控且具歸因性,為構建高效能、可擴展的大型多模態模型提供了一套標準化的優化準則。