Problem
傳統影像生成模型的資料處理管線通常孤立地優化特定任務資料集,缺乏對異質監督資料之間「生成能力相依性」的有效組織。現有方法難以處理不同生成任務(如文字生成影像與影像編輯)間的相互作用,導致模型難以系統性地習得複雜的視覺概念。
Method
開發一套「能力驅動的資料基礎設施」,包含針對文字影像對齊、影像變換及知識關聯的三大互操作資料引擎。該框架導入多階段課程學習,依據能力習得的先後順序,動態調整任務組成、視覺概念分佈、資料品質及影像解析度,並透過能力感知評估機制進行針對性重採樣以閉環優化。
Results
利用此框架構建了包含 4.4 億張影像的 T2I 語料庫、1.2 億組編輯對及超過 2700 萬組影像實體對。實驗證明,以此資料訓練的 3B 與 6B 多模態擴散模型在 CPI-Bench 評測及多樣化的編輯場景中,展現出卓越的視覺涵蓋範圍、渲染效果以及強大的跨生成能力遷移。
Significance
此研究將資料設計的重心從單純的規模擴展轉向精細的能力建模與協同進化,為建構通用型影像生成模型提供了一套可擴展且系統化的方法論,顯著提升了多模態模型在處理複雜生成任務時的效率與品質。