Problem
隨著影像生成技術向高解析度與長影片發展,傳統全域注意力機制(Full Attention)因運算複雜度隨序列長度呈平方增長,導致運算成本過高且難以處理長文本脈絡。此外,如何在異質架構中有效地進行模型擴展(Scaling),並找到運算資源的最佳配置,也是當前研究的一大挑戰。
Method
提出名為 Chimera 的混合視覺擴散骨幹架構。該架構採用光柵順序處理標記,整合了具備 O(N) 複雜度的 Kimi Delta Attention (KDA) 以處理長文本、多頭潛在注意力 (MLA) 進行全域互動,以及模態感知短卷積擷取局部時空資訊。同時,利用稀疏混合專家(MoE)擴展模型容量,並開發 HeteroP 方案,根據張量功能特性將超參數跨深度與寬度進行轉移,藉此擬合 Chinchilla 風格的運算最佳化擴展法則。
Results
實驗顯示,11B 參數(2B 激活參數)的 Chimera 在預訓練擴散損失效率上,較 Wan-2.1 基準模型提升了 1.7 至 7.3 倍。該模型具備優異的零樣本外推能力,在未經長度微調下,能將 5 秒影片的訓練效果延伸至 30 秒生成,且最後 5 秒的 FID 衰減僅 6.5%。研究亦證實,影像預訓練應均分運算量於模型規模與資料量,而影片預訓練在預算較高時則應更偏向增加模型規模。
Significance
這項研究為開發高效能長文本擴散架構奠定了重要的理論與設計基礎。透過混合注意力機制與精確的 HeteroP 擴展方案,解決了高維度視覺生成中的運算瓶頸,證明了系統化地設計異質架構能大幅提升大規模多模態模型生成的效率與品質。