Problem

目前影音生成模型多採用獨立訓練的音訊與影像編碼器,導致兩者的潛在空間缺乏對齊。這使得下游模型在學習影音同步與細粒度語義對應時,必須從零開始建立關聯,導致訓練難度高且同步效果不佳。

Method

OmniVAE 採用聯合訓練架構,核心技術包含段落級影音對比學習目標,用以精準捕捉時間與語義的連結。同時,模型運用特徵蒸餾技術,將預訓練模態編碼器的語義知識引入潛在空間,提升模態內的特徵表達能力。

Results

實驗結果顯示,這種對齊與蒸餾策略能大幅增強潛在空間的可學習性。在文字生成影音(T2AV)的任務中,OmniVAE 不僅產出更高品質的影音內容,且在影音同步的精確度上明顯優於傳統的分離式編碼架構。

Significance

本研究證明了統一表徵學習是全模態建模(Omnimodal Modeling)的關鍵基石。透過在編碼階段即建立跨模態對齊,為未來開發具備高度協調性的多媒體生成人工智慧奠定了重要的技術基礎。