Problem
現有的音視訊大語言模型(AV-LLMs)大多侷限於短片段的處理,在面對真實世界中包含複雜事件且具備長時程特性的影片時,往往難以進行深層的跨模態邏輯推理與精確的時間對齊。
Method
研究團隊開發了 Audio-Visual-Skills 大型資料集,包含約 700 萬筆標註與問答資料。技術上採用三階段課程學習,從短期感知逐步過渡到長程多事件推理,並引入「時序音視訊交織思維鏈」框架,將推理步驟與時間戳記連結以強化解釋性。
Results
在超過 15 項視聽與多模態基準測試中,AV-Flamingo 的表現顯著優於同規模的開源模型,甚至在處理長影片理解任務時,能與參數規模更大的開源或閉源模型並駕齊驅,並展現出優異的任務泛化能力。
Significance
此研究不僅提供了強大的開源音視訊模型,更透過創新的思維鏈技術解決了長影片中的時序關聯問題。這項成果大幅提升了人工智慧在理解真實世界動態內容時的實用價值,為未來跨模態研究奠定基礎。