Problem

自回歸影片世界模型在處理視角切換、場景填補及長效一致性時,往往需要針對特定任務進行模型微調或添加額外模組。要在維持靈活性的同時,確保生成內容與來源影片同步,並在多次重訪同一場景時恢復先前的視覺細節,是目前技術的一大挑戰。

Method

開發名為 World in World 的免訓練推論介面,將來源影片、幾何渲染與先前生成的狀態轉換為標記化的視覺證據。透過「對應路由」(Correspondence Router)連結點位身份與幾何資訊,並結合「證據維度注意力」(EWA)引導凍結模型的自注意力機制,在不改動骨幹網路的情況下實現精準控制。

Results

實驗證實在多樣化的視角變化下,該方法能有效完成相機控制的影片重渲染、長時場景重訪與人體動作遷移。在感官品質、時間連貫性以及相機跟隨精確度上,World in World 皆展現出優於現有技術的表現,且具備極佳的跨任務通用性。

Significance

此框架證明了直接利用大規模預訓練影片模型的內在潛力,即可實現複雜的時空控制。這種無需高昂訓練成本的方案,為互動式世界模型、視覺內容創作與虛擬環境探索提供了更具效率且一致的技術路徑。