Problem
互動式影片世界模型依賴 KV 快取(KV cache)來維持視覺記憶。然而,當生成長度超過訓練時的時序長度時,旋轉位置編碼(RoPE)的偏移會超出模型處理範圍,導致模型無法正確定址並擷取過去的資訊。此外,若直接在 RoPE 旋轉空間進行壓縮,會因平均了不相容的位置相位而損壞記憶內容。
Method
研究團隊提出 WorldTrace 框架,這是一種無需重新訓練的記憶管理機制。該框架透過為壓縮後的每個摘要插槽(summary slot)分配一個特定的「分佈內虛擬位置」,使快取保持可定址性。其中包含兩種策略:WorldTrace-Field 透過壓縮歷史資料來維持時間連貫性,而 WorldTrace-Landmark 則在偵測到轉場時儲存場景痕跡,以實現片段式回憶。
Results
透過新建立的基準測試 LoopBench 評估,WorldTrace-Field 在時間一致性上提升了 15.5%,而 WorldTrace-Landmark 則在片段式回憶表現上進步了 19.5%。這證明了該框架能在不犧牲效能的情況下,有效延伸視覺持續生成的長度。
Significance
此研究克服了影片生成模型在長序列任務中的「視覺遺忘」瓶頸。其無需重新訓練即可部署的特性,大幅降低了開發成本,對於建構具備穩定時空感知能力的互動式 AI 環境、虛擬實境以及自動駕駛模擬系統具有高度的應用價值。