Problem

現有的多步生成式算圖模型在進行攝影機控制時,容易受離散化誤差影響,導致在不同採樣步數下出現不一致的控制效果。此外,去噪軌跡的高曲率也增加了後續模型蒸餾的難度,使得在追求少步數快速採樣時,難以兼顧影像品質與幾何準確度。

Method

研究團隊開發了 RETA(表示轉換與對齊)技術,將來源影片的隱藏表示與目標特徵對齊,確保攝影機控制的一致性。接著,在 RETA 誘導的低曲率去噪軌跡上採用 MeanFlow 目標函數進行微調,最後結合「在線流圖蒸餾」(On-policy flow map distillation)技術,修正固定少步數採樣下的自我捲積誤差。

Results

實驗證明 FlashRender 能以低於基準模型 25 倍的採樣成本,達成同等級甚至更優異的影片品質與幾何一致性。即使面對超出訓練分布範圍(Out-of-distribution)的攝影機軌跡,該模型仍展現出卓越的操控穩定性與視覺保真度。

Significance

這項研究為高效能神經算圖領域帶來重大突破,將複雜的影片重渲染過程縮短至數秒內完成。其針對幾何一致性的改進與對採樣軌跡曲率的處理,為未來需要即時、高品質攝影機操控的虛擬製片、視覺特效與數位內容創作提供了關鍵的技術基礎。