Problem
現有的程式碼世界模型雖能將世界表示為可執行程式,但缺乏有效構建複雜場景的系統化方法。在處理單一參考影像時,難以在保持整體幾何佈局的同時,精確重建細部結構,且容易在不同層級的細節之間產生空間關係不一致或邊界重合的錯誤。
Method
導入「遞迴場景程式」(RSP)與遞迴解算器。該架構採用「全域-局部-全域」的遞迴邏輯:首先建立場景整體結構,接著針對未解析的局部零件進行遞迴重建,最後重新檢視全域以優化各部件的組合。系統透過視覺語言編碼代理程式,直接比對參考影像與場景渲染圖,並利用對齊的視角確保相機投影在不同遞迴層級間的一致性。
Results
實驗結果顯示,RCWM 在複雜場景的影像轉場景重建任務中,表現優於以往所有基於程式碼的方法。消融實驗進一步證明了遞迴構建的優勢,顯示增加遞迴深度能顯著提升細微結構的重建品質,並有效修正局部細化後出現的空間位置誤差。
Significance
這項研究為從視覺證據構建複雜且可執行的世界模型,提供了一套具備擴展性的遞迴建構原則。這不僅強化了 3D 場景的數位孿生能力,更讓機器人或 AI 代理程式能透過結構化程式碼更深層地理解與模擬現實世界的物理組成。