Problem
評估影片生成模型的物理推理能力極具挑戰,主要原因在於生成影片往往缺乏影格率(Frame Rate)、物體比例及相機校準等絕對參數,這使得傳統的物理測量方式難以直接應用於評估生成內容的真實性。
Method
提出名為 Principia 的基準測試,核心理念是利用場景中遵循相同物理定律的成對物體,分析其運動間的「關係一致性」。該測試涵蓋了重力、摩擦力、動量、彈擺與彈簧振盪等八大類物理現象,並引入一套不依賴校準的評分標準,直接在影像空間中量化物理規律的違規程度。
Results
實驗結果顯示,即便在 VBench 評測中獲得高分(約 0.8)的六款頂尖影片生成模型,在 Principia 上的物理一致性得分均低於 0.42。此外,視覺語言模型(VLM)在偵測物理違規方面的表現同樣不理想,最強模型僅達到 67% 的準確率,多數模型表現甚至接近隨機猜測。
Significance
此研究提供了一種更強健且不需外部參數的物理評估架構,精確指出目前生成式模型在掌握基礎物理法則上的不足。這不僅為開發具備物理常識的 AI 模型提供了新的測量基準,也為提升生成影片的科學準確性奠定了基礎。