Problem

目前的相機引導世界模型在生成互動影片時,缺乏能同時評估「動作執行準確度」與「視覺品質」的統一獎勵指標。傳統基於幾何的指標無法判斷視覺細節,而基於影像的指標則難以捕捉動態行為與動作的一致性。此外,視覺語言模型(VLM)處理長影片時,容易因情境資訊過長且嘈雜,導致模型忽略短暫且關鍵的局部動作證據。

Method

研究團隊提出 WorldReward,這是一種基於 VLM 的成對偏好獎勵模型。該方法將影片分解為與特定動作對齊的「區塊」(chunks),並將其組織成結構化的視覺證據,最後透過投票機制將區塊層級的評分整合為影片層級的動作與品質偏好。為了訓練此模型,團隊建構了大規模推理增強資料集,並推出 WorldReward-Bench 基準測試,涵蓋動作一致性、外觀品質與動態品質三大維度。

Results

實驗證明 WorldReward 在三大評估維度上皆展現了最高的人類偏好一致性,表現優於 GPT-5.5(分別高出 3.42%、1.45% 與 3.56%)。當將此模型應用於 HY-WorldPlay 1.5 的強化學習(RL)後訓練時,能顯著改善模型在長短時程中的動作執行精確度與整體影像視覺品質。

Significance

這項研究為世界模型的優化提供了更精確的自動化評估工具,成功將語義動作理解與視覺感知整合至單一框架中。這對於自動駕駛、機器人模擬及互動式遊戲生成等,需要高度動作準確性與物理連貫性的領域具有重要的應用價值。