Problem

影片模型正逐漸轉型為視覺推理任務的基礎模型,但如何像語言模型一樣透過「提示工程」來系統性地優化其推理表現(例如預測物理運動路徑),仍是目前電腦視覺領域中尚未被充分開發的挑戰。

Method

提出「視覺提示工程」(Visual Prompt Engineering,簡稱 VIPE),利用影像編輯模型自動修改輸入的圖像。例如在物理推理任務中,將抽象的草圖場景轉換為寫實擬真的影像,藉此提供模型更易於處理的視覺提示資訊。

Results

實驗結果顯示,VIPE 能顯著提升影片模型在各類推理任務中的準確度。事實上,對於影片基礎模型而言,視覺提示的效果往往優於傳統的文字提示工程,且在提升效能方面比增加測試時運算資源(test-time scaling)更為直接且有效。

Significance

這項研究證明了視覺提示是激發影片模型潛力的關鍵工具。VIPE 提供了一種計算效率極高且簡單的方法,讓開發者無需重新訓練模型,即可透過優化輸入品質來獲取更精準的視覺推理結果,為多模態 AI 的應用開闢了新路徑。