Problem
現有的視覺語言模型基準測試多採用矩形切塊拼圖,但在紋理重複的區域常產生多個合法的排列順序,導致難以精確評估模型結合視覺內容與幾何約束的推理能力,使得現有模型在處理複雜空間關係時的表現不明確。
Method
研究團隊開發了名為 JigShape 的新型基準測試,包含 9.5 萬個拼圖實例。該測試捨棄矩形切塊,改採具備凹凸卡榫(tab-and-blank)的連鎖拼圖塊,透過嚴格的局部幾何兼容性提供唯一的真值答案。測試涵蓋從 4x4 到 16x16 四種不同密度的網格,全面挑戰模型的空間佈局能力。
Results
實驗顯示零樣本視覺語言模型普遍缺乏幾何推理能力:在最簡單的 4x4 拼圖中,僅有一款頂尖模型(GPT-5.5)表現優於隨機基準。雖然監督式微調可使 4x4 表現達到 97% 以上,但所有模型在更大網格下均出現性能崩潰,12x12 規模的準確率甚至跌破 5%,呈現明顯的「擴展斷崖」。
Significance
此項研究證實了現行的模型架構在拼圖塊數量增加時,無法維持一致的約束滿足能力。JigShape 為開發具備穩健空間推理能力的下一代視覺語言模型奠定了基礎,並將可擴展的幾何推理列為當前人工智慧領域的重要挑戰。