Problem

目前的視覺-語言-動作(VLA)模型在進行行為複製(BC)微調時,容易發生「表徵漂移」現象,即模型原有的預訓練視覺與語意知識會逐漸被微調資料覆蓋,進而損害泛化能力。此外,現有的協同訓練方法往往將語言與動作損失應用於不同的觀察資料上,導致模型難以在操作任務中建立正確的語意-動作對齊,影響其在複雜環境下的表現。

Method

研究團隊開發了名為「Anchor-Align」的兩大核心技術:首先是「視覺語言錨定(Vision-Language Anchoring)」,透過蒸餾技術從凍結的預訓練模型副本中提取層級表徵,確保微調過程中知識不流失;其次是「語言-動作對齊(Language-Action Alignment)」,將動作目標轉化為離散的方向標籤,並在同一筆機器人觀察資料上同步進行語言與動作預測訓練。

Results

在實體 xArm7 機器人的兩項 VLA 架構測試中,Anchor-Align 將成功率分別從 28% 提升至 54% 以及從 37% 提升至 60%。在大規模模擬實驗中,該方法在 LIBERO-PRO、LIBERO-Plus 與 CALVIN 等基準測試上,展現了卓越的分布外(OOD)擾動抗性、感知強健性以及長程控制能力。

Significance

此研究證明了保留預訓練表徵與學習動作控制並非魚與熊掌不可兼得。透過有效的表徵錨定與語意對齊,開發者能更穩定地將大規模視覺語言模型轉化為通用的機器人策略,為建構能在多樣化現實環境中穩定運作的具身智能系統提供了關鍵的方法論參考。