Problem

現有的視覺語言動作(VLA)模型在處理異質機器人硬體時面臨兩大挑戰。首先,模型未能充分利用不同設備間共享的視覺與互動動力學資訊,限制了跨機體的知識遷移;其次,現有方法通常需要繁瑣的人工預處理,將各類機體的動作格式強行對齊為統一標準,這不僅耗時且損害了原始控制的精確度。

Method

研究團隊開發了 DyPES-VLA 架構,其核心包含兩部分:第一,透過「未來預測」訓練目標,驅動視覺語言模型學習物體運動與接觸點變化的共享動力學先驗。第二,設計了一套機體專屬的混合專家(MoE)動作標頭,該標頭共享注意力層以捕捉通用的時間序列特徵,並透過專屬的前饋網路專家層,直接將動力學資訊轉換為各機體的原生動作指令,無需手動對齊動作空間。

Results

實驗證明 DyPES-VLA 在多項基準測試中均達到頂尖性能(SOTA)。在 LIBERO 測試中取得 98.0% 的成功率,RoboCasa-GR1 達 59.25%,而在 RoboTwin 2.0 模擬環境中則達到 89.02%。此外,模型展現出極強的泛化能力,能同時處理具備不同運動學約束與控制語義的多種機器人平台。

Significance

此研究的重要意義在於實現了通用性與特異性的平衡。它證明了單一大型策略模型可以在不依賴人工定義動作格式的情況下,藉由共享的動力學感知來驅動多種不同結構的機器人。這為未來開發真正的通用機器人基礎模型提供了更具擴展性且高效的技術路徑。