Problem
現有的機器人操控模型往往缺乏泛化能力,難以直接應用於未曾見過的環境或複雜任務,且擴展模型效能所需的標註資料成本極高,限制了具身智能技術的大規模應用與發展。
Method
研究團隊開發了兩階段訓練法。預訓練階段利用 UMI 設備採集超過 10 萬小時的真實操作軌跡,並結合大規模自動標註管線產生精確的環境轉換描述;後訓練階段則進一步將模型能力與特定機器人硬體及人類指令進行對齊。
Results
該模型展現顯著的擴展效應,在 RoboCasa365 基準測試中達到 57.6% 的成功率,大幅超越先前 46.6% 的最佳紀錄;在 RoboDojo 的平均表現亦顯著提升。實驗證明,擴大預訓練規模能有效強化模型在未知環境中的零樣本執行效能。
Significance
這項研究證明了大規模真實世界資料驅動 VLA 模型的有效性,並提供一個強大的基礎策略框架,讓機器人能以極高效率適應複雜的精密任務,對於推動通用型自動化機器人的落地具有重要實務意義。