Problem

現有的視覺-語言-動作(VLA)模型(如 pi0.5)多採用單幀處理模式,這限制了模型保留過去觀測資訊的能力,使其在需要精密空間感知或依賴長期記憶的機器人操控任務中,難以達成高準確度的判斷。

Method

本研究提出 StreamPI 框架,核心設計為「指令錨定時序建模」,將每一對視覺觀測與語言指令視為原子時序單位,利用因果注意力機制達成自動回歸串流推論。此外,引入「隨機間隔串流訓練」策略,模擬真實機器人部署中的非同步特性,並利用大語言模型底層的長度外推能力,實現無縫的參數繼承與靈活的推理模式。

Results

在 LIBERO 模擬基準測試以及涉及記憶依賴、精密感知的真實機器人任務中,StreamPI 的表現均優於基準模型 pi0.5。實驗證實,隨機化間隔訓練顯著提升了模型對於影格計時擾動的魯棒性,使動作執行更加流暢且精準。

Significance

這項研究證明了無需增加額外參數,即可賦予單幀 VLA 模型強大的時序推理能力。其提出的訓練策略有效橋接了同步訓練與非同步真實部署之間的鴻溝,為開發高效、穩健的機器人通用智能系統提供了關鍵技術路徑。