Problem

現有的協同說話手勢生成模型雖能對齊語音,卻往往忽略了肢體姿勢的限制以及周遭物理環境的影響,導致生成的手勢與空間中的物體缺乏互動,且難以維持長時間的連貫性與物理一致性。

Method

研發名為 Puppeteer 的擴散模型,利用因果變分自編碼器(Causal VAE)將手勢分解為結構化的基元並編碼為有序潛在標記。該模型在潛在空間內執行條件擴散,同時將語音信號、動作歷史、初始姿勢及環境物體幾何特徵納入考量,以確保生成的動作符合物理邏輯。

Results

實驗結果顯示,Puppeteer 生成的手勢在多樣性與時間同步性上均優於前代技術,並成功實現與環境物體互動的手勢合成。研究同步發布了首個包含 3D 物體資訊的合成資料集 SceneGes,以及一套專為此任務設計的新型評估指標。

Significance

這項技術突破了僅依賴音訊驅動的框架,將物理空間感知引入手勢生成領域,顯著提升了虛擬化身在複雜環境中的自然度。其時間有序的潛在空間設計,更支援了手勢補全與中間動作插入等實用應用,為具身智能與人機互動奠定重要基礎。