Problem
現有的語音手勢生成技術多處於離線狀態,需依賴完整的語音段落才能合成動作。然而,在真實互動情境中,數位人必須在極低延遲下即時反應。傳統方法若非依賴「未來語音資訊」,就是運算延遲過高,導致無法滿足流暢且即時的對話需求。
Method
研究團隊開發了 Super Star 框架,整合串流語音與線上手勢生成模組。其核心採用「因果多模態自回歸模型」,僅根據目前語音串流與歷史動作紀錄來預測後續手勢。此外,團隊建立了一套針對虛擬同伴場景的資料合成管線,並引入「自進化訓練環路」,將線上互動收集的使用者回饋重新納入訓練過程,使模型能持續優化並適應使用者偏好。
Results
實驗結果顯示,Super Star 框架在延遲與生成品質之間達到了最佳平衡。相較於現有基準模型,該框架在語音與動作的同步性(Synchronization)以及使用者主觀偏好度上均表現優異,能產生更自然且具情感表現力的即時互動反應。
Significance
這項研究成功克服了即時互動數位人的技術瓶頸,為虛擬助手與社交機器人等應用提供了更真實的體驗。其自進化機制有效縮小了離線訓練與線上部署之間的表現差距,為未來數位人技術的商用化與持續學習奠定了重要基礎。