Problem
傳統 3D 網格生成模型通常將網格序列化為標記並進行自回歸解碼,這導致推理速度極其緩慢且容易產生誤差累積,難以滿足影視、遊戲及互動式應用中對於即時 3D 資產創作的實務需求。
Method
提出 Meshy T2 框架,核心採用 Vertex-set Mesh VAE 將網格編碼為連續潛在標記。生成流程結合了「由粗到精」的兩階段流匹配(Flow Matching)模型:首先透過體素流(Voxel Flow)勾勒形狀輪廓,再由網格流(Mesh Flow)根據設定的頂點預算生成精確的頂點、連接性與面序,並原生支援多組件資產生成。
Results
實驗結果顯示,Meshy T2 在影像轉網格的生成任務中,中位數處理時間僅需 6 秒,比傳統自回歸基準模型快超過一個數量級。同時,該模型在幾何保真度上達到了頂尖水準,且能產出符合藝術家創作習慣的拓撲結構。
Significance
本研究成功打破了生成式 3D 模型在速度與可控性之間的權衡限制。透過流匹配技術實現的平行化合成與頂點預算控制,為互動式 3D 內容生產線提供了一套具備高效、精確且可直接用於專業管線的高品質解決方案。