Problem
創意專業人士在影像生成過程中,常需要對材質、物件識別及空間佈局進行精確的區域控制,但單靠文字提示難以達成。目前的擴散 Transformer (DiT) 雖能處理異質標記,卻缺乏有效機制來決定這些標記應在何處及如何影響最終的影像輸出。
Method
研究團隊開發了「樣貌指標」(Appearance Pointers),這是一種緊湊的標記,透過區域對應網路與空間聚合機制,將文字或影像輸入與使用者指定的遮罩精確對齊。此方法是首個不需重新訓練基礎模型,即可為 DiT 提供不限模態(Modality-agnostic)的局部控制介面。
Results
實驗證明,這款單一模型在多項指標上均達到或超越了現有針對特定模態設計的技術水準。它能有效同時處理多個區域描述,且不會顯著增加系統的運算負擔,在維持生成品質的同時大幅提升了空間操控的精準度。
Significance
本研究建立了首個針對 DiT 框架的通用型局部多模態控制架構。它為生成式影像合成提供了一條簡潔且具擴充性的路徑,讓創作者能以更直覺、精確的方式進行區域感應的引導,對專業影像創作領域具有重要貢獻。