Problem
現有的影像編輯框架多沿用文字生成影像的訓練範式,導致模型對編輯概念的粒度關注不足,且因訓練過程中的監督訊號過於稀疏,造成模型學習效率低下,難以精確應對複雜的現實編輯需求。
Method
研究團隊建立了一個包含超過 1,000 種細分編輯概念的分層分類架構,並藉此建構出擁有 1,200 萬對高品質影像的 ConceptEdit-12M 大型資料集。此外,提出密集監督訓練策略,在單組影像對中同時合成多個互不干擾的編輯概念,以提供更豐富的學習訊號。
Results
實驗結果顯示,此方法有效解決了生成資料常見的分布崩潰問題,並顯著提升資料保真度。透過新開發的 ConceptEdit-Bench 評估套件驗證,本模型在多樣化的現實情境中,其編輯準確性與模型性能皆顯著超越了過往的先進技術。
Significance
這項研究透過大規模概念擴展與創新的訓練策略,大幅優化了影像編輯模型的細緻度與訓練效率。這不僅為研究社群提供了龐大的高品質資料資源,也為實現更精準、更具多樣性的自動化影像處理工具奠定了堅實基礎。