Problem

現有圖像生成器雖能產出令人驚豔的單張影像,但在構建大規模人像資料集時,仍難以確保人物屬性與場景的多樣性、合理的屬性組合以及寫實攝影風格,且缺乏可規模化的品質控管與審核機制。

Method

提出名為 Poplar 的可重現管線,包含三個階段:首先是「指定」(Specify),在常識約束下抽樣結構化屬性並轉化為攝影導向的提示詞;其次是「渲染」(Render),利用寫實導向的生成器並針對技術性失敗進行重試;最後是「檢查」(Inspect),透過視覺語言模型(VLM)過濾掉具備瑕疵或與提示詞不符的候選影像。

Results

利用 Poplar 管線構建出 Poplar-9K 資料集,從 11,765 個候選樣本中篩選出 9,401 組高品質人像圖文對,審核通過率達 79.9%。研究同時釋出了管線源碼、設定檔、生成提示詞以及完整的審核紀錄。

Significance

本研究提供了一個標準化且可審計的框架,讓開發者能以低成本且可擴展的方式,自行建構高品質、具備客製化特徵的人像合成資料集,對於推動生成式 AI 與電腦視覺領域的研究具有重要貢獻。