Problem

現有的擴散模型生成影像雖具美感,但輸出的位元圖缺乏圖層資訊且文字容易出錯,導致難以進行後期編輯;另一方面,純程式碼生成法雖具備排版精準度,卻缺乏全局美學直覺,且難以撰寫複雜視覺素材的程式碼。

Method

提出以程式碼代理人驅動的「先構思後行動」閉環工作流。由視覺語言模型(VLM)擔任創意大腦進行任務規劃與美感判斷,並將圖像模型作為視覺模擬器生成獨立素材,最後透過產出 HTML/CSS 進行分層排版,並根據視覺回饋進行迭代優化。

Results

該系統能生成具備獨立圖層與真實文本的可編輯檔案,使用者可直接在圖形介面上進行拖曳調整。在海報、資訊圖表等應用情境中,此範式成功兼顧了高品質的美學表現與生產等級的可編輯性。

Significance

本研究透過「代理人設計回溯」機制忠實呈現人類設計師的決策軌跡,有效解決了自動化生成中「視覺美感」與「實務操作性」之間的長期衝突,為次世代數位設計自動化流程建立了重要的新框架。