擴散模型
一種生成式 AI 架構,透過學習反轉逐步加入雜訊的過程來生成全新圖像。
什麼是擴散模型?
擴散模型 (Diffusion model) 是一種生成式 AI 架構,透過學習反轉「加噪」的過程來生成圖像。在訓練期間,系統會逐漸加入隨機雜訊來破壞圖像,並讓模型學習還原每一個步驟。到了生成階段,模型會從純雜訊開始,在文字提示、參考圖像或兩者的引導下,逐步去噪並生成全新的圖像。
目前最先進的圖像生成器大多採用擴散模型,包含用於圖像式虛擬試穿的服裝轉換系統。

運作原理
- 前向過程 (訓練):將雜訊分多個小步驟加入真實圖像中,直到只剩下靜態雜訊。
- 學習反向過程:訓練模型在每個步驟中預測上一個雜訊較少的狀態。
- 生成:從隨機雜訊開始,反覆應用學到的去噪過程 (通常為 20 到 50 個步驟),直到呈現出清晰的圖像。
- 條件控制 (Conditioning):在每個步驟中,模型都能透過服裝圖像、人體姿勢或需要重新繪製的區域遮罩等輸入來進行引導。
在虛擬試穿中的角色
條件控制是將一般圖像生成器轉化為試穿引擎的關鍵:只要提供人物照片、服裝照片和服裝遮罩,模型就能只重新生成被遮罩覆蓋的區域 (參見圖像修補),同時保持布料紋理、皺褶與光影和原圖一致。
這種技術的代價是速度:生成圖像需要耗費數秒鐘,且需要 GPU 運算,這就是為什麼基於擴散模型的試穿技術產生的是靜態圖像,而非即時影片疊加。
常見問答
為您解答疑問。
為什麼擴散模型在試穿技術上取代了 GAN?↓
早期的虛擬試穿研究多使用 GAN,但後來發現擴散模型在訓練上更穩定,透過條件控制也更容易引導,而且在重現細緻紋理的表現更佳。這些優勢對服裝呈現來說都至關重要。
相關術語