擴散模型

一種生成式 AI 架構,透過學習反轉逐步加入雜訊的過程來生成全新圖像。

什麼是擴散模型?

擴散模型 (Diffusion model) 是一種生成式 AI 架構,透過學習反轉「加噪」的過程來生成圖像。在訓練期間,系統會逐漸加入隨機雜訊來破壞圖像,並讓模型學習還原每一個步驟。到了生成階段,模型會從純雜訊開始,在文字提示、參考圖像或兩者的引導下,逐步去噪並生成全新的圖像。

目前最先進的圖像生成器大多採用擴散模型,包含用於圖像式虛擬試穿的服裝轉換系統。

擴散模型從隨機雜訊逐步去噪至完整圖像的過程
擴散模型從隨機雜訊逐步去噪至完整圖像的過程

運作原理

  1. 前向過程 (訓練):將雜訊分多個小步驟加入真實圖像中,直到只剩下靜態雜訊。
  2. 學習反向過程:訓練模型在每個步驟中預測上一個雜訊較少的狀態。
  3. 生成:從隨機雜訊開始,反覆應用學到的去噪過程 (通常為 20 到 50 個步驟),直到呈現出清晰的圖像。
  4. 條件控制 (Conditioning):在每個步驟中,模型都能透過服裝圖像、人體姿勢或需要重新繪製的區域遮罩等輸入來進行引導。

在虛擬試穿中的角色

條件控制是將一般圖像生成器轉化為試穿引擎的關鍵:只要提供人物照片、服裝照片和服裝遮罩,模型就能只重新生成被遮罩覆蓋的區域 (參見圖像修補),同時保持布料紋理、皺褶與光影和原圖一致。

這種技術的代價是速度:生成圖像需要耗費數秒鐘,且需要 GPU 運算,這就是為什麼基於擴散模型的試穿技術產生的是靜態圖像,而非即時影片疊加。

常見問答

為您解答疑問。

為什麼擴散模型在試穿技術上取代了 GAN?

早期的虛擬試穿研究多使用 GAN,但後來發現擴散模型在訓練上更穩定,透過條件控制也更容易引導,而且在重現細緻紋理的表現更佳。這些優勢對服裝呈現來說都至關重要。

相關術語

影像局部重繪
重新生成影像中的特定遮罩區域,同時保持影像其餘部分原封不動的技術。
服裝轉換
服裝轉換是將 2D 產品圖上的服裝渲染至人物照片上的 AI 處理過程。

在您自己的產品上查看效果。

只需幾分鐘即可在 Shopify 上安裝 Genlook,讓購物者在購買前預覽產品。