扩散模型

一种生成式 AI 架构,通过学习逆转逐步加噪的过程来生成高质量图像。

什么是扩散模型?

扩散模型(Diffusion model)是一种生成式 AI 架构,它通过学习逆转加噪过程来生成图像。在训练阶段,模型会使用随机噪声逐步破坏图像,并学习如何撤销每一步的破坏。在生成阶段,它从纯噪声开始,在文本提示词、参考图像或两者的共同引导下,一步步去噪并最终生成一张全新的图像。

目前大多数领先的图像生成器均以扩散模型为基础,这其中也包括用于基于图像的虚拟试穿的服装迁移系统。

扩散模型从随机噪声去噪到生成完整图像的过程
扩散模型从随机噪声去噪到生成完整图像的过程

工作原理

  1. 前向过程(训练):分多个小步骤向真实图像中添加噪声,直到只剩下完全无序的静态噪点。
  2. 学习逆向过程:模型经过训练,在每一步中预测前一个噪声较小的状态。
  3. 图像生成:从随机噪声开始,重复应用已学习的去噪过程(通常为 20 到 50 步),直到呈现出清晰连贯的图像。
  4. 条件控制:在去噪的每一步中,模型都可以受到特定输入的引导,例如服装图像、人物姿势或需要重绘区域的蒙版。

在虚拟试穿中的作用

条件控制是将通用图像生成器转化为试穿引擎的关键:在提供人物照片、服装照片以及衣物蒙版后,模型只会重新生成蒙版区域(参见图像修复),使其面料纹理、褶皱和光照均与原图保持完美一致。

这种技术的代价是生成速度:图像生成需要数秒钟并依赖 GPU 算力,这也是为什么基于扩散模型的虚拟试穿通常生成静态图像,而不是实时视频叠加。

常见问题

常见问题解答。

为什么扩散模型在虚拟试穿中取代了 GAN?

早期的虚拟试穿研究使用 GAN(生成对抗网络),但事实证明,扩散模型在训练上更稳定,能够通过条件控制进行更精确的引导,并且在还原细腻的纹理方面表现更佳。而这些优势对于服装呈现至关重要。

相关术语

图像局部重绘
重新生成图像中被遮罩(掩码)覆盖的特定区域,同时保持图像的其余部分原样不变。
服装迁移
利用 AI 技术将产品照片中的服装逼真地渲染到人物图像上的整个过程。

在您自己的产品上查看效果。

只需几分钟即可在 Shopify 上安装 Genlook,让顾客在购买前预览上身效果。