扩散模型
一种生成式 AI 架构,通过学习逆转逐步加噪的过程来生成高质量图像。
什么是扩散模型?
扩散模型(Diffusion model)是一种生成式 AI 架构,它通过学习逆转加噪过程来生成图像。在训练阶段,模型会使用随机噪声逐步破坏图像,并学习如何撤销每一步的破坏。在生成阶段,它从纯噪声开始,在文本提示词、参考图像或两者的共同引导下,一步步去噪并最终生成一张全新的图像。
目前大多数领先的图像生成器均以扩散模型为基础,这其中也包括用于基于图像的虚拟试穿的服装迁移系统。

工作原理
- 前向过程(训练):分多个小步骤向真实图像中添加噪声,直到只剩下完全无序的静态噪点。
- 学习逆向过程:模型经过训练,在每一步中预测前一个噪声较小的状态。
- 图像生成:从随机噪声开始,重复应用已学习的去噪过程(通常为 20 到 50 步),直到呈现出清晰连贯的图像。
- 条件控制:在去噪的每一步中,模型都可以受到特定输入的引导,例如服装图像、人物姿势或需要重绘区域的蒙版。
在虚拟试穿中的作用
条件控制是将通用图像生成器转化为试穿引擎的关键:在提供人物照片、服装照片以及衣物蒙版后,模型只会重新生成蒙版区域(参见图像修复),使其面料纹理、褶皱和光照均与原图保持完美一致。
这种技术的代价是生成速度:图像生成需要数秒钟并依赖 GPU 算力,这也是为什么基于扩散模型的虚拟试穿通常生成静态图像,而不是实时视频叠加。
常见问题
常见问题解答。
为什么扩散模型在虚拟试穿中取代了 GAN?↓
早期的虚拟试穿研究使用 GAN(生成对抗网络),但事实证明,扩散模型在训练上更稳定,能够通过条件控制进行更精确的引导,并且在还原细腻的纹理方面表现更佳。而这些优势对于服装呈现至关重要。
相关术语