Modelo de difusión

Una arquitectura de IA generativa que crea imágenes al aprender a revertir un proceso gradual de adición de ruido.

¿Qué es un modelo de difusión?

Un modelo de difusión es una arquitectura de IA generativa que crea imágenes aprendiendo a revertir un proceso de adición de ruido. Durante el entrenamiento, las imágenes se destruyen progresivamente con ruido aleatorio y el modelo aprende a deshacer cada paso. Al momento de generar, comienza desde ruido puro y elimina el ruido paso a paso hasta crear una nueva imagen, guiado por un prompt de texto, una imagen de referencia o ambos.

Los modelos de difusión son la base de la mayoría de los generadores de imágenes de vanguardia, incluyendo los sistemas de transferencia de prendas utilizados en los probadores virtuales basados en imágenes.

Un modelo de difusión eliminando el ruido desde un estado aleatorio hasta una imagen final
Un modelo de difusión eliminando el ruido desde un estado aleatorio hasta una imagen final

Cómo funciona

  1. Proceso de avance (entrenamiento): se añade ruido a una imagen real en muchos pasos pequeños hasta que solo queda estática.
  2. Proceso inverso aprendido: el modelo se entrena para predecir el estado anterior, con menos ruido, en cada paso.
  3. Generación: a partir de ruido aleatorio, se aplica repetidamente la eliminación de ruido aprendida (generalmente entre 20 y 50 pasos) hasta que emerge una imagen coherente.
  4. Condicionamiento: en cada paso, el modelo puede ser guiado por datos de entrada como la foto de una prenda, la postura del cuerpo o una máscara de la región a repintar.

Su rol en el probador virtual

El condicionamiento es lo que convierte a un generador de imágenes de propósito general en un motor de probador virtual: al proporcionarle la foto de una persona, la foto de una prenda y una máscara de la ropa, el modelo regenera exclusivamente la región enmascarada (ver inpainting de imágenes) aplicando texturas, arrugas e iluminación coherentes con la foto original.

La contrapartida es la velocidad: la generación tarda segundos y exige capacidad de procesamiento en GPU. Por esto, el probador virtual basado en difusión produce imágenes estáticas en lugar de superposiciones de video en tiempo real.

FAQ

Preguntas, respondidas.

¿Por qué los modelos de difusión reemplazaron a las GAN en los probadores virtuales?

Las primeras investigaciones sobre probadores virtuales utilizaban redes GAN, pero los modelos de difusión demostraron ser más estables de entrenar, más controlables mediante el condicionamiento y mejores a la hora de reproducir texturas finas. Todo esto resulta fundamental cuando se trata de prendas de vestir.

The 30-second version

Términos relacionados

Inpainting de imágenes
Regenerar una región enmascarada de una imagen dejando el resto totalmente intacto.
Transferencia de prendas
El proceso de IA que renderiza una prenda desde una foto de producto sobre la imagen de una persona.

Míralo en tus propios productos.

Instala Genlook en Shopify en minutos y permite a los compradores visualizar los productos antes de comprar.