Modello di diffusione

Un'architettura di IA generativa che crea immagini imparando a invertire un processo graduale di aggiunta di rumore.

Cos'è un modello di diffusione?

Un modello di diffusione è un'architettura di intelligenza artificiale generativa che crea immagini imparando a invertire un processo di aggiunta di rumore (noising). Durante l'addestramento, le immagini vengono progressivamente alterate con del rumore casuale e il modello impara ad annullare ogni singolo passaggio. Nella fase di generazione, parte da un rumore puro e lo rimuove (denoising) passo dopo passo per creare una nuova immagine, guidato da un prompt testuale, un'immagine di riferimento o da entrambi.

I modelli di diffusione sono alla base della maggior parte dei generatori di immagini all'avanguardia, inclusi i sistemi di trasferimento dei capi utilizzati per il virtual try-on basato su immagini.

Un modello di diffusione che rimuove il rumore passando da rumore casuale a un'immagine finita
Un modello di diffusione che rimuove il rumore passando da rumore casuale a un'immagine finita

Come funziona

  1. Processo in avanti (addestramento): viene aggiunto rumore a un'immagine reale in molti piccoli passaggi finché non rimane solo rumore statico.
  2. Processo inverso appreso: il modello viene addestrato a prevedere lo stato precedente, meno rumoroso, in ogni passaggio.
  3. Generazione: partendo da un rumore casuale, il denoising appreso viene applicato ripetutamente (in genere 20-50 passaggi) finché non emerge un'immagine coerente.
  4. Condizionamento: a ogni passaggio il modello può essere guidato da input come l'immagine di un capo, una posa del corpo o una maschera della regione da rigenerare.

Il ruolo nel virtual try-on

Il condizionamento è ciò che trasforma un generatore di immagini generico in un motore di try-on: data la foto di una persona, la foto di un capo e una maschera per i vestiti, il modello rigenera solo la regione mascherata (vedi image inpainting) con texture, pieghe e illuminazione coerenti con la foto originale.

Il compromesso è la velocità: la generazione richiede secondi e necessita di calcolo GPU, motivo per cui il try-on basato sulla diffusione produce immagini statiche anziché sovrapposizioni video in tempo reale.

FAQ

Risposte alle tue domande.

Perché i modelli di diffusione hanno sostituito le reti GAN per il try-on?

Le prime ricerche sul try-on utilizzavano le GAN, ma i modelli di diffusione si sono rivelati più stabili da addestrare, più controllabili tramite il condizionamento e migliori nel riprodurre i dettagli fini delle texture. Tutti aspetti fondamentali quando si tratta di abbigliamento.

The 30-second version

Termini correlati

Inpainting delle immagini
La rigenerazione di un'area mascherata di un'immagine, lasciando intatto tutto il resto.
Trasferimento dei capi
Il processo basato sull'IA che applica un capo d'abbigliamento da una foto di prodotto all'immagine di una persona.

Provalo sui tuoi prodotti.

Installa Genlook su Shopify in pochi minuti e permetti ai clienti di vedere in anteprima i prodotti prima dell'acquisto.