TechnologyPubblicato il September 21, 2026Di Thibault Mathian

Qwen-Image-2.1 per il Virtual Try-On: i risultati dei test

Il 20 settembre 2026 Alibaba ha rilasciato Qwen-Image-2.1. Lo abbiamo testato su otto capi confrontandolo con il modello di Google Vertex AI. Risultati, costi e licenza.

Indice

Il 20 settembre 2026, il team Qwen di Alibaba ha rilasciato open-source Qwen-Image-2.1. Parliamo di un modello di immagini da 7B parametri in grado di generare e modificare tutto in un unico flusso. Gestisce fino a 10 immagini di riferimento e punta apertamente al virtual try-on come caso d'uso ideale.

Lo abbiamo messo alla prova sulle otto coppie persona-capo che usiamo per testare tutti i motori, affiancandolo al modello di prova virtuale di Google su Vertex AI, una delle soluzioni commerciali più diffuse. Stesse foto, stessa pipeline di prompt, nessun fine-tuning.

Try-on di una maglietta da calcio. Da sinistra a destra: foto dell'utente, packshot del prodotto, risultato di Qwen-Image-2.1, risultato di Google Vertex AI.
Try-on di una maglietta da calcio. Da sinistra a destra: foto dell'utente, packshot del prodotto, risultato di Qwen-Image-2.1, risultato di Google Vertex AI.

Che cos'è Qwen-Image-2.1?

Qwen-Image-2.1 riunisce in un unico checkpoint tre modelli precedenti (Qwen-Image per la generazione, Qwen-Image-Edit per la modifica, Qwen-Image-Layered per la trasparenza).

  • 7B di parametri nel modulo di generazione (32 layer DiT a singolo flusso). Qwen3-VL 8B elabora il prompt e le immagini di input.
  • Fino a 10 immagini di riferimento in un unico edit. Citando la nota di rilascio: "per il virtual try-on, si possono combinare cinque input (un modello, vestiti, scarpe, una borsa e un cappello) per creare un outfit completo".
  • Modifica a zone. Basta cerchiare un'area, colorarla o passare una maschera separata: cambierà solo quella porzione.
  • Fedeltà a persone e prodotti è uno degli obiettivi dichiarati in fase di addestramento: i volti restano identici dopo l'edit, mentre "testi, texture e forma" del prodotto vengono mantenuti intatti.
  • Trasparenza nativa. Output RGBA da prompt ed estrazione del soggetto da una foto come livello trasparente.
  • Inferenza efficiente. Le immagini di input e l'istruzione vengono codificate una sola volta e messe in cache per ogni step di denoising. Così, un edit con dieci reference costa per ogni step all'incirca quanto uno con una singola reference.

Sul benchmark interno del team (Qwen-Image-Bench) registra un punteggio di 60,28, piazzandosi al settimo posto su 29 modelli. I sei modelli che lo precedono sono closed-source (in testa c'è GPT Image 2.5 a 67,01). Tra i modelli open-weight, invece, primeggia con un netto distacco.

Punteggi su Qwen-Image-Bench dei modelli open-weight e relativi parametri. Qwen-Image-2.1 guida la classifica a 60,28 con 7B parametri.
Punteggi su Qwen-Image-Bench dei modelli open-weight e relativi parametri. Qwen-Image-2.1 guida la classifica a 60,28 con 7B parametri.

È bene precisare che si tratta di un benchmark auto-riportato e che valuta la generazione, non l'editing. I pesi sono disponibili su Hugging Face e ModelScope, con supporto fin dal day zero in Diffusers, ComfyUI, vLLM-Omni e SGLang.

La licenza è la Qwen Research License, valida "solo per scopi non commerciali". L'uso commerciale richiede un accordo a parte con Alibaba. Ne parleremo tra poco.

Funziona per il virtual try-on?

Assolutamente sì, anche in modalità zero-shot.

Il set-up: otto coppie dai nostri esempi pubblici di try-on. Per ognuna, un selfie allo specchio più l'immagine del prodotto così come verrebbe caricata da un negoziante (un packshot steso o una foto indossata da un modello). Abbiamo fatto girare Qwen-Image-2.1 su Comfy Cloud a 16 step, mentre Vertex AI è stato interpellato tramite API. Stessa pipeline di prompt per entrambi, niente LoRA e nessuna post-produzione. Ogni pannello va letto da sinistra a destra: foto dell'acquirente, foto del prodotto, Qwen-Image-2.1, Google Vertex AI.

Il try-on della maglia da calcio in cima all'articolo rappresenta il nostro test sui testi. Entrambi i modelli mantengono leggibili e al posto giusto sia il logo dello sponsor che lo stemma, e nessuno dei due altera le mani, il telefono o lo sfondo dell'utente.

Try-on di un'abaya. Da sinistra a destra: foto dell'utente, foto a modello del prodotto con foulard panna, risultato di Qwen-Image-2.1 che cambia solo l'abaya, risultato di Google Vertex AI che aggiunge anche il foulard.
Try-on di un'abaya. Da sinistra a destra: foto dell'utente, foto a modello del prodotto con foulard panna, risultato di Qwen-Image-2.1 che cambia solo l'abaya, risultato di Google Vertex AI che aggiunge anche il foulard.

Dove Qwen fa meglio. L'abaya è fotografata su una modella che indossa un foulard panna. Vertex si è portato dietro il foulard insieme all'abito. Qwen, invece, ha sostituito l'abaya e nient'altro.

Try-on di un trench. Da sinistra a destra: foto dell'utente, packshot steso, risultato di Qwen-Image-2.1 che si ferma al ginocchio, risultato di Google Vertex AI che mantiene la lunghezza a metà polpaccio.
Try-on di un trench. Da sinistra a destra: foto dell'utente, packshot steso, risultato di Qwen-Image-2.1 che si ferma al ginocchio, risultato di Google Vertex AI che mantiene la lunghezza a metà polpaccio.

Dove Qwen fa peggio. Il packshot ha una lunghezza a metà polpaccio. Vertex mantiene questa proporzione, Qwen si ferma sopra il ginocchio. Su cintura, chiusura e revers ci azzeccano entrambi. La lunghezza dell'orlo sui capi lunghi è stata l'unica vera pecca di Qwen, confermata poi da un test su un maxi abito a balze.

Le altre cinque coppie (un abito midi a fiori, una felpa fluo, un sari in due pezzi, un maxi dress plus-size e un abito da sposa in pizzo) si sono concluse con un pareggio netto. Entrambi hanno replicato correttamente il corpetto e il bordo del sari, indovinato le proporzioni della stampa sul midi e rispettato i volti.

Qwen-Image-2.1 vs Google Vertex AI per il try-on

Qwen-Image-2.1 su Comfy CloudGoogle Vertex AI virtual try-on
Prove completate8 su 88 su 8
Tempo mediano per try-on9,9 s9,3 s
Costo per try-oncirca 0,005 $ (tempo GPU)0,06 $ (prezzo di listino)
Qualità, confronto diretto6 pareggi, 1 vinta, 1 persa6 pareggi, 1 vinta, 1 persa
Pesiopen, si può fare fine-tuningAPI chiusa
Licenzasolo ricerca, commerciale tramite accordocommerciale

Il tempo di Qwen comprende circa tre secondi di coda su Comfy Cloud. Il costo stimato di Qwen copre il solo tempo GPU del modello; una richiesta di try-on completa esegue anche la classificazione del capo, la costruzione del prompt e i controlli di qualità.

Il nodo da sciogliere

Licenza. Qwen-Image-2.1 viene distribuito con la Qwen Research License Agreement, non con licenza Apache 2.0 come Qwen-Image-Edit-2511. Il file di licenza ne concede l'uso "esclusivamente per scopi non commerciali", definendo tali la ricerca o la valutazione, e rimanda gli utenti commerciali a richiedere una licenza ad Alibaba. Inserire un pulsante per il try-on nel proprio e-commerce equivale a un uso commerciale. Anche per il self-hosting serve l'accordo.

Le due mancanze. Lunghezza degli orli nei capi lunghi ed eliminazione di capi secondari in alcuni prodotti composti. Entrambi sono errori sistematici, ed è proprio per questo che esistono i LoRA. Con i suoi 7B di parametri, basta una singola GPU e qualche ora per addestrare un adapter. DiffSynth-Studio su ModelScope supporta il training di LoRA su 2.1 fin dal day one e ComfyUI carica gli adapter tramite i suoi classici nodi. I dati di addestramento? Una foto a modello abbinata al rispettivo packshot, materiale che i cataloghi di moda hanno già. Anche solo un prompt mirato che specifichi categoria del capo, tipo di chiusura e lunghezza risolve gran parte dei problemi legati all'orlo; un LoRA copre il resto.

Cosa significa per Genlook

Qwen-Image-2.1 è il primo modello open a pareggiare le prestazioni di un'API commerciale di try-on sui nostri test, con un costo per immagine irrisorio al confronto. Stiamo già potenziando la pipeline di Genlook integrando Qwen per i capi su cui performa meglio. Lo faremo appoggiandoci, come sempre, sui nostri processi di classificazione dei capi, stesura del prompt e controllo qualità, così da garantire il miglior risultato possibile per ogni tipo di prodotto. Le due lacune segnalate sono in cima alle nostre priorità di ottimizzazione.

Per gli sviluppatori, l'API Genlook Try-On API offre un endpoint unico per tutti i prodotti. Un credito equivale a un try-on, al costo di 0,01 $. Nessun canone, nessuna postazione, nessun minimo mensile, i crediti non scadono mai e i nuovi account ricevono un pacchetto di crediti gratuiti. La guida introduttiva in quattro step: creare il prodotto, caricare la foto, generare, recuperare il risultato.

In sintesi

  • La release: un modello open-weight da 7B capace di generare, modificare (con un massimo di 10 reference) e gestire le trasparenze, tutto in un unico checkpoint. È il miglior modello open nel benchmark interno al team.
  • Alla prova del try-on: in modalità zero-shot, tiene testa al modello Vertex AI di Google su 6 coppie di capi su 8. Vince nel non alterare elementi estranei al capo da indossare, ma pecca nella resa della lunghezza dell'orlo per i capi lunghi.
  • Costo: all'incirca 0,005 $ di tempo GPU per immagine contro 0,06 $.
  • Da considerare: licenza limitata alla ricerca per chi sceglie il self-hosting, e due incertezze strutturali facilmente risolvibili con un LoRA.

Richiedi una chiave API su platform.genlook.app per usare la Try-On API di Genlook, oppure aggiungi il camerino virtuale al tuo e-commerce.

FAQ

Risposte alle tue domande.

Qwen-Image-2.1 può fare virtual try-on?
Qwen-Image-2.1 è gratuito per uso commerciale?
Come si comporta Qwen-Image-2.1 rispetto a Google Vertex AI per il virtual try-on?
È possibile fare fine-tuning su Qwen-Image-2.1 con un LoRA?
Quanto costa l'API Genlook Try-On?

Pronto a ridurre i resi e aumentare le conversioni?

Installa Genlook sul tuo negozio Shopify in pochi minuti. Inizia con il nostro piano gratuito.

Articoli correlati