Il 20 settembre 2026, il team Qwen di Alibaba ha rilasciato open-source [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1). Parliamo di un modello di immagini da 7B parametri in grado di generare e modificare tutto in un unico flusso. Gestisce fino a 10 immagini di riferimento e punta apertamente al [virtual try-on](/glossary/virtual-try-on) come caso d'uso ideale.

Lo abbiamo messo alla prova sulle otto coppie persona-capo che usiamo per testare tutti i motori, affiancandolo al modello di prova virtuale di Google su Vertex AI, una delle soluzioni commerciali più diffuse. Stesse foto, stessa pipeline di prompt, nessun fine-tuning.

![Try-on di una maglietta da calcio. Da sinistra a destra: foto dell'utente, packshot del prodotto, risultato di Qwen-Image-2.1, risultato di Google Vertex AI.](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## Che cos'è Qwen-Image-2.1?

Qwen-Image-2.1 riunisce in un unico checkpoint tre modelli precedenti (Qwen-Image per la generazione, Qwen-Image-Edit per la modifica, Qwen-Image-Layered per la trasparenza).

- **7B di parametri** nel modulo di generazione (32 layer DiT a singolo flusso). Qwen3-VL 8B elabora il prompt e le immagini di input.
- **Fino a 10 immagini di riferimento** in un unico edit. Citando la nota di rilascio: "per il virtual try-on, si possono combinare cinque input (un modello, vestiti, scarpe, una borsa e un cappello) per creare un outfit completo".
- **Modifica a zone.** Basta cerchiare un'area, colorarla o passare una maschera separata: cambierà solo quella porzione.
- **Fedeltà a persone e prodotti** è uno degli obiettivi dichiarati in fase di addestramento: i volti restano identici dopo l'edit, mentre "testi, texture e forma" del prodotto vengono mantenuti intatti.
- **Trasparenza nativa.** Output RGBA da prompt ed estrazione del soggetto da una foto come livello trasparente.
- **Inferenza efficiente.** Le immagini di input e l'istruzione vengono codificate una sola volta e messe in cache per ogni step di denoising. Così, un edit con dieci reference costa per ogni step all'incirca quanto uno con una singola reference.

Sul benchmark interno del team (Qwen-Image-Bench) registra un punteggio di 60,28, piazzandosi al settimo posto su 29 modelli. I sei modelli che lo precedono sono closed-source (in testa c'è GPT Image 2.5 a 67,01). Tra i modelli open-weight, invece, primeggia con un netto distacco.

![Punteggi su Qwen-Image-Bench dei modelli open-weight e relativi parametri. Qwen-Image-2.1 guida la classifica a 60,28 con 7B parametri.](/blog-images/qwen-image-2-1-bench-open-weights.webp)

È bene precisare che si tratta di un benchmark auto-riportato e che valuta la generazione, non l'editing. I pesi sono disponibili su Hugging Face e ModelScope, con supporto fin dal day zero in Diffusers, ComfyUI, vLLM-Omni e SGLang.

La licenza è la **Qwen Research License**, valida "solo per scopi non commerciali". L'uso commerciale richiede un accordo a parte con Alibaba. Ne parleremo tra poco.

## Funziona per il virtual try-on?

Assolutamente sì, anche in modalità zero-shot.

Il set-up: otto coppie dai nostri esempi pubblici di try-on. Per ognuna, un selfie allo specchio più l'immagine del prodotto così come verrebbe caricata da un negoziante (un packshot steso o una foto indossata da un modello). Abbiamo fatto girare Qwen-Image-2.1 su Comfy Cloud a 16 step, mentre Vertex AI è stato interpellato tramite API. Stessa pipeline di prompt per entrambi, niente LoRA e nessuna post-produzione. Ogni pannello va letto da sinistra a destra: foto dell'acquirente, foto del prodotto, Qwen-Image-2.1, Google Vertex AI.

Il try-on della maglia da calcio in cima all'articolo rappresenta il nostro test sui testi. Entrambi i modelli mantengono leggibili e al posto giusto sia il logo dello sponsor che lo stemma, e nessuno dei due altera le mani, il telefono o lo sfondo dell'utente.

![Try-on di un'abaya. Da sinistra a destra: foto dell'utente, foto a modello del prodotto con foulard panna, risultato di Qwen-Image-2.1 che cambia solo l'abaya, risultato di Google Vertex AI che aggiunge anche il foulard.](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Dove Qwen fa meglio.** L'abaya è fotografata su una modella che indossa un foulard panna. Vertex si è portato dietro il foulard insieme all'abito. Qwen, invece, ha sostituito l'abaya e nient'altro.

![Try-on di un trench. Da sinistra a destra: foto dell'utente, packshot steso, risultato di Qwen-Image-2.1 che si ferma al ginocchio, risultato di Google Vertex AI che mantiene la lunghezza a metà polpaccio.](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Dove Qwen fa peggio.** Il packshot ha una lunghezza a metà polpaccio. Vertex mantiene questa proporzione, Qwen si ferma sopra il ginocchio. Su cintura, chiusura e revers ci azzeccano entrambi. La lunghezza dell'orlo sui capi lunghi è stata l'unica vera pecca di Qwen, confermata poi da un test su un maxi abito a balze.

**Le altre cinque coppie** (un abito midi a fiori, una felpa fluo, un sari in due pezzi, un maxi dress plus-size e un abito da sposa in pizzo) si sono concluse con un pareggio netto. Entrambi hanno replicato correttamente il corpetto e il bordo del sari, indovinato le proporzioni della stampa sul midi e rispettato i volti.

## Qwen-Image-2.1 vs Google Vertex AI per il try-on

| | Qwen-Image-2.1 su Comfy Cloud | Google Vertex AI virtual try-on |
|---|---|---|
| Prove completate | 8 su 8 | 8 su 8 |
| Tempo mediano per try-on | 9,9 s | 9,3 s |
| Costo per try-on | circa 0,005 $ (tempo GPU) | 0,06 $ (prezzo di listino) |
| Qualità, confronto diretto | 6 pareggi, 1 vinta, 1 persa | 6 pareggi, 1 vinta, 1 persa |
| Pesi | open, si può fare fine-tuning | API chiusa |
| Licenza | solo ricerca, commerciale tramite accordo | commerciale |

Il tempo di Qwen comprende circa tre secondi di coda su Comfy Cloud. Il costo stimato di Qwen copre il solo tempo GPU del modello; una richiesta di try-on completa esegue anche la classificazione del capo, la costruzione del prompt e i controlli di qualità.

## Il nodo da sciogliere

**Licenza.** Qwen-Image-2.1 viene distribuito con la Qwen Research License Agreement, non con licenza Apache 2.0 come Qwen-Image-Edit-2511. Il file di licenza ne concede l'uso "esclusivamente per scopi non commerciali", definendo tali la ricerca o la valutazione, e rimanda gli utenti commerciali a richiedere una licenza ad Alibaba. Inserire un pulsante per il try-on nel proprio e-commerce equivale a un uso commerciale. Anche per il self-hosting serve l'accordo.

**Le due mancanze.** Lunghezza degli orli nei capi lunghi ed eliminazione di capi secondari in alcuni prodotti composti. Entrambi sono errori sistematici, ed è proprio per questo che esistono i LoRA. Con i suoi 7B di parametri, basta una singola GPU e qualche ora per addestrare un adapter. DiffSynth-Studio su ModelScope supporta il training di LoRA su 2.1 fin dal day one e ComfyUI carica gli adapter tramite i suoi classici nodi. I dati di addestramento? Una foto a modello abbinata al rispettivo packshot, materiale che i cataloghi di moda hanno già. Anche solo un prompt mirato che specifichi categoria del capo, tipo di chiusura e lunghezza risolve gran parte dei problemi legati all'orlo; un LoRA copre il resto.

## Cosa significa per Genlook

Qwen-Image-2.1 è il primo modello open a pareggiare le prestazioni di un'API commerciale di try-on sui nostri test, con un costo per immagine irrisorio al confronto. Stiamo già potenziando la pipeline di Genlook integrando Qwen per i capi su cui performa meglio. Lo faremo appoggiandoci, come sempre, sui nostri processi di classificazione dei capi, stesura del prompt e controllo qualità, così da garantire il miglior risultato possibile per ogni tipo di prodotto. Le due lacune segnalate sono in cima alle nostre priorità di ottimizzazione.

Per gli sviluppatori, l'API [Genlook Try-On API](https://platform.genlook.app) offre un endpoint unico per tutti i prodotti. Un credito equivale a un try-on, al costo di 0,01 $. Nessun canone, nessuna postazione, nessun minimo mensile, i crediti non scadono mai e i nuovi account ricevono un pacchetto di crediti gratuiti. La [guida introduttiva](/docs/tryon-api/quickstart) in quattro step: creare il prodotto, caricare la foto, generare, recuperare il risultato.

## In sintesi

- **La release:** un modello open-weight da 7B capace di generare, modificare (con un massimo di 10 reference) e gestire le trasparenze, tutto in un unico checkpoint. È il miglior modello open nel benchmark interno al team.
- **Alla prova del try-on:** in modalità zero-shot, tiene testa al modello Vertex AI di Google su 6 coppie di capi su 8. Vince nel non alterare elementi estranei al capo da indossare, ma pecca nella resa della lunghezza dell'orlo per i capi lunghi.
- **Costo:** all'incirca 0,005 $ di tempo GPU per immagine contro 0,06 $.
- **Da considerare:** licenza limitata alla ricerca per chi sceglie il self-hosting, e due incertezze strutturali facilmente risolvibili con un LoRA.

---

_[Richiedi una chiave API su platform.genlook.app](https://platform.genlook.app) per usare la Try-On API di Genlook, oppure [aggiungi il camerino virtuale al tuo e-commerce](/get-started)._

<Faq>
  <FaqItem
    question="Qwen-Image-2.1 può fare virtual try-on?"
    answer="Sì. Nella pagina di rilascio si vede un outfit creato partendo da cinque reference (modello, abiti, scarpe, borsa e cappello). Sulle nostre otto coppie di test, ha pareggiato zero-shot con il modello Vertex AI di Google su sei casi, facendo meglio in uno e peggio in un altro."
  />
  <FaqItem
    question="Qwen-Image-2.1 è gratuito per uso commerciale?"
    answer="No. Viene distribuito con la Qwen Research License Agreement, che limita l'uso a ricerca o valutazione non commerciale. Richiede una licenza commerciale separata da Alibaba. Qwen-Image-Edit-2511, invece, è sotto Apache 2.0."
  />
  <FaqItem
    question="Come si comporta Qwen-Image-2.1 rispetto a Google Vertex AI per il virtual try-on?"
    answer="Nei nostri test: tempo mediano di 9,9 s contro 9,3 s, en plein di successi (8 su 8 completati) per entrambi, sei pareggi su otto per qualità percepita. Sul fronte costi: circa 0,005 $ di tempo GPU per immagine contro i 0,06 $ del listino Vertex. Vertex è un'API commerciale; Qwen offre pesi open ma vincolati da licenza per la ricerca."
  />
  <FaqItem
    question="È possibile fare fine-tuning su Qwen-Image-2.1 con un LoRA?"
    answer="Sì. DiffSynth-Studio su ModelScope supporta il training di LoRA per Qwen-Image-2.1 e ComfyUI carica gli adapter usando i classici nodi LoRA. A 7B di parametri, un adapter si addestra su una singola GPU."
  />
  <FaqItem
    question="Quanto costa l'API Genlook Try-On?"
    answer="Un credito corrisponde a un try-on e ha un costo di 0,01 $. Nessun canone per la piattaforma, né per le utenze, né limiti minimi mensili. I crediti non scadono e i nuovi iscritti iniziano con crediti gratuiti."
  />
</Faq>