Le 20 septembre 2026, l'équipe Qwen d'Alibaba a publié [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1) en open source. Ce modèle d'image de 7 milliards de paramètres gère la génération et l'édition en une seule passe, accepte jusqu'à 10 images de référence et cite explicitement [l'essayage virtuel](/glossary/virtual-try-on) (virtual try-on) parmi ses cas d'usage.

Nous l'avons mis à l'épreuve avec notre jeu de test standard de huit paires modèle-vêtement. Face à lui : le modèle d'essayage virtuel de Google sur Vertex AI, l'une des solutions commerciales les plus répandues. Même photos, même pipeline de prompt, aucun fine-tuning.

![Essayage d'un maillot de football. De gauche à droite : photo du client, packshot du produit, résultat Qwen-Image-2.1, résultat Google Vertex AI.](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## Qu'est-ce que Qwen-Image-2.1 ?

Qwen-Image-2.1 fusionne trois anciens modèles (Qwen-Image pour la génération, Qwen-Image-Edit pour la retouche et Qwen-Image-Layered pour la transparence) en un unique checkpoint.

- **7 milliards de paramètres** pour la brique de génération (32 couches DiT mono-flux). Qwen3-VL 8B s'occupe de lire le prompt et les images en entrée.
- **Jusqu'à 10 images de référence** pour une seule retouche. Selon la page de présentation : « pour l'essayage virtuel, cinq éléments (un mannequin, des vêtements, des chaussures, un sac et un chapeau) peuvent être combinés pour créer une tenue complète. »
- **Retouche ciblée (Region editing).** Entourez une zone, peignez dessus ou fournissez un masque : seule cette partie sera modifiée.
- **Fidélité des modèles et des produits :** c'est l'un des objectifs de l'entraînement. Les visages restent identiques après retouche et « le texte, les textures et les formes » du produit sont préservés.
- **Transparence native.** Il génère du RGBA à partir d'un prompt et détoure un sujet depuis une photo pour en faire un calque transparent.
- **Inférence optimisée.** Les images d'entrée et l'instruction sont encodées une fois pour toutes et mises en cache à chaque étape de débruitage. Une retouche avec 10 références coûte donc à peu près la même chose qu'avec une seule.

Sur le benchmark maison de l'équipe (Qwen-Image-Bench), il décroche la note de 60,28 et se classe 7ᵉ sur 29 modèles. Les six modèles qui le devancent sont propriétaires (GPT Image 2.5 est en tête avec 67,01). Du côté des modèles ouverts, il s'impose haut la main.

![Scores Qwen-Image-Bench des modèles d'image ouverts et nombre de paramètres. Qwen-Image-2.1 domine avec 60,28 pour 7B de paramètres.](/blog-images/qwen-image-2-1-bench-open-weights.webp)

Attention : ce benchmark est réalisé par l'éditeur et évalue la génération, pas l'édition. Les poids sont disponibles sur Hugging Face et ModelScope, avec un support dès le premier jour sur Diffusers, ComfyUI, vLLM-Omni et SGLang.

Côté licence, il s'agit de la **Qwen Research License**, strictement réservée à un usage non commercial. Pour l'exploiter commercialement, il faut signer un accord spécifique avec Alibaba. On y revient plus bas.

## Est-ce que ça marche pour l'essayage virtuel ?

Oui, du premier coup (zero-shot).

Le protocole : huit paires issues de nos exemples publics d'essayage, composées d'un selfie miroir et d'une image produit telle qu'un marchand la mettrait en ligne (packshot à plat ou photo portée). Qwen-Image-2.1 a tourné sur Comfy Cloud en 16 étapes. Vertex AI a été appelé via son API. Les deux modèles ont reçu exactement les mêmes prompts, sans LoRA ni post-traitement. Sur chaque comparatif, de gauche à droite : photo du client, image produit, Qwen-Image-2.1, Google Vertex AI.

Le maillot de foot en haut de l'article servait de test pour le texte. Les deux modèles conservent le logo du sponsor et l'écusson de manière lisible et au bon endroit. Aucun des deux ne déforme les mains du client, son téléphone ou l'arrière-plan.

![Essayage d'une abaya. De gauche à droite : photo de la cliente, photo du produit porté avec un foulard crème, résultat Qwen-Image-2.1 qui modifie uniquement l'abaya, résultat Google Vertex AI qui a aussi ajouté le foulard.](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Où Qwen s'en sort mieux.** L'abaya est photographiée sur un mannequin portant un foulard crème. Vertex a ajouté le foulard au vêtement. Qwen n'a modifié que l'abaya.

![Essayage d'un trench-coat. De gauche à droite : photo du client, packshot à plat, résultat Qwen-Image-2.1 qui s'arrête au genou, résultat Google Vertex AI qui conserve la longueur mi-mollet.](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Où Qwen pèche.** Le packshot montre un trench mi-mollet. Vertex garde cette longueur, Qwen s'arrête au genou. La ceinture, le système de fermeture et les revers sont corrects chez les deux. La longueur des ourlets sur les vêtements longs s'est avérée être le point faible récurrent de Qwen, un défaut confirmé avec une robe longue à volants.

**Pour les cinq autres paires** (une robe midi à fleurs, un sweat à capuche fluo, un sari en deux pièces, une robe longue grande taille, une robe de mariée en dentelle), impossible de les départager. Les deux ont bien géré le chemisier et la bordure du sari, ont respecté l'échelle des motifs de la robe midi et n'ont pas altéré les visages.

## Qwen-Image-2.1 face à Google Vertex AI (essayage virtuel)

| | Qwen-Image-2.1 sur Comfy Cloud | Essayage virtuel Google Vertex AI |
|---|---|---|
| Paires réussies | 8 sur 8 | 8 sur 8 |
| Temps médian par essayage | 9,9 s | 9,3 s |
| Coût par essayage | Environ 0,005 $ (temps GPU) | 0,06 $ (prix public) |
| Qualité en face à face | 6 égalités, 1 victoire, 1 défaite | 6 égalités, 1 victoire, 1 défaite |
| Poids (weights) | Ouverts, fine-tuning possible | API propriétaire |
| Licence | Recherche uniquement, usage commercial sur accord | Commerciale |

Le temps chronométré pour Qwen inclut environ trois secondes de file d'attente sur Comfy Cloud. Le coût indiqué pour Qwen ne prend en compte que le temps GPU du modèle. En réalité, une requête complète d'essayage inclut aussi la classification du vêtement, la création du prompt et des contrôles de qualité.

## Les limites de l'exercice

**La licence.** Qwen-Image-2.1 est distribué sous la *Qwen Research License Agreement*, et non sous Apache 2.0 comme l'était Qwen-Image-Edit-2511. Cette licence limite l'utilisation à des fins « non commerciales » (recherche ou évaluation) et impose aux professionnels de demander une licence à Alibaba. Proposer un bouton d'essayage sur une boutique en ligne est un usage commercial. L'auto-hébergement nécessite donc cet accord.

**Les deux défauts.** La gestion de la longueur sur les vêtements longs et la disparition de certains éléments secondaires sur les produits multi-pièces. Ce sont des erreurs systématiques, typiquement le genre de problème qu'un LoRA peut régler. À 7B de paramètres, un adaptateur s'entraîne sur un seul GPU en quelques heures. DiffSynth-Studio (ModelScope) supporte l'entraînement de LoRA pour 2.1 depuis le premier jour et ComfyUI charge les adaptateurs via ses nœuds standards. Les données d'entraînement nécessaires : une photo portée associée au packshot correspondant (ce que les catalogues de mode ont déjà). Un prompt qui précise la catégorie du vêtement, son système de fermeture et sa longueur corrige la plupart des erreurs d'ourlet ; un LoRA s'occupera du reste.

## Qu'est-ce que cela change pour Genlook ?

Qwen-Image-2.1 est le premier modèle ouvert à faire jeu égal avec une API commerciale sur notre jeu de test, pour une fraction du prix par image. Nous mettons actuellement à jour l'architecture de Genlook pour l'utiliser là où il excelle. Cette intégration viendra s'ajouter à la classification des vêtements, à la création des prompts et aux contrôles de qualité qui encadrent n'importe quel modèle, afin de garantir un essayage parfait pour chaque type de produit. Les deux limites mentionnées plus haut sont notre priorité absolue.

Côté développeurs, l'[API Genlook Try-On](https://platform.genlook.app) offre un point d'accès unique pour tous les types de produits. Un crédit = un essayage : 0,04 $ à l'usage, ou à partir de 0,015 $ avec un abonnement mensuel. Les packs de crédits n'expirent jamais et les nouveaux comptes bénéficient de crédits offerts. Le [guide de démarrage rapide](/docs/tryon-api/quickstart) nécessite seulement quatre appels : créer un produit, uploader une photo, générer, récupérer le résultat.

## En résumé

- **La nouveauté :** un modèle ouvert de 7 milliards de paramètres, capable de générer, d'éditer avec jusqu'à 10 références et de gérer la transparence avec un seul checkpoint. C'est le meilleur modèle ouvert sur le benchmark de ses créateurs.
- **Côté essayage virtuel :** il fait jeu égal avec le modèle Vertex AI de Google sur 6 paires sur 8 en mode zero-shot. Meilleur pour ne pas altérer ce qui n'est pas un vêtement, moins bon sur la longueur des vêtements longs.
- **Coût :** environ 0,005 $ de temps GPU par image contre 0,06 $ pour Vertex AI.
- **Le hic :** une licence restreinte à la recherche pour l'auto-hébergement, et deux défauts qu'un LoRA devrait pouvoir corriger.

---

_[Obtenez une clé API sur platform.genlook.app](https://platform.genlook.app) pour utiliser l'API Genlook Try-On, ou [ajoutez l'essayage virtuel à votre boutique](/get-started)._

<Faq>
  <FaqItem
    question="Qwen-Image-2.1 gère-t-il l'essayage virtuel ?"
    answer="Oui. L'annonce officielle présente une tenue composée à partir de cinq images de référence (un mannequin, des vêtements, des chaussures, un sac et un chapeau). Sur nos huit paires de test, il a fait jeu égal avec le modèle Vertex AI de Google sur six d'entre elles en mode zero-shot, avec une victoire et une défaite."
  />
  <FaqItem
    question="Puis-je utiliser Qwen-Image-2.1 gratuitement pour mon entreprise ?"
    answer="Non. Il est publié sous la Qwen Research License Agreement, qui limite l'usage à la recherche non commerciale ou à l'évaluation. Un usage commercial nécessite un accord spécifique avec Alibaba. À titre de comparaison, Qwen-Image-Edit-2511 est sous licence Apache 2.0."
  />
  <FaqItem
    question="Quelles différences entre Qwen-Image-2.1 et l'essayage virtuel de Google Vertex AI ?"
    answer="Lors de nos tests : un temps médian de 9,9 s contre 9,3 s, 8 réussites sur 8 de chaque côté, six égalités sur huit en termes de qualité, et un coût d'environ 0,005 $ en temps GPU par image contre 0,06 $ (prix public) pour Vertex. Vertex est une API commerciale ; Qwen propose des poids ouverts sous licence de recherche."
  />
  <FaqItem
    question="Peut-on fine-tuner Qwen-Image-2.1 avec un LoRA ?"
    answer="Oui. DiffSynth-Studio sur ModelScope permet d'entraîner des LoRA pour Qwen-Image-2.1 et ComfyUI charge les adaptateurs via ses nœuds LoRA standards. Avec ses 7 milliards de paramètres, un adaptateur s'entraîne sur un seul GPU."
  />
  <FaqItem
    question="Combien coûte l'API Genlook Try-On ?"
    answer="Un crédit équivaut à un essayage. Le crédit coûte 0,04 $ sans engagement, ou à partir de 0,015 $ avec un abonnement mensuel : 20 $ pour 1 000 essayages (Starter), 300 $ pour 20 000 (Scale). Les packs de crédits n'expirent jamais et les nouveaux comptes bénéficient de crédits offerts."
  />
</Faq>