Le 20 septembre 2026, l'équipe Qwen d'Alibaba a publié [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1) en open source. Il s'agit d'un modèle d'image 7B capable de générer et d'éditer via un pipeline unique. Il accepte jusqu'à 10 images de référence et cite [l'essayage virtuel](/glossary/virtual-try-on) comme l'un de ses cas d'usage principaux. 

Nous l'avons mis à l'épreuve sur les huit paires (personne et vêtement) que nous utilisons pour évaluer chaque moteur, face au modèle d'essayage virtuel de Google sur Vertex AI, l'une des solutions commerciales les plus répandues. Les photos sont identiques, le pipeline de prompts est le même, sans aucun fine-tuning.

![Essayage d'un maillot de football. De gauche à droite : photo de l'acheteur, packshot du produit, résultat Qwen-Image-2.1, résultat Google Vertex AI.](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## Qu'est-ce que Qwen-Image-2.1 ?

Qwen-Image-2.1 remplace trois modèles distincts (Qwen-Image pour la génération, Qwen-Image-Edit pour la retouche et Qwen-Image-Layered pour la transparence) par un seul point de contrôle (checkpoint).

- **7B paramètres** dans le composant de génération (32 couches DiT à flux unique). Qwen3-VL 8B se charge de lire le prompt et les images d'entrée.
- **Jusqu'à 10 images de référence** pour une seule retouche. Selon la note de version : « pour l'essayage virtuel, cinq entrées (un mannequin, des vêtements, des chaussures, un sac et un chapeau) peuvent être combinées pour former une tenue complète. »
- **Édition par zone.** Entourez une zone, peignez dessus ou utilisez un masque séparé, et seule cette partie sera modifiée.
- **Fidélité des personnes et des produits :** c'est un objectif d'entraînement clairement affiché. Les visages restent identiques après retouche, et « le texte, les textures ainsi que la forme » des produits sont préservés.
- **Transparence native.** Sortie RGBA à partir d'un prompt et extraction du sujet d'une photo sous forme de calque transparent.
- **Inférence efficace.** Les images d'entrée et les instructions sont encodées une seule fois puis mises en cache pour chaque étape de débruitage. Une retouche avec dix références coûte donc environ la même chose par étape qu'une retouche avec une seule référence.

Sur le propre banc d'essai de l'équipe (Qwen-Image-Bench), il obtient un score de 60,28, se classant septième sur 29 modèles. Les six premiers sont des modèles fermés (GPT Image 2.5 est en tête avec 67,01). En revanche, parmi les modèles à poids ouverts, il occupe largement la première place.

![Scores Qwen-Image-Bench des modèles d'image à poids ouverts avec leur nombre de paramètres. Qwen-Image-2.1 est en tête avec un score de 60,28 pour 7B paramètres.](/blog-images/qwen-image-2-1-bench-open-weights.webp)

Il s'agit d'un benchmark auto-évalué qui mesure la génération, et non la retouche. Les poids sont disponibles sur Hugging Face et ModelScope, avec une compatibilité dès la sortie sur Diffusers, ComfyUI, vLLM-Omni et SGLang.

La licence applicable est la **Qwen Research License**, « à des fins non commerciales uniquement ». Toute utilisation commerciale nécessite un accord séparé avec Alibaba. Plus de détails ci-dessous.

## Est-ce que ça fonctionne pour l'essayage virtuel ?

Oui, en zero-shot (sans entraînement préalable).

Configuration : huit paires issues de nos exemples publics d'essayage, comprenant chacune un selfie dans un miroir et la photo du produit telle qu'un marchand l'ajouterait (un packshot à plat ou une photo sur mannequin). Qwen-Image-2.1 a tourné sur Comfy Cloud avec 16 étapes. Vertex AI a fonctionné via son API. Tous deux ont suivi le même pipeline de prompts, sans LoRA ni post-traitement. Chaque panneau se lit de gauche à droite : photo de l'acheteur, image du produit, Qwen-Image-2.1, Google Vertex AI.

Le maillot de football en haut de cet article est le test de texte. Les deux modèles gardent le logo du sponsor et l'écusson parfaitement lisibles et à la bonne place. Aucun d'eux ne modifie les mains, le téléphone ou l'arrière-plan de l'acheteur.

![Essayage d'une abaya. De gauche à droite : photo de l'acheteuse, photo du produit porté avec un foulard crème, résultat Qwen-Image-2.1 modifiant uniquement l'abaya, résultat Google Vertex AI ajoutant également le foulard.](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Là où Qwen est meilleur.** L'abaya est photographiée sur un mannequin portant un foulard crème. Vertex a repris le foulard avec le vêtement. Qwen a changé l'abaya, et absolument rien d'autre.

![Essayage d'un trench-coat. De gauche à droite : photo de l'acheteuse, packshot à plat, résultat Qwen-Image-2.1 s'arrêtant au genou, résultat Google Vertex AI conservant la longueur mi-mollet.](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Là où Qwen est moins bon.** Le packshot montre un vêtement qui descend à mi-mollet. Vertex conserve cette longueur, mais Qwen s'arrête au genou. La ceinture, la fermeture et les revers sont corrects sur les deux. La longueur des ourlets sur les vêtements longs a été le seul défaut systématique, que nous avons de nouveau observé sur une robe longue à volants.

**Pour les cinq autres paires** (une robe midi à fleurs, un sweat à capuche fluo, un sari deux pièces, une robe longue grande taille, une robe de mariée en dentelle), il était impossible de les départager. Tous deux ont correctement intégré le chemisier et la bordure du sari, ont respecté l'échelle des motifs de la robe midi et n'ont altéré aucun visage.

## Qwen-Image-2.1 face à l'essayage virtuel Google Vertex AI

| | Qwen-Image-2.1 sur Comfy Cloud | Essayage virtuel Google Vertex AI |
|---|---|---|
| Paires complétées | 8 sur 8 | 8 sur 8 |
| Temps médian par essayage | 9,9 s | 9,3 s |
| Coût par essayage | environ 0,005 $ (temps GPU) | 0,06 $ (prix catalogue) |
| Qualité, côte à côte | 6 égalités, 1 meilleur, 1 moins bon | 6 égalités, 1 meilleur, 1 moins bon |
| Poids | ouverts, fine-tuning possible | API fermée |
| Licence | recherche uniquement, commercial sous accord | commerciale |

Le temps mesuré pour Qwen inclut environ trois secondes de file d'attente sur Comfy Cloud. Le coût de Qwen correspond au temps GPU pour le modèle seul ; une requête complète d'essayage comprend également la classification du vêtement, la construction du prompt et les contrôles qualité.

## Le bémol

**La licence.** Qwen-Image-2.1 est distribué sous la Qwen Research License Agreement, et non sous licence Apache 2.0 comme l'était Qwen-Image-Edit-2511. Le fichier de licence autorise une utilisation « à des fins non commerciales uniquement », c'est-à-dire pour la recherche ou l'évaluation, et oblige les utilisateurs commerciaux à demander une licence auprès d'Alibaba. Proposer un bouton d'essayage sur une boutique en ligne constitue un usage commercial. L'auto-hébergement requiert donc cet accord.

**Les deux défauts.** La longueur des ourlets sur les vêtements longs et la disparition d'éléments secondaires sur certains produits composés de plusieurs pièces. Ces deux erreurs sont systématiques, et c'est précisément à cela que sert un LoRA. Avec 7B paramètres, un adaptateur s'entraîne sur un seul GPU en quelques heures. DiffSynth-Studio de ModelScope prend en charge l'entraînement LoRA sur la version 2.1 dès son lancement, et ComfyUI charge les adaptateurs via ses nœuds habituels. Les données d'entraînement se limitent à une photo sur mannequin associée au packshot correspondant, des éléments que les catalogues de mode possèdent déjà. Un prompt précisant la catégorie du vêtement, son type de fermeture et sa longueur corrige de lui-même la plupart des erreurs d'ourlet ; un LoRA s'occupe du reste.

## Ce que cela signifie pour Genlook

Qwen-Image-2.1 est le premier modèle ouvert à faire jeu égal avec une API d'essayage commerciale sur nos paires de test, et ce pour une fraction du coût par image. Nous mettons actuellement à jour le pipeline d'essayage de Genlook pour l'utiliser là où il excelle, en complément de la classification des vêtements, de la création de prompts et des contrôles qualité qui accompagnent chaque modèle, afin que chaque type de produit bénéficie de la meilleure qualité d'essayage possible. Les deux défauts mentionnés plus haut sont d'ailleurs notre priorité pour cette mise à jour.

Pour les développeurs, [l'API Genlook Try-On](https://platform.genlook.app) offre un endpoint unique adapté à tous les types de produits. Un crédit correspond à un essayage : 0,04 $ à l'usage, ou à partir de 0,015 $ avec un abonnement mensuel. Les crédits achetés en packs n'expirent jamais, et les nouveaux comptes démarrent avec des crédits offerts. Le [guide de démarrage rapide](/docs/tryon-api/quickstart) se résume à quatre appels : créer un produit, uploader une photo, générer l'image, récupérer le résultat.

## En résumé

- **La nouveauté :** un modèle ouvert de 7B paramètres qui génère des images, les édite avec jusqu'à 10 références et gère la transparence via un seul point de contrôle. Il s'agit du meilleur modèle ouvert selon le banc d'essai de l'équipe.
- **Pour l'essayage :** il fait jeu égal avec le modèle Vertex AI de Google sur 6 paires sur 8 en zero-shot. Il est meilleur pour ne pas altérer les éléments non vestimentaires, mais moins performant sur la longueur des ourlets pour les vêtements longs.
- **Le coût :** environ 0,005 $ de temps GPU par image, contre 0,06 $.
- **Le bémol :** une licence restreinte à la recherche pour l'auto-hébergement, et deux défauts qu'un LoRA devrait pouvoir corriger.

---

_[Obtenez une clé API sur platform.genlook.app](https://platform.genlook.app) pour utiliser l'API Genlook Try-On, ou [ajoutez l'essayage virtuel à votre boutique](/get-started)._

<Faq>
  <FaqItem
    question="Qwen-Image-2.1 permet-il l'essayage virtuel ?"
    answer="Oui. La note de version présente une tenue complète assemblée à partir de cinq images de référence (un mannequin, des vêtements, des chaussures, un sac et un chapeau). Sur nos huit paires de test, il a fait jeu égal avec le modèle d'essayage Vertex AI de Google sur six paires en zero-shot, s'est montré meilleur sur une et moins bon sur une autre."
  />
  <FaqItem
    question="L'utilisation de Qwen-Image-2.1 est-elle gratuite à des fins commerciales ?"
    answer="Non. Il est publié sous la Qwen Research License Agreement, qui limite son usage à la recherche et à l'évaluation non commerciales. Une licence commerciale distincte doit être demandée auprès d'Alibaba. (Qwen-Image-Edit-2511 est quant à lui sous licence Apache 2.0)."
  />
  <FaqItem
    question="Comment Qwen-Image-2.1 se compare-t-il à l'essayage virtuel Google Vertex AI ?"
    answer="Lors de nos tests : temps médian de 9,9 s contre 9,3 s, 8 essais sur 8 complétés pour chacun, six égalités sur huit en termes de qualité, et un coût en temps GPU d'environ 0,005 $ par image, contre un prix catalogue de 0,06 $ pour Vertex. Vertex est une API commerciale, tandis que Qwen est un modèle à poids ouverts sous licence de recherche."
  />
  <FaqItem
    question="Peut-on fine-tuner Qwen-Image-2.1 avec un LoRA ?"
    answer="Oui. DiffSynth-Studio sur ModelScope prend en charge l'entraînement LoRA pour Qwen-Image-2.1, et ComfyUI charge les adaptateurs via ses nœuds LoRA standards. Avec 7B paramètres, un adaptateur s'entraîne sur un seul GPU."
  />
  <FaqItem
    question="Quel est le prix de l'API Genlook Try-On ?"
    answer="Un crédit correspond à un essayage. Les crédits coûtent 0,04 $ à l'usage, ou à partir de 0,015 $ avec un forfait mensuel : Starter est à 20 $ pour 1 000 essayages, Growth à 99 $ pour 6 000, et Scale à 300 $ pour 20 000. Les crédits des packs n'expirent jamais et les nouveaux comptes bénéficient de crédits offerts pour démarrer."
  />
</Faq>