Le 20 septembre 2026, l'équipe Qwen d'Alibaba a publié en open source Qwen-Image-2.1. Ce modèle d'image de 7 milliards de paramètres génère et retouche dans un seul et même flux de travail, accepte jusqu'à 10 images de référence et cible explicitement l'essayage virtuel.
Nous l'avons mis à l'épreuve avec nos huit paires personne-vêtement de référence face au modèle d'essayage virtuel de Google sur Vertex AI, l'une des solutions commerciales les plus répandues. Mêmes photos, même prompt, pas de fine-tuning.

Qwen-Image-2.1, c'est quoi ?
Qwen-Image-2.1 remplace trois anciens modèles (Qwen-Image pour la génération, Qwen-Image-Edit pour la retouche, Qwen-Image-Layered pour la transparence) par un seul et unique point de contrôle.
- 7 milliards de paramètres dans le module de génération (32 couches DiT à flux unique). Qwen3-VL 8B se charge de lire le prompt et les images sources.
- Jusqu'à 10 images de référence pour une seule retouche. La page de présentation précise que « pour un essayage virtuel, cinq éléments (un mannequin, un vêtement, des chaussures, un sac et un chapeau) peuvent être combinés pour former une tenue complète ».
- Retouche ciblée. Entourez une zone, peignez dessus ou fournissez un masque : seule cette zone sera modifiée.
- Fidélité au produit et au visage : c'est l'un des objectifs annoncés. Les visages restent identiques, les « textes, textures et formes » des produits sont préservés.
- Transparence native. Sortie RGBA à partir d'un prompt et extraction du sujet d'une photo sous forme de calque transparent.
- Inférence optimisée. Les images sources et l'instruction sont encodées une seule fois puis mises en cache. Ainsi, une retouche avec dix références ne coûte pas plus cher en ressources qu'une retouche avec une seule.
Sur son propre banc d'essai Qwen-Image-Bench, le modèle affiche un score de 60,28, se classant 7e sur 29. Les six modèles qui le devancent sont propriétaires (GPT Image 2.5 est en tête avec 67,01). Parmi les modèles à poids ouverts, il écrase la concurrence.

Gardez en tête qu'il s'agit d'un benchmark interne mesurant la génération brute et non la retouche. Les poids sont disponibles sur Hugging Face et ModelScope, avec une compatibilité immédiate sur Diffusers, ComfyUI, vLLM-Omni et SGLang.
Attention : le modèle est sous Qwen Research License, donc « réservé à un usage non commercial ». Une exploitation commerciale exige un accord spécifique avec Alibaba. On en reparle plus bas.
Est-ce que ça marche pour l'essayage virtuel ?
Oui, du premier coup.
Notre configuration : huit duos issus de nos exemples publics. D'un côté, un selfie dans le miroir ; de l'autre, la photo du produit telle qu'un marchand l'importerait (un packshot à plat ou porté par un mannequin). Qwen-Image-2.1 a tourné sur Comfy Cloud en 16 étapes. Vertex AI a été sollicité via son API. Les deux modèles ont reçu les mêmes instructions, sans LoRA ni post-traitement. Sur chaque visuel de gauche à droite : photo de l'acheteur, image du produit, Qwen-Image-2.1, Google Vertex AI.
Le maillot de foot tout en haut de cet article constituait le test de lecture. Les deux modèles ont conservé le logo du sponsor et l'écusson de manière lisible et à la bonne place. Aucun n'a déformé les mains du client, ni son téléphone, ni le décor.

Où Qwen s'en sort mieux. L'abaya est photographiée sur un mannequin portant un foulard crème. Vertex a incrusté le foulard avec le vêtement. Qwen a changé l'abaya et seulement l'abaya.

Où Qwen peine un peu. Le packshot montre un trench descendant à mi-mollet. Vertex conserve cette coupe ; Qwen l'arrête au genou. La ceinture, la boutonnière et le col sont impeccables chez les deux. La longueur de l'ourlet sur les pièces longues s'est avérée être son principal défaut, également constaté sur une robe longue à volants.
Pour les cinq autres duos (une robe midi fleurie, un sweat fluo, un sari en deux pièces, une robe longue grande taille, une robe de mariée en dentelle), impossible de les départager. Les deux ont respecté le chemisier et les bordures du sari, l'échelle de l'imprimé fleuri était parfaite, et aucun visage n'a été altéré.
Match : Qwen-Image-2.1 contre l'essayage virtuel Google Vertex AI
| Qwen-Image-2.1 sur Comfy Cloud | Essayage virtuel Google Vertex AI | |
|---|---|---|
| Duos réussis | 8 sur 8 | 8 sur 8 |
| Temps médian par essayage | 9,9 s | 9,3 s |
| Coût par essayage | Environ 0,005 $ (temps GPU) | 0,06 $ (prix public) |
| Qualité comparée | 6 égalités, 1 victoire, 1 défaite | 6 égalités, 1 victoire, 1 défaite |
| Poids | Ouverts, fine-tuning possible | API fermée |
| Licence | Recherche uniquement, commercial sur accord | Commerciale |
Le temps de Qwen inclut environ trois secondes d'attente sur Comfy Cloud. Son coût ne couvre que le temps machine du modèle ; une requête complète d'essayage nécessite aussi une classification du vêtement, l'élaboration du prompt et des vérifications de qualité.
Le hic
La licence. Qwen-Image-2.1 est distribué sous la Qwen Research License Agreement, et non sous Apache 2.0 comme Qwen-Image-Edit-2511. Cette licence autorise un usage « exclusivement non commercial » (recherche ou évaluation). Pour toute utilisation commerciale, il faut demander l'autorisation d'Alibaba. Un bouton d'essayage sur une boutique en ligne est un usage commercial. L'héberger soi-même requiert cet accord.
Les deux défauts. La longueur des ourlets sur les pièces longues et l'oubli de certaines pièces secondaires sur des tenues complexes. Ces erreurs sont systématiques : c'est exactement ce qu'un LoRA permet de corriger. Avec 7 milliards de paramètres, l'entraînement d'un adaptateur prend quelques heures sur un seul GPU. DiffSynth-Studio de ModelScope permet d'entraîner des LoRA pour 2.1 dès le premier jour et ComfyUI les charge via ses nœuds standards. Les données d'entraînement idéales : une photo du produit porté couplée à son packshot, ce que possèdent déjà la plupart des catalogues de mode. Un prompt précisant le type de vêtement, le système de fermeture et la longueur règle déjà une bonne partie des problèmes d'ourlet ; un LoRA s'occupe du reste.
Qu'est-ce que cela signifie pour Genlook ?
Qwen-Image-2.1 est le premier modèle ouvert à rivaliser avec une API d'essayage commerciale sur notre base de test, pour une fraction du coût par image. Nous allons l'intégrer au flux de travail d'essayage Genlook là où il excelle. Il viendra s'ajouter à la classification des vêtements, à l'élaboration des prompts et aux contrôles qualité dont bénéficie chaque modèle, pour offrir la meilleure qualité possible quel que soit le produit. Les deux limites mentionnées plus haut sont notre priorité absolue.
Pour les développeurs, l'API d'essayage Genlook regroupe tout type de vêtement sous un seul point de terminaison. Un crédit équivaut à un essayage et coûte 0,01 $. Pas d'abonnement, pas de frais fixes, pas de minimum mensuel, les crédits n'expirent jamais et un nouveau compte bénéficie de crédits offerts. Le guide de démarrage tient en quatre requêtes : créer le produit, télécharger la photo, générer, récupérer le résultat.
En résumé
- La sortie : un modèle ouvert de 7 milliards de paramètres qui génère, retouche avec jusqu'à 10 références et gère la transparence, le tout depuis un seul point de contrôle. Le meilleur modèle ouvert du moment sur le banc d'essai de son équipe.
- L'essayage : il fait jeu égal avec le modèle Google Vertex AI sur 6 de nos 8 tests sans aucun entraînement préalable. Mieux pour ignorer les éléments extérieurs à la tenue, moins précis sur la longueur des ourlets pour les pièces longues.
- Le coût : environ 0,005 $ de temps machine par image contre 0,06 $.
- Le bémol : une licence cantonnée à la recherche pour l'hébergement personnel, et deux défauts qui nécessiteront un LoRA.
Obtenez une clé API sur platform.genlook.app pour utiliser l'API d'essayage Genlook, ou ajoutez l'essayage virtuel à votre boutique.
FAQ