El 20 de septiembre de 2026, el equipo de Qwen en Alibaba lanzó en código abierto [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1). Se trata de un modelo de imágenes de 7B que genera y edita en un único proceso, admite hasta 10 imágenes de referencia y señala a los [probadores virtuales](/glossary/virtual-try-on) como uno de sus casos de uso principales.
Lo probamos con los ocho conjuntos de persona y prenda que usamos para evaluar cada motor, y lo comparamos con el modelo de prueba virtual de Google en Vertex AI, una de las opciones comerciales más habituales. Mismas fotos, mismo proceso de *prompts* y sin reentrenamiento (*fine-tuning*).

## ¿Qué es Qwen-Image-2.1?
Qwen-Image-2.1 sustituye a tres modelos anteriores (Qwen-Image para generación, Qwen-Image-Edit para edición y Qwen-Image-Layered para transparencias) en un único *checkpoint*.
- **7B de parámetros** en el componente de generación (32 capas DiT de flujo único). Qwen3-VL 8B se encarga de interpretar el *prompt* y las imágenes de entrada.
- **Hasta 10 imágenes de referencia** en una sola edición. Según las notas de la versión: «para los probadores virtuales, se pueden combinar cinco entradas (modelo, ropa, zapatos, bolso y sombrero) para crear un conjunto completo».
- **Edición por zonas.** Puedes rodear un área, pintar sobre ella o usar una máscara para que los cambios se apliquen solo a esa parte.
- **Fidelidad de personas y productos**, que es un objetivo declarado en su entrenamiento: los rostros se mantienen idénticos en las ediciones y se conservan el «texto, las texturas y la forma» del producto.
- **Transparencia nativa.** Salida RGBA a partir de un *prompt* y extracción del sujeto de una foto como capa transparente.
- **Inferencia eficiente.** Las imágenes de entrada y la instrucción se codifican una sola vez y se guardan en caché para cada paso de reducción de ruido (*denoising*), por lo que una edición con diez referencias cuesta casi lo mismo por paso que una con una sola referencia.
En la propia prueba de evaluación del equipo, Qwen-Image-Bench, obtiene una puntuación de 60,28, situándose en el séptimo puesto de 29 modelos. Los seis que le superan son modelos cerrados (GPT Image 2.5 lidera con 67,01). Entre los modelos de pesos abiertos, ocupa el primer puesto con un amplio margen.

Se trata de un *benchmark* elaborado por ellos mismos y mide la generación, no la edición. Los pesos están disponibles en Hugging Face y ModelScope, con soporte desde el primer día en Diffusers, ComfyUI, vLLM-Omni y SGLang.
La licencia aplicable es la **Qwen Research License**, «exclusivamente para fines no comerciales». El uso comercial requiere un acuerdo independiente con Alibaba. A continuación, más detalles.
## ¿Sirve para probadores virtuales?
Sí, sin necesidad de entrenamiento previo (*zero-shot*).
Configuración: ocho combinaciones de nuestros ejemplos públicos de prueba virtual. Cada una consta de un selfi en el espejo y la imagen del producto tal como la subiría un vendedor (una foto del producto sobre una superficie plana o en un modelo). Qwen-Image-2.1 se ejecutó en Comfy Cloud a 16 pasos. Vertex AI se usó a través de su API. Ambos pasaron por el mismo proceso de *prompts*, sin LoRA ni posprocesamiento. Cada panel muestra, de izquierda a derecha: la foto del comprador, la imagen del producto, Qwen-Image-2.1 y Google Vertex AI.
La camiseta de fútbol al principio del artículo corresponde a la prueba de texto. Ambos modelos mantienen legible y en su sitio el logotipo del patrocinador y el escudo, y ninguno altera las manos del cliente, el móvil ni el fondo.

**En qué destaca Qwen.** La abaya aparece fotografiada en un modelo que lleva un pañuelo de color crema. Vertex incorporó el pañuelo junto con la prenda. Qwen modificó únicamente la abaya.

**En qué falla Qwen.** En la foto del producto, la gabardina llega a media pantorrilla. Vertex respeta ese largo, mientras que Qwen lo recorta a la altura de la rodilla. Tanto el cinturón como el cierre y las solapas son correctos en ambos casos. La longitud del bajo en prendas largas fue el único error recurrente, repitiéndose también en un vestido largo de volantes.
**En cuanto a las otras cinco prendas** (un vestido midi de flores, una sudadera flúor, un sari de dos piezas, un vestido largo de talla grande y un vestido de novia de encaje), los resultados fueron un empate. Ambos incluyeron la blusa y el borde del sari, acertaron con la escala del estampado en el vestido midi y ninguno modificó los rostros.
## Qwen-Image-2.1 frente al probador virtual de Google Vertex AI
| | Qwen-Image-2.1 en Comfy Cloud | Probador virtual de Google Vertex AI |
|---|---|---|
| Combinaciones completadas | 8 de 8 | 8 de 8 |
| Tiempo medio por prueba | 9,9 s | 9,3 s |
| Coste por prueba | Aprox. 0,005 $ (tiempo de GPU) | 0,06 $ (precio de catálogo) |
| Calidad, lado a lado | 6 empates, 1 mejor, 1 peor | 6 empates, 1 mejor, 1 peor |
| Pesos | Abiertos, puede hacerse *fine-tuning* | API cerrada |
| Licencia | Solo para investigación, comercial bajo acuerdo | Comercial |
El tiempo de Qwen incluye unos tres segundos de espera en la cola de Comfy Cloud. El coste de Qwen se calcula en base al tiempo de GPU dedicado únicamente al modelo; una solicitud de prueba completa también incluye la clasificación de la prenda, la creación del *prompt* y comprobaciones de calidad.
## El truco
**Licencia.** Qwen-Image-2.1 se distribuye bajo el acuerdo de licencia Qwen Research, y no bajo Apache 2.0 como Qwen-Image-Edit-2511. El documento de licencia permite su uso «exclusivamente para fines no comerciales», lo que abarca la investigación o evaluación, y requiere que los usuarios comerciales soliciten una licencia a Alibaba. Añadir un botón de prueba virtual en una tienda online se considera un uso comercial. Del mismo modo, el autoalojamiento (*self-hosting*) precisa dicho acuerdo.
**Los dos fallos.** La longitud del bajo en las prendas largas y la omisión de elementos secundarios en algunos artículos de varias piezas. Como ambos problemas son sistemáticos, se pueden solucionar con un LoRA. Con 7B de parámetros, un adaptador se entrena en unas horas usando una sola GPU. DiffSynth-Studio de ModelScope permite entrenar modelos LoRA en la versión 2.1 desde el primer momento, y ComfyUI carga los adaptadores mediante sus nodos estándar. Los datos de entrenamiento consisten en emparejar una foto del producto en un modelo con la imagen correspondiente del artículo suelto, algo que los catálogos de moda ya suelen tener. Un *prompt* que especifique la categoría de la prenda, el tipo de cierre y su longitud soluciona la mayoría de los errores del bajo; un LoRA se encarga del resto.
## Qué implica esto para Genlook
Qwen-Image-2.1 es el primer modelo abierto que logra igualar a una API de probador comercial en nuestras combinaciones de prueba, con un coste por imagen considerablemente inferior. Estamos actualizando el sistema de prueba de Genlook para integrarlo donde ofrezca mejores resultados, sumado a la clasificación de prendas, la redacción de *prompts* y los controles de calidad que aplicamos a todos los modelos, para garantizar que cada categoría de producto reciba la máxima calidad en la prueba virtual. Los dos fallos mencionados son las primeras áreas que abordará esta actualización.
Para los desarrolladores, la [API de probador virtual de Genlook](https://platform.genlook.app) es un punto de acceso único para cualquier tipo de producto. Un crédito equivale a una prueba: 0,04 $ si pagas según uso, o desde 0,015 $ con una suscripción mensual. Los créditos de los paquetes no caducan y las nuevas cuentas empiezan con créditos de regalo. La [guía de inicio rápido](/docs/tryon-api/quickstart) requiere cuatro pasos: crear un producto, subir una foto, generar y obtener el resultado.
## Resumen
- **El lanzamiento:** un modelo de pesos abiertos de 7B que genera, edita usando hasta 10 referencias y gestiona las transparencias desde un único *checkpoint*. Es el mejor modelo abierto según la evaluación del propio equipo.
- **En la prueba virtual:** iguala al modelo Vertex AI de Google en 6 de 8 casos sin entrenamiento previo (*zero-shot*). Es mejor a la hora de no alterar elementos ajenos a la ropa, pero rinde peor ajustando el bajo de las prendas largas.
- **Coste:** aproximadamente 0,005 $ de tiempo de GPU por imagen, frente a los 0,06 $.
- **El truco:** una licencia limitada a la investigación para el autoalojamiento y dos errores que deberían poder corregirse con un modelo LoRA.
---
_[Obtén una clave de API en platform.genlook.app](https://platform.genlook.app) para usar la API de probador virtual de Genlook o [añade el probador a tu tienda online](/get-started)._
<Faq>
<FaqItem
question="¿Puede Qwen-Image-2.1 funcionar como probador virtual?"
answer="Sí. La presentación incluye un ejemplo de un conjunto montado a partir de cinco imágenes de referencia (modelo, ropa, zapatos, bolso y sombrero). En nuestra prueba de ocho prendas, empató en seis ocasiones con el modelo Vertex AI de Google sin entrenamiento previo, obteniendo un resultado mejor en una y peor en otra."
/>
<FaqItem
question="¿El uso comercial de Qwen-Image-2.1 es gratuito?"
answer="No. Se distribuye bajo el acuerdo de licencia Qwen Research, que restringe su uso a investigaciones o evaluaciones no comerciales y exige solicitar una licencia comercial a Alibaba. Qwen-Image-Edit-2511 sí cuenta con licencia Apache 2.0."
/>
<FaqItem
question="¿Cómo rinde Qwen-Image-2.1 en comparación con el probador virtual de Google Vertex AI?"
answer="En nuestra prueba: 9,9 s de tiempo medio frente a 9,3 s, ambos completaron los 8 casos, 6 de los 8 terminaron en empate de calidad y el coste fue de unos 0,005 $ en tiempo de GPU por imagen en contraste con los 0,06 $ de precio de catálogo de Vertex. Vertex es una API comercial, mientras que Qwen tiene pesos abiertos con licencia de investigación."
/>
<FaqItem
question="¿Se puede aplicar *fine-tuning* a Qwen-Image-2.1 con un LoRA?"
answer="Sí. DiffSynth-Studio en ModelScope admite el entrenamiento de modelos LoRA para Qwen-Image-2.1 y ComfyUI carga los adaptadores mediante sus nodos estándar para LoRA. Con 7B de parámetros, un adaptador se entrena usando una sola GPU."
/>
<FaqItem
question="¿Cuánto cuesta la API de probador de Genlook?"
answer="Un crédito equivale a una prueba virtual. Los créditos cuestan 0,04 $ en la modalidad de pago por uso o desde 0,015 $ en la suscripción mensual. El plan Starter cuesta 20 $ por 1000 pruebas; el Growth, 99 $ por 6000 pruebas; y el Scale, 300 $ por 20 000. Los créditos de los paquetes no caducan y las cuentas nuevas incluyen créditos gratuitos."
/>
</Faq>