El 20 de septiembre de 2026, el equipo Qwen de Alibaba lanzó la versión de código abierto [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1). Es un modelo de imágenes de 7B que genera y edita en un solo flujo de trabajo, admite hasta 10 imágenes de referencia y señala a los [probadores virtuales](/glossary/virtual-try-on) como uno de sus casos de uso principales.
Lo probamos con los ocho conjuntos de persona y prenda que usamos para cada motor, comparándolo con el modelo de probador virtual de Google en Vertex AI, una de las opciones comerciales más comunes. Mismas fotos, mismo flujo de instrucciones, sin ajustes finos.

## ¿Qué es Qwen-Image-2.1?
Qwen-Image-2.1 sustituye a tres modelos anteriores (Qwen-Image para generación, Qwen-Image-Edit para edición y Qwen-Image-Layered para transparencia) por un único punto de control.
- **7B parámetros** en el componente de generación (32 capas DiT de flujo único). Qwen3-VL 8B lee las instrucciones y las imágenes de entrada.
- **Hasta 10 imágenes de referencia** en una sola edición. Según la página de lanzamiento: «para el probador virtual, se pueden combinar cinco entradas (modelo, ropa, zapatos, bolso y sombrero) en un conjunto completo».
- **Edición por regiones.** Rodea un área con un círculo, pinta sobre ella o aplica una máscara independiente, y solo cambiará esa región.
- **Fidelidad de personas y productos** es un objetivo de entrenamiento declarado: los rostros se mantienen iguales en las distintas ediciones, y se conservan el «texto, las texturas y la forma» del producto.
- **Transparencia nativa.** Salida RGBA a partir de una instrucción y extracción del sujeto de una foto como capa transparente.
- **Inferencia eficiente.** Las imágenes de entrada y la instrucción se codifican una vez y se almacenan en caché para cada paso de eliminación de ruido, por lo que una edición con diez referencias cuesta aproximadamente lo mismo por paso que una con una sola referencia.
En su propio Qwen-Image-Bench, el equipo obtiene una puntuación de 60,28, lo que lo sitúa séptimo entre 29 modelos. Los seis primeros son cerrados (GPT Image 2.5 lidera con 67,01). Entre los modelos de pesos abiertos es el primero con gran diferencia.

Este es un banco de pruebas elaborado por ellos mismos y mide la generación, no la edición. Los pesos están en Hugging Face y ModelScope, con soporte desde el primer día en Diffusers, ComfyUI, vLLM-Omni y SGLang.
La licencia es la **Qwen Research License**, «solo para fines no comerciales». El uso comercial requiere un acuerdo independiente con Alibaba. Más abajo.
## ¿Sirve para el probador virtual?
Sí, sin entrenamiento previo (zero-shot).
Configuración: ocho pares de nuestros ejemplos públicos de probadores virtuales, cada uno de los cuales consiste en un selfi frente al espejo y la imagen del producto tal y como la subiría un comerciante (una foto del producto sobre una superficie plana o una foto sobre modelo). Qwen-Image-2.1 funcionó en Comfy Cloud a 16 pasos. Vertex AI se ejecutó a través de su API. Ambos pasaron por el mismo flujo de instrucciones, sin LoRA y sin posprocesamiento. Cada panel se lee de izquierda a derecha: foto del comprador, imagen del producto, Qwen-Image-2.1, Google Vertex AI.
La camiseta de fútbol que encabeza el artículo es la prueba de texto. Ambos modelos mantienen el logotipo del patrocinador y el escudo legibles y en su sitio, y ninguno altera las manos, el teléfono ni el fondo del comprador.

**Dónde es mejor Qwen.** La abaya está fotografiada en una modelo que lleva un pañuelo de color crema. Vertex transfirió el pañuelo junto con la prenda. Qwen cambió la abaya y nada más.

**Dónde es peor Qwen.** La foto del producto en plano llega a media pantorrilla. Vertex mantiene ese largo; Qwen se queda en la rodilla. El cinturón, el cierre y las solapas son correctos en ambos. El largo del dobladillo en prendas largas fue el único fallo constante, y volvió a aparecer en un vestido largo escalonado.
**En los otros cinco pares** (un vestido midi de flores, una sudadera con capucha flúor, un sari de dos piezas, un vestido largo de talla grande y un vestido de novia de encaje) no pudimos desempatar. Ambos mantuvieron la blusa y el borde del sari, ambos acertaron con la escala del estampado en el midi y ninguno alteró los rostros.
## Qwen-Image-2.1 vs. probador virtual de Google Vertex AI
| | Qwen-Image-2.1 en Comfy Cloud | Probador virtual de Google Vertex AI |
|---|---|---|
| Pares completados | 8 de 8 | 8 de 8 |
| Tiempo medio por prueba | 9,9 s | 9,3 s |
| Coste por prueba | alrededor de 0,005 $ (tiempo de GPU) | 0,06 $ (precio de catálogo) |
| Calidad, cara a cara | 6 empates, 1 mejor, 1 peor | 6 empates, 1 mejor, 1 peor |
| Pesos | abiertos, se pueden hacer ajustes finos | API cerrada |
| Licencia | solo investigación, comercial mediante acuerdo | comercial |
El tiempo de Qwen incluye unos tres segundos de espera en Comfy Cloud. El coste de Qwen es el tiempo de GPU del modelo en sí; una solicitud completa de prueba también ejecuta la clasificación de prendas, la construcción de instrucciones y las comprobaciones de calidad.
## El truco
**Licencia.** Qwen-Image-2.1 se distribuye bajo el acuerdo Qwen Research License Agreement, no bajo Apache 2.0 como Qwen-Image-Edit-2511. El archivo de licencia permite su uso «solo para fines no comerciales», definidos como investigación o evaluación, e insta a los usuarios comerciales a solicitar una licencia a Alibaba. Un botón de probador virtual en una tienda es uso comercial. El alojamiento propio necesita ese acuerdo.
**Los dos fallos.** El largo del dobladillo en prendas largas y la omisión de piezas secundarias en algunos productos de varias partes. Ambos son sistemáticos, que es para lo que sirve un LoRA. A 7B, un adaptador se entrena en una sola GPU en cuestión de horas. DiffSynth-Studio de ModelScope admite el entrenamiento LoRA en la versión 2.1 desde el primer día, y ComfyUI carga adaptadores a través de sus nodos estándar. Los datos de entrenamiento son una foto sobre modelo junto con la foto del producto en plano correspondiente, algo que los catálogos de moda ya tienen. Una instrucción que nombre la categoría de prenda, el cierre y el largo soluciona la mayoría de los fallos del dobladillo por sí sola; un LoRA se encarga del resto.
## Qué significa esto para Genlook
Qwen-Image-2.1 es el primer modelo abierto que alcanza la paridad con una API de prueba comercial en nuestros pares de ejemplos, a una fracción del coste por imagen. Estamos actualizando el proceso de prueba de Genlook para usarlo donde es más fuerte, además de la clasificación de prendas, la construcción de instrucciones y las comprobaciones de calidad que acompañan a cualquier modelo, para que cada tipo de producto tenga la mejor calidad de prueba disponible. Los dos fallos mencionados anteriormente son el primer objetivo de las mejoras del proceso.
Para los desarrolladores, la [API del probador de Genlook](https://platform.genlook.app) es un punto de conexión único para todos los tipos de productos. Un crédito equivale a una prueba: 0,04 $ de pago por uso o desde 0,015 $ con un plan mensual. Los créditos de los paquetes no caducan, y las cuentas nuevas empiezan con créditos gratis. La [guía de inicio rápido](/docs/tryon-api/quickstart) consta de cuatro llamadas: crear un producto, subir una foto, generar y obtener el resultado.
## Resumen
- **El lanzamiento:** un modelo de pesos abiertos de 7B que genera, edita con hasta 10 referencias y gestiona la transparencia en un solo punto de control. El mejor modelo abierto en las pruebas del propio equipo.
- **En el probador virtual:** iguala al modelo Vertex AI de Google en 6 de 8 pares (zero-shot). Es mejor a la hora de no alterar elementos que no sean prendas y peor en el largo de dobladillo para prendas largas.
- **Coste:** aproximadamente 0,005 $ de tiempo de GPU por imagen frente a 0,06 $.
- **El truco:** una licencia solo para investigación en caso de alojamiento propio, y dos fallos que un LoRA debería solucionar.
---
_[Obtén una clave de API en platform.genlook.app](https://platform.genlook.app) para usar la API del probador de Genlook, o [añade el probador virtual a tu tienda](/get-started)._
<Faq>
<FaqItem
question="¿Puede Qwen-Image-2.1 funcionar como probador virtual?"
answer="Sí. El lanzamiento muestra un conjunto ensamblado a partir de cinco imágenes de referencia (modelo, ropa, zapatos, bolso y sombrero). En nuestros ocho pares de referencia igualó al modelo de probador de Google Vertex AI en seis de las pruebas sin entrenamiento previo, con un resultado mejor y otro peor."
/>
<FaqItem
question="¿Es gratis el uso comercial de Qwen-Image-2.1?"
answer="No. Se ha lanzado bajo el acuerdo Qwen Research License Agreement, que limita el uso a investigación o evaluación no comercial y requiere una licencia comercial de Alibaba por separado. Qwen-Image-Edit-2511 es Apache 2.0."
/>
<FaqItem
question="¿Cómo se compara Qwen-Image-2.1 con el probador virtual de Google Vertex AI?"
answer="En nuestra prueba: una media de 9,9 s frente a 9,3 s, los 8 completados en cada caso, seis empates de ocho en cuanto a calidad, y alrededor de 0,005 $ de tiempo de GPU por imagen frente a los 0,06 $ de precio de catálogo de Vertex. Vertex es una API comercial; Qwen es de pesos abiertos bajo una licencia de investigación."
/>
<FaqItem
question="¿Se pueden hacer ajustes finos a Qwen-Image-2.1 con un LoRA?"
answer="Sí. DiffSynth-Studio en ModelScope admite el entrenamiento LoRA para Qwen-Image-2.1 y ComfyUI carga adaptadores a través de sus nodos LoRA estándar. Con 7B parámetros, un adaptador se entrena en una sola GPU."
/>
<FaqItem
question="¿Cuánto cuesta la API del probador de Genlook?"
answer="Un crédito equivale a una prueba. Los créditos cuestan 0,04 $ en modalidad de pago por uso o desde 0,015 $ con un plan mensual: el plan Starter cuesta 20 $ por 1000 pruebas y el plan Scale cuesta 300 $ por 20 000. Los créditos de los paquetes no caducan, y las cuentas nuevas empiezan con créditos gratuitos."
/>
</Faq>