El 20 de septiembre de 2026, el equipo Qwen de Alibaba publicó Qwen-Image-2.1 en código abierto. Es un modelo de imagen de 7B que genera y edita en un único flujo de trabajo, admite hasta 10 imágenes de referencia y señala los probadores virtuales como uno de sus principales casos de uso.
Lo probamos con los ocho pares de persona y prenda que utilizamos en cada motor de IA, junto al modelo de probador virtual de Google en Vertex AI, una de las opciones comerciales más habituales. Las mismas fotos, los mismos prompts, sin ningún ajuste fino.

¿Qué es Qwen-Image-2.1?
Qwen-Image-2.1 unifica tres modelos anteriores (Qwen-Image para generación, Qwen-Image-Edit para edición, y Qwen-Image-Layered para transparencias) en un solo archivo checkpoint.
- 7B de parámetros en el componente de generación (32 capas DiT single-stream). Qwen3-VL 8B interpreta la instrucción y las imágenes de entrada.
- Hasta 10 imágenes de referencia en una sola edición. Según las notas de la versión: "para los probadores virtuales, se pueden combinar cinco elementos de entrada (modelo, ropa, zapatos, bolso y sombrero) para crear un conjunto completo".
- Edición por zonas. Rodea un área, píntala, o usa una máscara independiente; el modelo solo modificará esa región.
- Fidelidad de personas y productos, que figura como objetivo durante el entrenamiento: los rostros se mantienen idénticos entre ediciones y "el texto, las texturas y la forma" del producto no cambian.
- Transparencia nativa. Salida RGBA desde una instrucción de texto y extracción de sujetos desde una fotografía como capa transparente.
- Inferencia eficiente. Las imágenes de entrada y la instrucción se codifican una vez y se guardan en la memoria caché para todos los pasos de eliminación de ruido. Por tanto, el coste por paso de una edición con diez imágenes de referencia es muy similar al de una con una sola imagen.
En su propio banco de pruebas Qwen-Image-Bench obtiene 60.28 puntos, quedando séptimo entre 29 modelos. Los seis que le superan son de código cerrado (GPT Image 2.5 lidera con 67.01). Entre los modelos de pesos abiertos (open-weight), se sitúa primero con gran ventaja.

Es un banco de pruebas elaborado por sus propios creadores y evalúa la generación, no la edición. Los pesos están disponibles en Hugging Face y ModelScope, y es compatible desde el primer día con Diffusers, ComfyUI, vLLM-Omni y SGLang.
La licencia es la Qwen Research License, "solo para fines no comerciales". El uso comercial requiere un acuerdo independiente con Alibaba. Más abajo te contamos todos los detalles.
¿Funciona para un probador virtual?
Sí, zero-shot (sin ejemplos previos).
Configuración: ocho pares de nuestros ejemplos públicos de probadores virtuales, cada uno formado por un selfi en el espejo y la imagen del producto tal y como la subiría un vendedor (fotografía sobre superficie plana o puesta sobre modelo). Ejecutamos Qwen-Image-2.1 en Comfy Cloud a 16 pasos. Vertex AI se usó a través de su API. Ambos pasaron por el mismo proceso de prompts, sin usar LoRA y sin ningún procesamiento posterior. Cada panel muestra, de izquierda a derecha: foto del cliente, foto del producto, Qwen-Image-2.1, Google Vertex AI.
La camiseta de fútbol que encabeza este artículo es la prueba con texto. Ambos modelos mantienen el logotipo del patrocinador y el escudo de forma legible y en su sitio; y ninguno de ellos altera las manos, el teléfono, ni el fondo original.

Dónde es mejor Qwen. La abaya está fotografiada en una modelo que lleva un pañuelo de color crema. Vertex ha llevado también ese pañuelo a la nueva imagen, junto con la prenda. Qwen, sin embargo, cambió la abaya y nada más.

Dónde falla Qwen. En la foto de producto, la prenda llega a media pantorrilla. Vertex mantiene esa longitud exacta; Qwen se detiene en la rodilla. El cinturón, el cierre y las solapas son correctos en ambos casos. El largo de los dobladillos en prendas largas fue el único fallo constante, que se volvió a repetir en un vestido largo por capas.
Los otros cinco pares (un vestido midi de flores, una sudadera con capucha de color neón, un sari de dos piezas, un vestido largo de talla grande, un vestido de novia de encaje) resultaron muy similares. Ambos modelos consiguieron adaptar correctamente la blusa y el ribete del sari, además de ajustar bien el estampado en el vestido midi; y ninguno deformó el rostro original.
Qwen-Image-2.1 frente a Google Vertex AI virtual try-on
| Qwen-Image-2.1 en Comfy Cloud | Probador virtual de Google Vertex AI | |
|---|---|---|
| Pares completados | 8 de 8 | 8 de 8 |
| Tiempo medio por prueba | 9.9 s | 9.3 s |
| Coste por prueba | alrededor de 0,005 $ (tiempo de GPU) | 0,06 $ (precio base) |
| Calidad, lado a lado | 6 empates, 1 mejor, 1 peor | 6 empates, 1 mejor, 1 peor |
| Pesos | abiertos, permite fine-tuning | API cerrada |
| Licencia | solo para investigación; para uso comercial requiere acuerdo | comercial |
El tiempo de Qwen incluye unos tres segundos en la cola de Comfy Cloud. Su coste hace referencia únicamente al tiempo de uso de la GPU para el modelo; una solicitud de probador completa también ejecuta la clasificación de prendas, la construcción del prompt y los controles de calidad.
La letra pequeña
Licencia. Qwen-Image-2.1 se publica bajo el Acuerdo de Licencia de Investigación Qwen (Qwen Research License Agreement), y no bajo Apache 2.0 como el modelo Qwen-Image-Edit-2511. El documento de la licencia restringe su uso "únicamente con fines no comerciales", como puede ser la investigación o su evaluación, y remite a los usuarios comerciales a solicitar una licencia a Alibaba. Añadir el botón del probador virtual en una tienda online se considera uso comercial. Alojarlo por tu cuenta también requiere dicho acuerdo.
Los dos fallos principales. El largo del dobladillo en prendas largas y la omisión de prendas secundarias en algunos productos de varias partes. Ambos son errores sistemáticos, precisamente para lo que sirve un LoRA. Tratándose de 7B de parámetros, un adaptador puede entrenarse en una sola GPU durante unas horas. DiffSynth-Studio, en ModelScope, admite el entrenamiento de LoRA para la versión 2.1 desde su lanzamiento y ComfyUI carga adaptadores a través de sus nodos estándar. Los datos de entrenamiento constan de una foto con modelo emparejada con otra que la muestre en plano; algo con lo que los catálogos de moda ya cuentan. Incluir en el prompt la categoría de la prenda, su cierre y la longitud soluciona de base gran parte de estos problemas de largo; un LoRA puede pulir el resto.
Qué supone esto para Genlook
Qwen-Image-2.1 es el primer modelo abierto que logra igualar a una API comercial de probadores virtuales usando nuestros pares de imágenes, y lo hace por una fracción de su coste. Estamos modernizando el sistema de Genlook para usarlo ahí donde es más fuerte, sumándolo a nuestro flujo de clasificación de prendas, generación de prompts y controles de calidad con los que rodeamos a todos los modelos; todo para que cada tipo de producto tenga el mejor probador virtual posible. Los dos fallos expuestos más arriba son lo primero que vamos a corregir.
Para los desarrolladores, la Genlook Try-On API es un punto de enlace único para cualquier tipo de producto. Un crédito equivale a una prueba virtual, y cada crédito cuesta 0,01 $. Sin coste de plataforma, ni licencias de usuario, ni compromisos mensuales. Los créditos nunca caducan, y todas las cuentas nuevas cuentan con créditos gratis de inicio. La guía de inicio rápido consta de solo cuatro llamadas: crear un producto, subir una foto, generar y obtener el resultado.
En resumen
- El lanzamiento: un modelo abierto de 7B que genera, edita basándose en hasta 10 referencias, y procesa transparencias desde un único checkpoint. Se alza como el mejor modelo abierto en el banco de pruebas de sus desarrolladores.
- Al probar prendas virtuales: empata frente al modelo Vertex AI de Google en 6 de cada 8 pares (con ejemplos zero-shot). Es superior evitando modificar elementos que no sean prendas de ropa, pero inferior ajustando el bajo de las prendas largas.
- Coste: en torno a 0,005 $ de tiempo de GPU por imagen, en comparación con 0,06 $.
- El inconveniente principal: licencia solo apta para investigación si decides alojar el modelo tú mismo, y dos fallos recurrentes que se pueden solucionar con un LoRA.
Obtén una clave de API en platform.genlook.app para usar la Genlook Try-On API, o añade el probador virtual a tu tienda online.
FAQ