TechnologyPublicado el September 21, 2026Por Thibault Mathian

Resultados de las pruebas de Qwen-Image-2.1 en probadores virtuales

Alibaba lanzó Qwen-Image-2.1 en versión de código abierto el 20 de septiembre de 2026. Lo probamos en ocho conjuntos para probador virtual frente al modelo Vertex AI de Google. Resultados, coste y condiciones de la licencia.

Tabla de contenidos

El 20 de septiembre de 2026, el equipo Qwen de Alibaba publicó Qwen-Image-2.1 en código abierto. Es un modelo de imagen de 7B que genera y edita en un único flujo de trabajo, admite hasta 10 imágenes de referencia y señala los probadores virtuales como uno de sus principales casos de uso.

Lo probamos con los ocho pares de persona y prenda que utilizamos en cada motor de IA, junto al modelo de probador virtual de Google en Vertex AI, una de las opciones comerciales más habituales. Las mismas fotos, los mismos prompts, sin ningún ajuste fino.

Probador virtual con camiseta de fútbol. De izquierda a derecha: foto del cliente, foto del producto, resultado de Qwen-Image-2.1, resultado de Google Vertex AI.
Probador virtual con camiseta de fútbol. De izquierda a derecha: foto del cliente, foto del producto, resultado de Qwen-Image-2.1, resultado de Google Vertex AI.

¿Qué es Qwen-Image-2.1?

Qwen-Image-2.1 unifica tres modelos anteriores (Qwen-Image para generación, Qwen-Image-Edit para edición, y Qwen-Image-Layered para transparencias) en un solo archivo checkpoint.

  • 7B de parámetros en el componente de generación (32 capas DiT single-stream). Qwen3-VL 8B interpreta la instrucción y las imágenes de entrada.
  • Hasta 10 imágenes de referencia en una sola edición. Según las notas de la versión: "para los probadores virtuales, se pueden combinar cinco elementos de entrada (modelo, ropa, zapatos, bolso y sombrero) para crear un conjunto completo".
  • Edición por zonas. Rodea un área, píntala, o usa una máscara independiente; el modelo solo modificará esa región.
  • Fidelidad de personas y productos, que figura como objetivo durante el entrenamiento: los rostros se mantienen idénticos entre ediciones y "el texto, las texturas y la forma" del producto no cambian.
  • Transparencia nativa. Salida RGBA desde una instrucción de texto y extracción de sujetos desde una fotografía como capa transparente.
  • Inferencia eficiente. Las imágenes de entrada y la instrucción se codifican una vez y se guardan en la memoria caché para todos los pasos de eliminación de ruido. Por tanto, el coste por paso de una edición con diez imágenes de referencia es muy similar al de una con una sola imagen.

En su propio banco de pruebas Qwen-Image-Bench obtiene 60.28 puntos, quedando séptimo entre 29 modelos. Los seis que le superan son de código cerrado (GPT Image 2.5 lidera con 67.01). Entre los modelos de pesos abiertos (open-weight), se sitúa primero con gran ventaja.

Puntuaciones Qwen-Image-Bench de los modelos de imagen de pesos abiertos junto a su número de parámetros. Qwen-Image-2.1 lidera con 60.28 teniendo 7B de parámetros.
Puntuaciones Qwen-Image-Bench de los modelos de imagen de pesos abiertos junto a su número de parámetros. Qwen-Image-2.1 lidera con 60.28 teniendo 7B de parámetros.

Es un banco de pruebas elaborado por sus propios creadores y evalúa la generación, no la edición. Los pesos están disponibles en Hugging Face y ModelScope, y es compatible desde el primer día con Diffusers, ComfyUI, vLLM-Omni y SGLang.

La licencia es la Qwen Research License, "solo para fines no comerciales". El uso comercial requiere un acuerdo independiente con Alibaba. Más abajo te contamos todos los detalles.

¿Funciona para un probador virtual?

Sí, zero-shot (sin ejemplos previos).

Configuración: ocho pares de nuestros ejemplos públicos de probadores virtuales, cada uno formado por un selfi en el espejo y la imagen del producto tal y como la subiría un vendedor (fotografía sobre superficie plana o puesta sobre modelo). Ejecutamos Qwen-Image-2.1 en Comfy Cloud a 16 pasos. Vertex AI se usó a través de su API. Ambos pasaron por el mismo proceso de prompts, sin usar LoRA y sin ningún procesamiento posterior. Cada panel muestra, de izquierda a derecha: foto del cliente, foto del producto, Qwen-Image-2.1, Google Vertex AI.

La camiseta de fútbol que encabeza este artículo es la prueba con texto. Ambos modelos mantienen el logotipo del patrocinador y el escudo de forma legible y en su sitio; y ninguno de ellos altera las manos, el teléfono, ni el fondo original.

Probador de abaya. De izquierda a derecha: foto de la clienta, foto de producto en modelo con pañuelo crema, resultado de Qwen-Image-2.1 cambiando solo la abaya, resultado de Google Vertex AI que añade también el pañuelo.
Probador de abaya. De izquierda a derecha: foto de la clienta, foto de producto en modelo con pañuelo crema, resultado de Qwen-Image-2.1 cambiando solo la abaya, resultado de Google Vertex AI que añade también el pañuelo.

Dónde es mejor Qwen. La abaya está fotografiada en una modelo que lleva un pañuelo de color crema. Vertex ha llevado también ese pañuelo a la nueva imagen, junto con la prenda. Qwen, sin embargo, cambió la abaya y nada más.

Probador con gabardina. De izquierda a derecha: foto del cliente, foto plana de producto, resultado de Qwen-Image-2.1 cortando a la altura de la rodilla, resultado de Google Vertex AI manteniendo la longitud a media pantorrilla.
Probador con gabardina. De izquierda a derecha: foto del cliente, foto plana de producto, resultado de Qwen-Image-2.1 cortando a la altura de la rodilla, resultado de Google Vertex AI manteniendo la longitud a media pantorrilla.

Dónde falla Qwen. En la foto de producto, la prenda llega a media pantorrilla. Vertex mantiene esa longitud exacta; Qwen se detiene en la rodilla. El cinturón, el cierre y las solapas son correctos en ambos casos. El largo de los dobladillos en prendas largas fue el único fallo constante, que se volvió a repetir en un vestido largo por capas.

Los otros cinco pares (un vestido midi de flores, una sudadera con capucha de color neón, un sari de dos piezas, un vestido largo de talla grande, un vestido de novia de encaje) resultaron muy similares. Ambos modelos consiguieron adaptar correctamente la blusa y el ribete del sari, además de ajustar bien el estampado en el vestido midi; y ninguno deformó el rostro original.

Qwen-Image-2.1 frente a Google Vertex AI virtual try-on

Qwen-Image-2.1 en Comfy CloudProbador virtual de Google Vertex AI
Pares completados8 de 88 de 8
Tiempo medio por prueba9.9 s9.3 s
Coste por pruebaalrededor de 0,005 $ (tiempo de GPU)0,06 $ (precio base)
Calidad, lado a lado6 empates, 1 mejor, 1 peor6 empates, 1 mejor, 1 peor
Pesosabiertos, permite fine-tuningAPI cerrada
Licenciasolo para investigación; para uso comercial requiere acuerdocomercial

El tiempo de Qwen incluye unos tres segundos en la cola de Comfy Cloud. Su coste hace referencia únicamente al tiempo de uso de la GPU para el modelo; una solicitud de probador completa también ejecuta la clasificación de prendas, la construcción del prompt y los controles de calidad.

La letra pequeña

Licencia. Qwen-Image-2.1 se publica bajo el Acuerdo de Licencia de Investigación Qwen (Qwen Research License Agreement), y no bajo Apache 2.0 como el modelo Qwen-Image-Edit-2511. El documento de la licencia restringe su uso "únicamente con fines no comerciales", como puede ser la investigación o su evaluación, y remite a los usuarios comerciales a solicitar una licencia a Alibaba. Añadir el botón del probador virtual en una tienda online se considera uso comercial. Alojarlo por tu cuenta también requiere dicho acuerdo.

Los dos fallos principales. El largo del dobladillo en prendas largas y la omisión de prendas secundarias en algunos productos de varias partes. Ambos son errores sistemáticos, precisamente para lo que sirve un LoRA. Tratándose de 7B de parámetros, un adaptador puede entrenarse en una sola GPU durante unas horas. DiffSynth-Studio, en ModelScope, admite el entrenamiento de LoRA para la versión 2.1 desde su lanzamiento y ComfyUI carga adaptadores a través de sus nodos estándar. Los datos de entrenamiento constan de una foto con modelo emparejada con otra que la muestre en plano; algo con lo que los catálogos de moda ya cuentan. Incluir en el prompt la categoría de la prenda, su cierre y la longitud soluciona de base gran parte de estos problemas de largo; un LoRA puede pulir el resto.

Qué supone esto para Genlook

Qwen-Image-2.1 es el primer modelo abierto que logra igualar a una API comercial de probadores virtuales usando nuestros pares de imágenes, y lo hace por una fracción de su coste. Estamos modernizando el sistema de Genlook para usarlo ahí donde es más fuerte, sumándolo a nuestro flujo de clasificación de prendas, generación de prompts y controles de calidad con los que rodeamos a todos los modelos; todo para que cada tipo de producto tenga el mejor probador virtual posible. Los dos fallos expuestos más arriba son lo primero que vamos a corregir.

Para los desarrolladores, la Genlook Try-On API es un punto de enlace único para cualquier tipo de producto. Un crédito equivale a una prueba virtual, y cada crédito cuesta 0,01 $. Sin coste de plataforma, ni licencias de usuario, ni compromisos mensuales. Los créditos nunca caducan, y todas las cuentas nuevas cuentan con créditos gratis de inicio. La guía de inicio rápido consta de solo cuatro llamadas: crear un producto, subir una foto, generar y obtener el resultado.

En resumen

  • El lanzamiento: un modelo abierto de 7B que genera, edita basándose en hasta 10 referencias, y procesa transparencias desde un único checkpoint. Se alza como el mejor modelo abierto en el banco de pruebas de sus desarrolladores.
  • Al probar prendas virtuales: empata frente al modelo Vertex AI de Google en 6 de cada 8 pares (con ejemplos zero-shot). Es superior evitando modificar elementos que no sean prendas de ropa, pero inferior ajustando el bajo de las prendas largas.
  • Coste: en torno a 0,005 $ de tiempo de GPU por imagen, en comparación con 0,06 $.
  • El inconveniente principal: licencia solo apta para investigación si decides alojar el modelo tú mismo, y dos fallos recurrentes que se pueden solucionar con un LoRA.

Obtén una clave de API en platform.genlook.app para usar la Genlook Try-On API, o añade el probador virtual a tu tienda online.

FAQ

Preguntas, respondidas.

¿Se puede usar Qwen-Image-2.1 para probadores virtuales?
¿Es Qwen-Image-2.1 gratuito para usos comerciales?
¿Cómo rinde Qwen-Image-2.1 en comparación con el probador virtual Google Vertex AI?
¿Se puede hacer fine-tuning en Qwen-Image-2.1 usando un LoRA?
¿Cuánto cuesta la Genlook Try-On API?

¿Listo para reducir devoluciones y aumentar conversiones?

Instala Genlook en tu tienda Shopify en minutos. Empieza con nuestro plan gratuito.

Artículos relacionados