A 20 de setembro de 2026, a equipa do Qwen no Alibaba disponibilizou o [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1) em código aberto. Trata-se de um modelo de imagem de 7B que gera e edita num único fluxo de trabalho, suporta até 10 imagens de referência e aponta o [provador virtual](/glossary/virtual-try-on) como um dos principais casos de uso.

Testámo-lo nos oito pares de pessoa-peça que usamos para avaliar qualquer motor, lado a lado com o modelo de provador virtual da Google no Vertex AI, uma das opções comerciais mais comuns no mercado. Usámos as mesmas fotografias, a mesma cadeia de prompts e sem qualquer ajuste fino (fine-tuning).

![Provador virtual com camisola de futebol. Da esquerda para a direita: fotografia do comprador, fotografia do produto, resultado do Qwen-Image-2.1, resultado do Google Vertex AI.](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## O que é o Qwen-Image-2.1?

O Qwen-Image-2.1 substitui três modelos anteriores (Qwen-Image para geração, Qwen-Image-Edit para edição e Qwen-Image-Layered para transparência) num único checkpoint.

- **7B de parâmetros** na componente de geração (32 camadas DiT de fluxo único). O Qwen3-VL 8B lê o prompt e as imagens de entrada.
- **Até 10 imagens de referência** numa só edição. Citando a página de lançamento: "para um provador virtual, cinco entradas (um modelo, roupa, sapatos, uma mala e um chapéu) podem ser combinadas para criar um visual completo."
- **Edição de regiões.** Desenhe um círculo à volta de uma área, pinte sobre ela ou introduza uma máscara à parte, e apenas essa região sofrerá alterações.
- **Fidelidade de pessoas e produtos** é um objetivo declarado no treino: os rostos mantêm-se inalterados nas edições, e "texto, texturas e formato" dos produtos são preservados.
- **Transparência nativa.** Saída RGBA a partir de um prompt e extração do motivo central de uma fotografia como uma camada transparente.
- **Inferência eficiente.** As imagens de entrada e a instrução são codificadas apenas uma vez e guardadas em cache para cada etapa de eliminação de ruído, pelo que uma edição com dez referências custa praticamente o mesmo por passo que uma edição com uma única referência.

No Qwen-Image-Bench da própria equipa, o modelo obteve uma pontuação de 60,28, classificando-se em sétimo lugar entre 29 modelos. Os seis à frente são de código fechado (o GPT Image 2.5 lidera com 67,01). Entre os modelos de pesos abertos, lidera com larga margem.

![Pontuações no Qwen-Image-Bench de modelos de imagem de pesos abertos com as respetivas contagens de parâmetros. O Qwen-Image-2.1 lidera com 60,28 e 7B de parâmetros.](/blog-images/qwen-image-2-1-bench-open-weights.webp)

Trata-se de um benchmark auto-reportado que mede a geração e não a edição. Os pesos encontram-se disponíveis no Hugging Face e no ModelScope, com suporte no dia zero em Diffusers, ComfyUI, vLLM-Omni e SGLang.

A licença é a **Qwen Research License**, "apenas para fins não comerciais". O uso comercial exige um acordo em separado com o Alibaba. Mais pormenores abaixo.

## Funciona para o provador virtual?

Sim, de forma nativa (zero-shot).

Configuração: oito pares dos nossos exemplos públicos de provadores virtuais, cada um composto por uma selfie ao espelho e a imagem do produto tal como o comerciante a carregaria (uma fotografia do produto plano ou vestido num modelo). O Qwen-Image-2.1 correu na Comfy Cloud com 16 passos. O Vertex AI foi executado através da sua API. Ambos passaram pela mesma cadeia de prompts, sem LoRA e sem qualquer pós-processamento. Cada painel lê-se da esquerda para a direita: fotografia do comprador, imagem do produto, Qwen-Image-2.1 e Google Vertex AI.

A camisola de futebol no topo da publicação é o teste de texto. Ambos os modelos mantêm o logótipo do patrocinador e o emblema legíveis e no sítio certo, e nenhum altera as mãos do comprador, o telemóvel ou o fundo.

![Provador virtual de abaya. Da esquerda para a direita: fotografia do comprador, fotografia do produto no modelo com um lenço creme, resultado do Qwen-Image-2.1 a alterar apenas a abaya, resultado do Google Vertex AI que também acrescentou o lenço.](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Onde o Qwen se sai melhor.** A abaya foi fotografada numa modelo a usar um lenço creme. O Vertex AI transportou o lenço em conjunto com a peça de roupa. O Qwen mudou a abaya e mais nada.

![Provador virtual de gabardine. Da esquerda para a direita: fotografia do comprador, fotografia do produto plano, resultado do Qwen-Image-2.1 que para no joelho, resultado do Google Vertex AI que mantém o comprimento a meio da barriga da perna.](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Onde o Qwen se sai pior.** A fotografia plana mostra o casaco a meio da perna. O Vertex mantém o comprimento, enquanto o Qwen para pelo joelho. O cinto, o fecho e as lapelas estão corretos em ambos. O comprimento da bainha em peças compridas foi a falha consistente, algo que se voltou a notar num vestido comprido com folhos.

**Nos outros cinco pares** (um vestido pelo meio da perna com padrão floral, uma camisola de capuz néon, um saree de duas peças, um vestido comprido plus-size e um vestido de noiva de renda), não conseguimos distinguir um vencedor. Ambos transportaram bem a blusa e o rebordo do saree, acertaram na escala do padrão do vestido e não alteraram nenhum rosto.

## Qwen-Image-2.1 vs Google Vertex AI provador virtual

| | Qwen-Image-2.1 na Comfy Cloud | Provador virtual do Google Vertex AI |
|---|---|---|
| Pares concluídos | 8 de 8 | 8 de 8 |
| Tempo mediano por provador virtual | 9,9 s | 9,3 s |
| Custo por provador virtual | aprox. 0,005 $ (tempo de GPU) | 0,06 $ (preço de tabela) |
| Qualidade, lado a lado | 6 empates, 1 melhor, 1 pior | 6 empates, 1 melhor, 1 pior |
| Pesos | abertos, podem sofrer fine-tuning | API fechada |
| Licença | apenas para investigação, comercial por acordo | comercial |

O tempo do Qwen inclui cerca de três segundos em fila de espera na Comfy Cloud. O custo do Qwen reflete apenas o tempo de GPU para o modelo; um pedido completo de provador virtual também corre a classificação da peça de roupa, a construção do prompt e verificações de qualidade.

## O senão

**Licença.** O Qwen-Image-2.1 foi lançado sob o Qwen Research License Agreement, e não com a licença Apache 2.0 como o Qwen-Image-Edit-2511. O ficheiro de licença permite a sua utilização "apenas para fins não comerciais", definidos como investigação ou avaliação, direcionando os utilizadores comerciais para o pedido de licença ao Alibaba. Um botão de provador virtual numa loja online enquadra-se no uso comercial. Alojamento próprio (self-hosting) exige esse acordo.

**As duas falhas.** O comprimento das bainhas em peças compridas e a perda de peças secundárias em produtos compostos. Ambas são sistemáticas, que é precisamente para o que serve um LoRA. Com 7B, um adaptador treina-se numa única GPU numa questão de horas. O DiffSynth-Studio no ModelScope suporta treino com LoRA na versão 2.1 desde o primeiro dia, e a ComfyUI carrega adaptadores através dos seus nós habituais. Os dados de treino consistem numa fotografia no modelo associada à fotografia da peça plana, algo que os catálogos de moda já possuem. Um prompt que indique a categoria da peça de roupa, o fecho e o comprimento resolve grande parte das falhas na bainha, o LoRA trata do resto.

## O que isto significa para a Genlook

O Qwen-Image-2.1 é o primeiro modelo aberto a conseguir paridade com uma API comercial de provador virtual nos nossos pares de teste, e por uma fração do custo por imagem. Estamos a atualizar a cadeia de fluxo de provador virtual da Genlook para utilizá-lo nas áreas em que é mais forte, juntando-lhe a classificação das peças, a construção de prompts e as verificações de qualidade que usamos em qualquer modelo. Desta forma, garantimos que todos os tipos de produto contam com a melhor qualidade de provador virtual disponível. As duas falhas mencionadas são os primeiros aspetos que o trabalho da cadeia de fluxo vai solucionar.

Para os programadores, a [API Genlook Try-On](https://platform.genlook.app) oferece um ponto de acesso para todos os tipos de produto. Um crédito equivale a uma prova virtual: 0,04 $ no modelo "pay as you go" (pague consoante a utilização), ou desde 0,015 $ num plano mensal. Os créditos de pacotes nunca expiram, e as contas novas começam com créditos grátis. O [guia de iniciação](/docs/tryon-api/quickstart) resume-se a quatro chamadas: criar um produto, carregar uma fotografia, gerar e obter o resultado.

## Resumo

- **O lançamento:** um modelo de pesos abertos de 7B que gera, edita com até 10 referências e trata da transparência num só checkpoint. É o melhor modelo aberto no benchmark da equipa.
- **No provador virtual:** empata com o modelo Vertex AI da Google em 6 dos 8 pares, numa base zero-shot. É melhor a não tocar nos artigos que não sejam roupa e tem dificuldades com o comprimento das bainhas em peças compridas.
- **Custo:** cerca de 0,005 $ de tempo de GPU por imagem, em comparação com os 0,06 $.
- **O senão:** uma licença exclusiva para fins de investigação aplicável a alojares por ti mesmo, e duas falhas que se devem conseguir resolver com um LoRA.

---

_[Obtém uma chave API em platform.genlook.app](https://platform.genlook.app) para utilizar a API Genlook Try-On, ou [adiciona o provador virtual à tua loja](/get-started)._

<Faq>
  <FaqItem
    question="O Qwen-Image-2.1 serve para o provador virtual?"
    answer="Sim. O anúncio de lançamento mostra um visual completo montado a partir de cinco imagens de referência (uma modelo, a roupa, os sapatos, a mala e o chapéu). Nos nossos oito pares de avaliação, igualou o modelo de provador virtual Vertex AI da Google em seis pares zero-shot, com um resultado melhor e outro pior."
  />
  <FaqItem
    question="O Qwen-Image-2.1 é de uso comercial livre?"
    answer="Não. Foi lançado sob o Qwen Research License Agreement, o que limita o seu uso a investigação ou avaliação não comercial, exigindo uma licença comercial à parte com o Alibaba. O Qwen-Image-Edit-2511 possui licença Apache 2.0."
  />
  <FaqItem
    question="Como se compara o Qwen-Image-2.1 com o provador virtual Google Vertex AI?"
    answer="No nosso teste: média de 9,9 s contra 9,3 s, 8 de 8 concluídos em ambos, seis empates em oito no campo da qualidade, e cerca de 0,005 $ de tempo de GPU por imagem contra o preço de tabela de 0,06 $ do Vertex. O Vertex é uma API comercial; o Qwen tem pesos abertos sob uma licença de investigação."
  />
  <FaqItem
    question="É possível fazer fine-tuning no Qwen-Image-2.1 com um LoRA?"
    answer="Sim. O DiffSynth-Studio no ModelScope suporta o treino com LoRA para o Qwen-Image-2.1 e a ComfyUI carrega os adaptadores através dos seus nós padrão LoRA. Com 7B parâmetros, o adaptador treina numa única GPU."
  />
  <FaqItem
    question="Quanto custa a API Genlook Try-On?"
    answer="Um crédito é igual a uma prova virtual. Os créditos custam 0,04 $ no modelo pay as you go, ou a partir de 0,015 $ num plano mensal: o plano Starter custa 20 $ por 1000 provas, o Growth 99 $ por 6000 e o Scale 300 $ por 20000. Os créditos de pacote não expiram e as novas contas têm créditos gratuitos para começar."
  />
</Faq>