Technology发布于 September 21, 2026作者:Thibault Mathian

Qwen-Image-2.1 用于虚拟试衣:测试结果

2026年9月20日,阿里巴巴开源了 Qwen-Image-2.1。我们将其与 Google 的 Vertex AI 虚拟试衣模型进行了 8 组试衣对比。测试结果、成本以及授权注意事项都在这里。

目录

2026年9月20日,阿里巴巴的 Qwen 团队开源了 Qwen-Image-2.1。这是一个拥有 7B 参数的图像模型,将生成与编辑集成在同一管线中,最高支持 10 张参考图像输入,并明确将虚拟试衣列为目标应用场景。

我们将它与市面上最常见的商业方案之一——Google Vertex AI 上的虚拟试衣模型进行了对比测试。测试使用了我们用于评估所有引擎的 8 组“人物-服装”样本。照片相同,提示词管线相同,未经过任何微调。

球衣试穿。从左到右:买家照片,商品平铺图,Qwen-Image-2.1 结果,Google Vertex AI 结果。
球衣试穿。从左到右:买家照片,商品平铺图,Qwen-Image-2.1 结果,Google Vertex AI 结果。

Qwen-Image-2.1 是什么?

Qwen-Image-2.1 用一个模型权重取代了之前的三个模型(用于生成的 Qwen-Image、用于编辑的 Qwen-Image-Edit 以及用于透明度处理的 Qwen-Image-Layered)。

  • 生成组件包含 7B 参数(32 层单流 DiT)。由 Qwen3-VL 8B 负责读取提示词和输入图像。
  • 单次编辑最多支持 10 张参考图。 发布页面指出:“在虚拟试衣场景下,可以将模特、衣服、鞋子、包和帽子等五个输入图像组合成一套完整的穿搭。”
  • 区域编辑。 画圈、涂抹或传入独立的蒙版,仅改变该区域。
  • 针对人物和商品的高保真度 是一项明确的训练目标:在编辑过程中保持人脸不变,并保留商品的“文字、纹理和形状”。
  • 原生透明度支持。 根据提示词输出 RGBA 图像,或将照片中的主体提取为透明图层。
  • 高效推理。 输入图像和指令仅被编码一次,并在每个去噪步骤中缓存,因此使用 10 张参考图进行编辑的单步成本与单张参考图大致相同。

在团队自己的 Qwen-Image-Bench 测试中,它得分为 60.28,在 29 个模型中排名第七。排在它前面的 6 个模型都是闭源的(GPT Image 2.5 以 67.01 分领跑)。在开源权重模型中,它以巨大优势位居第一。

开源图像模型在 Qwen-Image-Bench 上的得分及其参数量。Qwen-Image-2.1 以 7B 参数量和 60.28 的得分领跑。
开源图像模型在 Qwen-Image-Bench 上的得分及其参数量。Qwen-Image-2.1 以 7B 参数量和 60.28 的得分领跑。

这属于自评基准测试,且衡量的是生成能力而非编辑能力。模型权重已上线 Hugging Face 和 ModelScope,发布首日即被 Diffusers、ComfyUI、vLLM-Omni 和 SGLang 支持。

该模型采用 Qwen Research License(Qwen 研究许可证),“仅供非商业用途”。如需商业使用,须与阿里巴巴另行签订协议。详情见下文。

虚拟试衣效果如何?

很好,并且是零样本(zero-shot)直出。

测试设定:从我们的公开试衣案例中挑选 8 组,每组包含一张对镜自拍照以及一张商家通常会上传的商品图(平铺图或模特图)。Qwen-Image-2.1 在 Comfy Cloud 上运行,步数为 16。Vertex AI 通过其 API 运行。两者使用相同的提示词管线,无 LoRA,无后处理。每组拼图从左到右依次为:买家照片、商品图、Qwen-Image-2.1 结果、Google Vertex AI 结果。

文章开头的球衣是针对文字保留的测试。两个模型都清晰地保留了赞助商标志和队徽,位置准确,并且均未改变买家的手、手机或背景。

长袍试穿。从左到右:买家照片,模特穿着该长袍并搭配米色头巾的商品图,Qwen-Image-2.1 结果(仅更换了长袍),Google Vertex AI 结果(连同头巾一起添加了)。
长袍试穿。从左到右:买家照片,模特穿着该长袍并搭配米色头巾的商品图,Qwen-Image-2.1 结果(仅更换了长袍),Google Vertex AI 结果(连同头巾一起添加了)。

Qwen 表现更好的地方。 商品图上的模特穿着长袍并搭配了一条米色头巾。Vertex 把头巾连同衣服一起搬了过去。而 Qwen 只更换了长袍,其余分毫不差。

风衣试穿。从左到右:买家照片,平铺图,Qwen-Image-2.1 结果(衣摆停在膝盖处),Google Vertex AI 结果(保持了小腿中部的长度)。
风衣试穿。从左到右:买家照片,平铺图,Qwen-Image-2.1 结果(衣摆停在膝盖处),Google Vertex AI 结果(保持了小腿中部的长度)。

Qwen 表现稍逊的地方。 商品平铺图展示的风衣长度到小腿中部。Vertex 保持了这个长度,但 Qwen 的衣摆停在了膝盖处。腰带、门襟和翻领两者都处理对了。长款服装的下摆长度是 Qwen 唯一持续出现偏差的地方,这在另一件多层长裙测试中再次出现。

其余 5 组测试(碎花中长裙、荧光连帽衫、两件套纱丽、大码长裙、蕾丝婚纱)两者难分伯仲。两个模型都准确保留了纱丽的上衣和边缘细节,都还原了中长裙的印花比例,并且都未对面部特征做任何篡改。

Qwen-Image-2.1 与 Google Vertex AI 试衣对比

Qwen-Image-2.1 (运行于 Comfy Cloud)Google Vertex AI 虚拟试衣
完成组数8 / 88 / 8
单次试衣中位时间9.9 秒9.3 秒
单次试衣成本约 $0.005 (GPU 算力耗时)$0.06 (标价)
并排质量盲测6 次平局,1 次胜出,1 次落败6 次平局,1 次胜出,1 次落败
权重状态开源,可微调闭源 API
授权协议仅限研究,商用需授权可商用

Qwen 的耗时包含了在 Comfy Cloud 上约 3 秒的排队时间。Qwen 的成本仅为模型本身的 GPU 运行时间;一个完整的试衣请求还需要执行服装分类、提示词构建以及质量检查。

需要注意的地方

授权协议。 Qwen-Image-2.1 采用的是 Qwen Research License Agreement,而非 Qwen-Image-Edit-2511 所用的 Apache 2.0。许可证文件明确规定“仅供非商业用途”(定义为研究或评估),并指出商业用户需向阿里巴巴申请授权。在网店中添加试衣按钮显然属于商业行为。即使是自托管,也需要获得该协议授权。

两个短板。 长款服装的下摆长度,以及部分多组件商品容易丢失次要部件。这两种情况都是系统性的偏差,而这正是 LoRA 的用武之地。在 7B 的参数量下,单张 GPU 几小时内即可完成一个适配器的训练。ModelScope 上的 DiffSynth-Studio 发布首日便支持针对 2.1 的 LoRA 训练,ComfyUI 也能通过其标准节点加载这些适配器。训练数据就是模特图配对相应的平铺图,这在时尚图册中现成就有。在提示词中明确服装品类、门襟和长度,靠提示词就能解决大部分下摆偏差问题;剩下的问题交给 LoRA 即可。

这对 Genlook 意味着什么?

Qwen-Image-2.1 是首个在我们测试样本中能够与商业试衣 API 掰手腕的开源模型,而单张图像的成本仅为后者的零头。我们正在升级 Genlook 的试衣管线,在它表现更好的环节引入它,并与环绕在任何模型外围的服装分类、提示词构建和质量检查模块相结合,确保每种商品类型都能获得最优质的试衣效果。上述两个短板将是管线升级的首要攻坚目标。

对于开发者而言,Genlook Try-On API 为所有商品类型提供统一的端点。消耗一个积分即可进行一次试衣:按量付费 $0.04/次,包月套餐低至 $0.015/次。套餐积分永久有效,新注册账户赠送免费积分。快速入门仅需四步调用:创建商品、上传照片、生成、获取结果。

总结

  • 发布亮点: 7B 开源权重模型,将生成、最高 10 张参考图的编辑以及透明度处理整合在一个权重文件中。在团队评测基准中夺得开源模型第一。
  • 试衣表现: 在 8 组零样本测试中,有 6 组打平 Google Vertex AI。优势是不易篡改非服装元素,劣势是长款服装的下摆长度控制不足。
  • 成本优势: 每张图片约 $0.005 的 GPU 时长,对比 $0.06。
  • 注意事项: 自托管用于商用需申请授权;两个短板需要引入 LoRA 解决。

前往 platform.genlook.app 获取 API 密钥 体验 Genlook Try-On API,或者为您的店铺添加虚拟试衣功能。

常见问题

常见问题解答。

Qwen-Image-2.1 可以用来做虚拟试衣吗?↓
Qwen-Image-2.1 可以免费商用吗?↓
Qwen-Image-2.1 和 Google Vertex AI 虚拟试衣相比如何?↓
可以使用 LoRA 微调 Qwen-Image-2.1 吗?↓
Genlook Try-On API 是如何收费的?↓

准备好减少退货并提升转化率了吗?

只需几分钟即可在您的 Shopify 店铺安装 Genlook。从免费套餐开始。

相关文章