TechnologyОпубликовано September 21, 2026Автор: Thibault Mathian

Qwen-Image-2.1 для виртуальной примерки: результаты тестов

20 сентября 2026 года команда Alibaba выпустила в открытый доступ модель Qwen-Image-2.1. Мы протестировали ее на восьми парах изображений для виртуальной примерки в сравнении с Google Vertex AI. Результаты, стоимость и нюансы лицензии.

Содержание

20 сентября 2026 года команда Qwen из Alibaba открыла исходный код Qwen-Image-2.1. Это модель для работы с изображениями на 7 млрд параметров, которая генерирует и редактирует картинки в едином пайплайне, принимает до 10 референсных изображений и прямо называет виртуальную примерку одним из целевых сценариев использования.

Мы протестировали ее на восьми парах «человек и одежда», которые используем для проверки каждого движка, и сравнили с моделью для виртуальной примерки от Google на базе Vertex AI — одним из самых популярных коммерческих решений. Те же фото, тот же промпт, никакого дообучения.

Примерка футбольной формы. Слева направо: фото покупателя, пэкшот товара, результат Qwen-Image-2.1, результат Google Vertex AI.
Примерка футбольной формы. Слева направо: фото покупателя, пэкшот товара, результат Qwen-Image-2.1, результат Google Vertex AI.

Что такое Qwen-Image-2.1?

Qwen-Image-2.1 заменяет собой три предыдущие модели (Qwen-Image для генерации, Qwen-Image-Edit для редактирования, Qwen-Image-Layered для работы с прозрачностью) одним чекпоинтом.

  • 7 млрд параметров в компоненте генерации (32 однопоточных слоя DiT). Qwen3-VL 8B считывает промпт и входные изображения.
  • До 10 референсов за одну операцию редактирования. Из описания релиза: «для виртуальной примерки можно объединить пять вводных элементов (модель, одежду, обувь, сумку и шляпу) в полноценный образ».
  • Редактирование отдельных областей. Обведите область, закрасьте ее или передайте отдельную маску, и изменится только этот фрагмент.
  • Реалистичность людей и товаров заявлена как цель обучения: лица не меняются при редактировании, «текст, текстуры и форма» товара сохраняются.
  • Нативная прозрачность. Вывод в формате RGBA по промпту и выделение объекта с фото на прозрачный слой.
  • Эффективный инференс. Входные изображения и инструкция кодируются один раз и кэшируются для каждого шага денойзинга, поэтому редактирование с десятью референсами стоит за шаг примерно столько же, сколько и с одним.

На собственном бенчмарке команды Qwen-Image-Bench модель набирает 60,28 балла, занимая седьмое место из 29. Шесть моделей впереди — закрытые (лидирует GPT Image 2.5 с 67,01). Среди моделей с открытыми весами она занимает первое место с большим отрывом.

Оценки в Qwen-Image-Bench для открытых моделей для работы с изображениями с указанием количества параметров. Qwen-Image-2.1 лидирует с 60,28 балла при 7 млрд параметров.
Оценки в Qwen-Image-Bench для открытых моделей для работы с изображениями с указанием количества параметров. Qwen-Image-2.1 лидирует с 60,28 балла при 7 млрд параметров.

Это результаты бенчмарка от самих создателей, и он оценивает генерацию, а не редактирование. Веса доступны на Hugging Face и ModelScope, с поддержкой в первый же день в Diffusers, ComfyUI, vLLM-Omni и SGLang.

Лицензия — Qwen Research License, «только для некоммерческого использования». Для коммерческого применения требуется отдельное соглашение с Alibaba. Подробнее об этом ниже.

Подходит ли она для виртуальной примерки?

Да, прямо из коробки (zero-shot).

Условия: восемь пар из наших публичных примеров, каждая состоит из селфи в зеркале и фото товара в том виде, в каком его обычно загружает продавец (раскладка на плоскости или фото на модели). Qwen-Image-2.1 работала в Comfy Cloud (16 шагов). Vertex AI — через API. Обе модели прошли через один и тот же пайплайн промптов, без LoRA и постобработки. На каждом коллаже слева направо: фото покупателя, фото товара, результат Qwen-Image-2.1, результат Google Vertex AI.

Футбольное джерси в начале статьи — это тест на сохранение текста. Обе модели сохранили логотип спонсора и эмблему читаемыми и на своих местах, ни одна из них не изменила руки покупателя, телефон или фон.

Примерка абаи. Слева направо: фото покупательницы, фото товара на модели с кремовым платком, результат Qwen-Image-2.1 (изменена только абая), результат Google Vertex AI (добавлен платок).
Примерка абаи. Слева направо: фото покупательницы, фото товара на модели с кремовым платком, результат Qwen-Image-2.1 (изменена только абая), результат Google Vertex AI (добавлен платок).

Где Qwen справляется лучше. Абая сфотографирована на модели, на которой надет кремовый платок. Vertex перенес платок вместе с одеждой. Qwen изменил абаю и ничего больше.

Примерка тренча. Слева направо: фото покупательницы, пэкшот на плоскости, результат Qwen-Image-2.1 (длина до колена), результат Google Vertex AI (сохранена длина до середины икры).
Примерка тренча. Слева направо: фото покупательницы, пэкшот на плоскости, результат Qwen-Image-2.1 (длина до колена), результат Google Vertex AI (сохранена длина до середины икры).

Где Qwen справляется хуже. На пэкшоте длина до середины икры. Vertex сохраняет эту длину, Qwen останавливается на колене. Пояс, застежка и лацканы получились хорошо на обеих моделях. Длина подола длинной одежды — единственный стабильный промах, и он повторился на ярусном платье макси.

Остальные пять пар (платье миди с цветочным принтом, неоновое худи, сари из двух частей, платье макси size+, кружевное свадебное платье) мы не смогли однозначно оценить. Обе модели перенесли блузку и кайму сари, обе правильно передали масштаб принта на платье миди, ни одна не изменила лицо.

Qwen-Image-2.1 против Google Vertex AI для примерки

Qwen-Image-2.1 в Comfy CloudВиртуальная примерка Google Vertex AI
Обработано пар8 из 88 из 8
Медианное время на примерку9,9 с9,3 с
Стоимость примеркиоколо $0,005 (машинное время GPU)$0,06 (базовая цена)
Качество при сравнении6 ничьих, 1 лучше, 1 хуже6 ничьих, 1 лучше, 1 хуже
Весаоткрытые, можно дообучатьзакрытый API
Лицензиятолько для исследований, коммерческая по соглашениюкоммерческая

Время Qwen включает около трех секунд ожидания в очереди в Comfy Cloud. Стоимость Qwen — это время GPU только для работы самой модели; полный запрос на примерку также включает классификацию одежды, составление промпта и проверку качества.

В чем подвох

Лицензия. Qwen-Image-2.1 поставляется по лицензии Qwen Research License Agreement, а не Apache 2.0, как Qwen-Image-Edit-2511. Файл лицензии разрешает использование «только в некоммерческих целях», что определяется как исследования или оценка, и предписывает коммерческим пользователям запрашивать лицензию у Alibaba. Кнопка примерки в магазине — это коммерческое использование. Для самостоятельного хостинга потребуется это соглашение.

Два промаха. Длина подола длинной одежды и потеря второстепенных деталей на некоторых сборных товарах. Обе проблемы носят систематический характер, а именно для этого и существуют LoRA. При 7 млрд параметров адаптер обучается на одном GPU за несколько часов. DiffSynth-Studio от ModelScope поддерживает обучение LoRA для 2.1 с первого дня, а ComfyUI загружает адаптеры через свои стандартные ноды. Данные для обучения — это фото на модели в паре с соответствующим пэкшотом (а они и так есть в каталогах одежды). Промпт, в котором указаны категория одежды, тип застежки и длина, сам по себе исправляет большинство ошибок с подолом; LoRA закрывает все остальные.

Что это значит для Genlook

Qwen-Image-2.1 — первая открытая модель, которая на наших парах показала паритет с коммерческим API для примерки, при этом стоимость за изображение в разы ниже. Мы обновляем пайплайн примерки Genlook, чтобы использовать эту модель там, где она сильнее, поверх классификации одежды, составления промптов и проверок качества, которые окружают любую модель. Таким образом каждый тип товара получит лучшее из возможных качество примерки. Два промаха, описанные выше, — это то, над чем мы будем работать в первую очередь при доработке пайплайна.

Для разработчиков API виртуальной примерки Genlook — это единая точка входа для каждого типа товара. Один кредит — это одна примерка, стоимость кредита составляет $0,01. Никаких плат за платформу, никаких мест, никаких минимальных ежемесячных платежей, кредиты не сгорают, а новые аккаунты получают бесплатные стартовые кредиты. Краткое руководство состоит из четырех вызовов: создать товар, загрузить фото, сгенерировать, получить результат.

Краткие выводы

  • Релиз: открытая модель на 7 млрд параметров, которая генерирует, редактирует с использованием до 10 референсов и обрабатывает прозрачность в одном чекпоинте. Лучшая открытая модель на бенчмарке команды.
  • Виртуальная примерка: на 6 из 8 пар не уступает модели Google Vertex AI прямо из коробки (zero-shot). Лучше справляется с тем, чтобы не трогать посторонние предметы, хуже — с длиной подола длинной одежды.
  • Стоимость: около $0,005 машинного времени GPU за изображение против $0,06.
  • Нюансы: лицензия только для исследований при селф-хостинге и два промаха, которые должно исправить дообучение (LoRA).

Получите API-ключ на platform.genlook.app, чтобы использовать API виртуальной примерки Genlook, или добавьте виртуальную примерку в свой магазин.

FAQ

Ответы на вопросы.

Справляется ли Qwen-Image-2.1 с виртуальной примеркой?
Можно ли использовать Qwen-Image-2.1 в коммерческих целях бесплатно?
Как Qwen-Image-2.1 показывает себя в сравнении с виртуальной примеркой Google Vertex AI?
Можно ли дообучить Qwen-Image-2.1 с помощью LoRA?
Сколько стоит API виртуальной примерки Genlook?

Готовы сократить возвраты и повысить конверсию?

Установите Genlook в свой магазин Shopify за пару минут. Начните с бесплатного тарифа.

Похожие статьи