20 сентября 2026 года команда Qwen из Alibaba открыла исходный код Qwen-Image-2.1. Это модель для работы с изображениями на 7 млрд параметров, которая генерирует и редактирует картинки в едином пайплайне, принимает до 10 референсных изображений и прямо называет виртуальную примерку одним из целевых сценариев использования.
Мы протестировали ее на восьми парах «человек и одежда», которые используем для проверки каждого движка, и сравнили с моделью для виртуальной примерки от Google на базе Vertex AI — одним из самых популярных коммерческих решений. Те же фото, тот же промпт, никакого дообучения.

Что такое Qwen-Image-2.1?
Qwen-Image-2.1 заменяет собой три предыдущие модели (Qwen-Image для генерации, Qwen-Image-Edit для редактирования, Qwen-Image-Layered для работы с прозрачностью) одним чекпоинтом.
- 7 млрд параметров в компоненте генерации (32 однопоточных слоя DiT). Qwen3-VL 8B считывает промпт и входные изображения.
- До 10 референсов за одну операцию редактирования. Из описания релиза: «для виртуальной примерки можно объединить пять вводных элементов (модель, одежду, обувь, сумку и шляпу) в полноценный образ».
- Редактирование отдельных областей. Обведите область, закрасьте ее или передайте отдельную маску, и изменится только этот фрагмент.
- Реалистичность людей и товаров заявлена как цель обучения: лица не меняются при редактировании, «текст, текстуры и форма» товара сохраняются.
- Нативная прозрачность. Вывод в формате RGBA по промпту и выделение объекта с фото на прозрачный слой.
- Эффективный инференс. Входные изображения и инструкция кодируются один раз и кэшируются для каждого шага денойзинга, поэтому редактирование с десятью референсами стоит за шаг примерно столько же, сколько и с одним.
На собственном бенчмарке команды Qwen-Image-Bench модель набирает 60,28 балла, занимая седьмое место из 29. Шесть моделей впереди — закрытые (лидирует GPT Image 2.5 с 67,01). Среди моделей с открытыми весами она занимает первое место с большим отрывом.

Это результаты бенчмарка от самих создателей, и он оценивает генерацию, а не редактирование. Веса доступны на Hugging Face и ModelScope, с поддержкой в первый же день в Diffusers, ComfyUI, vLLM-Omni и SGLang.
Лицензия — Qwen Research License, «только для некоммерческого использования». Для коммерческого применения требуется отдельное соглашение с Alibaba. Подробнее об этом ниже.
Подходит ли она для виртуальной примерки?
Да, прямо из коробки (zero-shot).
Условия: восемь пар из наших публичных примеров, каждая состоит из селфи в зеркале и фото товара в том виде, в каком его обычно загружает продавец (раскладка на плоскости или фото на модели). Qwen-Image-2.1 работала в Comfy Cloud (16 шагов). Vertex AI — через API. Обе модели прошли через один и тот же пайплайн промптов, без LoRA и постобработки. На каждом коллаже слева направо: фото покупателя, фото товара, результат Qwen-Image-2.1, результат Google Vertex AI.
Футбольное джерси в начале статьи — это тест на сохранение текста. Обе модели сохранили логотип спонсора и эмблему читаемыми и на своих местах, ни одна из них не изменила руки покупателя, телефон или фон.

Где Qwen справляется лучше. Абая сфотографирована на модели, на которой надет кремовый платок. Vertex перенес платок вместе с одеждой. Qwen изменил абаю и ничего больше.

Где Qwen справляется хуже. На пэкшоте длина до середины икры. Vertex сохраняет эту длину, Qwen останавливается на колене. Пояс, застежка и лацканы получились хорошо на обеих моделях. Длина подола длинной одежды — единственный стабильный промах, и он повторился на ярусном платье макси.
Остальные пять пар (платье миди с цветочным принтом, неоновое худи, сари из двух частей, платье макси size+, кружевное свадебное платье) мы не смогли однозначно оценить. Обе модели перенесли блузку и кайму сари, обе правильно передали масштаб принта на платье миди, ни одна не изменила лицо.
Qwen-Image-2.1 против Google Vertex AI для примерки
| Qwen-Image-2.1 в Comfy Cloud | Виртуальная примерка Google Vertex AI | |
|---|---|---|
| Обработано пар | 8 из 8 | 8 из 8 |
| Медианное время на примерку | 9,9 с | 9,3 с |
| Стоимость примерки | около $0,005 (машинное время GPU) | $0,06 (базовая цена) |
| Качество при сравнении | 6 ничьих, 1 лучше, 1 хуже | 6 ничьих, 1 лучше, 1 хуже |
| Веса | открытые, можно дообучать | закрытый API |
| Лицензия | только для исследований, коммерческая по соглашению | коммерческая |
Время Qwen включает около трех секунд ожидания в очереди в Comfy Cloud. Стоимость Qwen — это время GPU только для работы самой модели; полный запрос на примерку также включает классификацию одежды, составление промпта и проверку качества.
В чем подвох
Лицензия. Qwen-Image-2.1 поставляется по лицензии Qwen Research License Agreement, а не Apache 2.0, как Qwen-Image-Edit-2511. Файл лицензии разрешает использование «только в некоммерческих целях», что определяется как исследования или оценка, и предписывает коммерческим пользователям запрашивать лицензию у Alibaba. Кнопка примерки в магазине — это коммерческое использование. Для самостоятельного хостинга потребуется это соглашение.
Два промаха. Длина подола длинной одежды и потеря второстепенных деталей на некоторых сборных товарах. Обе проблемы носят систематический характер, а именно для этого и существуют LoRA. При 7 млрд параметров адаптер обучается на одном GPU за несколько часов. DiffSynth-Studio от ModelScope поддерживает обучение LoRA для 2.1 с первого дня, а ComfyUI загружает адаптеры через свои стандартные ноды. Данные для обучения — это фото на модели в паре с соответствующим пэкшотом (а они и так есть в каталогах одежды). Промпт, в котором указаны категория одежды, тип застежки и длина, сам по себе исправляет большинство ошибок с подолом; LoRA закрывает все остальные.
Что это значит для Genlook
Qwen-Image-2.1 — первая открытая модель, которая на наших парах показала паритет с коммерческим API для примерки, при этом стоимость за изображение в разы ниже. Мы обновляем пайплайн примерки Genlook, чтобы использовать эту модель там, где она сильнее, поверх классификации одежды, составления промптов и проверок качества, которые окружают любую модель. Таким образом каждый тип товара получит лучшее из возможных качество примерки. Два промаха, описанные выше, — это то, над чем мы будем работать в первую очередь при доработке пайплайна.
Для разработчиков API виртуальной примерки Genlook — это единая точка входа для каждого типа товара. Один кредит — это одна примерка, стоимость кредита составляет $0,01. Никаких плат за платформу, никаких мест, никаких минимальных ежемесячных платежей, кредиты не сгорают, а новые аккаунты получают бесплатные стартовые кредиты. Краткое руководство состоит из четырех вызовов: создать товар, загрузить фото, сгенерировать, получить результат.
Краткие выводы
- Релиз: открытая модель на 7 млрд параметров, которая генерирует, редактирует с использованием до 10 референсов и обрабатывает прозрачность в одном чекпоинте. Лучшая открытая модель на бенчмарке команды.
- Виртуальная примерка: на 6 из 8 пар не уступает модели Google Vertex AI прямо из коробки (zero-shot). Лучше справляется с тем, чтобы не трогать посторонние предметы, хуже — с длиной подола длинной одежды.
- Стоимость: около $0,005 машинного времени GPU за изображение против $0,06.
- Нюансы: лицензия только для исследований при селф-хостинге и два промаха, которые должно исправить дообучение (LoRA).
Получите API-ключ на platform.genlook.app, чтобы использовать API виртуальной примерки Genlook, или добавьте виртуальную примерку в свой магазин.
FAQ