Am 20. September 2026 veröffentlichte das Qwen-Team von Alibaba [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1) als Open Source. Dabei handelt es sich um ein 7B-Bildmodell, das in einer einzigen Pipeline generieren und bearbeiten kann. Es verarbeitet bis zu 10 Referenzbilder und nennt die [virtuelle Anprobe](/glossary/virtual-try-on) ausdrücklich als einen der Hauptanwendungsfälle.
Wir haben das Modell mit denselben acht Bildpaaren aus Person und Kleidungsstück getestet, die wir für jede Engine verwenden. Als Gegner trat das Try-on-Modell von Google auf Vertex AI an – eine der am weitesten verbreiteten kommerziellen Lösungen. Gleiche Fotos, gleicher Prompt, kein Fine-Tuning.

## Was ist Qwen-Image-2.1?
Qwen-Image-2.1 ersetzt drei bisherige Modelle (Qwen-Image für die Generierung, Qwen-Image-Edit für die Bearbeitung, Qwen-Image-Layered für Transparenzen) durch einen einzigen Checkpoint.
- **7B Parameter** in der Generierungskomponente (32 Single-Stream DiT-Schichten). Qwen3-VL 8B liest dabei den Prompt und die Eingabebilder.
- **Bis zu 10 Referenzbilder** in einem Bearbeitungsschritt. Zitat von der Release-Seite: „Für die virtuelle Anprobe können fünf Eingaben (ein Model, Kleidung, Schuhe, eine Tasche und ein Hut) zu einem kompletten Outfit kombiniert werden.“
- **Regionale Bearbeitung.** Kreisen Sie einen Bereich ein, übermalen Sie ihn oder übergeben Sie eine separate Maske – und nur dieser Bereich verändert sich.
- **Detailtreue bei Personen und Produkten** ist ein erklärtes Trainingsziel: Gesichter bleiben über alle Bearbeitungen hinweg identisch, „Text, Texturen und Form“ von Produkten bleiben erhalten.
- **Native Transparenz.** RGBA-Output aus einem Prompt sowie die Freistellung eines Motivs aus einem Foto als transparente Ebene.
- **Effiziente Inferenz.** Eingabebilder und die Anweisung werden nur einmal encodiert und für jeden Denoising-Schritt zwischengespeichert. Eine Bearbeitung mit zehn Referenzen kostet pro Schritt also in etwa so viel wie eine mit nur einer Referenz.
Im teaminternen Qwen-Image-Bench erreicht das Modell einen Score von 60,28 und belegt damit Platz sieben von 29 Modellen. Die sechs Modelle davor sind alle Closed Source (GPT Image 2.5 führt mit 67,01). Unter den Modellen mit offenen Gewichten liegt es mit großem Abstand auf Platz eins.

Es handelt sich hierbei um einen selbst gemeldeten Benchmark, der die Generierung misst, nicht die Bearbeitung. Die Gewichte finden sich auf Hugging Face und ModelScope, mit Day-Zero-Support in Diffusers, ComfyUI, vLLM-Omni und SGLang.
Die Lizenz ist die **Qwen Research License**, die eine Nutzung „nur für nicht-kommerzielle Zwecke“ erlaubt. Für den kommerziellen Einsatz ist eine separate Vereinbarung mit Alibaba erforderlich. Mehr dazu weiter unten.
## Taugt es für die virtuelle Anprobe?
Ja, und zwar Zero-Shot.
Das Setup: acht Bildpaare aus unseren öffentlichen Try-on-Beispielen. Jedes besteht aus einem Spiegel-Selfie sowie dem Produktbild, so wie es ein Händler hochladen würde (ein flacher Packshot oder ein Foto an einem Model). Qwen-Image-2.1 lief in der Comfy Cloud mit 16 Steps. Vertex AI wurde über dessen API angesprochen. Beide durchliefen die gleiche Prompt-Pipeline, ohne LoRA und ohne Post-Processing. Jedes Panel ist von links nach rechts aufgebaut: Käufer-Foto, Produktbild, Qwen-Image-2.1, Google Vertex AI.
Das Fußballtrikot ganz oben in diesem Beitrag war unser Text-Test. Beide Modelle erhalten den Schriftzug des Sponsors und das Wappen lesbar und an der richtigen Stelle. Keines der beiden Modelle verändert die Hände der Person, das Smartphone oder den Hintergrund.

**Wo Qwen besser abschneidet.** Die Abaya ist auf dem Produktfoto an einem Model zu sehen, das einen cremefarbenen Schal trägt. Vertex hat den Schal zusammen mit dem Kleidungsstück übernommen. Qwen hat nur die Abaya ausgetauscht und sonst nichts.

**Wo Qwen schlechter abschneidet.** Der Packshot zeigt eine wadenlange Passform. Vertex behält diese Länge bei, Qwen hört bereits auf Kniehöhe auf. Gürtel, Verschluss und Revers werden von beiden Modellen richtig dargestellt. Die Saumlänge bei langen Kleidungsstücken war der einzige durchgängige Fehler, der auch bei einem gestuften Maxikleid wieder auftrat.
**Bei den anderen fünf Bildpaaren** (ein florales Midikleid, ein neonfarbener Hoodie, ein zweiteiliger Sari, ein Maxikleid in Plus-Size, ein Spitzenbrautkleid) konnten wir keinen klaren Sieger ermitteln. Beide übernahmen die Bluse und die Borte des Saris, beide trafen die Skalierung des Musters beim Midikleid genau, keines veränderte ein Gesicht.
## Qwen-Image-2.1 gegen Google Vertex AI Try-on
| | Qwen-Image-2.1 in der Comfy Cloud | Google Vertex AI Virtual Try-on |
|---|---|---|
| Erfolgreiche Bildpaare | 8 von 8 | 8 von 8 |
| Median-Dauer pro Try-on | 9,9 s | 9,3 s |
| Kosten pro Try-on | ca. 0,005 $ (GPU-Zeit) | 0,06 $ (Listenpreis) |
| Qualität im Direktvergleich | 6 Unentschieden, 1 besser, 1 schlechter | 6 Unentschieden, 1 besser, 1 schlechter |
| Gewichte | offen, Fine-Tuning möglich | Closed API |
| Lizenz | nur Forschung, kommerziell nach Vereinbarung | kommerziell |
Die Zeit bei Qwen beinhaltet etwa drei Sekunden Warteschlange in der Comfy Cloud. Die Kosten bei Qwen beziehen sich nur auf die reine GPU-Zeit für das Modell; bei einer vollständigen Try-on-Anfrage fallen zusätzlich Kleidungsklassifizierung, Prompt-Erstellung und Qualitätsprüfungen an.
## Der Haken
**Die Lizenz.** Qwen-Image-2.1 wird unter dem Qwen Research License Agreement ausgeliefert, nicht unter Apache 2.0 wie noch Qwen-Image-Edit-2511. Die Lizenzdatei erlaubt die Nutzung „nur für nicht-kommerzielle Zwecke“, definiert als Forschung oder Evaluierung, und verweist kommerzielle Nutzer darauf, eine Lizenz bei Alibaba anzufragen. Ein Try-on-Button in einem Onlineshop gilt als kommerzielle Nutzung. Wer das Modell selbst hosten möchte, braucht also diese Vereinbarung.
**Die beiden Schwachpunkte.** Die Saumlänge bei langen Kleidungsstücken und das Weglassen von Nebenteilen bei einigen mehrteiligen Produkten. Beides sind systematische Fehler – und genau dafür gibt es LoRAs. Bei 7B lässt sich ein Adapter innerhalb weniger Stunden auf einer einzelnen GPU trainieren. DiffSynth-Studio von ModelScope unterstützt das LoRA-Training für 2.1 vom ersten Tag an, und ComfyUI lädt Adapter über seine Standard-Nodes. Die Trainingsdaten bestehen lediglich aus einem Foto am Model und dem dazugehörigen Packshot – Material, das in Modekatalogen ohnehin vorhanden ist. Ein Prompt, der die Kleidungskategorie, den Verschluss und die Länge benennt, behebt die meisten Fehler am Saum bereits von allein; ein LoRA kümmert sich um den Rest.
## Was das für Genlook bedeutet
Qwen-Image-2.1 ist das erste offene Modell, das bei unseren Bildpaaren mit einer kommerziellen Try-on-API gleichzieht – und das zu einem Bruchteil der Kosten pro Bild. Wir überarbeiten derzeit die Try-on-Pipeline von Genlook, um es dort einzusetzen, wo es seine Stärken hat. Dies geschieht zusätzlich zur Kleidungsklassifizierung, Prompt-Erstellung und den Qualitätsprüfungen, die jedes Modell bei uns durchläuft, sodass jede Produktart die bestmögliche Try-on-Qualität erhält. Die beiden oben genannten Schwachpunkte sind die ersten Ziele, die wir mit der Pipeline-Überarbeitung angehen.
Für Entwickler bietet die [Genlook Try-On API](https://platform.genlook.app) einen einzigen Endpunkt für jeden Produkttyp. Ein Credit entspricht einer Anprobe: 0,04 $ im Pay-as-you-go-Modell oder ab 0,015 $ in einem Monatstarif. Paket-Credits verfallen nie, und neue Accounts starten mit kostenlosen Credits. Der [Quickstart](/docs/tryon-api/quickstart) umfasst nur vier Aufrufe: Produkt anlegen, Foto hochladen, generieren, Ergebnis abrufen.
## Zusammenfassung
- **Das Release:** ein 7B-Modell mit offenen Gewichten, das generiert, mit bis zu 10 Referenzen bearbeitet und Transparenz in einem einzigen Checkpoint handhabt. Das beste offene Modell im Benchmark des Teams.
- **Bei der Anprobe:** zieht bei 6 von 8 Bildpaaren im Zero-Shot-Verfahren mit dem Vertex-AI-Modell von Google gleich. Es ist besser darin, Nicht-Kleidungsstücke in Ruhe zu lassen, aber schlechter bei der Saumlänge von langen Kleidungsstücken.
- **Kosten:** etwa 0,005 $ an GPU-Zeit pro Bild im Vergleich zu 0,06 $.
- **Der Haken:** eine reine Forschungslizenz für Self-Hoster sowie zwei Schwachpunkte, die sich mit einem LoRA beheben lassen sollten.
---
_[Holen Sie sich einen API-Key auf platform.genlook.app](https://platform.genlook.app), um die Genlook Try-On API zu nutzen, oder [fügen Sie die virtuelle Anprobe zu Ihrem Shop hinzu](/get-started)._
<Faq>
<FaqItem
question="Kann Qwen-Image-2.1 virtuelle Anproben durchführen?"
answer="Ja. Das Release zeigt ein Outfit, das aus fünf Referenzbildern zusammengestellt wurde (ein Model, Kleidung, Schuhe, eine Tasche und ein Hut). Bei unseren acht Benchmark-Bildpaaren zog es bei sechs Outfits im Zero-Shot-Verfahren mit Googles Vertex-AI-Try-on-Modell gleich, bei einem schnitt es besser ab, bei einem schlechter."
/>
<FaqItem
question="Darf Qwen-Image-2.1 kostenlos kommerziell genutzt werden?"
answer="Nein. Es wird unter dem Qwen Research License Agreement veröffentlicht. Dieses beschränkt die Nutzung auf nicht-kommerzielle Forschung oder Evaluierung und erfordert eine separate kommerzielle Lizenz von Alibaba. Qwen-Image-Edit-2511 läuft unter Apache 2.0."
/>
<FaqItem
question="Wie schneidet Qwen-Image-2.1 im Vergleich zur virtuellen Anprobe mit Google Vertex AI ab?"
answer="In unserem Testdurchlauf: 9,9 s gegenüber 9,3 s im Median, 8 von 8 erfolgreich abgeschlossen, sechs Unentschieden von acht bei der Qualität und etwa 0,005 $ an reiner GPU-Zeit pro Bild gegenüber 0,06 $ Listenpreis bei Vertex. Vertex ist eine kommerzielle API; Qwen bietet offene Gewichte unter einer Forschungslizenz."
/>
<FaqItem
question="Kann man Qwen-Image-2.1 mit einem LoRA feintunen?"
answer="Ja. DiffSynth-Studio auf ModelScope unterstützt LoRA-Training für Qwen-Image-2.1 und ComfyUI lädt Adapter über seine regulären LoRA-Nodes. Mit 7B Parametern lässt sich ein Adapter auf einer einzelnen GPU trainieren."
/>
<FaqItem
question="Was kostet die Genlook Try-On API?"
answer="Ein Credit entspricht einer Anprobe. Credits kosten 0,04 $ im Pay-as-you-go-Modell oder ab 0,015 $ in einem Monatstarif: Starter kostet 20 $ für 1.000 Anproben, Growth 99 $ für 6.000, Scale 300 $ für 20.000. Paket-Credits verfallen nie und neue Accounts starten mit kostenlosen Credits."
/>
</Faq>