Am 20. September 2026 hat das Qwen-Team von Alibaba [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1) als Open Source veröffentlicht. Es ist ein 7B-Bildmodell, das in einer einzigen Pipeline generiert und bearbeitet, bis zu 10 Referenzbilder verarbeitet und [Virtual Try-On](/glossary/virtual-try-on) als primären Anwendungsfall nennt. 0
Wir haben es mit den acht Personen-und-Kleidungs-Paaren getestet, die wir für jede Engine verwenden, und zwar im direkten Vergleich mit Googles Virtual Try-On-Modell auf Vertex AI – einer der gängigsten kommerziellen Optionen. Gleiche Fotos, gleiche Prompt-Pipeline, kein Fine-Tuning.

## Was ist Qwen-Image-2.1?
Qwen-Image-2.1 ersetzt drei frühere Modelle (Qwen-Image für die Generierung, Qwen-Image-Edit für die Bearbeitung, Qwen-Image-Layered für Transparenz) durch einen einzigen Checkpoint.
- **7B Parameter** in der Generierungskomponente (32 Single-Stream DiT-Schichten). Qwen3-VL 8B liest den Prompt und die Eingabebilder.
- **Bis zu 10 Referenzbilder** in einer Bearbeitung. Aus den Release-Notes: „Für Virtual Try-On können fünf Eingaben (ein Model, Kleidung, Schuhe, eine Tasche und ein Hut) zu einem kompletten Outfit kombiniert werden.“
- **Regionale Bearbeitung.** Kreisen Sie einen Bereich ein, malen Sie darüber oder übergeben Sie eine separate Maske, und nur dieser Bereich ändert sich.
- **Detailtreue für Menschen und Produkte** ist ein erklärtes Trainingsziel: Gesichter bleiben bei Bearbeitungen gleich, „Text, Texturen und Form“ von Produkten bleiben erhalten.
- **Native Transparenz.** RGBA-Ausgabe durch einen Prompt und Freistellung des Motivs aus einem Foto als transparente Ebene.
- **Effiziente Inferenz.** Eingabebilder und Anweisungen werden einmal codiert und für jeden Denoising-Schritt zwischengespeichert, sodass eine Bearbeitung mit zehn Referenzen pro Schritt ungefähr das Gleiche kostet wie mit einer einzigen Referenz.
Im teaminternen Qwen-Image-Bench erreicht es einen Score von 60,28 und belegt damit Platz sieben von 29 Modellen. Die sechs davor platzierten Modelle sind nicht öffentlich (GPT Image 2.5 führt mit 67,01). Unter den Open-Weight-Modellen liegt es mit großem Abstand auf dem ersten Platz.

Dies ist ein selbst durchgeführter Benchmark, der die Generierung und nicht die Bearbeitung misst. Die Gewichte liegen auf Hugging Face und ModelScope bereit, mit Day-Zero-Support in Diffusers, ComfyUI, vLLM-Omni und SGLang.
Die Lizenz ist die **Qwen Research License**, „nur für nicht-kommerzielle Zwecke“. Für die kommerzielle Nutzung ist eine separate Vereinbarung mit Alibaba erforderlich. Mehr dazu weiter unten.
## Funktioniert es für Virtual Try-On?
Ja, Zero-Shot.
Setup: Acht Paare aus unseren öffentlichen Try-On-Beispielen, jeweils ein Spiegel-Selfie plus das Produktbild, so wie ein Händler es hochladen würde (ein flacher Packshot oder ein Foto am Model). Qwen-Image-2.1 lief in der Comfy Cloud mit 16 Schritten. Vertex AI lief über seine API. Beide durchliefen dieselbe Prompt-Pipeline, ohne LoRA und ohne Post-Processing. Jedes Panel zeigt von links nach rechts: Kundenfoto, Produktbild, Qwen-Image-2.1, Google Vertex AI.
Das Fußballtrikot oben im Beitrag ist der Text-Test. Beide Modelle halten den Sponsorenschriftzug und das Wappen lesbar und an der richtigen Stelle, und keines der beiden verändert die Hände, das Telefon oder den Hintergrund der Kundin.

**Wo Qwen besser abschneidet.** Die Abaya wird an einem Model fotografiert, das einen cremefarbenen Schal trägt. Vertex hat den Schal zusammen mit dem Kleidungsstück übernommen. Qwen hat nur die Abaya geändert und sonst nichts.

**Wo Qwen schwächer ist.** Der Packshot ist wadenlang. Vertex behält diese Länge bei, Qwen stoppt am Knie. Gürtel, Verschluss und Revers sind bei beiden richtig. Die Saumlänge bei langen Kleidungsstücken war der einzige durchgängige Fehler, der auch bei einem gestuften Maxikleid wieder auftrat.
**Die anderen fünf Paare** (ein florales Midi-Kleid, ein Neon-Hoodie, ein zweiteiliger Sari, ein Plus-Size-Maxikleid, ein Spitzenbrautkleid) konnten wir qualitativ nicht trennen. Beide übernahmen die Bluse und die Bordüre des Saris, beide trafen die Skalierung des Musters beim Midi-Kleid richtig, keines der beiden veränderte ein Gesicht.
## Qwen-Image-2.1 vs. Google Vertex AI Try-On
| | Qwen-Image-2.1 auf Comfy Cloud | Google Vertex AI Virtual Try-On |
|---|---|---|
| Abgeschlossene Paare | 8 von 8 | 8 von 8 |
| Median-Dauer pro Try-On | 9,9 s | 9,3 s |
| Kosten pro Try-On | ca. $0,005 (GPU-Zeit) | $0,06 (Listenpreis) |
| Qualität im Direktvergleich | 6 Unentschieden, 1 besser, 1 schlechter | 6 Unentschieden, 1 besser, 1 schlechter |
| Gewichte | offen, können fine-getuned werden | geschlossene API |
| Lizenz | nur Forschung, kommerziell nach Vereinbarung | kommerziell |
Die Zeit von Qwen beinhaltet etwa drei Sekunden Warteschlange in der Comfy Cloud. Die Qwen-Kosten beziehen sich nur auf die GPU-Zeit für das Modell; eine vollständige Try-On-Anfrage umfasst außerdem die Klassifizierung von Kleidungsstücken, die Prompt-Erstellung und Qualitätsprüfungen.
## Der Haken
**Lizenz.** Qwen-Image-2.1 wird unter dem Qwen Research License Agreement ausgeliefert, nicht unter Apache 2.0 wie Qwen-Image-Edit-2511. Die Lizenzdatei gewährt die Nutzung „nur für nicht-kommerzielle Zwecke“, definiert als Forschung oder Evaluierung, und weist kommerzielle Nutzer an, eine Lizenz bei Alibaba zu beantragen. Ein Try-On-Button in einem Shop ist eine kommerzielle Nutzung. Auch für Self-Hosting ist diese Vereinbarung erforderlich.
**Die zwei Schwachpunkte.** Die Saumlänge bei langen Kleidungsstücken und weggelassene Nebenteile bei einigen mehrteiligen Produkten. Beide Fehler sind systematisch – genau dafür ist ein LoRA da. Mit 7B trainiert ein Adapter auf einer einzelnen GPU in wenigen Stunden. DiffSynth-Studio auf ModelScope unterstützt LoRA-Training für 2.1 vom ersten Tag an und ComfyUI lädt Adapter über seine Standard-Nodes. Die Trainingsdaten bestehen aus einem Model-Foto gepaart mit dem passenden Packshot, was Modekataloge ohnehin schon haben. Ein Prompt, der die Kategorie, den Verschluss und die Länge des Kleidungsstücks nennt, behebt die meisten Saumfehler bereits von selbst; ein LoRA deckt den Rest ab.
## Was das für Genlook bedeutet
Qwen-Image-2.1 ist das erste offene Modell, das bei unseren Paaren die Parität mit einer kommerziellen Try-On-API erreicht – zu einem Bruchteil der Kosten pro Bild. Wir rüsten die Genlook-Try-On-Pipeline auf, um es dort einzusetzen, wo es stärker ist. Dies geschieht zusätzlich zur Kleidungsstückklassifizierung, Prompt-Erstellung und den Qualitätsprüfungen, die jedes Modell umgeben, damit jeder Produkttyp die beste verfügbare Try-On-Qualität erhält. Die beiden oben genannten Schwachpunkte sind die ersten Dinge, die wir bei der Pipeline-Arbeit in Angriff nehmen.
Für Entwickler ist die [Genlook Try-On API](https://platform.genlook.app) der einzige Endpunkt für jeden Produkttyp. Ein Credit entspricht einem Try-On: $0,04 Pay-as-you-go oder ab $0,015 im Monatsabo. Paket-Credits verfallen nie, und neue Accounts starten mit Gratis-Credits. Der [Quickstart](/docs/tryon-api/quickstart) besteht aus vier Aufrufen: Produkt erstellen, Foto hochladen, generieren, Ergebnis abrufen.
## Zusammenfassung
- **Das Release:** Ein offenes 7B-Modell, das in einem Checkpoint generiert, mit bis zu 10 Referenzen bearbeitet und Transparenz handhabt. Bestes offenes Modell im teaminternen Benchmark.
- **Beim Try-On:** Zieht bei 6 von 8 Paaren Zero-Shot mit Googles Vertex AI-Modell gleich. Besser darin, Nicht-Kleidungsstücke in Ruhe zu lassen, schwächer bei der Saumlänge von langen Kleidungsstücken.
- **Kosten:** Etwa $0,005 GPU-Zeit pro Bild im Vergleich zu $0,06.
- **Der Haken:** Eine reine Forschungslizenz für Self-Hoster und zwei Schwachpunkte, die ein LoRA beheben sollte.
---
_[Holen Sie sich einen API-Key unter platform.genlook.app](https://platform.genlook.app), um die Genlook Try-On API zu nutzen, oder [fügen Sie Virtual Try-On zu Ihrem Shop hinzu](/get-started)._
<Faq>
<FaqItem
question="Kann Qwen-Image-2.1 Virtual Try-On?"
answer="Ja. Das Release zeigt ein Outfit, das aus fünf Referenzbildern (einem Model, Kleidung, Schuhen, einer Tasche und einem Hut) zusammengestellt wurde. Bei unseren acht Benchmark-Paaren zog es bei sechs Zero-Shot-Tests mit Googles Vertex AI Try-On-Modell gleich, bei einem war es besser und bei einem schlechter."
/>
<FaqItem
question="Ist Qwen-Image-2.1 für die kommerzielle Nutzung kostenlos?"
answer="Nein. Es wird unter dem Qwen Research License Agreement veröffentlicht, das die Nutzung auf nicht-kommerzielle Forschung oder Evaluierung beschränkt und eine separate kommerzielle Lizenz von Alibaba erfordert. Qwen-Image-Edit-2511 ist Apache 2.0."
/>
<FaqItem
question="Wie schneidet Qwen-Image-2.1 im Vergleich zu Google Vertex AI Virtual Try-On ab?"
answer="In unserem Durchlauf: 9,9 s gegenüber 9,3 s im Median, jeweils 8 von 8 abgeschlossen, sechs Unentschieden bei acht Versuchen in Bezug auf die Qualität und etwa $0,005 GPU-Zeit pro Bild gegenüber dem Listenpreis von Vertex von $0,06. Vertex ist eine kommerzielle API; Qwen bietet offene Gewichte unter einer Forschungslizenz."
/>
<FaqItem
question="Kann man Qwen-Image-2.1 mit einem LoRA fine-tunen?"
answer="Ja. DiffSynth-Studio auf ModelScope unterstützt das LoRA-Training für Qwen-Image-2.1 und ComfyUI lädt Adapter über seine Standard-LoRA-Nodes. Bei 7B Parametern trainiert ein Adapter auf einer einzigen GPU."
/>
<FaqItem
question="Wie viel kostet die Genlook Try-On API?"
answer="Ein Credit ist ein Try-On. Credits kosten $0,04 Pay-as-you-go oder ab $0,015 im Monatsplan: Starter kostet $20 für 1.000 Try-Ons, Scale $300 für 20.000. Paket-Credits verfallen nie und neue Accounts starten mit kostenlosen Credits."
/>
</Faq>