TechnologyVeröffentlicht am September 21, 2026Von Thibault Mathian

Qwen-Image-2.1 für die virtuelle Anprobe: Testergebnisse

Am 20. September 2026 hat Alibaba Qwen-Image-2.1 als Open Source veröffentlicht. Wir haben das Modell anhand von acht Test-Outfits gegen die virtuelle Anprobe von Google Vertex AI antreten lassen. Ergebnisse, Kosten und der Haken bei der Lizenz.

Inhaltsverzeichnis

Am 20. September 2026 veröffentlichte das Qwen-Team von Alibaba Qwen-Image-2.1 als Open Source. Dabei handelt es sich um ein 7B-Bildmodell, das in einer einzigen Pipeline generieren und bearbeiten kann. Es verarbeitet bis zu 10 Referenzbilder und nennt die virtuelle Anprobe ausdrücklich als einen der Hauptanwendungsfälle.

Wir haben das Modell mit denselben acht Bildpaaren aus Person und Kleidungsstück getestet, die wir für jede Engine verwenden. Als Gegner trat das Try-on-Modell von Google auf Vertex AI an – eine der am weitesten verbreiteten kommerziellen Lösungen. Gleiche Fotos, gleicher Prompt, kein Fine-Tuning.

Anprobe eines Fußballtrikots. Von links nach rechts: Foto des Käufers, Packshot des Produkts, Ergebnis mit Qwen-Image-2.1, Ergebnis mit Google Vertex AI.
Anprobe eines Fußballtrikots. Von links nach rechts: Foto des Käufers, Packshot des Produkts, Ergebnis mit Qwen-Image-2.1, Ergebnis mit Google Vertex AI.

Was ist Qwen-Image-2.1?

Qwen-Image-2.1 ersetzt drei bisherige Modelle (Qwen-Image für die Generierung, Qwen-Image-Edit für die Bearbeitung, Qwen-Image-Layered für Transparenzen) durch einen einzigen Checkpoint.

  • 7B Parameter in der Generierungskomponente (32 Single-Stream DiT-Schichten). Qwen3-VL 8B liest dabei den Prompt und die Eingabebilder.
  • Bis zu 10 Referenzbilder in einem Bearbeitungsschritt. Zitat von der Release-Seite: „Für die virtuelle Anprobe können fünf Eingaben (ein Model, Kleidung, Schuhe, eine Tasche und ein Hut) zu einem kompletten Outfit kombiniert werden.“
  • Regionale Bearbeitung. Kreisen Sie einen Bereich ein, übermalen Sie ihn oder übergeben Sie eine separate Maske – und nur dieser Bereich verändert sich.
  • Detailtreue bei Personen und Produkten ist ein erklärtes Trainingsziel: Gesichter bleiben über alle Bearbeitungen hinweg identisch, „Text, Texturen und Form“ von Produkten bleiben erhalten.
  • Native Transparenz. RGBA-Output aus einem Prompt sowie die Freistellung eines Motivs aus einem Foto als transparente Ebene.
  • Effiziente Inferenz. Eingabebilder und die Anweisung werden nur einmal encodiert und für jeden Denoising-Schritt zwischengespeichert. Eine Bearbeitung mit zehn Referenzen kostet pro Schritt also in etwa so viel wie eine mit nur einer Referenz.

Im teaminternen Qwen-Image-Bench erreicht das Modell einen Score von 60,28 und belegt damit Platz sieben von 29 Modellen. Die sechs Modelle davor sind alle Closed Source (GPT Image 2.5 führt mit 67,01). Unter den Modellen mit offenen Gewichten liegt es mit großem Abstand auf Platz eins.

Qwen-Image-Bench-Scores von Bildmodellen mit offenen Gewichten samt ihrer Parameteranzahl. Qwen-Image-2.1 führt mit 60,28 und 7B Parametern.
Qwen-Image-Bench-Scores von Bildmodellen mit offenen Gewichten samt ihrer Parameteranzahl. Qwen-Image-2.1 führt mit 60,28 und 7B Parametern.

Es handelt sich hierbei um einen selbst gemeldeten Benchmark, der die Generierung misst, nicht die Bearbeitung. Die Gewichte finden sich auf Hugging Face und ModelScope, mit Day-Zero-Support in Diffusers, ComfyUI, vLLM-Omni und SGLang.

Die Lizenz ist die Qwen Research License, die eine Nutzung „nur für nicht-kommerzielle Zwecke“ erlaubt. Für den kommerziellen Einsatz ist eine separate Vereinbarung mit Alibaba erforderlich. Mehr dazu weiter unten.

Taugt es für die virtuelle Anprobe?

Ja, und zwar Zero-Shot.

Das Setup: acht Bildpaare aus unseren öffentlichen Try-on-Beispielen. Jedes besteht aus einem Spiegel-Selfie sowie dem Produktbild, so wie es ein Händler hochladen würde (ein flacher Packshot oder ein Foto an einem Model). Qwen-Image-2.1 lief in der Comfy Cloud mit 16 Steps. Vertex AI wurde über dessen API angesprochen. Beide durchliefen die gleiche Prompt-Pipeline, ohne LoRA und ohne Post-Processing. Jedes Panel ist von links nach rechts aufgebaut: Käufer-Foto, Produktbild, Qwen-Image-2.1, Google Vertex AI.

Das Fußballtrikot ganz oben in diesem Beitrag war unser Text-Test. Beide Modelle erhalten den Schriftzug des Sponsors und das Wappen lesbar und an der richtigen Stelle. Keines der beiden Modelle verändert die Hände der Person, das Smartphone oder den Hintergrund.

Abaya-Anprobe. Von links nach rechts: Foto der Käuferin, Produktfoto am Model mit einem cremefarbenen Schal, Ergebnis mit Qwen-Image-2.1 (verändert nur die Abaya), Ergebnis mit Google Vertex AI (fügt auch den Schal hinzu).
Abaya-Anprobe. Von links nach rechts: Foto der Käuferin, Produktfoto am Model mit einem cremefarbenen Schal, Ergebnis mit Qwen-Image-2.1 (verändert nur die Abaya), Ergebnis mit Google Vertex AI (fügt auch den Schal hinzu).

Wo Qwen besser abschneidet. Die Abaya ist auf dem Produktfoto an einem Model zu sehen, das einen cremefarbenen Schal trägt. Vertex hat den Schal zusammen mit dem Kleidungsstück übernommen. Qwen hat nur die Abaya ausgetauscht und sonst nichts.

Trenchcoat-Anprobe. Von links nach rechts: Foto des Käufers, flacher Packshot, Ergebnis mit Qwen-Image-2.1 (endet am Knie), Ergebnis mit Google Vertex AI (behält die wadenlange Passform bei).
Trenchcoat-Anprobe. Von links nach rechts: Foto des Käufers, flacher Packshot, Ergebnis mit Qwen-Image-2.1 (endet am Knie), Ergebnis mit Google Vertex AI (behält die wadenlange Passform bei).

Wo Qwen schlechter abschneidet. Der Packshot zeigt eine wadenlange Passform. Vertex behält diese Länge bei, Qwen hört bereits auf Kniehöhe auf. Gürtel, Verschluss und Revers werden von beiden Modellen richtig dargestellt. Die Saumlänge bei langen Kleidungsstücken war der einzige durchgängige Fehler, der auch bei einem gestuften Maxikleid wieder auftrat.

Bei den anderen fünf Bildpaaren (ein florales Midikleid, ein neonfarbener Hoodie, ein zweiteiliger Sari, ein Maxikleid in Plus-Size, ein Spitzenbrautkleid) konnten wir keinen klaren Sieger ermitteln. Beide übernahmen die Bluse und die Borte des Saris, beide trafen die Skalierung des Musters beim Midikleid genau, keines veränderte ein Gesicht.

Qwen-Image-2.1 gegen Google Vertex AI Try-on

Qwen-Image-2.1 in der Comfy CloudGoogle Vertex AI Virtual Try-on
Erfolgreiche Bildpaare8 von 88 von 8
Median-Dauer pro Try-on9,9 s9,3 s
Kosten pro Try-onca. 0,005 $ (GPU-Zeit)0,06 $ (Listenpreis)
Qualität im Direktvergleich6 Unentschieden, 1 besser, 1 schlechter6 Unentschieden, 1 besser, 1 schlechter
Gewichteoffen, Fine-Tuning möglichClosed API
Lizenznur Forschung, kommerziell nach Vereinbarungkommerziell

Die Zeit bei Qwen beinhaltet etwa drei Sekunden Warteschlange in der Comfy Cloud. Die Kosten bei Qwen beziehen sich nur auf die reine GPU-Zeit für das Modell; bei einer vollständigen Try-on-Anfrage fallen zusätzlich Kleidungsklassifizierung, Prompt-Erstellung und Qualitätsprüfungen an.

Der Haken

Die Lizenz. Qwen-Image-2.1 wird unter dem Qwen Research License Agreement ausgeliefert, nicht unter Apache 2.0 wie noch Qwen-Image-Edit-2511. Die Lizenzdatei erlaubt die Nutzung „nur für nicht-kommerzielle Zwecke“, definiert als Forschung oder Evaluierung, und verweist kommerzielle Nutzer darauf, eine Lizenz bei Alibaba anzufragen. Ein Try-on-Button in einem Onlineshop gilt als kommerzielle Nutzung. Wer das Modell selbst hosten möchte, braucht also diese Vereinbarung.

Die beiden Schwachpunkte. Die Saumlänge bei langen Kleidungsstücken und das Weglassen von Nebenteilen bei einigen mehrteiligen Produkten. Beides sind systematische Fehler – und genau dafür gibt es LoRAs. Bei 7B lässt sich ein Adapter innerhalb weniger Stunden auf einer einzelnen GPU trainieren. DiffSynth-Studio von ModelScope unterstützt das LoRA-Training für 2.1 vom ersten Tag an, und ComfyUI lädt Adapter über seine Standard-Nodes. Die Trainingsdaten bestehen lediglich aus einem Foto am Model und dem dazugehörigen Packshot – Material, das in Modekatalogen ohnehin vorhanden ist. Ein Prompt, der die Kleidungskategorie, den Verschluss und die Länge benennt, behebt die meisten Fehler am Saum bereits von allein; ein LoRA kümmert sich um den Rest.

Was das für Genlook bedeutet

Qwen-Image-2.1 ist das erste offene Modell, das bei unseren Bildpaaren mit einer kommerziellen Try-on-API gleichzieht – und das zu einem Bruchteil der Kosten pro Bild. Wir überarbeiten derzeit die Try-on-Pipeline von Genlook, um es dort einzusetzen, wo es seine Stärken hat. Dies geschieht zusätzlich zur Kleidungsklassifizierung, Prompt-Erstellung und den Qualitätsprüfungen, die jedes Modell bei uns durchläuft, sodass jede Produktart die bestmögliche Try-on-Qualität erhält. Die beiden oben genannten Schwachpunkte sind die ersten Ziele, die wir mit der Pipeline-Überarbeitung angehen.

Für Entwickler bietet die Genlook Try-On API einen einzigen Endpunkt für jeden Produkttyp. Ein Credit entspricht einer Anprobe: 0,04 $ im Pay-as-you-go-Modell oder ab 0,015 $ in einem Monatstarif. Paket-Credits verfallen nie, und neue Accounts starten mit kostenlosen Credits. Der Quickstart umfasst nur vier Aufrufe: Produkt anlegen, Foto hochladen, generieren, Ergebnis abrufen.

Zusammenfassung

  • Das Release: ein 7B-Modell mit offenen Gewichten, das generiert, mit bis zu 10 Referenzen bearbeitet und Transparenz in einem einzigen Checkpoint handhabt. Das beste offene Modell im Benchmark des Teams.
  • Bei der Anprobe: zieht bei 6 von 8 Bildpaaren im Zero-Shot-Verfahren mit dem Vertex-AI-Modell von Google gleich. Es ist besser darin, Nicht-Kleidungsstücke in Ruhe zu lassen, aber schlechter bei der Saumlänge von langen Kleidungsstücken.
  • Kosten: etwa 0,005 $ an GPU-Zeit pro Bild im Vergleich zu 0,06 $.
  • Der Haken: eine reine Forschungslizenz für Self-Hoster sowie zwei Schwachpunkte, die sich mit einem LoRA beheben lassen sollten.

Holen Sie sich einen API-Key auf platform.genlook.app, um die Genlook Try-On API zu nutzen, oder fügen Sie die virtuelle Anprobe zu Ihrem Shop hinzu.

FAQ

Deine Fragen, beantwortet.

Kann Qwen-Image-2.1 virtuelle Anproben durchführen?↓
Darf Qwen-Image-2.1 kostenlos kommerziell genutzt werden?↓
Wie schneidet Qwen-Image-2.1 im Vergleich zur virtuellen Anprobe mit Google Vertex AI ab?↓
Kann man Qwen-Image-2.1 mit einem LoRA feintunen?↓
Was kostet die Genlook Try-On API?↓

Bereit, Retouren zu senken und Conversions zu steigern?

Installiere Genlook in wenigen Minuten in deinem Shopify-Store. Starte mit unserem Free-Plan.

Ähnliche Beiträge