ב-20 בספטמבר 2026, צוות Qwen של עליבאבא שחרר בקוד פתוח את Qwen-Image-2.1. מדובר במודל תמונה עם 7 מיליארד פרמטרים שמייצר ועורך תמונות בתהליך אחד, מקבל עד 10 תמונות כרפרנס, ומציין מדידה וירטואלית כאחד משימושי המטרה שלו.
בדקנו אותו על שמונה צמדים של תמונות אדם-ופריט לבוש, אותם אנחנו מריצים על כל מנוע שאנו בודקים. הצבנו את התוצאות לצד אלו של מודל המדידה הווירטואלית של גוגל ב-Vertex AI, שהוא כיום אחת האופציות המסחריות הנפוצות ביותר. אותן התמונות, אותו תהליך של פרומפט, בלי פיין-טיונינג (אימון עדין).

מה זה בעצם Qwen-Image-2.1?
המודל החדש מחליף שלושה מודלים קודמים של עליבאבא (Qwen-Image לייצור תמונה, Qwen-Image-Edit לעריכה, ו-Qwen-Image-Layered לשקיפות) ומאחד אותם לקובץ אחד.
- 7 מיליארד פרמטרים ברכיב היצירה (32 שכבות DiT בערוץ בודד). מודל Qwen3-VL 8B אחראי על קריאת הפרומפט והתמונות המוזנות.
- עד 10 תמונות רפרנס לעריכה אחת. מתוך דף השחרור הרשמי: "עבור מדידה וירטואלית, ניתן לשלב חמישה קלטים (דוגמן, בגד, נעליים, תיק וכובע) לכדי אאוטפיט שלם".
- עריכת אזור. פשוט מסמנים אזור בעיגול, צובעים מעליו, או מעבירים מסכה נפרדת - ורק האזור הזה משתנה.
- נאמנות למקור (אנשים ומוצרים) היא מטרת אימון מוצהרת: הפנים נשארות זהות לאורך העריכות, והטקסט, הטקסטורות והצורה של המוצר נשמרים כפי שהם.
- שקיפות מובנית. פלט RGBA ישירות מהפרומפט, או חילוץ של נושא התמונה כשכבה שקופה.
- הסקות יעילות. התמונות וההנחיות מקודדות פעם אחת ונשמרות בזיכרון המטמון (Cache) עבור כל שלב בניקוי הרעשים (Denoising), כך שעריכה עם עשרה רפרנסים עולה פחות או יותר אותו הדבר כמו עריכה עם רפרנס אחד.
במבחן הביצועים של הצוות עצמו, Qwen-Image-Bench, המודל זוכה לציון של 60.28, ומדורג שביעי מתוך 29 מודלים. ששת המודלים שמקדימים אותו סגורים למפתחים (GPT Image 2.5 מוביל עם ציון 67.01). בקרב המודלים הפתוחים, הוא ממוקם במקום הראשון בפער משמעותי.

כמובן שמדובר במבחן מדווח עצמית המודד יצירת תמונה, ולא עריכה. המשקלים זמינים ב-Hugging Face וב-ModelScope, עם תמיכה מלאה ביום השחרור (Day-zero) ל-Diffusers, ComfyUI, vLLM-Omni ו-SGLang.
הרישיון כאן הוא Qwen Research License, ומוגדר "למטרות לא מסחריות בלבד". שימוש מסחרי דורש הסכם נפרד מול עליבאבא. נרחיב על כך בהמשך.
האם זה מתאים למדידה וירטואלית?
התשובה הקצרה: כן, ישירות מהקופסה (Zero-shot).
כדי לבדוק זאת, לקחנו שמונה זוגות מדגמי המדידה הפומביים שלנו. כל זוג מורכב מתמונת סלפי מול מראה בתוספת תמונת המוצר, בדיוק כפי שסוחר ב-Shopify היה מעלה (פקשוט שטוח או צילום על דוגמן). הרצנו את Qwen-Image-2.1 דרך Comfy Cloud ב-16 שלבים, ואת Vertex AI דרך ה-API שלו. שני המודלים עברו את אותו תהליך של פרומפט, ללא שימוש ב-LoRA וללא עיבוד לאחר מכן (Post-processing). כל תמונה מסודרת משמאל לימין: תמונת קונה, תמונת מוצר, Qwen-Image-2.1, Google Vertex AI.
חולצת הכדורגל בתחילת הפוסט מדגימה איך המודלים מתמודדים עם טקסט. שני המודלים הצליחו לשמור על הלוגו של נותן החסות והסמל קריאים ובמקומם. באף אחת מהתוצאות הידיים של הקונה, הטלפון או הרקע לא השתנו.

איפה Qwen בולט יותר. בתמונת העבאיה שצולמה על דוגמנית עוטה צעיף שמנת, Vertex העביר את הצעיף יחד עם הבגד. לעומתו, Qwen השכיל לשנות את העבאיה ותו לא.

איפה Qwen נופל. הפקשוט הוא באורך אמצע-השוק. בעוד ש-Vertex שומר על האורך, Qwen עוצר בברך. החגורה, הרוכסן והדשים יצאו נכון אצל שניהם, אבל קו המכפלת בבגדים ארוכים היווה בעיה עקבית שהופיעה שוב במדידת שמלת מקסי רב-שכבתית.
בשאר חמשת הזוגות (שמלת מידי פרחונית, קפוצ'ון בצבע ניאון, סארי בשני חלקים, שמלת מקסי במידות גדולות, ושמלת כלה מתחרה) התוצאות היו צמודות לחלוטין. שני המודלים שמרו על חולצת הסארי וגבולותיה, שניהם קלעו לקנה המידה של ההדפס במידי, ואף אחד מהם לא עיוות פרצופים.
השוואה: Qwen-Image-2.1 לעומת מודל המדידה של Google Vertex AI
| Qwen-Image-2.1 ב-Comfy Cloud | מדידה וירטואלית ב-Google Vertex AI | |
|---|---|---|
| זוגות שהושלמו | 8 מתוך 8 | 8 מתוך 8 |
| זמן חציון למדידה | 9.9 שניות | 9.3 שניות |
| עלות למדידה | כ-0.005$ (זמן מעבד GPU) | 0.06$ (מחיר מחירון) |
| איכות (ראש בראש) | 6 תיקו, 1 ניצחון, 1 הפסד | 6 תיקו, 1 ניצחון, 1 הפסד |
| משקלים | פתוחים, ניתן לבצע פיין-טיונינג | API סגור |
| רישיון | למחקר בלבד, מסחרי תלוי הסכם | מסחרי |
זמן הביצוע של Qwen כולל כשלוש שניות המתנה בתור של Comfy Cloud. עלות ה-Qwen מתייחסת לזמן המעבד (GPU) עבור המודל בלבד; בקשת מדידה מלאה כוללת גם סיווג של הבגד, יצירת פרומפטים ובדיקות איכות.
הקאצ'
רישוי. Qwen-Image-2.1 משוחרר תחת Qwen Research License Agreement, ולא תחת Apache 2.0 כמו במודל Qwen-Image-Edit-2511. קובץ הרישיון קובע כי השימוש מוגבל "למטרות לא מסחריות בלבד" – כלומר, למחקר והערכה, ומפנה משתמשים המעוניינים בשימוש מסחרי, לבקש רישיון נפרד מעליבאבא. כפתור מדידה בחנות שופיפיי נחשב חד-משמעית לשימוש מסחרי. כך גם אירוח המודל בעצמכם (Self-hosting) דורש חתימה על ההסכם הזה.
שני פספוסים. אורך המכפלת בבגדים ארוכים, והשמטה של חלקים משניים במוצרים מרובי-חלקים. מדובר בבעיות מערכתיות - וזה בדיוק המקום שבו LoRA נכנס לתמונה. עם 7 מיליארד פרמטרים, מתאם (Adapter) יכול להיות מאומן על מעבד GPU בודד בתוך שעות ספורות. פלטפורמת DiffSynth-Studio של ModelScope תומכת באימון LoRA על המודל מיומו הראשון, ו-ComfyUI טוענת מתאמים דרך צמתים סטנדרטיים. כל מה שנדרש לאימון זה תמונה על דוגמן לצד פקשוט תואם – מה שיש כבר כמעט בכל קטלוג אופנה. הוספת תיאור הקטגוריה, סוג הרכיסה והאורך לפרומפט, פותרת בעצמה את רוב בעיות המכפלת; ו-LoRA משלים את החסר.
מה זה אומר עבור Genlook
Qwen-Image-2.1 הוא המודל הפתוח הראשון שמגיע לשוויון מול API מסחרי של מדידה וירטואלית בצמדי התמונות שלנו, ובשבריר מהעלות פר תמונה. אנו משדרגים את תהליך המדידה של Genlook, כדי לשלב אותו במקומות שבהם הוא חזק יותר, וזאת בנוסף לסיווג הבגדים, בניית הפרומפטים, ובדיקות האיכות שמקיפות כל מודל – כך שכל סוג מוצר יקבל את איכות המדידה הטובה ביותר שיש. שני הפספוסים שצוינו לעיל הם היעדים הראשונים שהשדרוג שלנו מתמקד בהם.
עבור מפתחים, Genlook Try-On API מספק נקודת קצה (Endpoint) אחת לכל סוגי המוצרים. קרדיט אחד שווה למדידה אחת, ועלות קרדיט היא 0.01$. בלי דמי פלטפורמה, בלי רישיונות, בלי מינימום חודשי, הקרדיטים לא פגים, וחשבונות חדשים מקבלים קרדיטים חינם. ה-מדריך למתחילים כולל רק ארבע קריאות: יצירת מוצר, העלאת תמונה, יצירת מדידה ומשיכת התוצאה.
לסיכום
- מה שוחרר: מודל פתוח בעל 7 מיליארד פרמטרים, המייצר תמונות, עורך תמונות עם עד 10 רפרנסים ומטפל בשקיפות - הכול בקובץ אחד. זהו המודל הפתוח הטוב ביותר לפי בדיקת הביצועים של הצוות עצמו.
- במדידה וירטואלית: מגיע לאותן התוצאות מול מודל Vertex AI של גוגל, ב-6 מתוך 8 זוגות של תמונות היישר מהקופסה. מצטיין בהשארת אלמנטים לא קשורים (שאינם בגדים) במקומם, ונופל באורך המכפלת של בגדים ארוכים.
- עלויות: רק כ-0.005$ של זמן מחשוב מול 0.06$.
- הקאצ': רישיון למחקר בלבד למי שמעוניין לארח בעצמו, ושני פספוסים עקביים שניתן לפתור באמצעות LoRA.
קבלו מפתח API באתר platform.genlook.app כדי להתחיל להשתמש ב-Genlook Try-On API, או הוסיפו מדידה וירטואלית לחנות שלכם.
שאלות נפוצות