GPT Image 2.5: Sketch-Test, API-Preis gleich
GPT Image 2.5 steckt hinter ChatGPT Images 2.5. Ich habe Sketch und Kommentar-Edits im Free-Konto getestet, API-Preise bleiben wie bei GPT Image 2.
Artikel lesen →
Qwen Image 2.1 ist Alibabas neues Open-Weight-Bildmodell, veröffentlicht am 20. September 2026. Ein einziges Modell mit einem Bildgenerator von 7 Milliarden Parametern erzeugt und bearbeitet Bilder. Es erzeugt transparente PNGs direkt, nimmt für eine Bearbeitung bis zu 10 Referenzbilder entgegen, gibt nativ in 2K aus, und man kann es in Qwens Hugging-Face-Demos kostenlos ausprobieren. Der Haken ist die Lizenz, die nur nicht-kommerzielle Nutzung erlaubt.
Ich habe am 25. September drei Tests gemacht: eine transparente Produktaufnahme, ein textlastiges Poster und eine Bearbeitung, alle über Qwens offizielle Hugging-Face-Demo. Die Freisteller sind echt gut. Bei der Kleinschrift hakt es noch.
Ein einziges Modell übernimmt Generierung und Bearbeitung. Ein Bildgenerator mit 7 Milliarden Parametern arbeitet zusammen mit Qwen3-VL 8B, einem Vision-Language-Modell, das Textanweisungen und mitgegebene Bilder liest. Qwen hat dieses kompakte Design im Februar mit Qwen-Image-2.0 eingeführt, allerdings nur über Alibabas API. 2.1 ist die erste Version davon, die man herunterladen kann, und ihr Bildgenerator ist nur rund ein Drittel so groß wie der des ursprünglichen Qwen-Image vom August 2025 mit 20 Milliarden Parametern.
Transparenz ist das große Thema. Es erzeugt normale oder transparente (RGBA) Bilder direkt aus Text, bearbeitet transparente Ebenen und kann ein Motiv aus einem Foto freistellen und den Hintergrund entfernen. Das baut auf Qwen-Image-Layered auf, das Qwen im Dezember 2025 veröffentlicht hat. Für eine Bearbeitung lassen sich bis zu 10 Referenzbilder einsetzen, und man kann einen bestimmten Bereich mit einem Kreis, einem gemalten Pinselstrich oder einer separaten Maske markieren. Laut Qwen bleiben Personen und Produkte über mehrere Bearbeitungen hinweg wiedererkennbar, und Typografie, Porträtlicht und Feindetails haben sich gegenüber früheren Versionen verbessert.
Bilder sind nicht das Einzige, was Qwen liefert. Qwens Modell, das Stimmen aus 3 Sekunden Audio klont, kam im vergangenen Dezember.
Angefangen habe ich mit dem, was Qwen am stärksten bewirbt. Ich wollte eine Cold-Brew-Flasche mit Kondenswasser und Kraftpapier-Etikett, formuliert nach Qwens eigener Empfehlung für transparente Bilder:
This is an RGBA image with transparency. A glass bottle of cold-brew coffee with condensation droplets and a kraft-paper label reading “NORTH ROAST”, three coffee beans beside it. The image has alpha channel and the background is transparent.
Zurück kam ein 1024x1024-PNG, die Standardgröße der Demo, mit echtem Alphakanal. Etwa drei Viertel des Bildes sind durchsichtig, auf dem Etikett steht fehlerfrei NORTH ROAST, und die Tröpfchen wirken überzeugend.
Um zu sehen, wie sich der Freisteller verhält, habe ich ihn auf einen dunklen Marineblau- und einen Sandhintergrund gelegt. Auf Sand sieht es wie eine Studio-Produktaufnahme aus.
Auf Marineblau fällt eine Schwäche sofort auf. Der leere Flaschenhals ist durchgehend blassgrau, weil das Modell das Glas gemalt hat, als stünde ein weißer Studiohintergrund dahinter, statt es durchsichtig zu lassen. Wer stark hineinzoomt, sieht unter dem Flaschenboden außerdem einen schmalen hellen Rand, in normaler Größe fällt er aber kaum auf.
Für Sticker, Icons und Produktfreisteller auf hellen Seiten ist es hervorragend und erspart den Schritt der Hintergrundentfernung. Bei Glas oder allem, was auf einem dunklen Layout landet, lohnt sich vorher ein Blick auf die Kanten.

Qwen zufolge hat sich die Textwiedergabe verbessert, also wollte ich ein Poster mit drei Textzeilen:
A risograph-style concert poster that reads “Harbour Lights Jazz Night”, “Friday 17 October, 20:00”, “Café Aurora, London”, two-colour teal and orange ink, grainy paper texture.
Dieser Durchlauf kam sauber zurück. Die Überschrift, Datum und Uhrzeit sowie “Café Aurora, London” sind alle richtig geschrieben, Akzent inklusive, und der zweifarbige Risograph-Look funktioniert.
Konsistent ist das aber nicht. Mein erster Versuch mit demselben Poster, mit einer anderen Stadt in der letzten Zeile, druckte die Uhrzeit als 10:00 statt 20:00 und verhunzte den Stadtnamen. Den Überschriften kann man also trauen, aber jede kleine Zeile sollte man vor dem Druck noch einmal lesen.

Für die Bearbeitung habe ich dem Modell die transparente Flasche gegeben und es gebeten, sie auf einen sonnenbeschienenen Holztisch in einem Café zu stellen, mit einem Jazz-Poster an der Wand dahinter. Flasche und Etikett sollten dabei exakt so bleiben, wie sie waren.
Flasche, Etikett und die drei Bohnen kamen unverändert zurück, und das Fensterlicht sowie der Schatten auf dem Tisch wirken stimmig. Diesmal ist der Flaschenhals durchsichtig, und man sieht die Wand dahinter.
Das Poster an der Wand zeigt allerdings nur Fantasieschrift, dieselbe Schwäche bei kleinem Text wie beim ersten Poster-Durchlauf.
Qwens Hauptdemo, die bis zu 10 Bilder verarbeitet, hat mich an diesem Morgen wiederholt mit voller Warteschlange abgewiesen, also liefen meine Durchläufe über Qwens zweite Hugging-Face-Demo, die nur ein Bild auf einmal bearbeitet. Die Bearbeitung mit 10 Bildern habe ich damit noch nicht ausprobiert.

Qwen Image 2.1 erscheint unter dem Qwen Research License Agreement, ein Rückschritt gegenüber dem ursprünglichen Qwen-Image, das unter Apache 2.0 stand und kommerzielle Nutzung erlaubte. Die neue Lizenz gewährt eine lizenzgebührenfreie Nutzung, aber nur für nicht-kommerzielle Zwecke, definiert als Forschung oder Evaluation. Alles darüber hinaus braucht eine separate kommerzielle Lizenz von Alibaba, anzufragen per E-Mail an die in der Lizenzdatei genannte Adresse.
Eine kostenpflichtige Qwen-Image-2.1-API, mit der man sich freikaufen könnte, gibt es ebenfalls nicht. Alibabas kostenpflichtige Bild-API, in Alibaba Cloud Model Studio, bietet qwen-image-3.0 und qwen-image-3.0-pro an, nicht dieses Modell.
Die Lizenz sagt nichts Gesondertes über die vom Modell erzeugten Bilder, daher würde ich Kundenarbeit, Werbung und alles, was verkauft werden soll, als kommerzielle Nutzung behandeln und vorher bei Alibaba anfragen.
Wer heute schon verkaufbare Bilder braucht: Higgsfields kostenloser Plan erlaubt die kommerzielle Nutzung der Ergebnisse bereits.
Higgsfields eigenes Bildmodell Soul 2.0 ist im kostenlosen Plan enthalten, und die Ergebnisse dürfen in jedem Plan kommerziell genutzt werden, auch im Free-Plan.
Higgsfield kostenlos testen →Die vollen Gewichte sind ein 33,1-GB-Download, mit Unterstützung ab Tag eins in ComfyUI, samt fertigen Text-zu-Bild- und Bildbearbeitungs-Workflows, dazu Diffusers, vLLM-Omni, SGLang und LightX2V. Über ROCm läuft es auch auf AMD-Radeon-GPUs, man ist also nicht an Nvidia gebunden.
Neben dem Bildmodell hat Qwen zwei Prompt-Rewriting-Modelle auf Basis von Qwen3.5-VL veröffentlicht, die aus einem kurzen Prompt einen ausführlichen machen, eines für die Generierung, eines für die Bearbeitung. Wer in Festlandchina sitzt, findet auf wuli.art jede Qwen-Image-2.1-Funktion kostenlos. Wer stattdessen lokales Open-Weight-Video sucht: LTX-2.5 habe ich im August behandelt.
Qwen hat zusammen mit der Veröffentlichung einen eigenen Benchmark publiziert, Qwen-Image-Bench. Die Werte sind also Qwens eigene Angabe, kein unabhängiger Test. Darin liegt 2.1 knapp vor Googles Nano Banana 2.0 und OpenAIs GPT Image 1.5, und hinter OpenAIs GPT Image 2.5, GPT Image 2 und Qwens eigenem geschlossenen Qwen Image 3 Pro.
Ausgewählte Gesamtwerte aus Qwen-Image-Bench, dem Benchmark, den Qwen mit der Veröffentlichung publiziert hat.
| Modell | Qwen-Image-Bench-Score |
|---|---|
| GPT Image 2.5 (Sunburst) | 67,01 |
| GPT Image 2 | 64,69 |
| Qwen Image 3 Pro | 62,36 |
| Qwen Image 2.1 | 60,28 |
| Nano Banana 2.0 | 59,82 |
| GPT Image 1.5 | 59,65 |
| FLUX 2 Max | 55,33 |
| Qwen Image 2512 | 52,06 |
Für ein Modell, das man herunterladen und auf dem eigenen Rechner laufen lassen kann, ist das ziemlich nah an der Spitze.
Wer Sticker, Icons oder Produktfreisteller braucht, sollte die kostenlose Demo ausprobieren. Bevor etwas rausgeht, Glas auf dunklem Hintergrund prüfen.
Wer eine leistungsfähige GPU hat und ein lokales Bildmodell will: ComfyUI unterstützt es seit dem ersten Tag und bietet fertige Workflows zum Einstieg.
Wer Bilder für bezahlte Arbeit braucht, ist mit dieser Lizenz nicht abgedeckt. Entweder vorher eine kommerzielle Lizenz bei Alibaba anfragen oder ein Tool nutzen, dessen Bedingungen kommerzielle Nutzung bereits erlauben.
Ja, Qwen Image 2.1 ist kostenlos herunterzuladen und kostenlos in Qwens zwei Hugging-Face-Demos zu testen, auch wenn die Demos zu Stoßzeiten Warteschlangen bilden können. Ich habe alle meine Tests am 25. September 2026 ohne Bezahlung durchgeführt. Kostenlos heißt aber nicht kostenlos für kommerzielle Nutzung, denn es erscheint unter einer Forschungslizenz.
Unter der Standard-Qwen-Research-License nicht, die deckt nur Forschung oder Evaluation ab. Kommerzielle Nutzung braucht eine separate Lizenz von Alibaba, und eine kostenpflichtige 2.1-API gibt es nicht: Alibabas kostenpflichtige API bietet stattdessen qwen-image-3.0 an. Die Lizenz enthält keine gesonderte Klausel für erzeugte Bilder, also bezahlte Arbeit als kommerzielle Nutzung behandeln oder ein Tool wie Higgsfield nutzen, dessen kostenloser Plan kommerzielle Nutzung bereits erlaubt.
Qwens empfohlene Formulierung verwenden: 'This is an RGBA image with transparency. [Beschreibung] The image has alpha channel and the background is transparent.' Das Ergebnis ist ein PNG mit echtem Alphakanal. In meinem Test war der Freisteller sauber, aber Glas sollte auf dunklem Hintergrund geprüft werden.
Qwen Image 2.1 bringt native Transparenz, erzeugt und bearbeitet also RGBA-Bilder direkt, und nimmt bis zu 10 Referenzbilder pro Bearbeitung entgegen. Es behält das kompakte Design bei, das Qwen-Image-2.0 im Februar 2026 über Alibabas API eingeführt hat, ein Modell für Generierung und Bearbeitung mit 7B-Bildgenerator und nativer 2K-Ausgabe, und ist die erste Version dieses Designs mit offenen Gewichten. Das ursprüngliche Qwen-Image vom August 2025 hatte einen 20B-Generator. Laut Qwen haben sich Typografie, Porträtlicht und Feindetails verbessert.
Ja, die Gewichte sind offen, 33,1 GB für das volle Modell. ComfyUI und Diffusers unterstützen es ab Tag eins, dazu vLLM-Omni, SGLang und LightX2V, und über ROCm werden auch AMD-Radeon-GPUs unterstützt. Eine leistungsfähige GPU ist nötig.