Qwen-Image: KI-Bilder lokal erzeugen und die richtige Fassung wählen

Qwen-Image erzeugt Bilder auf dem eigenen Rechner. Die neue Fassung 2.1 ist nur für Forschung und Erprobung freigegeben, für Unternehmen ist 2512 die Fassung. Was beide an Speicher brauchen und wie lange ein Bild auf unserer Karte dauerte.

Stand: 2026-09-22

Qwen-Image ist eine Reihe von Bildmodellen aus dem Hause Alibaba. Sie beschreiben in Worten, was Sie sehen wollen, und das Modell erzeugt daraus ein Bild, auf Ihrem eigenen Rechner. Dieser Text behandelt zwei der Fassungen: Qwen-Image-2512 vom Dezember 2025 und Qwen-Image-2.1 vom September 2026. Die neuere ist deutlich kleiner, darf aber ohne gesonderte Lizenz nicht geschäftlich genutzt werden.

Wir ordnen beide ein: welche Fassung Sie nutzen dürfen, was sie an Speicher braucht, womit Sie sie starten und wie lange ein Bild auf einer Karte dauerte, auf der wir 2.1 selbst gemessen haben. Die Zahlen zu Speicher und Geräten stammen aus unserem Katalog, der beide Fassungen gegen 527 Geräte rechnet.

Welche Fassung Sie nutzen dürfen

FassungerschienenParameter des BildteilsLizenzgeschäftlich nutzbar
Qwen-Image-2512Dezember 202520,4 Mrd.Apache 2.0ja
Qwen-Image-2.1September 20267,1 Mrd.Qwen Research License Agreementnur mit eigener Lizenz des Herstellers

Für ein Unternehmen ist Qwen-Image-2512 die Fassung. Sie steht unter Apache 2.0, so nennt es die Modellkarte von Qwen-Image-2512, also die Beschreibung, die der Hersteller bei Hugging Face veröffentlicht, einer Plattform für offene Modelle. Damit darf sie auch geschäftlich eingesetzt, verändert und weitergegeben werden. Was eine offene Lizenz von einer eigenen Lizenz des Herstellers unterscheidet, erklärt der Ratgeber Open Source KI. 2512 erzeugt Bilder aus Text; zum Bearbeiten vorhandener Bilder gibt es ein eigenes Modell unter derselben Lizenz, Qwen-Image-Edit-2511. Unser Katalog führt es nicht, und gemessen haben wir es nicht.

Qwen-Image-2.1 kann laut der Modellkarte von Qwen-Image-2.1 beides in einem Modell, steht aber unter einer Forschungslizenz. Sie erlaubt die Nutzung nur zu nicht-kommerziellen Zwecken und versteht darunter Forschung oder Erprobung. Für geschäftliche Zwecke verlangt sie eine eigene Lizenz des Herstellers:

„You shall not use the Materials for any commercial purpose without obtaining a separate commercial license from us.“

Quelle: Qwen Research License Agreement zu Qwen-Image-2.1, gelesen am

Ob ein Versuch im Unternehmen schon als Erprobung im Sinne der Lizenz gilt, beurteilen wir nicht. Unabhängig davon gilt für den Einsatz im Unternehmen, was der Ratgeber Open Source KI für jedes Modell unter einer Lizenz ohne gewerbliche Nutzung rät: Es gehört nicht auf die Liste der erlaubten Modelle, auch nicht zum Ausprobieren. Wer 2.1 geschäftlich nutzen will, muss beim Hersteller eine Lizenz anfragen; die Adresse steht im Lizenztext. Das ist keine Rechtsberatung, maßgeblich ist der Lizenztext selbst.

Was es an Speicher braucht

Ein Bildmodell kommt nie allein. Für ein Bild aus Text brauchen Sie drei Dateien: den Bildteil, der das eigentliche Bild in mehreren Schritten berechnet, einen Text-Encoder, also ein Sprachmodell, das Ihre Beschreibung für den Bildteil übersetzt, und einen VAE, der das Ergebnis am Ende in Pixel umsetzt. Unsere Modellseiten rechnen alle drei zusammen, Bildteil und Text-Encoder jeweils in einer Quantisierungsstufe, also einer verkleinerten Fassung der Datei:

laut ModellseiteQwen-Image-2512Qwen-Image-2.1
Bildteil13,2 GB in der Stufe Q4_K_M4,2 GB in der Stufe Q4_K
Text-EncoderQwen2.5-VL-7B-Instruct, 4,7 GB (Q4_K_M)Qwen3-VL-8B-Instruct, 5,0 GB (Q4_K_M)
VAE0,3 GB0,7 GB
Speicherbedarf mit Rechenpuffer20,4 GB12,1 GB
passt auf233 von 527 Geräten319 von 527 Geräten
passt nur mit Auslagerung auf46 weitere Geräte145 weitere Geräte

Die Werte gelten für ein Bild mit 1024 × 1024 Pixeln und für zwei Schalter, die den Rechenpuffer klein halten, also den Platz, den das Programm beim Rechnen zusätzlich belegt; dazu mehr bei unserer Messung, zur Auslagerung weiter unten. Den Rechenpuffer haben wir an 2.1 gemessen und für 2512 übernommen.

Praktisch heißt das: 2.1 passt auf eine Grafikkarte mit 16 GB, von denen wir 15,2 GB als nutzbar rechnen, dort sogar in der genaueren Stufe Q6_K mit 13,9 GB. Wer 2.1 wegen des geringeren Speichers wählt, bleibt an die Forschungslizenz gebunden. 2512 braucht in der Stufe Q4_K_M mehr, etwa eine Grafikkarte mit 24 GB oder einen Mac mit 32 GB gemeinsamem Speicher, von dem wir 21,3 GB rechnen. Was die Stufen hinter dem Modellnamen bedeuten, erklärt der Ratgeber Lokale KI-Modelle.

Die drei Dateien gehören zusammen. Jede Fassung braucht ihren eigenen Text-Encoder aus der Tabelle, und auch die VAE-Datei von 2.1 lässt sich nicht tauschen, weder gegen die ältere VAE-Datei, die auch 2512 nutzt, noch gegen die des Videomodells Wan 2.2:

„The earlier Qwen Image and Wan 2.2 VAE weights are not interchangeable with the Qwen Image 2.1 VAE weights.“

Quelle: stable-diffusion.cpp, Anleitung zu Qwen Image 2.1, gelesen am

Wenn die Grafikkarte zu klein ist, hilft die Auslagerung. Mit dem Schalter --offload-to-cpu liegen die Modelldateien im Arbeitsspeicher des Rechners, und die Grafikkarte bekommt jeweils nur den Teil, der gerade rechnet: den Text-Encoder, den Bildteil oder den VAE. Das ist ein anderes Auslagern als bei Sprachmodellen, wo der ausgelagerte Teil bremst: Hier rechnet weiterhin die Grafikkarte, das Programm lädt jeden Teil erst dann in den Grafikspeicher, wenn er gebraucht wird. Laut Modellseite braucht 2.1 in der Stufe Q4_K dann rund 5,5 GB Grafikspeicher und 9,9 GB Arbeitsspeicher und passt damit nach unserer Rechnung schon auf Notebooks mit einer 8-GB-Grafikkarte, bei 16 GB Arbeitsspeicher allerdings mit nur 0,1 GB Reserve. 2512 braucht in der Stufe Q4_K_M 14,5 GB Grafikspeicher und 18,2 GB nutzbaren Arbeitsspeicher; bei einem Rechner mit 32 GB Arbeitsspeicher rechnen wir 26,0 GB als nutzbar. Auf unserer Karte kostete die Auslagerung 2 bis 3 Sekunden je Bild; wie viel es auf einem schwächeren Gerät kostet, wissen wir nicht.

Womit Sie es starten

Für Sprachmodelle zeigen unsere Ratgeber meist Ollama. Für Qwen-Image hilft das nicht: In der Bibliothek von Ollama steht es nicht. Die Seite von Unsloth bei Hugging Face, die den Bildteil von 2512 in mehreren Stufen bereitstellt, nennt zwei andere Wege.

stable-diffusion.cpp ist ein freies Programm für die Befehlszeile, das auch einen Server mit Weboberfläche mitbringt. Es liest die Dateiformate GGUF und safetensors, in denen die drei Dateien im Befehl unten vorliegen, und rechnet laut seiner Projektseite unter anderem über die Rechenschnittstellen CUDA für Karten von NVIDIA, Metal für Macs und Vulkan. Über Vulkan lief auch unsere Messung auf einer Karte von AMD. Für 2512 sieht der Befehl so aus:

sd-cli --diffusion-model qwen-image-2512-Q4_K_M.gguf --vae qwen_image_vae.safetensors --llm Qwen2.5-VL-7B-Instruct.Q4_K_M.gguf --diffusion-fa --vae-tiling -W 1024 -H 1024 --cfg-scale 2.5 -p "Ihr Bildwunsch" -o bild.png

sd-cli ist das Programm selbst. Die ersten drei Angaben sind die drei Dateien: Bildteil, VAE und Text-Encoder. --diffusion-fa schaltet im Bildteil eine speichersparende Rechenweise ein, die Flash-Attention, und --vae-tiling lässt den VAE das Bild in Kacheln umsetzen statt in einem Stück. Dateien und Schalter stammen von der Modellseite. Auf der Seite von Unsloth bei Hugging Face liegt nur der Bildteil. Den VAE finden Sie unter diesem Dateinamen im Verzeichnis von Comfy-Org, den Text-Encoder im Verzeichnis von mradermacher; beide nennt auch die Anleitung von stable-diffusion.cpp zu Qwen Image. -W und -H legen die Bildgröße fest; ohne sie rechnet das Programm laut seinem Hilfetext mit 512 × 512 Pixeln, unsere Speicherzahlen gelten aber für 1024 × 1024. --cfg-scale legt fest, wie eng das Bild der Beschreibung folgt; den Wert 2,5 nennt die Anleitung von Unsloth für stable-diffusion.cpp, dort stehen auch die übrigen Einstellungen wie die Zahl der Schritte. Hinter -p steht Ihre Beschreibung, hinter -o die Datei, in die das Bild geschrieben wird. Gemessen haben wir diesen Weg mit 2.1, dort mit --cfg-scale 6 aus der Anleitung von stable-diffusion.cpp zu 2.1; 2512 haben wir nicht selbst gestartet.

ComfyUI ist ein Programm mit Oberfläche, in dem Sie die Arbeitsschritte als Bausteine verbinden, ohne Programmcode zu schreiben. Für 2512 beschreibt Unsloth den Weg in einer eigenen Anleitung für ComfyUI. Für 2.1 stellt Comfy-Org, die Organisation hinter ComfyUI, die Dateien für ComfyUI umgepackt bereit; auch für diese Dateien gilt die Forschungslizenz. Den Weg über ComfyUI haben wir nicht gemessen.

Unsere Messung

Wir haben Qwen-Image-2.1 am 21. September 2026 auf einer AMD Radeon AI PRO R9700 mit 32 GB Grafikspeicher laufen lassen, mit stable-diffusion.cpp über Vulkan. Bildteil und Text-Encoder lagen in der Stufe Q8_0 vor, also größer und genauer als die Q4-Stufen oben. Jedes Bild wurde in 20 Schritten berechnet, in der ersten Tabelle mit 1024 × 1024 Pixeln. Den Grafikspeicher geben wir in MiB an; 1.000 MiB sind rund 1,05 GB.

SchalterDauer je BildGrafikspeicher, Spitze
keine113 s22.139 MiB
--diffusion-fa --vae-tiling91 s18.392 MiB
--offload-to-cpu115 s10.288 MiB
--offload-to-cpu --diffusion-fa --vae-tiling94 s8.596 MiB

Die beiden Schalter --diffusion-fa und --vae-tiling senkten die Spitze um rund 3.700 MiB auf 18.392 MiB, rund 19,3 GB, und machten das Bild auf dieser Karte zugleich schneller, 91 statt 113 Sekunden. Mit ihnen rechnen auch unsere Modellseiten. Die Hinweise von stable-diffusion.cpp zu Tempo und Speicher sagen allerdings, dass Flash-Attention auf den meisten Rechenschnittstellen bremst und mit CUDA in der Regel beschleunigt. Ob Ihre Karte so reagiert wie unsere, zeigt nur ein eigener Versuch. Mit allen drei Schaltern belegte ein Bild gut ein Viertel der 32 GB.

Dass die 18.392 MiB über den 15,6 GB liegen, die die Modellseite für Q8_0 nennt, hat einen Grund: Wir haben auch den Text-Encoder in Q8_0 geladen, die Seite rechnet ihn mit Q4_K_M.

Mit den beiden Schaltern hing die Spitze kaum an der Bildgröße, nur die Dauer wuchs:

BildgrößeDauer je BildGrafikspeicher, Spitze
768 × 76847 s18.379 MiB
1024 × 102491 s18.392 MiB
1328 × 1328179 s18.416 MiB

Die Modellkarte von 2.1 rechnet in ihren Codebeispielen mit 2048 × 2048 Pixeln und 40 Schritten. So groß haben wir nicht gemessen.

Die verlangte Zahl stand im Bild. Bei jedem dieser Läufe verlangte die Beschreibung ein Schild mit einer vierstelligen Zahl, die wir vorher per Zufall gezogen hatten, und in jedem fertigen Bild stand sie exakt so da. Das ist eine kleine Probe, aber eine, die sich nicht raten lässt.

Die Zeiten gelten nur für diese Karte. Ein Bildmodell hängt an der Rechenleistung der Grafikkarte, und für einen Vergleich fehlen uns Messungen auf anderen Karten. Unsere Modellseiten zeigen deshalb, ob Qwen-Image auf ein Gerät passt, rechnen aber keine Zeit je Bild.

Wann Qwen-Image nicht die richtige Wahl ist

Wenn Sie 2.1 im Unternehmen einsetzen wollen. Die Forschungslizenz erlaubt keine geschäftliche Nutzung; eine Lizenz dafür müssten Sie beim Hersteller anfragen. Für diesen Fall ist 2512 da.

Wenn Ihr Gerät zu wenig Speicher hat. 2512 braucht in der Stufe Q4_K_M etwa eine Grafikkarte mit 24 GB oder einen Mac mit 32 GB, mit Auslagerung eine Grafikkarte mit 16 GB und dazu 18,2 GB nutzbaren Arbeitsspeicher. Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Modellseite; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?

Wenn Sie eine Zusage zur Bildqualität brauchen. Wir messen Speicher und Dauer; außer der Zahlprobe oben haben wir die Güte der Bilder nicht geprüft. Bevor Sie sich festlegen, probieren Sie das Modell mit Ihren eigenen Beschreibungen aus.

Beide Fassungen mit ihren Stufen und Beispielen für Geräte, auf die sie passen, finden Sie auf den Modellseiten: Qwen-Image-2512 und Qwen-Image-2.1.

Weitere Ratgeber