Qwen-Image: KI-Bilder lokal erzeugen und die richtige Fassung wählen
Qwen-Image erzeugt Bilder auf dem eigenen Rechner. Die neue Fassung 2.1 ist nur für Forschung und Erprobung freigegeben, für Unternehmen ist 2512 die Fassung. Was beide an Speicher brauchen und wie lange ein Bild auf unserer Karte dauerte.
Stand: 2026-09-22
Qwen-Image ist eine Reihe von Bildmodellen aus dem Hause Alibaba. Sie beschreiben in Worten, was Sie sehen wollen, und das Modell erzeugt daraus ein Bild, auf Ihrem eigenen Rechner. Dieser Text behandelt zwei der Fassungen: Qwen-Image-2512 vom Dezember 2025 und Qwen-Image-2.1 vom September 2026. Die neuere ist deutlich kleiner, darf aber ohne gesonderte Lizenz nicht geschäftlich genutzt werden.
Wir ordnen beide ein: welche Fassung Sie nutzen dürfen, was sie an Speicher braucht, womit Sie sie starten und wie lange ein Bild auf einer Karte dauerte, auf der wir 2.1 selbst gemessen haben. Die Zahlen zu Speicher und Geräten stammen aus unserem Katalog, der beide Fassungen gegen 527 Geräte rechnet.
Welche Fassung Sie nutzen dürfen
| Fassung | erschienen | Parameter des Bildteils | Lizenz | geschäftlich nutzbar |
|---|---|---|---|---|
| Qwen-Image-2512 | Dezember 2025 | 20,4 Mrd. | Apache 2.0 | ja |
| Qwen-Image-2.1 | September 2026 | 7,1 Mrd. | Qwen Research License Agreement | nur mit eigener Lizenz des Herstellers |
Für ein Unternehmen ist Qwen-Image-2512 die Fassung. Sie steht unter Apache 2.0, so nennt es die Modellkarte von Qwen-Image-2512, also die Beschreibung, die der Hersteller bei Hugging Face veröffentlicht, einer Plattform für offene Modelle. Damit darf sie auch geschäftlich eingesetzt, verändert und weitergegeben werden. Was eine offene Lizenz von einer eigenen Lizenz des Herstellers unterscheidet, erklärt der Ratgeber Open Source KI. 2512 erzeugt Bilder aus Text; zum Bearbeiten vorhandener Bilder gibt es ein eigenes Modell unter derselben Lizenz, Qwen-Image-Edit-2511. Unser Katalog führt es nicht, und gemessen haben wir es nicht.
Qwen-Image-2.1 kann laut der Modellkarte von Qwen-Image-2.1 beides in einem Modell, steht aber unter einer Forschungslizenz. Sie erlaubt die Nutzung nur zu nicht-kommerziellen Zwecken und versteht darunter Forschung oder Erprobung. Für geschäftliche Zwecke verlangt sie eine eigene Lizenz des Herstellers:
„You shall not use the Materials for any commercial purpose without obtaining a separate commercial license from us.“
Ob ein Versuch im Unternehmen schon als Erprobung im Sinne der Lizenz gilt, beurteilen wir nicht. Unabhängig davon gilt für den Einsatz im Unternehmen, was der Ratgeber Open Source KI für jedes Modell unter einer Lizenz ohne gewerbliche Nutzung rät: Es gehört nicht auf die Liste der erlaubten Modelle, auch nicht zum Ausprobieren. Wer 2.1 geschäftlich nutzen will, muss beim Hersteller eine Lizenz anfragen; die Adresse steht im Lizenztext. Das ist keine Rechtsberatung, maßgeblich ist der Lizenztext selbst.
Was es an Speicher braucht
Ein Bildmodell kommt nie allein. Für ein Bild aus Text brauchen Sie drei Dateien: den Bildteil, der das eigentliche Bild in mehreren Schritten berechnet, einen Text-Encoder, also ein Sprachmodell, das Ihre Beschreibung für den Bildteil übersetzt, und einen VAE, der das Ergebnis am Ende in Pixel umsetzt. Unsere Modellseiten rechnen alle drei zusammen, Bildteil und Text-Encoder jeweils in einer Quantisierungsstufe, also einer verkleinerten Fassung der Datei:
| laut Modellseite | Qwen-Image-2512 | Qwen-Image-2.1 |
|---|---|---|
| Bildteil | 13,2 GB in der Stufe Q4_K_M | 4,2 GB in der Stufe Q4_K |
| Text-Encoder | Qwen2.5-VL-7B-Instruct, 4,7 GB (Q4_K_M) | Qwen3-VL-8B-Instruct, 5,0 GB (Q4_K_M) |
| VAE | 0,3 GB | 0,7 GB |
| Speicherbedarf mit Rechenpuffer | 20,4 GB | 12,1 GB |
| passt auf | 233 von 527 Geräten | 319 von 527 Geräten |
| passt nur mit Auslagerung auf | 46 weitere Geräte | 145 weitere Geräte |
Die Werte gelten für ein Bild mit 1024 × 1024 Pixeln und für zwei Schalter, die den Rechenpuffer klein halten, also den Platz, den das Programm beim Rechnen zusätzlich belegt; dazu mehr bei unserer Messung, zur Auslagerung weiter unten. Den Rechenpuffer haben wir an 2.1 gemessen und für 2512 übernommen.
Praktisch heißt das: 2.1 passt auf eine Grafikkarte mit 16 GB, von denen wir 15,2 GB als nutzbar rechnen, dort sogar in der genaueren Stufe Q6_K mit 13,9 GB. Wer 2.1 wegen des geringeren Speichers wählt, bleibt an die Forschungslizenz gebunden. 2512 braucht in der Stufe Q4_K_M mehr, etwa eine Grafikkarte mit 24 GB oder einen Mac mit 32 GB gemeinsamem Speicher, von dem wir 21,3 GB rechnen. Was die Stufen hinter dem Modellnamen bedeuten, erklärt der Ratgeber Lokale KI-Modelle.
Die drei Dateien gehören zusammen. Jede Fassung braucht ihren eigenen Text-Encoder aus der Tabelle, und auch die VAE-Datei von 2.1 lässt sich nicht tauschen, weder gegen die ältere VAE-Datei, die auch 2512 nutzt, noch gegen die des Videomodells Wan 2.2:
„The earlier Qwen Image and Wan 2.2 VAE weights are not interchangeable with the Qwen Image 2.1 VAE weights.“
Wenn die Grafikkarte zu klein ist, hilft die Auslagerung. Mit dem Schalter --offload-to-cpu liegen die Modelldateien im Arbeitsspeicher des Rechners, und die Grafikkarte bekommt jeweils nur den Teil, der gerade rechnet: den Text-Encoder, den Bildteil oder den VAE. Das ist ein anderes Auslagern als bei Sprachmodellen, wo der ausgelagerte Teil bremst: Hier rechnet weiterhin die Grafikkarte, das Programm lädt jeden Teil erst dann in den Grafikspeicher, wenn er gebraucht wird. Laut Modellseite braucht 2.1 in der Stufe Q4_K dann rund 5,5 GB Grafikspeicher und 9,9 GB Arbeitsspeicher und passt damit nach unserer Rechnung schon auf Notebooks mit einer 8-GB-Grafikkarte, bei 16 GB Arbeitsspeicher allerdings mit nur 0,1 GB Reserve. 2512 braucht in der Stufe Q4_K_M 14,5 GB Grafikspeicher und 18,2 GB nutzbaren Arbeitsspeicher; bei einem Rechner mit 32 GB Arbeitsspeicher rechnen wir 26,0 GB als nutzbar. Auf unserer Karte kostete die Auslagerung 2 bis 3 Sekunden je Bild; wie viel es auf einem schwächeren Gerät kostet, wissen wir nicht.
Womit Sie es starten
Für Sprachmodelle zeigen unsere Ratgeber meist Ollama. Für Qwen-Image hilft das nicht: In der Bibliothek von Ollama steht es nicht. Die Seite von Unsloth bei Hugging Face, die den Bildteil von 2512 in mehreren Stufen bereitstellt, nennt zwei andere Wege.
stable-diffusion.cpp ist ein freies Programm für die Befehlszeile, das auch einen Server mit Weboberfläche mitbringt. Es liest die Dateiformate GGUF und safetensors, in denen die drei Dateien im Befehl unten vorliegen, und rechnet laut seiner Projektseite unter anderem über die Rechenschnittstellen CUDA für Karten von NVIDIA, Metal für Macs und Vulkan. Über Vulkan lief auch unsere Messung auf einer Karte von AMD. Für 2512 sieht der Befehl so aus:
sd-cli --diffusion-model qwen-image-2512-Q4_K_M.gguf --vae qwen_image_vae.safetensors --llm Qwen2.5-VL-7B-Instruct.Q4_K_M.gguf --diffusion-fa --vae-tiling -W 1024 -H 1024 --cfg-scale 2.5 -p "Ihr Bildwunsch" -o bild.png
sd-cli ist das Programm selbst. Die ersten drei Angaben sind die drei Dateien: Bildteil, VAE und Text-Encoder. --diffusion-fa schaltet im Bildteil eine speichersparende Rechenweise ein, die Flash-Attention, und --vae-tiling lässt den VAE das Bild in Kacheln umsetzen statt in einem Stück. Dateien und Schalter stammen von der Modellseite. Auf der Seite von Unsloth bei Hugging Face liegt nur der Bildteil. Den VAE finden Sie unter diesem Dateinamen im Verzeichnis von Comfy-Org, den Text-Encoder im Verzeichnis von mradermacher; beide nennt auch die Anleitung von stable-diffusion.cpp zu Qwen Image. -W und -H legen die Bildgröße fest; ohne sie rechnet das Programm laut seinem Hilfetext mit 512 × 512 Pixeln, unsere Speicherzahlen gelten aber für 1024 × 1024. --cfg-scale legt fest, wie eng das Bild der Beschreibung folgt; den Wert 2,5 nennt die Anleitung von Unsloth für stable-diffusion.cpp, dort stehen auch die übrigen Einstellungen wie die Zahl der Schritte. Hinter -p steht Ihre Beschreibung, hinter -o die Datei, in die das Bild geschrieben wird. Gemessen haben wir diesen Weg mit 2.1, dort mit --cfg-scale 6 aus der Anleitung von stable-diffusion.cpp zu 2.1; 2512 haben wir nicht selbst gestartet.
ComfyUI ist ein Programm mit Oberfläche, in dem Sie die Arbeitsschritte als Bausteine verbinden, ohne Programmcode zu schreiben. Für 2512 beschreibt Unsloth den Weg in einer eigenen Anleitung für ComfyUI. Für 2.1 stellt Comfy-Org, die Organisation hinter ComfyUI, die Dateien für ComfyUI umgepackt bereit; auch für diese Dateien gilt die Forschungslizenz. Den Weg über ComfyUI haben wir nicht gemessen.
Unsere Messung
Wir haben Qwen-Image-2.1 am 21. September 2026 auf einer AMD Radeon AI PRO R9700 mit 32 GB Grafikspeicher laufen lassen, mit stable-diffusion.cpp über Vulkan. Bildteil und Text-Encoder lagen in der Stufe Q8_0 vor, also größer und genauer als die Q4-Stufen oben. Jedes Bild wurde in 20 Schritten berechnet, in der ersten Tabelle mit 1024 × 1024 Pixeln. Den Grafikspeicher geben wir in MiB an; 1.000 MiB sind rund 1,05 GB.
| Schalter | Dauer je Bild | Grafikspeicher, Spitze |
|---|---|---|
| keine | 113 s | 22.139 MiB |
--diffusion-fa --vae-tiling | 91 s | 18.392 MiB |
--offload-to-cpu | 115 s | 10.288 MiB |
--offload-to-cpu --diffusion-fa --vae-tiling | 94 s | 8.596 MiB |
Die beiden Schalter --diffusion-fa und --vae-tiling senkten die Spitze um rund 3.700 MiB auf 18.392 MiB, rund 19,3 GB, und machten das Bild auf dieser Karte zugleich schneller, 91 statt 113 Sekunden. Mit ihnen rechnen auch unsere Modellseiten. Die Hinweise von stable-diffusion.cpp zu Tempo und Speicher sagen allerdings, dass Flash-Attention auf den meisten Rechenschnittstellen bremst und mit CUDA in der Regel beschleunigt. Ob Ihre Karte so reagiert wie unsere, zeigt nur ein eigener Versuch. Mit allen drei Schaltern belegte ein Bild gut ein Viertel der 32 GB.
Dass die 18.392 MiB über den 15,6 GB liegen, die die Modellseite für Q8_0 nennt, hat einen Grund: Wir haben auch den Text-Encoder in Q8_0 geladen, die Seite rechnet ihn mit Q4_K_M.
Mit den beiden Schaltern hing die Spitze kaum an der Bildgröße, nur die Dauer wuchs:
| Bildgröße | Dauer je Bild | Grafikspeicher, Spitze |
|---|---|---|
| 768 × 768 | 47 s | 18.379 MiB |
| 1024 × 1024 | 91 s | 18.392 MiB |
| 1328 × 1328 | 179 s | 18.416 MiB |
Die Modellkarte von 2.1 rechnet in ihren Codebeispielen mit 2048 × 2048 Pixeln und 40 Schritten. So groß haben wir nicht gemessen.
Die verlangte Zahl stand im Bild. Bei jedem dieser Läufe verlangte die Beschreibung ein Schild mit einer vierstelligen Zahl, die wir vorher per Zufall gezogen hatten, und in jedem fertigen Bild stand sie exakt so da. Das ist eine kleine Probe, aber eine, die sich nicht raten lässt.
Die Zeiten gelten nur für diese Karte. Ein Bildmodell hängt an der Rechenleistung der Grafikkarte, und für einen Vergleich fehlen uns Messungen auf anderen Karten. Unsere Modellseiten zeigen deshalb, ob Qwen-Image auf ein Gerät passt, rechnen aber keine Zeit je Bild.
Wann Qwen-Image nicht die richtige Wahl ist
Wenn Sie 2.1 im Unternehmen einsetzen wollen. Die Forschungslizenz erlaubt keine geschäftliche Nutzung; eine Lizenz dafür müssten Sie beim Hersteller anfragen. Für diesen Fall ist 2512 da.
Wenn Ihr Gerät zu wenig Speicher hat. 2512 braucht in der Stufe Q4_K_M etwa eine Grafikkarte mit 24 GB oder einen Mac mit 32 GB, mit Auslagerung eine Grafikkarte mit 16 GB und dazu 18,2 GB nutzbaren Arbeitsspeicher. Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Modellseite; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?
Wenn Sie eine Zusage zur Bildqualität brauchen. Wir messen Speicher und Dauer; außer der Zahlprobe oben haben wir die Güte der Bilder nicht geprüft. Bevor Sie sich festlegen, probieren Sie das Modell mit Ihren eigenen Beschreibungen aus.
Beide Fassungen mit ihren Stufen und Beispielen für Geräte, auf die sie passen, finden Sie auf den Modellseiten: Qwen-Image-2512 und Qwen-Image-2.1.
Weitere Ratgeber
- Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuftTeuken aus Deutschland, EuroLLM aus einem EU-Projekt, Mistral aus Paris, Apertus aus der Schweiz. Lizenz, Größe und auf wie vielen der 527 Geräte sie flüssig laufen.
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuftOrnith 1.5 gibt es in drei Größen. Die kleine läuft nach unserer Rechnung beim Ausprobieren auf 406 von 527 geführten Geräten, die größte auf 9. Was jede Größe braucht und wann ein Verbund aus mehreren Geräten hilft.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.