Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?
Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
Stand: 2026-09-21
Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet fast immer eine einzige Zahl: der Speicher. Nicht der Prozessor, nicht das Baujahr, nicht der Preis des Geräts. Passt das Modell hinein und unterstützt das Programm Ihre Grafik, läuft es; wie schnell, entscheidet dann die Rechenleistung. Passt es nicht, hilft auch die schnellste Hardware wenig.
Dieser Text zeigt, wie Sie diese Zahl richtig lesen, warum sie oft kleiner ist als die auf dem Karton, und was die Buchstaben und Ziffern hinter einem Modellnamen damit zu tun haben. Welche Programme Sie für den Betrieb brauchen, erklärt der Ratgeber Lokale KI.
Der Speicher entscheidet, ob es läuft
Ein Sprachmodell ist eine große Datei, und damit das Modell zügig rechnet, muss die Datei vollständig in einem schnellen Speicher liegen. Bei einem Rechner mit eigener Grafikkarte ist das deren Grafikspeicher, bei einem Mac der gemeinsame Arbeitsspeicher.
Passt das Modell nicht ganz hinein, verteilt das Programm es auf zwei Speicher. Ollama zeigt das mit dem Befehl ollama ps an, und die Ollama-Dokumentation erklärt die Anzeige: 100% GPU heißt, das Modell liegt vollständig im Grafikspeicher; eine Angabe wie 48%/52% CPU/GPU heißt, es liegt teils dort und teils im gewöhnlichen Arbeitsspeicher.
Das Modell läuft dann zwar, aber der Teil im gewöhnlichen Arbeitsspeicher bremst das Ganze. Die Rechenleistung entscheidet danach, wie schnell die Antworten kommen.
Die Zahl auf dem Karton ist nicht die Zahl, die zählt
Ein Gerät mit 16 GB hat keine 16 GB für ein Modell frei. Wie viel wirklich nutzbar ist, hängt davon ab, wie das Gerät gebaut ist, und der Unterschied ist groß. Die folgenden Zahlen stammen aus unserem Katalog:
| Gerät | Speicher laut Datenblatt | davon für Modelle nutzbar |
|---|---|---|
| Grafikkarte mit 16 GB | 16 GB | 15,2 GB |
| Mac mini (2023), M2 Pro | 16 GB | 10,7 GB |
| Mac mini (2023), M2 Pro | 32 GB | 21,3 GB |
| Mac Studio | 96 GB | 72,0 GB |
Eine Grafikkarte stellt ihren Speicher fast vollständig zur Verfügung. Ein Mac teilt einen Arbeitsspeicher zwischen Prozessor und Grafik, und macOS gibt der Grafik davon nur einen Teil frei; wir rechnen bis 36 GB mit zwei Dritteln, darüber mit drei Vierteln.
Was das praktisch heißt, zeigt ein Modell mittlerer Größe. Qwen3 14B braucht in der verbreiteten Variante rund 10,7 GB. Auf einer Grafikkarte mit 16 GB bleibt damit reichlich Platz. Auf dem Mac mini mit 16 GB passt es genau, ohne Reserve.
Auf unseren Geräteseiten steht diese Grenze als Satz, einer je Anwendungsfall. Für den Mac mini mit 16 GB lautet er beim Ausprobieren, also mit 4.096 Token Kontext: Qwen3 14B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlen 5,4 GB nutzbarer Speicher. Mit 32 GB läuft Mistral Small 3.2 24B noch flüssig, und für Llama 3.3 70B fehlen 24,2 GB.
Dazwischen setzt auf diesem Gerät schon das Tempo die Grenze, bevor es der Speicher tut: Gemma 4 31B passt mit 20,7 von 21,3 GB noch hinein, rechnet aber nur rund 7,8 Token je Sekunde. Der Speicher entscheidet also, ob ein Modell läuft; ob es sich flüssig nutzen lässt, entscheidet auf einem Mac und anderen Geräten mit gemeinsamem Speicher auch das Tempo.
So finden Sie Ihre Zahl
Beim Mac steht der Arbeitsspeicher unter „Über diesen Mac“ im Apple-Menü. Bei einem Windows-Rechner kommt es darauf an, ob er eine eigene Grafikkarte hat: dann zählt deren Grafikspeicher, nicht der Arbeitsspeicher des Rechners.
Wie Sie Chip, Arbeitsspeicher und Grafikkarte herausfinden, beschreibt unsere Anleitung Welches Gerät habe ich? Mit Modellname, Chip und Speicher finden Sie ein Notebook, einen Mac oder einen Mini-PC dann in unserem Katalog, samt der Modelle, die darauf laufen. Eine einzeln gekaufte Grafikkarte hat keine eigene Seite; ob sie ein bestimmtes Modell trägt, steht auf dessen Seite im Abschnitt Grafikkarten, in die es ganz passt, die vollständige Liste hinter dem Verweis darunter.
Was die Stufen hinter dem Modellnamen bedeuten
Ein Modell gibt es fast immer in mehreren Varianten, und die Kürzel dahinter sagen, wie stark es verdichtet wurde. Die Ziffer nach dem Q steht für die Stufe: je höher, desto größer die Datei und desto näher am Original. Für Qwen3 14B sehen die Varianten so aus:
| Variante | Datei | Speicherbedarf |
|---|---|---|
| Q4_K_M | 9,0 GB | 10,7 GB |
| Q5_K_M | 10,5 GB | 12,2 GB |
| Q6_K | 12,1 GB | 13,8 GB |
| Q8_0 | 15,7 GB | 17,5 GB |
Von der niedrigsten zur höchsten Stufe wächst der Bedarf um 6,8 GB. Auf dem Mac mini mit 16 GB passt deshalb nur die Variante Q4_K_M, auf einer Grafikkarte mit 16 GB passen drei der vier.
Unser Katalog rechnet, wenn nicht anders angegeben, mit Q4_K_M. Haben Sie Speicher übrig, können Sie eine höhere Stufe wählen.
Wann es nicht reicht
Wenn die Lücke größer ist als eine Stufe. Eine niedrigere Stufe spart einige Gigabyte. An einer knappen Grenze reicht das: Mistral Small 3.2 24B braucht in der Variante Q3_K_M 13,2 GB und passt damit auf eine Grafikkarte mit 16 GB. Über eine große Lücke hilft es nicht. Dem Mac mini mit 32 GB fehlen für Llama 3.3 70B rund 24 GB, und selbst die kleinste geführte Variante braucht noch 37,1 GB. Dann ist ein kleineres Modell die Antwort, nicht eine stärkere Verdichtung.
Wenn Sie sehr lange Texte auf einmal verarbeiten lassen. Die Zahlen oben gelten für 4.096 Token Kontext, die Voreinstellung von Ollama. Je mehr Text das Modell gleichzeitig im Blick behalten soll, desto mehr Speicher braucht es zusätzlich; die Ollama-Dokumentation beschreibt, wie der Bedarf mit der Kontextlänge wächst. Auf dem Mac mini mit 32 GB passt Gemma 4 31B bei 4.096 Token gerade hinein; bei 16.384 Token, mit denen wir fürs Programmieren rechnen, fehlen schon rund 0,3 GB.
Wenn Sie einen Rechner mit eigener Grafikkarte haben und mehr wollen. Dort ist die Karte die Stellschraube. Worauf es beim Kauf ankommt, erklärt der Ratgeber Grafikkarte für KI.
Welche Modelle auf Ihrem Gerät laufen, sehen Sie auf seiner Seite im Katalog, für eine einzeln gekaufte Grafikkarte auf den Modellseiten; alle geführten Modelle mit ihren Varianten finden Sie unter Modelle.
Weitere Ratgeber
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.