Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?

Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.

Stand: 2026-09-21

Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet fast immer eine einzige Zahl: der Speicher. Nicht der Prozessor, nicht das Baujahr, nicht der Preis des Geräts. Passt das Modell hinein und unterstützt das Programm Ihre Grafik, läuft es; wie schnell, entscheidet dann die Rechenleistung. Passt es nicht, hilft auch die schnellste Hardware wenig.

Dieser Text zeigt, wie Sie diese Zahl richtig lesen, warum sie oft kleiner ist als die auf dem Karton, und was die Buchstaben und Ziffern hinter einem Modellnamen damit zu tun haben. Welche Programme Sie für den Betrieb brauchen, erklärt der Ratgeber Lokale KI.

Der Speicher entscheidet, ob es läuft

Ein Sprachmodell ist eine große Datei, und damit das Modell zügig rechnet, muss die Datei vollständig in einem schnellen Speicher liegen. Bei einem Rechner mit eigener Grafikkarte ist das deren Grafikspeicher, bei einem Mac der gemeinsame Arbeitsspeicher.

Passt das Modell nicht ganz hinein, verteilt das Programm es auf zwei Speicher. Ollama zeigt das mit dem Befehl ollama ps an, und die Ollama-Dokumentation erklärt die Anzeige: 100% GPU heißt, das Modell liegt vollständig im Grafikspeicher; eine Angabe wie 48%/52% CPU/GPU heißt, es liegt teils dort und teils im gewöhnlichen Arbeitsspeicher.

Das Modell läuft dann zwar, aber der Teil im gewöhnlichen Arbeitsspeicher bremst das Ganze. Die Rechenleistung entscheidet danach, wie schnell die Antworten kommen.

Die Zahl auf dem Karton ist nicht die Zahl, die zählt

Ein Gerät mit 16 GB hat keine 16 GB für ein Modell frei. Wie viel wirklich nutzbar ist, hängt davon ab, wie das Gerät gebaut ist, und der Unterschied ist groß. Die folgenden Zahlen stammen aus unserem Katalog:

GerätSpeicher laut Datenblattdavon für Modelle nutzbar
Grafikkarte mit 16 GB16 GB15,2 GB
Mac mini (2023), M2 Pro16 GB10,7 GB
Mac mini (2023), M2 Pro32 GB21,3 GB
Mac Studio96 GB72,0 GB

Eine Grafikkarte stellt ihren Speicher fast vollständig zur Verfügung. Ein Mac teilt einen Arbeitsspeicher zwischen Prozessor und Grafik, und macOS gibt der Grafik davon nur einen Teil frei; wir rechnen bis 36 GB mit zwei Dritteln, darüber mit drei Vierteln.

Was das praktisch heißt, zeigt ein Modell mittlerer Größe. Qwen3 14B braucht in der verbreiteten Variante rund 10,7 GB. Auf einer Grafikkarte mit 16 GB bleibt damit reichlich Platz. Auf dem Mac mini mit 16 GB passt es genau, ohne Reserve.

Auf unseren Geräteseiten steht diese Grenze als Satz, einer je Anwendungsfall. Für den Mac mini mit 16 GB lautet er beim Ausprobieren, also mit 4.096 Token Kontext: Qwen3 14B läuft noch, Mistral Small 3.2 24B nicht mehr, dafür fehlen 5,4 GB nutzbarer Speicher. Mit 32 GB läuft Mistral Small 3.2 24B noch flüssig, und für Llama 3.3 70B fehlen 24,2 GB.

Dazwischen setzt auf diesem Gerät schon das Tempo die Grenze, bevor es der Speicher tut: Gemma 4 31B passt mit 20,7 von 21,3 GB noch hinein, rechnet aber nur rund 7,8 Token je Sekunde. Der Speicher entscheidet also, ob ein Modell läuft; ob es sich flüssig nutzen lässt, entscheidet auf einem Mac und anderen Geräten mit gemeinsamem Speicher auch das Tempo.

So finden Sie Ihre Zahl

Beim Mac steht der Arbeitsspeicher unter „Über diesen Mac“ im Apple-Menü. Bei einem Windows-Rechner kommt es darauf an, ob er eine eigene Grafikkarte hat: dann zählt deren Grafikspeicher, nicht der Arbeitsspeicher des Rechners.

Wie Sie Chip, Arbeitsspeicher und Grafikkarte herausfinden, beschreibt unsere Anleitung Welches Gerät habe ich? Mit Modellname, Chip und Speicher finden Sie ein Notebook, einen Mac oder einen Mini-PC dann in unserem Katalog, samt der Modelle, die darauf laufen. Eine einzeln gekaufte Grafikkarte hat keine eigene Seite; ob sie ein bestimmtes Modell trägt, steht auf dessen Seite im Abschnitt Grafikkarten, in die es ganz passt, die vollständige Liste hinter dem Verweis darunter.

Was die Stufen hinter dem Modellnamen bedeuten

Ein Modell gibt es fast immer in mehreren Varianten, und die Kürzel dahinter sagen, wie stark es verdichtet wurde. Die Ziffer nach dem Q steht für die Stufe: je höher, desto größer die Datei und desto näher am Original. Für Qwen3 14B sehen die Varianten so aus:

VarianteDateiSpeicherbedarf
Q4_K_M9,0 GB10,7 GB
Q5_K_M10,5 GB12,2 GB
Q6_K12,1 GB13,8 GB
Q8_015,7 GB17,5 GB

Von der niedrigsten zur höchsten Stufe wächst der Bedarf um 6,8 GB. Auf dem Mac mini mit 16 GB passt deshalb nur die Variante Q4_K_M, auf einer Grafikkarte mit 16 GB passen drei der vier.

Unser Katalog rechnet, wenn nicht anders angegeben, mit Q4_K_M. Haben Sie Speicher übrig, können Sie eine höhere Stufe wählen.

Wann es nicht reicht

Wenn die Lücke größer ist als eine Stufe. Eine niedrigere Stufe spart einige Gigabyte. An einer knappen Grenze reicht das: Mistral Small 3.2 24B braucht in der Variante Q3_K_M 13,2 GB und passt damit auf eine Grafikkarte mit 16 GB. Über eine große Lücke hilft es nicht. Dem Mac mini mit 32 GB fehlen für Llama 3.3 70B rund 24 GB, und selbst die kleinste geführte Variante braucht noch 37,1 GB. Dann ist ein kleineres Modell die Antwort, nicht eine stärkere Verdichtung.

Wenn Sie sehr lange Texte auf einmal verarbeiten lassen. Die Zahlen oben gelten für 4.096 Token Kontext, die Voreinstellung von Ollama. Je mehr Text das Modell gleichzeitig im Blick behalten soll, desto mehr Speicher braucht es zusätzlich; die Ollama-Dokumentation beschreibt, wie der Bedarf mit der Kontextlänge wächst. Auf dem Mac mini mit 32 GB passt Gemma 4 31B bei 4.096 Token gerade hinein; bei 16.384 Token, mit denen wir fürs Programmieren rechnen, fehlen schon rund 0,3 GB.

Wenn Sie einen Rechner mit eigener Grafikkarte haben und mehr wollen. Dort ist die Karte die Stellschraube. Worauf es beim Kauf ankommt, erklärt der Ratgeber Grafikkarte für KI.

Welche Modelle auf Ihrem Gerät laufen, sehen Sie auf seiner Seite im Katalog, für eine einzeln gekaufte Grafikkarte auf den Modellseiten; alle geführten Modelle mit ihren Varianten finden Sie unter Modelle.

Weitere Ratgeber