Grafikkarte für KI: Worauf es bei lokalen Modellen ankommt
Für KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
Stand: 2026-09-21
Wer eine Grafikkarte für KI sucht, sollte anders auswählen als für Spiele. Bei Spielen entscheidet die Rechenleistung, wie flüssig das Bild läuft. Bei einem lokalen Sprachmodell entscheidet zuerst der Grafikspeicher, welche Modelle überhaupt laufen, und erst danach die Rechenleistung, wie schnell.
Dieser Text ordnet die Grafikkarten nach dem ein, was für KI zählt. Er nennt keine Preise und empfiehlt keinen Händler; er zeigt, welche Speicherklasse wie viele Modelle trägt, und wo sich ein Schritt nach oben lohnt. Die Zahlen stammen aus unserem Katalog mit 36 Modellen und den Grafikkarten, gegen die wir sie rechnen.
Zuerst zählt der Grafikspeicher
Damit ein Sprachmodell schnell rechnet, muss es vollständig in den Grafikspeicher passen. Passt es nicht, weicht das Programm auf den gewöhnlichen Arbeitsspeicher aus, und das Modell wird langsam. Warum das so ist und wie Sie es erkennen, erklärt der Ratgeber Lokale KI-Modelle.
Nutzbar ist dabei etwas weniger als die Angabe auf der Karte. In unserer Rechnung bleiben bei jeder Grafikkarte 0,8 GB für das System reserviert: eine Karte mit 16 GB stellt 15,2 GB für ein Modell bereit, eine mit 24 GB 23,2 GB.
Was die gängigen Speicherklassen tragen
Wir haben für die gängigen Speicherklassen gezählt, wie viele der 36 Modelle unseres Katalogs in der jeweils verbreiteten Variante und bei 4.096 Token Kontext in den nutzbaren Speicher passen:
| Speicher | davon nutzbar | passende Modelle | Beispiel | Karten dieser Klasse, zum Beispiel |
|---|---|---|---|---|
| 8 GB | 7,2 GB | 11 von 36 | Qwen3 8B | GeForce RTX 4060, RTX 5060, Radeon RX 9060 XT (8 GB) |
| 12 GB | 11,2 GB | 14 von 36 | Qwen3 14B | GeForce RTX 3060, RTX 4070, RTX 5070, Radeon RX 7700 XT |
| 16 GB | 15,2 GB | 15 von 36 | gpt-oss 20B | GeForce RTX 4080, RTX 5070 Ti, RTX 5080, Radeon RX 9070 XT |
| 20 GB | 19,2 GB | 19 von 36 | Gemma 4 26B A4B | Radeon RX 7900 XT, RTX 4000 Ada Generation |
| 24 GB | 23,2 GB | 24 von 36 | Gemma 4 31B | GeForce RTX 3090, RTX 4090, Radeon RX 7900 XTX |
| 32 GB | 31,2 GB | 26 von 36 | Laguna XS 2.1 | GeForce RTX 5090, Radeon AI PRO R9700 |
| 48 GB | 47,2 GB | 27 von 36 | Llama 3.3 70B | RTX 6000 Ada Generation, Radeon PRO W7900 |
Die übrigen Modelle des Katalogs sind so groß, dass sie auf keine einzelne Karte dieser Klassen passen.
Der Sprung, der zählt: von 16 auf 24 GB
Die Stufen sind ungleich. Von 12 auf 16 GB kommt genau ein Modell dazu. Von 24 auf 32 GB kommen zwei dazu. Von 16 auf 24 GB kommen neun dazu.
Der Grund sind neun Modelle mit 24 bis 35 Milliarden Parametern, die in der verbreiteten Variante zwischen 16 und 23 GB brauchen. Mistral Small 3.2 24B etwa braucht 16,1 GB und verfehlt eine 16-GB-Karte damit um 0,9 GB. Gemma 4 31B braucht 20,7 GB, die Qwen-Modelle mit 27 und 30 Milliarden Parametern liegen dazwischen. In dieser Variante läuft auf einer 16-GB-Karte keines davon ganz im Grafikspeicher, auf einer 24-GB-Karte jedes. Einzelne passen in einer niedrigeren Stufe auch auf 16 GB, etwa Mistral Small 3.2 24B in der Variante Q3_K_M mit 13,2 GB.
Daraus folgt ein Vergleich, der bei Spielen andersherum ausgeht: eine ältere GeForce RTX 3090 mit 24 GB trägt in unserem Katalog 24 der 36 Modelle, eine neue RTX 5080 mit 16 GB trägt 15. Für KI ist hier die ältere Karte die größere.
Das Tempo ist die zweite Frage
Innerhalb einer Speicherklasse unterscheiden sich die Karten im Tempo deutlich. Für gpt-oss 20B rechnen wir auf einer GeForce RTX 5080 mit 159 bis 238 Token je Sekunde, auf der 16-GB-Fassung der GeForce RTX 4060 Ti mit 68 bis 102. Diese Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen. Für die Karten von AMD und Intel sind die Werte bei gpt-oss 20B nicht abgeglichen.
Umgekehrt kann eine Karte aus einer höheren Klasse genauso schnell sein: die RTX 3090 mit 24 GB liegt bei gpt-oss 20B mit 157 bis 235 Token je Sekunde fast gleichauf mit der RTX 5080. Für den Alltag heißt das: die Speicherklasse entscheidet, welche Modelle laufen, die Karte innerhalb der Klasse, wie schnell, und zwischen zwei Karten derselben Klasse kann mehr als das Doppelte liegen. Die Werte für jede Karte stehen auf den Modellseiten unseres Katalogs.
NVIDIA, AMD und die Software
Eine Grafikkarte rechnet nur dann für ein Sprachmodell, wenn das Programm sie unterstützt. Für Ollama, eines der verbreiteten Programme, steht die Grenze bei NVIDIA in der Dokumentation:
„Ollama supports Nvidia GPUs with compute capability 5.0+ and driver version 550 and newer.“
Damit sind die NVIDIA-Karten der vergangenen Jahre abgedeckt. Bei AMD ist die Lage uneinheitlicher. Der Hauptweg führt über eine Bibliothek, die nicht jede Karte kennt:
„Ollama leverages the AMD ROCm library, which does not support all AMD GPUs.“
Welche AMD-Karten über diese Bibliothek laufen, führt dieselbe Seite in zwei Listen, für Linux und für Windows. Die Windows-Liste ist deutlich kürzer und nennt etwa die Radeon RX 9070 XT nicht. Für Karten außerhalb der Listen gibt es unter Windows und Linux einen zweiten Weg über die Schnittstelle Vulkan. Wenn Sie eine AMD-Karte kaufen wollen, prüfen Sie deshalb vorher, ob sie in der Liste für Ihr Betriebssystem steht.
Wann eine Grafikkarte nicht die Antwort ist
Wenn Sie Modelle mit 70 Milliarden Parametern oder mehr nutzen wollen. Die größte Spielekarte in unserem Katalog, die GeForce RTX 5090, hat 32 GB. Llama 3.3 70B braucht 45,5 GB, gpt-oss 120B rund 65 GB. Dafür braucht es eine Profikarte mit 48 oder 96 GB, oder ein System, in dem Prozessor und Grafik sich einen großen Speicher teilen. Ein Mac Studio mit 96 GB stellt in unserer Rechnung 72 GB für ein Modell bereit. Selbst eine Karte mit 96 GB trägt nur 29 der 36 Modelle; für die sieben größten reicht keine Karte, die unser Katalog führt.
Wenn Sie ein Notebook nutzen. Dort ist die Grafikkarte fest verbaut, und es zählt, was im Gerät steckt. Welche Modelle auf Ihrem Notebook laufen, zeigt dessen Seite in unserem Katalog; wie Sie es finden, beschreibt die Anleitung Welches Gerät habe ich?
Wenn Sie nur kleine Modelle brauchen. Für Zusammenfassungen, Umformulierungen und Fragen zu Texten, die Sie mitliefern, reicht oft ein Modell mit 4 bis 8 Milliarden Parametern, und das läuft auf einer 8-GB-Karte. Dann ist eine größere Karte Geld für Speicher, den Sie nicht nutzen.
Welche Modelle es gibt und wie viel Speicher jedes braucht, finden Sie unter Modelle.
Weitere Ratgeber
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.