Grafikkarte für KI: Worauf es bei lokalen Modellen ankommt

Für KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.

Stand: 2026-09-21

Wer eine Grafikkarte für KI sucht, sollte anders auswählen als für Spiele. Bei Spielen entscheidet die Rechenleistung, wie flüssig das Bild läuft. Bei einem lokalen Sprachmodell entscheidet zuerst der Grafikspeicher, welche Modelle überhaupt laufen, und erst danach die Rechenleistung, wie schnell.

Dieser Text ordnet die Grafikkarten nach dem ein, was für KI zählt. Er nennt keine Preise und empfiehlt keinen Händler; er zeigt, welche Speicherklasse wie viele Modelle trägt, und wo sich ein Schritt nach oben lohnt. Die Zahlen stammen aus unserem Katalog mit 36 Modellen und den Grafikkarten, gegen die wir sie rechnen.

Zuerst zählt der Grafikspeicher

Damit ein Sprachmodell schnell rechnet, muss es vollständig in den Grafikspeicher passen. Passt es nicht, weicht das Programm auf den gewöhnlichen Arbeitsspeicher aus, und das Modell wird langsam. Warum das so ist und wie Sie es erkennen, erklärt der Ratgeber Lokale KI-Modelle.

Nutzbar ist dabei etwas weniger als die Angabe auf der Karte. In unserer Rechnung bleiben bei jeder Grafikkarte 0,8 GB für das System reserviert: eine Karte mit 16 GB stellt 15,2 GB für ein Modell bereit, eine mit 24 GB 23,2 GB.

Was die gängigen Speicherklassen tragen

Wir haben für die gängigen Speicherklassen gezählt, wie viele der 36 Modelle unseres Katalogs in der jeweils verbreiteten Variante und bei 4.096 Token Kontext in den nutzbaren Speicher passen:

Speicherdavon nutzbarpassende ModelleBeispielKarten dieser Klasse, zum Beispiel
8 GB7,2 GB11 von 36Qwen3 8BGeForce RTX 4060, RTX 5060, Radeon RX 9060 XT (8 GB)
12 GB11,2 GB14 von 36Qwen3 14BGeForce RTX 3060, RTX 4070, RTX 5070, Radeon RX 7700 XT
16 GB15,2 GB15 von 36gpt-oss 20BGeForce RTX 4080, RTX 5070 Ti, RTX 5080, Radeon RX 9070 XT
20 GB19,2 GB19 von 36Gemma 4 26B A4BRadeon RX 7900 XT, RTX 4000 Ada Generation
24 GB23,2 GB24 von 36Gemma 4 31BGeForce RTX 3090, RTX 4090, Radeon RX 7900 XTX
32 GB31,2 GB26 von 36Laguna XS 2.1GeForce RTX 5090, Radeon AI PRO R9700
48 GB47,2 GB27 von 36Llama 3.3 70BRTX 6000 Ada Generation, Radeon PRO W7900

Die übrigen Modelle des Katalogs sind so groß, dass sie auf keine einzelne Karte dieser Klassen passen.

Der Sprung, der zählt: von 16 auf 24 GB

Die Stufen sind ungleich. Von 12 auf 16 GB kommt genau ein Modell dazu. Von 24 auf 32 GB kommen zwei dazu. Von 16 auf 24 GB kommen neun dazu.

Der Grund sind neun Modelle mit 24 bis 35 Milliarden Parametern, die in der verbreiteten Variante zwischen 16 und 23 GB brauchen. Mistral Small 3.2 24B etwa braucht 16,1 GB und verfehlt eine 16-GB-Karte damit um 0,9 GB. Gemma 4 31B braucht 20,7 GB, die Qwen-Modelle mit 27 und 30 Milliarden Parametern liegen dazwischen. In dieser Variante läuft auf einer 16-GB-Karte keines davon ganz im Grafikspeicher, auf einer 24-GB-Karte jedes. Einzelne passen in einer niedrigeren Stufe auch auf 16 GB, etwa Mistral Small 3.2 24B in der Variante Q3_K_M mit 13,2 GB.

Daraus folgt ein Vergleich, der bei Spielen andersherum ausgeht: eine ältere GeForce RTX 3090 mit 24 GB trägt in unserem Katalog 24 der 36 Modelle, eine neue RTX 5080 mit 16 GB trägt 15. Für KI ist hier die ältere Karte die größere.

Das Tempo ist die zweite Frage

Innerhalb einer Speicherklasse unterscheiden sich die Karten im Tempo deutlich. Für gpt-oss 20B rechnen wir auf einer GeForce RTX 5080 mit 159 bis 238 Token je Sekunde, auf der 16-GB-Fassung der GeForce RTX 4060 Ti mit 68 bis 102. Diese Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen. Für die Karten von AMD und Intel sind die Werte bei gpt-oss 20B nicht abgeglichen.

Umgekehrt kann eine Karte aus einer höheren Klasse genauso schnell sein: die RTX 3090 mit 24 GB liegt bei gpt-oss 20B mit 157 bis 235 Token je Sekunde fast gleichauf mit der RTX 5080. Für den Alltag heißt das: die Speicherklasse entscheidet, welche Modelle laufen, die Karte innerhalb der Klasse, wie schnell, und zwischen zwei Karten derselben Klasse kann mehr als das Doppelte liegen. Die Werte für jede Karte stehen auf den Modellseiten unseres Katalogs.

NVIDIA, AMD und die Software

Eine Grafikkarte rechnet nur dann für ein Sprachmodell, wenn das Programm sie unterstützt. Für Ollama, eines der verbreiteten Programme, steht die Grenze bei NVIDIA in der Dokumentation:

„Ollama supports Nvidia GPUs with compute capability 5.0+ and driver version 550 and newer.“

Quelle: Ollama, Hardware support, gelesen am

Damit sind die NVIDIA-Karten der vergangenen Jahre abgedeckt. Bei AMD ist die Lage uneinheitlicher. Der Hauptweg führt über eine Bibliothek, die nicht jede Karte kennt:

„Ollama leverages the AMD ROCm library, which does not support all AMD GPUs.“

Quelle: Ollama, Hardware support, gelesen am

Welche AMD-Karten über diese Bibliothek laufen, führt dieselbe Seite in zwei Listen, für Linux und für Windows. Die Windows-Liste ist deutlich kürzer und nennt etwa die Radeon RX 9070 XT nicht. Für Karten außerhalb der Listen gibt es unter Windows und Linux einen zweiten Weg über die Schnittstelle Vulkan. Wenn Sie eine AMD-Karte kaufen wollen, prüfen Sie deshalb vorher, ob sie in der Liste für Ihr Betriebssystem steht.

Wann eine Grafikkarte nicht die Antwort ist

Wenn Sie Modelle mit 70 Milliarden Parametern oder mehr nutzen wollen. Die größte Spielekarte in unserem Katalog, die GeForce RTX 5090, hat 32 GB. Llama 3.3 70B braucht 45,5 GB, gpt-oss 120B rund 65 GB. Dafür braucht es eine Profikarte mit 48 oder 96 GB, oder ein System, in dem Prozessor und Grafik sich einen großen Speicher teilen. Ein Mac Studio mit 96 GB stellt in unserer Rechnung 72 GB für ein Modell bereit. Selbst eine Karte mit 96 GB trägt nur 29 der 36 Modelle; für die sieben größten reicht keine Karte, die unser Katalog führt.

Wenn Sie ein Notebook nutzen. Dort ist die Grafikkarte fest verbaut, und es zählt, was im Gerät steckt. Welche Modelle auf Ihrem Notebook laufen, zeigt dessen Seite in unserem Katalog; wie Sie es finden, beschreibt die Anleitung Welches Gerät habe ich?

Wenn Sie nur kleine Modelle brauchen. Für Zusammenfassungen, Umformulierungen und Fragen zu Texten, die Sie mitliefern, reicht oft ein Modell mit 4 bis 8 Milliarden Parametern, und das läuft auf einer 8-GB-Karte. Dann ist eine größere Karte Geld für Speicher, den Sie nicht nutzen.

Welche Modelle es gibt und wie viel Speicher jedes braucht, finden Sie unter Modelle.

Weitere Ratgeber