NVIDIA GeForce RTX 2080 Ti, 11 GB

Ja. Mit dieser Karte läuft Gemma 4 12B flüssig, mit rund 55 bis 67 Token pro Sekunde (nicht an Messungen abgeglichen).

Die Grenze dieser Karte: Gemma 4 12B läuft noch, Qwen3 14B nicht mehr. Dafür fehlen 0,5 GB Grafikspeicher.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“), nur mit dem Grafikspeicher der Karte: ohne Auslagerung in den Arbeitsspeicher und ohne Prozessor. Die Tempowerte sind an veröffentlichten und eigenen Messungen abgeglichen, aber nicht auf dieser Karte gemessen. Ausgenommen sind Werte mit dem Zusatz „nicht an Messungen abgeglichen“: für sie fehlt der Abgleich, sie sind unsicher.

Wofür möchten Sie die Karte nutzen?
Mehr zu diesem Einsatzzweck: Modelle und Geräte nach Preis

Stärkstes Modell, das flüssig läuft

Gemma 4 12B

Q4_0 · 55 bis 67 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

So starten Sie es mit Ollama:

$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0

Schnellstes Modell

LFM2.5 8B A1B

Q4_K_M · 204 bis 326 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte unter ihnen.

So starten Sie es mit Ollama:

$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_M

Modelle auf dieser Karte

Die Tempowerte sind berechnet, nicht auf dem Gerät gemessen, und an veröffentlichten und eigenen Messungen abgeglichen. Ausgenommen sind die mit * markierten Werte: sie sind nicht abgeglichen und deshalb unsicher.

Kartendaten

Hersteller
NVIDIA
Grafikspeicher
11 GB
Speicherbandbreite
616 GB/s
Rechenschnittstelle
CUDA
Erschienen
2018

Weitere Ratgeber