NVIDIA RTX A6000, 48 GB

Ja. Mit dieser Karte läuft Apertus 70B 2509 flüssig, mit rund 11 bis 14 Token pro Sekunde (nicht an Messungen abgeglichen).

Die Grenze dieser Karte: Apertus 70B 2509 läuft noch, gpt-oss 120B nicht mehr. Dafür fehlen 17,8 GB Grafikspeicher.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“), nur mit dem Grafikspeicher der Karte: ohne Auslagerung in den Arbeitsspeicher und ohne Prozessor. Die Tempowerte sind an veröffentlichten und eigenen Messungen abgeglichen, aber nicht auf dieser Karte gemessen. Ausgenommen sind Werte mit dem Zusatz „nicht an Messungen abgeglichen“: für sie fehlt der Abgleich, sie sind unsicher.

Wofür möchten Sie die Karte nutzen?
Mehr zu diesem Einsatzzweck: Modelle und Geräte nach Preis

Stärkstes Modell, das flüssig läuft

Apertus 70B 2509

Q4_K_M · 11 bis 14 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/Apertus-70B-Instruct-2509-GGUF:Q4_K_M
>>> /set parameter num_ctx 4096

Ollama wählt auf diesem Gerät von selbst 65.536 Token Kontext, die Zahlen hier gelten für 4.096 Token. Damit sie stimmen, geben Sie die zweite Zeile nach dem Start in Ollama ein.

Schnellstes Modell

Ornith 1.5 35B A3B

Q4_K_M · 154 bis 246 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte unter ihnen.

So starten Sie es mit Ollama:

$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M
>>> /set parameter num_ctx 4096

Ollama wählt auf diesem Gerät von selbst 262.144 Token Kontext, die Zahlen hier gelten für 4.096 Token. Damit sie stimmen, geben Sie die zweite Zeile nach dem Start in Ollama ein.

Modelle auf dieser Karte

Die Tempowerte sind berechnet, nicht auf dem Gerät gemessen, und an veröffentlichten und eigenen Messungen abgeglichen. Ausgenommen sind die mit * markierten Werte: sie sind nicht abgeglichen und deshalb unsicher.

Kartendaten

Hersteller
NVIDIA
Grafikspeicher
48 GB
Speicherbandbreite
768 GB/s
Rechenschnittstelle
CUDA
Erschienen
2020

Weitere Ratgeber