Apple Mac Pro (2023), M2 Ultra mit 76-Kern-GPU, 192 GB

Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 33 bis 48 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Qwen3.5 122B A10B

Q4_K_M · 33 bis 48 Token/s

Schnellstes Modell

gpt-oss 120B

Q4_K_M · 69 bis 101 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run gpt-oss:120b

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Qwen3.5 122B A10B
Q4_K_M
Läuft gut33 bis 48 Token/s79,0 von 144,0 GB
Gemma 4 31B
Q4_K_M
Läuft gut17 bis 23 Token/s20,7 von 144,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut23 bis 33 Token/s110,8 von 144,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut18 bis 25 Token/s20,0 von 144,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut19 bis 27 Token/s17,9 von 144,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut19 bis 27 Token/s18,2 von 144,0 GB
gpt-oss 120B
Q4_K_M
Läuft gut69 bis 101 Token/s65,0 von 144,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut22 bis 31 Token/s16,1 von 144,0 GB
Qwen3 14B
Q4_K_M
Läuft gut35 bis 48 Token/s10,7 von 144,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut38 bis 53 Token/s9,9 von 144,0 GB
Gemma 4 12B
Q4_0
Läuft gut44 bis 61 Token/s8,3 von 144,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut109 bis 160 Token/s23,0 von 144,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut107 bis 157 Token/s23,5 von 144,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut96 bis 141 Token/s20,1 von 144,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut96 bis 141 Token/s20,1 von 144,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut78 bis 115 Token/s18,4 von 144,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut56 bis 78 Token/s6,9 von 144,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut57 bis 79 Token/s6,7 von 144,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut96 bis 141 Token/s12,8 von 144,0 GB
Qwen3 8B
Q4_K_M
Läuft gut62 bis 86 Token/s6,5 von 144,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut64 bis 88 Token/s6,4 von 144,0 GB
Gemma 4 E4B
Q4_0
Läuft gut70 bis 96 Token/s5,6 von 144,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut108 bis 149 Token/s4,0 von 144,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut120 bis 165 Token/s3,7 von 144,0 GB
Qwen3 4B
Q4_K_M
Läuft gut122 bis 169 Token/s4,0 von 144,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut176 bis 258 Token/s6,9 von 144,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut186 bis 257 Token/s2,8 von 144,0 GB
Llama 3.3 70B
Q4_K_M
Läuft, aber mit rund 8,9 Token pro Sekunde spürbar langsam.
Eingeschränkt7,5 bis 10 Token/s45,5 von 144,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 144,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 144,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 144,0 GB

Gerätedaten

Chip
M2 Ultra, 76-Kern-GPU
Arbeitsspeicher
192 GB
Davon für Modelle nutzbar
144,0 GB
Speicherbandbreite
800 GB/s
Rechenschnittstelle
Metal