Apple Mac Studio (2025), M3 Ultra mit 60-Kern-GPU, 256 GB

Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 33 bis 49 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Qwen3.5 122B A10B

Q4_K_M · 33 bis 49 Token/s

Schnellstes Modell

gpt-oss 120B

Q4_K_M · 70 bis 102 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run gpt-oss:120b

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Qwen3.5 122B A10B
Q4_K_M
Läuft gut33 bis 49 Token/s79,0 von 192,0 GB
Gemma 4 31B
Q4_K_M
Läuft gut17 bis 24 Token/s20,7 von 192,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut23 bis 34 Token/s110,8 von 192,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut18 bis 25 Token/s20,0 von 192,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut20 bis 27 Token/s17,9 von 192,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut20 bis 27 Token/s18,2 von 192,0 GB
gpt-oss 120B
Q4_K_M
Läuft gut70 bis 102 Token/s65,0 von 192,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut22 bis 31 Token/s16,1 von 192,0 GB
Qwen3 14B
Q4_K_M
Läuft gut36 bis 49 Token/s10,7 von 192,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut39 bis 54 Token/s9,9 von 192,0 GB
Gemma 4 12B
Q4_0
Läuft gut45 bis 62 Token/s8,3 von 192,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut111 bis 163 Token/s23,0 von 192,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut108 bis 159 Token/s23,5 von 192,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut97 bis 142 Token/s20,1 von 192,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut97 bis 142 Token/s20,1 von 192,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut79 bis 117 Token/s18,4 von 192,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut57 bis 78 Token/s6,9 von 192,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut58 bis 80 Token/s6,7 von 192,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut97 bis 143 Token/s12,8 von 192,0 GB
Qwen3 8B
Q4_K_M
Läuft gut63 bis 87 Token/s6,5 von 192,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut65 bis 89 Token/s6,4 von 192,0 GB
Gemma 4 E4B
Q4_0
Läuft gut71 bis 98 Token/s5,6 von 192,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut109 bis 151 Token/s4,0 von 192,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut121 bis 167 Token/s3,7 von 192,0 GB
Qwen3 4B
Q4_K_M
Läuft gut124 bis 171 Token/s4,0 von 192,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut178 bis 262 Token/s6,9 von 192,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut188 bis 260 Token/s2,8 von 192,0 GB
Llama 3.3 70B
Q4_K_M
Läuft, aber mit rund 9,0 Token pro Sekunde spürbar langsam.
Eingeschränkt7,6 bis 10 Token/s45,5 von 192,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 192,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 192,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 192,0 GB

Gerätedaten

Chip
M3 Ultra, 60-Kern-GPU
Arbeitsspeicher
256 GB
Davon für Modelle nutzbar
192,0 GB
Speicherbandbreite
819 GB/s
Rechenschnittstelle
Metal