Apple Mac Studio (2026), M5 Ultra mit 64-Kern-GPU, 256 GB

Ja. Auf diesem Gerät läuft Llama 3.3 70B flüssig, mit rund 9,0 bis 12 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Llama 3.3 70B

Q4_K_M · 9,0 bis 12 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_M

Schnellstes Modell

gpt-oss 120B

Q4_K_M · 84 bis 123 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run gpt-oss:120b

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Llama 3.3 70B
Q4_K_M
Läuft gut9,0 bis 12 Token/s45,5 von 192,0 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft gut40 bis 59 Token/s79,0 von 192,0 GB
Gemma 4 31B
Q4_K_M
Läuft gut21 bis 28 Token/s20,7 von 192,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut30 bis 45 Token/s110,8 von 192,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut22 bis 30 Token/s20,0 von 192,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut23 bis 32 Token/s17,9 von 192,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut23 bis 32 Token/s18,2 von 192,0 GB
gpt-oss 120B
Q4_K_M
Läuft gut84 bis 123 Token/s65,0 von 192,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut27 bis 37 Token/s16,1 von 192,0 GB
Qwen3 14B
Q4_K_M
Läuft gut43 bis 59 Token/s10,7 von 192,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut46 bis 64 Token/s9,9 von 192,0 GB
Gemma 4 12B
Q4_0
Läuft gut53 bis 74 Token/s8,3 von 192,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut134 bis 197 Token/s23,0 von 192,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut132 bis 194 Token/s23,5 von 192,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut119 bis 174 Token/s20,1 von 192,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut119 bis 174 Token/s20,1 von 192,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut98 bis 144 Token/s18,4 von 192,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut68 bis 94 Token/s6,9 von 192,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut70 bis 96 Token/s6,7 von 192,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut117 bis 172 Token/s12,8 von 192,0 GB
Qwen3 8B
Q4_K_M
Läuft gut76 bis 105 Token/s6,5 von 192,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut78 bis 107 Token/s6,4 von 192,0 GB
Gemma 4 E4B
Q4_0
Läuft gut84 bis 117 Token/s5,6 von 192,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut132 bis 182 Token/s4,0 von 192,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut146 bis 201 Token/s3,7 von 192,0 GB
Qwen3 4B
Q4_K_M
Läuft gut150 bis 207 Token/s4,0 von 192,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut224 bis 329 Token/s6,9 von 192,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut227 bis 313 Token/s2,8 von 192,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 192,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 192,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 192,0 GB

Gerätedaten

Chip
M5 Ultra, 64-Kern-GPU
Arbeitsspeicher
256 GB
Davon für Modelle nutzbar
192,0 GB
Speicherbandbreite
1.200 GB/s
Rechenschnittstelle
Metal