Apple Mac Studio (2025), M4 Max mit 40-Kern-GPU, 64 GB

Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 14 bis 19 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Gemma 4 31B

Q4_K_M · 14 bis 19 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_M

Schnellstes Modell

Ornith 1.5 35B A3B

Q4_K_M · 87 bis 127 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Gemma 4 31B
Q4_K_M
Läuft gut14 bis 19 Token/s20,7 von 48,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut14 bis 20 Token/s20,0 von 48,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut16 bis 22 Token/s17,9 von 48,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut16 bis 21 Token/s18,2 von 48,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut18 bis 25 Token/s16,1 von 48,0 GB
Qwen3 14B
Q4_K_M
Läuft gut28 bis 39 Token/s10,7 von 48,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut31 bis 42 Token/s9,9 von 48,0 GB
Gemma 4 12B
Q4_0
Läuft gut36 bis 49 Token/s8,3 von 48,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut87 bis 127 Token/s23,0 von 48,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut84 bis 124 Token/s23,5 von 48,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut75 bis 111 Token/s20,1 von 48,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut75 bis 111 Token/s20,1 von 48,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut61 bis 90 Token/s18,4 von 48,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut45 bis 62 Token/s6,9 von 48,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut46 bis 64 Token/s6,7 von 48,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut77 bis 112 Token/s12,8 von 48,0 GB
Qwen3 8B
Q4_K_M
Läuft gut50 bis 69 Token/s6,5 von 48,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut51 bis 71 Token/s6,4 von 48,0 GB
Gemma 4 E4B
Q4_0
Läuft gut56 bis 78 Token/s5,6 von 48,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut86 bis 119 Token/s4,0 von 48,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut96 bis 132 Token/s3,7 von 48,0 GB
Qwen3 4B
Q4_K_M
Läuft gut97 bis 135 Token/s4,0 von 48,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut135 bis 198 Token/s6,9 von 48,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut149 bis 205 Token/s2,8 von 48,0 GB
Llama 3.3 70B
Q4_K_M
Läuft, aber mit rund 7,2 Token pro Sekunde spürbar langsam.
Eingeschränkt6,0 bis 8,3 Token/s45,5 von 48,0 GB
gpt-oss 120B
Q4_K_M
Läuft nicht65,0 von 48,0 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 48,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 48,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 48,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 48,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 48,0 GB

Gerätedaten

Chip
M4 Max, 40-Kern-GPU
Arbeitsspeicher
64 GB
Davon für Modelle nutzbar
48,0 GB
Speicherbandbreite
546 GB/s
Rechenschnittstelle
Metal