Apple MacBook Pro 14 Zoll (2023), M2 Max mit 38-Kern-GPU, 96 GB

Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 11 bis 15 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Gemma 4 31B

Q4_K_M · 11 bis 15 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_M

Schnellstes Modell

gpt-oss 120B

Q4_K_M · 45 bis 66 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run gpt-oss:120b

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Gemma 4 31B
Q4_K_M
Läuft gut11 bis 15 Token/s20,7 von 72,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut12 bis 16 Token/s20,0 von 72,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut13 bis 18 Token/s17,9 von 72,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut13 bis 17 Token/s18,2 von 72,0 GB
gpt-oss 120B
Q4_K_M
Läuft gut45 bis 66 Token/s65,0 von 72,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut15 bis 20 Token/s16,1 von 72,0 GB
Qwen3 14B
Q4_K_M
Läuft gut23 bis 32 Token/s10,7 von 72,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut25 bis 35 Token/s9,9 von 72,0 GB
Gemma 4 12B
Q4_0
Läuft gut29 bis 40 Token/s8,3 von 72,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut70 bis 103 Token/s23,0 von 72,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut68 bis 100 Token/s23,5 von 72,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut61 bis 89 Token/s20,1 von 72,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut61 bis 89 Token/s20,1 von 72,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut49 bis 72 Token/s18,4 von 72,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut37 bis 51 Token/s6,9 von 72,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut38 bis 52 Token/s6,7 von 72,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut62 bis 91 Token/s12,8 von 72,0 GB
Qwen3 8B
Q4_K_M
Läuft gut41 bis 56 Token/s6,5 von 72,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut42 bis 58 Token/s6,4 von 72,0 GB
Gemma 4 E4B
Q4_0
Läuft gut46 bis 63 Token/s5,6 von 72,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut70 bis 97 Token/s4,0 von 72,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut78 bis 107 Token/s3,7 von 72,0 GB
Qwen3 4B
Q4_K_M
Läuft gut79 bis 109 Token/s4,0 von 72,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut107 bis 156 Token/s6,9 von 72,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut121 bis 167 Token/s2,8 von 72,0 GB
Llama 3.3 70B
Q4_K_M
Läuft, aber mit rund 5,9 Token pro Sekunde spürbar langsam.
Eingeschränkt4,9 bis 6,8 Token/s45,5 von 72,0 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 72,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 72,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 72,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 72,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 72,0 GB

Gerätedaten

Chip
M2 Max, 38-Kern-GPU
Arbeitsspeicher
96 GB
Davon für Modelle nutzbar
72,0 GB
Speicherbandbreite
400 GB/s
Rechenschnittstelle
Metal