Apple MacBook Pro 14 Zoll (2024), M4 Pro mit 16-Kern-GPU, 48 GB

Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 8,4 bis 12 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Gemma 4 31B

Q4_K_M · 8,4 bis 12 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_M

Schnellstes Modell

Ornith 1.5 35B A3B

Q4_K_M · 52 bis 77 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Gemma 4 31B
Q4_K_M
Läuft gut8,4 bis 12 Token/s20,7 von 36,0 GB
Granite 4.2 30B
Q4_K_M
Läuft gut8,9 bis 12 Token/s20,0 von 36,0 GB
Qwen3.8 27B
Q4_K_M
Läuft gut9,7 bis 13 Token/s17,9 von 36,0 GB
Qwen3.6 27B
Q4_K_M
Läuft gut9,6 bis 13 Token/s18,2 von 36,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft gut11 bis 15 Token/s16,1 von 36,0 GB
Qwen3 14B
Q4_K_M
Läuft gut17 bis 24 Token/s10,7 von 36,0 GB
Ministral 3 14B
Q4_K_M
Läuft gut19 bis 26 Token/s9,9 von 36,0 GB
Gemma 4 12B
Q4_0
Läuft gut22 bis 30 Token/s8,3 von 36,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft gut52 bis 77 Token/s23,0 von 36,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft gut51 bis 74 Token/s23,5 von 36,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut45 bis 66 Token/s20,1 von 36,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut45 bis 66 Token/s20,1 von 36,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut36 bis 53 Token/s18,4 von 36,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut28 bis 38 Token/s6,9 von 36,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut28 bis 39 Token/s6,7 von 36,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut47 bis 69 Token/s12,8 von 36,0 GB
Qwen3 8B
Q4_K_M
Läuft gut31 bis 42 Token/s6,5 von 36,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut32 bis 44 Token/s6,4 von 36,0 GB
Gemma 4 E4B
Q4_0
Läuft gut35 bis 48 Token/s5,6 von 36,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut53 bis 73 Token/s4,0 von 36,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut59 bis 81 Token/s3,7 von 36,0 GB
Qwen3 4B
Q4_K_M
Läuft gut59 bis 82 Token/s4,0 von 36,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut78 bis 115 Token/s6,9 von 36,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut91 bis 126 Token/s2,8 von 36,0 GB
Llama 3.3 70B
Q4_K_M
Läuft nicht45,5 von 36,0 GB
gpt-oss 120B
Q4_K_M
Läuft nicht65,0 von 36,0 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 36,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 36,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 36,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 36,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 36,0 GB

Gerätedaten

Chip
M4 Pro, 16-Kern-GPU
Arbeitsspeicher
48 GB
Davon für Modelle nutzbar
36,0 GB
Speicherbandbreite
273 GB/s
Rechenschnittstelle
Metal