Apple MacBook Pro 14 Zoll (2024), M4 mit 10-Kern-GPU, 32 GB

Ja. Auf diesem Gerät läuft Qwen3 14B flüssig, mit rund 8,8 bis 12 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Qwen3 14B

Q4_K_M · 8,8 bis 12 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_M

Schnellstes Modell

gpt-oss 20B

Q4_K_M · 24 bis 35 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Qwen3 14B
Q4_K_M
Läuft gut8,8 bis 12 Token/s10,7 von 21,3 GB
Ministral 3 14B
Q4_K_M
Läuft gut9,6 bis 13 Token/s9,9 von 21,3 GB
Gemma 4 12B
Q4_0
Läuft gut11 bis 15 Token/s8,3 von 21,3 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft gut22 bis 33 Token/s20,1 von 21,3 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft gut22 bis 33 Token/s20,1 von 21,3 GB
Gemma 4 26B A4B
Q4_K_M
Läuft gut18 bis 26 Token/s18,4 von 21,3 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut14 bis 19 Token/s6,9 von 21,3 GB
Qwen3.5 9B
Q4_K_M
Läuft gut14 bis 20 Token/s6,7 von 21,3 GB
gpt-oss 20B
Q4_K_M
Läuft gut24 bis 35 Token/s12,8 von 21,3 GB
Qwen3 8B
Q4_K_M
Läuft gut16 bis 21 Token/s6,5 von 21,3 GB
Llama 3.1 8B
Q4_K_M
Läuft gut16 bis 22 Token/s6,4 von 21,3 GB
Gemma 4 E4B
Q4_0
Läuft gut18 bis 24 Token/s5,6 von 21,3 GB
Gemma 4 E2B
Q4_K_M
Läuft gut27 bis 37 Token/s4,0 von 21,3 GB
Qwen3.5 4B
Q4_K_M
Läuft gut30 bis 41 Token/s3,7 von 21,3 GB
Qwen3 4B
Q4_K_M
Läuft gut30 bis 41 Token/s4,0 von 21,3 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut38 bis 55 Token/s6,9 von 21,3 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut46 bis 63 Token/s2,8 von 21,3 GB
Gemma 4 31B
Q4_K_M
Läuft, aber mit rund 5,1 Token pro Sekunde spürbar langsam.
Eingeschränkt4,3 bis 5,9 Token/s20,7 von 21,3 GB
Granite 4.2 30B
Q4_K_M
Läuft, aber mit rund 5,4 Token pro Sekunde spürbar langsam.
Eingeschränkt4,5 bis 6,2 Token/s20,0 von 21,3 GB
Qwen3.8 27B
Q4_K_M
Läuft, aber mit rund 5,9 Token pro Sekunde spürbar langsam.
Eingeschränkt4,9 bis 6,8 Token/s17,9 von 21,3 GB
Qwen3.6 27B
Q4_K_M
Läuft, aber mit rund 5,8 Token pro Sekunde spürbar langsam.
Eingeschränkt4,9 bis 6,7 Token/s18,2 von 21,3 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft, aber mit rund 6,7 Token pro Sekunde spürbar langsam.
Eingeschränkt5,6 bis 7,7 Token/s16,1 von 21,3 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft nicht23,0 von 21,3 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft nicht23,5 von 21,3 GB
Llama 3.3 70B
Q4_K_M
Läuft nicht45,5 von 21,3 GB
gpt-oss 120B
Q4_K_M
Läuft nicht65,0 von 21,3 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 21,3 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 21,3 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 21,3 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 21,3 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 21,3 GB

Gerätedaten

Chip
M4, 10-Kern-GPU
Arbeitsspeicher
32 GB
Davon für Modelle nutzbar
21,3 GB
Speicherbandbreite
120 GB/s
Rechenschnittstelle
Metal