Apple iMac 24 Zoll (2023), M3 mit 8-Kern-GPU, 24 GB

Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 9,5 bis 13 Token pro Sekunde.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Gemma 4 12B

Q4_0 · 9,5 bis 13 Token/s

So starten Sie es mit Ollama:

$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0

Schnellstes Modell

gpt-oss 20B

Q4_K_M · 20 bis 29 Token/s

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Gemma 4 12B
Q4_0
Läuft gut9,5 bis 13 Token/s8,3 von 16,0 GB
Ornith 1.5 9B
Q4_K_M
Läuft gut12 bis 17 Token/s6,9 von 16,0 GB
Qwen3.5 9B
Q4_K_M
Läuft gut12 bis 17 Token/s6,7 von 16,0 GB
gpt-oss 20B
Q4_K_M
Läuft gut20 bis 29 Token/s12,8 von 16,0 GB
Qwen3 8B
Q4_K_M
Läuft gut13 bis 18 Token/s6,5 von 16,0 GB
Llama 3.1 8B
Q4_K_M
Läuft gut14 bis 19 Token/s6,4 von 16,0 GB
Gemma 4 E4B
Q4_0
Läuft gut15 bis 21 Token/s5,6 von 16,0 GB
Gemma 4 E2B
Q4_K_M
Läuft gut23 bis 31 Token/s4,0 von 16,0 GB
Qwen3.5 4B
Q4_K_M
Läuft gut25 bis 35 Token/s3,7 von 16,0 GB
Qwen3 4B
Q4_K_M
Läuft gut25 bis 35 Token/s4,0 von 16,0 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut32 bis 47 Token/s6,9 von 16,0 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft gut39 bis 54 Token/s2,8 von 16,0 GB
Qwen3 14B
Q4_K_M
Läuft, aber mit rund 8,9 Token pro Sekunde spürbar langsam.
Eingeschränkt7,5 bis 10 Token/s10,7 von 16,0 GB
Ministral 3 14B
Q4_K_M
Läuft, aber mit rund 9,7 Token pro Sekunde spürbar langsam.
Eingeschränkt8,2 bis 11 Token/s9,9 von 16,0 GB
Mistral Small 3.2 24B
Q4_K_M
Läuft nicht16,1 von 16,0 GB
Qwen3.8 27B
Q4_K_M
Läuft nicht17,9 von 16,0 GB
Qwen3.6 27B
Q4_K_M
Läuft nicht18,2 von 16,0 GB
Gemma 4 26B A4B
Q4_K_M
Läuft nicht18,4 von 16,0 GB
Granite 4.2 30B
Q4_K_M
Läuft nicht20,0 von 16,0 GB
Qwen3 30B A3B 2507
Q4_K_M
Läuft nicht20,1 von 16,0 GB
Qwen3-Coder 30B A3B
Q4_K_M
Läuft nicht20,1 von 16,0 GB
Gemma 4 31B
Q4_K_M
Läuft nicht20,7 von 16,0 GB
Ornith 1.5 35B A3B
Q4_K_M
Läuft nicht23,0 von 16,0 GB
Qwen3.6 35B A3B
Q4_K_M
Läuft nicht23,5 von 16,0 GB
Llama 3.3 70B
Q4_K_M
Läuft nicht45,5 von 16,0 GB
gpt-oss 120B
Q4_K_M
Läuft nicht65,0 von 16,0 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 16,0 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 16,0 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 16,0 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 16,0 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 16,0 GB

Gerätedaten

Chip
M3, 8-Kern-GPU
Arbeitsspeicher
24 GB
Davon für Modelle nutzbar
16,0 GB
Speicherbandbreite
100 GB/s
Rechenschnittstelle
Metal