Apple MacBook Pro 14 Zoll (2026), M5 Max mit 32-Kern-GPU, 36 GB
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 12 bis 17 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 56 bis 82 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 12 bis 17 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 12 bis 16 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 12 bis 16 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 12 bis 17 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 77 bis 113 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 12 bis 17 Token/s | 20,7 von 24,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 20,0 von 24,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 17,9 von 24,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 18,2 von 24,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 16,1 von 24,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 25 bis 35 Token/s | 10,7 von 24,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 28 bis 38 Token/s | 9,9 von 24,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 32 bis 44 Token/s | 8,3 von 24,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 77 bis 113 Token/s | 23,0 von 24,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 75 bis 110 Token/s | 23,5 von 24,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 67 bis 98 Token/s | 20,1 von 24,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 67 bis 98 Token/s | 20,1 von 24,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 54 bis 80 Token/s | 18,4 von 24,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 40 bis 56 Token/s | 6,9 von 24,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 41 bis 57 Token/s | 6,7 von 24,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 68 bis 101 Token/s | 12,8 von 24,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 6,5 von 24,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 46 bis 63 Token/s | 6,4 von 24,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 50 bis 70 Token/s | 5,6 von 24,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 77 bis 106 Token/s | 4,0 von 24,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 86 bis 118 Token/s | 3,7 von 24,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 87 bis 120 Token/s | 4,0 von 24,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 119 bis 174 Token/s | 6,9 von 24,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 133 bis 183 Token/s | 2,8 von 24,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 45,5 von 24,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,0 von 24,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 24,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 24,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 24,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 24,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 24,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 56 bis 82 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 73 bis 108 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 12 bis 17 Token/s | 21,7 von 24,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 12 bis 17 Token/s | 23,2 von 24,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 18,7 von 24,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 19,0 von 24,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 18,1 von 24,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 24 bis 33 Token/s | 12,7 von 24,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 26 bis 35 Token/s | 11,9 von 24,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 32 bis 44 Token/s | 8,5 von 24,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 73 bis 108 Token/s | 23,3 von 24,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 72 bis 105 Token/s | 23,7 von 24,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 56 bis 82 Token/s | 21,3 von 24,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 56 bis 82 Token/s | 21,3 von 24,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 53 bis 77 Token/s | 18,6 von 24,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 39 bis 54 Token/s | 7,3 von 24,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 40 bis 56 Token/s | 7,1 von 24,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 65 bis 96 Token/s | 13,1 von 24,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 40 bis 55 Token/s | 8,3 von 24,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 42 bis 57 Token/s | 8,0 von 24,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 50 bis 69 Token/s | 5,8 von 24,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 76 bis 106 Token/s | 4,1 von 24,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 82 bis 113 Token/s | 4,1 von 24,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 71 bis 99 Token/s | 5,8 von 24,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 68 bis 100 Token/s | 9,5 von 24,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 115 bis 159 Token/s | 3,6 von 24,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 49,5 von 24,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 24,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 24,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 24,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 24,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 24,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 24,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 12 bis 17 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 76 bis 111 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 12 bis 17 Token/s | 21,0 von 24,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 13 bis 17 Token/s | 21,0 von 24,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 18,2 von 24,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 18,5 von 24,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 16,8 von 24,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 25 bis 34 Token/s | 11,3 von 24,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 27 bis 37 Token/s | 10,6 von 24,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 32 bis 44 Token/s | 8,4 von 24,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 76 bis 111 Token/s | 23,1 von 24,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 74 bis 109 Token/s | 23,5 von 24,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 63 bis 92 Token/s | 20,5 von 24,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 63 bis 92 Token/s | 20,5 von 24,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 54 bis 79 Token/s | 18,5 von 24,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 40 bis 55 Token/s | 7,0 von 24,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 41 bis 57 Token/s | 6,9 von 24,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 67 bis 99 Token/s | 12,9 von 24,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 43 bis 60 Token/s | 7,1 von 24,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 44 bis 61 Token/s | 6,9 von 24,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 50 bis 69 Token/s | 5,6 von 24,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 77 bis 106 Token/s | 4,0 von 24,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 84 bis 116 Token/s | 3,9 von 24,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 81 bis 112 Token/s | 4,6 von 24,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 95 bis 140 Token/s | 7,8 von 24,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 126 bis 174 Token/s | 3,1 von 24,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 46,9 von 24,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,1 von 24,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 24,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 24,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 24,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 24,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 24,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 12 bis 16 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 69 bis 101 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 12 bis 16 Token/s | 23,0 von 24,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 13 bis 19 Token/s | 19,9 von 24,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 13 bis 19 Token/s | 20,1 von 24,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 14 bis 20 Token/s | 20,8 von 24,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 22 bis 30 Token/s | 15,4 von 24,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 14,6 von 24,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 31 bis 43 Token/s | 8,8 von 24,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 23,7 von 24,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 46 bis 68 Token/s | 23,0 von 24,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 46 bis 68 Token/s | 23,0 von 24,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 50 bis 74 Token/s | 19,0 von 24,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 38 bis 53 Token/s | 7,9 von 24,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 39 bis 54 Token/s | 7,7 von 24,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 61 bis 90 Token/s | 13,5 von 24,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 35 bis 49 Token/s | 10,8 von 24,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 37 bis 51 Token/s | 10,1 von 24,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 49 bis 67 Token/s | 6,0 von 24,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 76 bis 104 Token/s | 4,2 von 24,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 77 bis 106 Token/s | 4,7 von 24,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 58 bis 79 Token/s | 8,2 von 24,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 44 bis 64 Token/s | 13,0 von 24,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 98 bis 135 Token/s | 4,7 von 24,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 24,1 von 24,0 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 27,5 von 24,0 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 24,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 24,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 24,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 24,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 24,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 24,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 24,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 12 bis 16 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 69 bis 101 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 12 bis 16 Token/s | 23,0 von 24,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 13 bis 19 Token/s | 19,9 von 24,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 13 bis 19 Token/s | 20,1 von 24,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 14 bis 20 Token/s | 20,8 von 24,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 22 bis 30 Token/s | 15,4 von 24,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 14,6 von 24,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 31 bis 43 Token/s | 8,8 von 24,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 23,7 von 24,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 46 bis 68 Token/s | 23,0 von 24,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 46 bis 68 Token/s | 23,0 von 24,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 50 bis 74 Token/s | 19,0 von 24,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 38 bis 53 Token/s | 7,9 von 24,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 39 bis 54 Token/s | 7,7 von 24,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 61 bis 90 Token/s | 13,5 von 24,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 35 bis 49 Token/s | 10,8 von 24,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 37 bis 51 Token/s | 10,1 von 24,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 49 bis 67 Token/s | 6,0 von 24,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 76 bis 104 Token/s | 4,2 von 24,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 77 bis 106 Token/s | 4,7 von 24,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 58 bis 79 Token/s | 8,2 von 24,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 44 bis 64 Token/s | 13,0 von 24,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 98 bis 135 Token/s | 4,7 von 24,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 24,1 von 24,0 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 27,5 von 24,0 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 24,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 24,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 24,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 24,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 24,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 24,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 24,0 GB |
Gerätedaten
- Chip
- M5 Max, 32-Kern-GPU
- Arbeitsspeicher
- 36 GB
- Davon für Modelle nutzbar
- 24,0 GB
- Speicherbandbreite
- 460 GB/s
- Rechenschnittstelle
- Metal