Apple Mac Studio (2025), M4 Max mit 40-Kern-GPU, 64 GB
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 14 bis 19 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 64 bis 94 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 14 bis 19 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 13 bis 18 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 13 bis 18 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 14 bis 19 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 87 bis 127 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 20,7 von 48,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 14 bis 20 Token/s | 20,0 von 48,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 17,9 von 48,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 16 bis 21 Token/s | 18,2 von 48,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 18 bis 25 Token/s | 16,1 von 48,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 28 bis 39 Token/s | 10,7 von 48,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 31 bis 42 Token/s | 9,9 von 48,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 36 bis 49 Token/s | 8,3 von 48,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 87 bis 127 Token/s | 23,0 von 48,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 84 bis 124 Token/s | 23,5 von 48,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 75 bis 111 Token/s | 20,1 von 48,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 75 bis 111 Token/s | 20,1 von 48,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 61 bis 90 Token/s | 18,4 von 48,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 6,9 von 48,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 46 bis 64 Token/s | 6,7 von 48,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 77 bis 112 Token/s | 12,8 von 48,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 50 bis 69 Token/s | 6,5 von 48,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 51 bis 71 Token/s | 6,4 von 48,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 56 bis 78 Token/s | 5,6 von 48,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 86 bis 119 Token/s | 4,0 von 48,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 96 bis 132 Token/s | 3,7 von 48,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 97 bis 135 Token/s | 4,0 von 48,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 135 bis 198 Token/s | 6,9 von 48,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 149 bis 205 Token/s | 2,8 von 48,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 7,2 Token pro Sekunde spürbar langsam. | Eingeschränkt | 6,0 bis 8,3 Token/s | 45,5 von 48,0 GB |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,0 von 48,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 48,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 48,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 48,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 48,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 48,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 64 bis 94 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 83 bis 121 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 21,7 von 48,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 23,2 von 48,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 18,7 von 48,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 19,0 von 48,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 17 bis 24 Token/s | 18,1 von 48,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 26 bis 37 Token/s | 12,7 von 48,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 29 bis 40 Token/s | 11,9 von 48,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 35 bis 49 Token/s | 8,5 von 48,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 83 bis 121 Token/s | 23,3 von 48,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 81 bis 119 Token/s | 23,7 von 48,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 64 bis 94 Token/s | 21,3 von 48,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 64 bis 94 Token/s | 21,3 von 48,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 59 bis 87 Token/s | 18,6 von 48,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 44 bis 61 Token/s | 7,3 von 48,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 7,1 von 48,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 73 bis 108 Token/s | 13,1 von 48,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 8,3 von 48,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 47 bis 64 Token/s | 8,0 von 48,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 55 bis 77 Token/s | 5,8 von 48,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 86 bis 118 Token/s | 4,1 von 48,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 92 bis 126 Token/s | 4,1 von 48,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 81 bis 111 Token/s | 5,8 von 48,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 79 bis 116 Token/s | 9,5 von 48,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 130 bis 179 Token/s | 3,6 von 48,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 49,5 von 48,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 48,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 48,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 48,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 48,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 48,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 48,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 14 bis 19 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 85 bis 125 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 21,0 von 48,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 21,0 von 48,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 16 bis 21 Token/s | 18,2 von 48,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 18,5 von 48,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 18 bis 24 Token/s | 16,8 von 48,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 28 bis 38 Token/s | 11,3 von 48,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 30 bis 41 Token/s | 10,6 von 48,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 35 bis 49 Token/s | 8,4 von 48,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 85 bis 125 Token/s | 23,1 von 48,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 83 bis 122 Token/s | 23,5 von 48,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 71 bis 104 Token/s | 20,5 von 48,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 71 bis 104 Token/s | 20,5 von 48,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 61 bis 89 Token/s | 18,5 von 48,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 7,0 von 48,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 46 bis 63 Token/s | 6,9 von 48,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 75 bis 111 Token/s | 12,9 von 48,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 48 bis 67 Token/s | 7,1 von 48,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 50 bis 68 Token/s | 6,9 von 48,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 56 bis 77 Token/s | 5,6 von 48,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 86 bis 119 Token/s | 4,0 von 48,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 94 bis 130 Token/s | 3,9 von 48,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 91 bis 126 Token/s | 4,6 von 48,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 109 bis 160 Token/s | 7,8 von 48,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 142 bis 196 Token/s | 3,1 von 48,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 7,1 Token pro Sekunde spürbar langsam. | Eingeschränkt | 6,0 bis 8,2 Token/s | 46,9 von 48,0 GB |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,1 von 48,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 48,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 48,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 48,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 48,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 48,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 13 bis 18 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 78 bis 114 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 23,0 von 48,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 27,5 von 48,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 19,9 von 48,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 20,1 von 48,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 20,8 von 48,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 24 bis 34 Token/s | 15,4 von 48,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 26 bis 36 Token/s | 14,6 von 48,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 35 bis 48 Token/s | 8,8 von 48,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 78 bis 114 Token/s | 23,7 von 48,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 77 bis 113 Token/s | 24,1 von 48,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 53 bis 78 Token/s | 23,0 von 48,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 53 bis 78 Token/s | 23,0 von 48,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 57 bis 84 Token/s | 19,0 von 48,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 43 bis 59 Token/s | 7,9 von 48,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 44 bis 61 Token/s | 7,7 von 48,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 13,5 von 48,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 40 bis 55 Token/s | 10,8 von 48,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 42 bis 58 Token/s | 10,1 von 48,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 54 bis 75 Token/s | 6,0 von 48,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 85 bis 117 Token/s | 4,2 von 48,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 87 bis 119 Token/s | 4,7 von 48,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 66 bis 91 Token/s | 8,2 von 48,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 51 bis 75 Token/s | 13,0 von 48,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 111 bis 153 Token/s | 4,7 von 48,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 48,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 48,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 48,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 48,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 48,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 48,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 48,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 13 bis 18 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 78 bis 114 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 23,0 von 48,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 13 bis 18 Token/s | 27,5 von 48,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 19,9 von 48,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 20,1 von 48,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 20,8 von 48,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 24 bis 34 Token/s | 15,4 von 48,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 26 bis 36 Token/s | 14,6 von 48,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 35 bis 48 Token/s | 8,8 von 48,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 78 bis 114 Token/s | 23,7 von 48,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 77 bis 113 Token/s | 24,1 von 48,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 53 bis 78 Token/s | 23,0 von 48,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 53 bis 78 Token/s | 23,0 von 48,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 57 bis 84 Token/s | 19,0 von 48,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 43 bis 59 Token/s | 7,9 von 48,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 44 bis 61 Token/s | 7,7 von 48,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 13,5 von 48,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 40 bis 55 Token/s | 10,8 von 48,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 42 bis 58 Token/s | 10,1 von 48,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 54 bis 75 Token/s | 6,0 von 48,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 85 bis 117 Token/s | 4,2 von 48,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 87 bis 119 Token/s | 4,7 von 48,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 66 bis 91 Token/s | 8,2 von 48,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 51 bis 75 Token/s | 13,0 von 48,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 111 bis 153 Token/s | 4,7 von 48,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 48,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 48,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 48,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 48,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 48,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 48,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 48,0 GB |
Gerätedaten
- Chip
- M4 Max, 40-Kern-GPU
- Arbeitsspeicher
- 64 GB
- Davon für Modelle nutzbar
- 48,0 GB
- Speicherbandbreite
- 546 GB/s
- Rechenschnittstelle
- Metal