Apple Mac Studio (2026), M5 Max mit 40-Kern-GPU, 48 GB
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 15 bis 20 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 69 bis 102 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 15 bis 20 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 14 bis 19 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 14 bis 19 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 15 bis 20 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 93 bis 137 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 15 bis 20 Token/s | 20,7 von 36,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 20,0 von 36,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 17,9 von 36,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 18,2 von 36,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 16,1 von 36,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 30 bis 42 Token/s | 10,7 von 36,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 33 bis 46 Token/s | 9,9 von 36,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 38 bis 53 Token/s | 8,3 von 36,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 93 bis 137 Token/s | 23,0 von 36,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 91 bis 134 Token/s | 23,5 von 36,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 81 bis 120 Token/s | 20,1 von 36,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 81 bis 120 Token/s | 20,1 von 36,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 66 bis 97 Token/s | 18,4 von 36,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 48 bis 67 Token/s | 6,9 von 36,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 49 bis 68 Token/s | 6,7 von 36,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 82 bis 121 Token/s | 12,8 von 36,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 54 bis 74 Token/s | 6,5 von 36,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 55 bis 76 Token/s | 6,4 von 36,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 60 bis 83 Token/s | 5,6 von 36,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 93 bis 128 Token/s | 4,0 von 36,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 103 bis 142 Token/s | 3,7 von 36,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 105 bis 145 Token/s | 4,0 von 36,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 147 bis 216 Token/s | 6,9 von 36,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 160 bis 221 Token/s | 2,8 von 36,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 45,5 von 36,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,0 von 36,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 36,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 36,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 36,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 36,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 36,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 69 bis 102 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 89 bis 131 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 14 bis 20 Token/s | 21,7 von 36,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 15 bis 20 Token/s | 23,2 von 36,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 18,7 von 36,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 16 bis 23 Token/s | 19,0 von 36,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 18 bis 25 Token/s | 18,1 von 36,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 28 bis 39 Token/s | 12,7 von 36,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 31 bis 43 Token/s | 11,9 von 36,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 38 bis 52 Token/s | 8,5 von 36,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 89 bis 131 Token/s | 23,3 von 36,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 87 bis 128 Token/s | 23,7 von 36,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 69 bis 102 Token/s | 21,3 von 36,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 69 bis 102 Token/s | 21,3 von 36,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 64 bis 95 Token/s | 18,6 von 36,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 47 bis 65 Token/s | 7,3 von 36,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 48 bis 67 Token/s | 7,1 von 36,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 79 bis 116 Token/s | 13,1 von 36,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 49 bis 67 Token/s | 8,3 von 36,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 50 bis 69 Token/s | 8,0 von 36,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 60 bis 82 Token/s | 5,8 von 36,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 92 bis 127 Token/s | 4,1 von 36,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 99 bis 136 Token/s | 4,1 von 36,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 88 bis 121 Token/s | 5,8 von 36,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 87 bis 128 Token/s | 9,5 von 36,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 140 bis 194 Token/s | 3,6 von 36,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 49,5 von 36,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 36,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 36,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 36,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 36,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 36,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 36,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 15 bis 20 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 92 bis 135 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 15 bis 20 Token/s | 21,0 von 36,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 15 bis 21 Token/s | 21,0 von 36,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 18,2 von 36,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 18,5 von 36,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 16,8 von 36,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 30 bis 41 Token/s | 11,3 von 36,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 32 bis 45 Token/s | 10,6 von 36,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 38 bis 52 Token/s | 8,4 von 36,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 92 bis 135 Token/s | 23,1 von 36,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 90 bis 132 Token/s | 23,5 von 36,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 77 bis 113 Token/s | 20,5 von 36,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 77 bis 113 Token/s | 20,5 von 36,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 66 bis 96 Token/s | 18,5 von 36,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 48 bis 66 Token/s | 7,0 von 36,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 49 bis 68 Token/s | 6,9 von 36,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 81 bis 119 Token/s | 12,9 von 36,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 52 bis 72 Token/s | 7,1 von 36,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 53 bis 74 Token/s | 6,9 von 36,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 60 bis 83 Token/s | 5,6 von 36,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 92 bis 128 Token/s | 4,0 von 36,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 101 bis 140 Token/s | 3,9 von 36,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 98 bis 136 Token/s | 4,6 von 36,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 120 bis 176 Token/s | 7,8 von 36,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 153 bis 211 Token/s | 3,1 von 36,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 46,9 von 36,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,1 von 36,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 36,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 36,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 36,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 36,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 36,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 14 bis 19 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 84 bis 124 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 23,0 von 36,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 27,5 von 36,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 19,9 von 36,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 20,1 von 36,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 18 bis 24 Token/s | 20,8 von 36,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 26 bis 36 Token/s | 15,4 von 36,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 28 bis 39 Token/s | 14,6 von 36,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 37 bis 52 Token/s | 8,8 von 36,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 84 bis 124 Token/s | 23,7 von 36,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 83 bis 122 Token/s | 24,1 von 36,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 58 bis 85 Token/s | 23,0 von 36,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 58 bis 85 Token/s | 23,0 von 36,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 62 bis 91 Token/s | 19,0 von 36,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 46 bis 63 Token/s | 7,9 von 36,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 47 bis 65 Token/s | 7,7 von 36,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 75 bis 110 Token/s | 13,5 von 36,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 43 bis 60 Token/s | 10,8 von 36,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 10,1 von 36,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 59 bis 81 Token/s | 6,0 von 36,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 91 bis 126 Token/s | 4,2 von 36,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 93 bis 129 Token/s | 4,7 von 36,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 72 bis 99 Token/s | 8,2 von 36,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 57 bis 83 Token/s | 13,0 von 36,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 121 bis 167 Token/s | 4,7 von 36,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 36,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 36,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 36,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 36,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 36,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 36,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 36,0 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 14 bis 19 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 84 bis 124 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 23,0 von 36,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 14 bis 19 Token/s | 27,5 von 36,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 19,9 von 36,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 20,1 von 36,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 18 bis 24 Token/s | 20,8 von 36,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 26 bis 36 Token/s | 15,4 von 36,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 28 bis 39 Token/s | 14,6 von 36,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 37 bis 52 Token/s | 8,8 von 36,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 84 bis 124 Token/s | 23,7 von 36,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 83 bis 122 Token/s | 24,1 von 36,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 58 bis 85 Token/s | 23,0 von 36,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 58 bis 85 Token/s | 23,0 von 36,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 62 bis 91 Token/s | 19,0 von 36,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 46 bis 63 Token/s | 7,9 von 36,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 47 bis 65 Token/s | 7,7 von 36,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 75 bis 110 Token/s | 13,5 von 36,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 43 bis 60 Token/s | 10,8 von 36,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 45 bis 62 Token/s | 10,1 von 36,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 59 bis 81 Token/s | 6,0 von 36,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 91 bis 126 Token/s | 4,2 von 36,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 93 bis 129 Token/s | 4,7 von 36,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 72 bis 99 Token/s | 8,2 von 36,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 57 bis 83 Token/s | 13,0 von 36,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 121 bis 167 Token/s | 4,7 von 36,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 36,0 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 36,0 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 36,0 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 36,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 36,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 36,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 36,0 GB |
Gerätedaten
- Chip
- M5 Max, 40-Kern-GPU
- Arbeitsspeicher
- 48 GB
- Davon für Modelle nutzbar
- 36,0 GB
- Speicherbandbreite
- 614 GB/s
- Rechenschnittstelle
- Metal