Apple Mac Studio (2026), M5 Ultra mit 64-Kern-GPU, 256 GB
Ja. Auf diesem Gerät läuft Llama 3.3 70B flüssig, mit rund 9,0 bis 12 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 105 bis 154 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Llama 3.3 70B flüssig, mit rund 9,0 bis 12 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Llama 3.3 70B flüssig, mit rund 8,6 bis 12 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Llama 3.3 70B flüssig, mit rund 8,6 bis 12 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Llama 3.3 70BQ4_K_M · 9,0 bis 12 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 84 bis 123 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Llama 3.3 70B Q4_K_M | Läuft gut | 9,0 bis 12 Token/s | 45,5 von 192,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 40 bis 59 Token/s | 79,0 von 192,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 21 bis 28 Token/s | 20,7 von 192,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 30 bis 45 Token/s | 110,8 von 192,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 22 bis 30 Token/s | 20,0 von 192,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 17,9 von 192,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 18,2 von 192,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 84 bis 123 Token/s | 65,0 von 192,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 27 bis 37 Token/s | 16,1 von 192,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 43 bis 59 Token/s | 10,7 von 192,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 46 bis 64 Token/s | 9,9 von 192,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 53 bis 74 Token/s | 8,3 von 192,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 134 bis 197 Token/s | 23,0 von 192,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 132 bis 194 Token/s | 23,5 von 192,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 119 bis 174 Token/s | 20,1 von 192,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 119 bis 174 Token/s | 20,1 von 192,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 98 bis 144 Token/s | 18,4 von 192,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 68 bis 94 Token/s | 6,9 von 192,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 70 bis 96 Token/s | 6,7 von 192,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 117 bis 172 Token/s | 12,8 von 192,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 76 bis 105 Token/s | 6,5 von 192,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 78 bis 107 Token/s | 6,4 von 192,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 84 bis 117 Token/s | 5,6 von 192,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 132 bis 182 Token/s | 4,0 von 192,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 146 bis 201 Token/s | 3,7 von 192,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 150 bis 207 Token/s | 4,0 von 192,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 224 bis 329 Token/s | 6,9 von 192,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 227 bis 313 Token/s | 2,8 von 192,0 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 192,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 192,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 192,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 105 bis 154 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 81 bis 119 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Llama 3.3 70B Q4_K_M | Läuft gut | 8,9 bis 12 Token/s | 49,5 von 192,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 40 bis 58 Token/s | 79,3 von 192,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 21,7 von 192,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 15 bis 22 Token/s | 146,9 von 192,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 21 bis 29 Token/s | 23,2 von 192,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 18,7 von 192,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 19,0 von 192,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 81 bis 119 Token/s | 65,4 von 192,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 26 bis 36 Token/s | 18,1 von 192,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 41 bis 56 Token/s | 12,7 von 192,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 44 bis 61 Token/s | 11,9 von 192,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 53 bis 73 Token/s | 8,5 von 192,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 130 bis 191 Token/s | 23,3 von 192,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 128 bis 188 Token/s | 23,7 von 192,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 105 bis 154 Token/s | 21,3 von 192,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 105 bis 154 Token/s | 21,3 von 192,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 96 bis 141 Token/s | 18,6 von 192,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 67 bis 93 Token/s | 7,3 von 192,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 69 bis 95 Token/s | 7,1 von 192,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 113 bis 166 Token/s | 13,1 von 192,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 71 bis 97 Token/s | 8,3 von 192,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 73 bis 100 Token/s | 8,0 von 192,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 84 bis 115 Token/s | 5,8 von 192,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 131 bis 181 Token/s | 4,1 von 192,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 141 bis 195 Token/s | 4,1 von 192,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 131 bis 181 Token/s | 5,8 von 192,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 146 bis 215 Token/s | 9,5 von 192,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 206 bis 285 Token/s | 3,6 von 192,0 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 192,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 192,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 192,0 GB |
Größtes Modell, das flüssig läuft
Llama 3.3 70BQ4_K_M · 9,0 bis 12 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 83 bis 121 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Llama 3.3 70B Q4_K_M | Läuft gut | 9,0 bis 12 Token/s | 46,9 von 192,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 40 bis 59 Token/s | 79,1 von 192,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 21,0 von 192,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 23 bis 34 Token/s | 122,8 von 192,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 21 bis 29 Token/s | 21,0 von 192,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 18,2 von 192,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 18,5 von 192,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 83 bis 121 Token/s | 65,1 von 192,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 27 bis 37 Token/s | 16,8 von 192,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 42 bis 58 Token/s | 11,3 von 192,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 46 bis 63 Token/s | 10,6 von 192,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 53 bis 73 Token/s | 8,4 von 192,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 133 bis 195 Token/s | 23,1 von 192,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 131 bis 192 Token/s | 23,5 von 192,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 114 bis 167 Token/s | 20,5 von 192,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 114 bis 167 Token/s | 20,5 von 192,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 97 bis 143 Token/s | 18,5 von 192,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 68 bis 94 Token/s | 7,0 von 192,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 69 bis 96 Token/s | 6,9 von 192,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 116 bis 170 Token/s | 12,9 von 192,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 74 bis 102 Token/s | 7,1 von 192,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 76 bis 105 Token/s | 6,9 von 192,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 84 bis 116 Token/s | 5,6 von 192,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 131 bis 181 Token/s | 4,0 von 192,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 144 bis 199 Token/s | 3,9 von 192,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 143 bis 197 Token/s | 4,6 von 192,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 190 bis 280 Token/s | 7,8 von 192,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 219 bis 303 Token/s | 3,1 von 192,0 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 192,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 192,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 192,0 GB |
Größtes Modell, das flüssig läuft
Llama 3.3 70BQ4_K_M · 8,6 bis 12 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 77 bis 114 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Llama 3.3 70B Q4_K_M | Läuft gut | 8,6 bis 12 Token/s | 54,9 von 192,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 39 bis 58 Token/s | 79,7 von 192,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 23,0 von 192,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 20 bis 27 Token/s | 27,5 von 192,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 19,9 von 192,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 20,1 von 192,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 77 bis 114 Token/s | 66,0 von 192,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 25 bis 35 Token/s | 20,8 von 192,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 38 bis 53 Token/s | 15,4 von 192,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 42 bis 57 Token/s | 14,6 von 192,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 53 bis 73 Token/s | 8,8 von 192,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 125 bis 183 Token/s | 23,7 von 192,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 123 bis 181 Token/s | 24,1 von 192,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 91 bis 133 Token/s | 23,0 von 192,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 91 bis 133 Token/s | 23,0 von 192,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 93 bis 137 Token/s | 19,0 von 192,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 66 bis 91 Token/s | 7,9 von 192,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 67 bis 93 Token/s | 7,7 von 192,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 109 bis 160 Token/s | 13,5 von 192,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 65 bis 89 Token/s | 10,8 von 192,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 67 bis 93 Token/s | 10,1 von 192,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 83 bis 114 Token/s | 6,0 von 192,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 130 bis 180 Token/s | 4,2 von 192,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 136 bis 188 Token/s | 4,7 von 192,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 112 bis 155 Token/s | 8,2 von 192,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 100 bis 147 Token/s | 13,0 von 192,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 184 bis 254 Token/s | 4,7 von 192,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 192,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 192,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 192,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 192,0 GB |
Größtes Modell, das flüssig läuft
Llama 3.3 70BQ4_K_M · 8,6 bis 12 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 77 bis 114 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Llama 3.3 70B Q4_K_M | Läuft gut | 8,6 bis 12 Token/s | 54,9 von 192,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 39 bis 58 Token/s | 79,7 von 192,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 23,0 von 192,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 20 bis 27 Token/s | 27,5 von 192,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 19,9 von 192,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 23 bis 32 Token/s | 20,1 von 192,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 77 bis 114 Token/s | 66,0 von 192,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 25 bis 35 Token/s | 20,8 von 192,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 38 bis 53 Token/s | 15,4 von 192,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 42 bis 57 Token/s | 14,6 von 192,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 53 bis 73 Token/s | 8,8 von 192,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 125 bis 183 Token/s | 23,7 von 192,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 123 bis 181 Token/s | 24,1 von 192,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 91 bis 133 Token/s | 23,0 von 192,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 91 bis 133 Token/s | 23,0 von 192,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 93 bis 137 Token/s | 19,0 von 192,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 66 bis 91 Token/s | 7,9 von 192,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 67 bis 93 Token/s | 7,7 von 192,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 109 bis 160 Token/s | 13,5 von 192,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 65 bis 89 Token/s | 10,8 von 192,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 67 bis 93 Token/s | 10,1 von 192,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 83 bis 114 Token/s | 6,0 von 192,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 130 bis 180 Token/s | 4,2 von 192,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 136 bis 188 Token/s | 4,7 von 192,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 112 bis 155 Token/s | 8,2 von 192,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 100 bis 147 Token/s | 13,0 von 192,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 184 bis 254 Token/s | 4,7 von 192,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 192,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 192,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 192,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 192,0 GB |
Gerätedaten
- Chip
- M5 Ultra, 64-Kern-GPU
- Arbeitsspeicher
- 256 GB
- Davon für Modelle nutzbar
- 192,0 GB
- Speicherbandbreite
- 1.200 GB/s
- Rechenschnittstelle
- Metal