Apple Mac Studio (2023), M2 Ultra mit 60-Kern-GPU, 192 GB
Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 33 bis 48 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 83 bis 121 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 32 bis 48 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 32 bis 46 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3.5 122B A10B flüssig, mit rund 32 bis 46 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Schnellstes Modell
gpt-oss 120BQ4_K_M · 69 bis 101 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 33 bis 48 Token/s | 79,0 von 144,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 20,7 von 144,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 23 bis 33 Token/s | 110,8 von 144,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 18 bis 25 Token/s | 20,0 von 144,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 17,9 von 144,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 18,2 von 144,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 65,0 von 144,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 22 bis 31 Token/s | 16,1 von 144,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 35 bis 48 Token/s | 10,7 von 144,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 38 bis 53 Token/s | 9,9 von 144,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 61 Token/s | 8,3 von 144,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 109 bis 160 Token/s | 23,0 von 144,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 107 bis 157 Token/s | 23,5 von 144,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 96 bis 141 Token/s | 20,1 von 144,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 96 bis 141 Token/s | 20,1 von 144,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 78 bis 115 Token/s | 18,4 von 144,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 56 bis 78 Token/s | 6,9 von 144,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 57 bis 79 Token/s | 6,7 von 144,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 96 bis 141 Token/s | 12,8 von 144,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 62 bis 86 Token/s | 6,5 von 144,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 64 bis 88 Token/s | 6,4 von 144,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 70 bis 96 Token/s | 5,6 von 144,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 108 bis 149 Token/s | 4,0 von 144,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 120 bis 165 Token/s | 3,7 von 144,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 122 bis 169 Token/s | 4,0 von 144,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 176 bis 258 Token/s | 6,9 von 144,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 186 bis 257 Token/s | 2,8 von 144,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,9 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,5 bis 10 Token/s | 45,5 von 144,0 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 144,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 144,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 144,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 83 bis 121 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 120BQ4_K_M · 66 bis 97 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 47 Token/s | 79,3 von 144,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 21,7 von 144,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 17 bis 24 Token/s | 23,2 von 144,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 18,7 von 144,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 19,0 von 144,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 66 bis 97 Token/s | 65,4 von 144,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 21 bis 30 Token/s | 18,1 von 144,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 33 bis 46 Token/s | 12,7 von 144,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 36 bis 50 Token/s | 11,9 von 144,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 60 Token/s | 8,5 von 144,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 105 bis 154 Token/s | 23,3 von 144,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 103 bis 151 Token/s | 23,7 von 144,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 83 bis 121 Token/s | 21,3 von 144,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 83 bis 121 Token/s | 21,3 von 144,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 76 bis 112 Token/s | 18,6 von 144,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 55 bis 76 Token/s | 7,3 von 144,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 56 bis 78 Token/s | 7,1 von 144,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 92 bis 135 Token/s | 13,1 von 144,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 57 bis 79 Token/s | 8,3 von 144,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 59 bis 81 Token/s | 8,0 von 144,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 69 bis 95 Token/s | 5,8 von 144,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 107 bis 148 Token/s | 4,1 von 144,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 115 bis 159 Token/s | 4,1 von 144,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 104 bis 143 Token/s | 5,8 von 144,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 108 bis 159 Token/s | 9,5 von 144,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 165 bis 228 Token/s | 3,6 von 144,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,7 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,3 bis 10 Token/s | 49,5 von 144,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 144,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 144,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 144,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 144,0 GB |
Schnellstes Modell
gpt-oss 120BQ4_K_M · 68 bis 100 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 48 Token/s | 79,1 von 144,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 21,0 von 144,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 17 bis 24 Token/s | 122,8 von 144,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 18 bis 24 Token/s | 21,0 von 144,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 18,2 von 144,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 18,5 von 144,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 68 bis 100 Token/s | 65,1 von 144,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 22 bis 30 Token/s | 16,8 von 144,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 34 bis 48 Token/s | 11,3 von 144,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 38 bis 52 Token/s | 10,6 von 144,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 61 Token/s | 8,4 von 144,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 108 bis 158 Token/s | 23,1 von 144,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 105 bis 155 Token/s | 23,5 von 144,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 91 bis 133 Token/s | 20,5 von 144,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 91 bis 133 Token/s | 20,5 von 144,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 78 bis 114 Token/s | 18,5 von 144,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 56 bis 77 Token/s | 7,0 von 144,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 57 bis 79 Token/s | 6,9 von 144,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 95 bis 139 Token/s | 12,9 von 144,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 60 bis 84 Token/s | 7,1 von 144,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 62 bis 86 Token/s | 6,9 von 144,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 70 bis 96 Token/s | 5,6 von 144,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 108 bis 149 Token/s | 4,0 von 144,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 118 bis 163 Token/s | 3,9 von 144,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 116 bis 160 Token/s | 4,6 von 144,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 145 bis 213 Token/s | 7,8 von 144,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 179 bis 247 Token/s | 3,1 von 144,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,8 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,4 bis 10 Token/s | 46,9 von 144,0 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 144,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 144,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 144,0 GB |
Schnellstes Modell
gpt-oss 120BQ4_K_M · 63 bis 92 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 46 Token/s | 79,7 von 144,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 16 bis 23 Token/s | 23,0 von 144,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 27,5 von 144,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 19,9 von 144,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 20,1 von 144,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 63 bis 92 Token/s | 66,0 von 144,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 20,8 von 144,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 31 bis 43 Token/s | 15,4 von 144,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 33 bis 46 Token/s | 14,6 von 144,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 43 bis 60 Token/s | 8,8 von 144,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 100 bis 146 Token/s | 23,7 von 144,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 98 bis 144 Token/s | 24,1 von 144,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 70 bis 103 Token/s | 23,0 von 144,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 70 bis 103 Token/s | 23,0 von 144,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 74 bis 108 Token/s | 19,0 von 144,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 54 bis 74 Token/s | 7,9 von 144,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 55 bis 76 Token/s | 7,7 von 144,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 88 bis 129 Token/s | 13,5 von 144,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 51 bis 71 Token/s | 10,8 von 144,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 54 bis 74 Token/s | 10,1 von 144,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 68 bis 94 Token/s | 6,0 von 144,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 106 bis 147 Token/s | 4,2 von 144,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 110 bis 152 Token/s | 4,7 von 144,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 86 bis 119 Token/s | 8,2 von 144,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 71 bis 105 Token/s | 13,0 von 144,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 144 bis 199 Token/s | 4,7 von 144,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,4 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,1 bis 9,8 Token/s | 54,9 von 144,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 144,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 144,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 144,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 144,0 GB |
Schnellstes Modell
gpt-oss 120BQ4_K_M · 63 bis 92 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run gpt-oss:120bModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 46 Token/s | 79,7 von 144,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 16 bis 23 Token/s | 23,0 von 144,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 16 bis 22 Token/s | 27,5 von 144,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 19,9 von 144,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 20,1 von 144,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 63 bis 92 Token/s | 66,0 von 144,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 20 bis 28 Token/s | 20,8 von 144,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 31 bis 43 Token/s | 15,4 von 144,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 33 bis 46 Token/s | 14,6 von 144,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 43 bis 60 Token/s | 8,8 von 144,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 100 bis 146 Token/s | 23,7 von 144,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 98 bis 144 Token/s | 24,1 von 144,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 70 bis 103 Token/s | 23,0 von 144,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 70 bis 103 Token/s | 23,0 von 144,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 74 bis 108 Token/s | 19,0 von 144,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 54 bis 74 Token/s | 7,9 von 144,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 55 bis 76 Token/s | 7,7 von 144,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 88 bis 129 Token/s | 13,5 von 144,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 51 bis 71 Token/s | 10,8 von 144,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 54 bis 74 Token/s | 10,1 von 144,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 68 bis 94 Token/s | 6,0 von 144,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 106 bis 147 Token/s | 4,2 von 144,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 110 bis 152 Token/s | 4,7 von 144,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 86 bis 119 Token/s | 8,2 von 144,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 71 bis 105 Token/s | 13,0 von 144,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 144 bis 199 Token/s | 4,7 von 144,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,4 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,1 bis 9,8 Token/s | 54,9 von 144,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 144,0 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 144,0 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 144,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 144,0 GB |
Gerätedaten
- Chip
- M2 Ultra, 60-Kern-GPU
- Arbeitsspeicher
- 192 GB
- Davon für Modelle nutzbar
- 144,0 GB
- Speicherbandbreite
- 800 GB/s
- Rechenschnittstelle
- Metal