Apple Mac Studio (2025), M3 Ultra mit 80-Kern-GPU, 512 GB
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 23 bis 34 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 84 bis 123 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 23 bis 34 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 22 bis 33 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 22 bis 33 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 23 bis 34 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 23 bis 34 Token/s | 250,1 von 384,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft gut | 11 bis 17 Token/s | 381,5 von 384,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 33 bis 49 Token/s | 79,0 von 384,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 24 Token/s | 20,7 von 384,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 23 bis 34 Token/s | 110,8 von 384,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 18 bis 25 Token/s | 20,0 von 384,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 20 bis 27 Token/s | 17,9 von 384,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 20 bis 27 Token/s | 18,2 von 384,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 70 bis 102 Token/s | 65,0 von 384,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 22 bis 31 Token/s | 16,1 von 384,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 36 bis 49 Token/s | 10,7 von 384,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 39 bis 54 Token/s | 9,9 von 384,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 45 bis 62 Token/s | 8,3 von 384,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 111 bis 163 Token/s | 23,0 von 384,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 108 bis 159 Token/s | 23,5 von 384,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 97 bis 142 Token/s | 20,1 von 384,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 97 bis 142 Token/s | 20,1 von 384,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 79 bis 117 Token/s | 18,4 von 384,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 57 bis 78 Token/s | 6,9 von 384,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 58 bis 80 Token/s | 6,7 von 384,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 97 bis 143 Token/s | 12,8 von 384,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 63 bis 87 Token/s | 6,5 von 384,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 65 bis 89 Token/s | 6,4 von 384,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 71 bis 98 Token/s | 5,6 von 384,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 109 bis 151 Token/s | 4,0 von 384,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 121 bis 167 Token/s | 3,7 von 384,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 124 bis 171 Token/s | 4,0 von 384,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 178 bis 262 Token/s | 6,9 von 384,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 188 bis 260 Token/s | 2,8 von 384,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 9,0 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,6 bis 10 Token/s | 45,5 von 384,0 GB |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 384,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 84 bis 123 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 397BQ4_K_M · 23 bis 33 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 23 bis 33 Token/s | 250,5 von 384,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 33 bis 48 Token/s | 79,3 von 384,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 21,7 von 384,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 11 bis 16 Token/s | 146,9 von 384,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 17 bis 24 Token/s | 23,2 von 384,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 18,7 von 384,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 19,0 von 384,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 67 bis 98 Token/s | 65,4 von 384,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 22 bis 30 Token/s | 18,1 von 384,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 34 bis 46 Token/s | 12,7 von 384,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 37 bis 50 Token/s | 11,9 von 384,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 61 Token/s | 8,5 von 384,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 106 bis 156 Token/s | 23,3 von 384,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 104 bis 153 Token/s | 23,7 von 384,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 84 bis 123 Token/s | 21,3 von 384,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 84 bis 123 Token/s | 21,3 von 384,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 77 bis 114 Token/s | 18,6 von 384,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 56 bis 77 Token/s | 7,3 von 384,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 57 bis 79 Token/s | 7,1 von 384,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 93 bis 137 Token/s | 13,1 von 384,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 58 bis 80 Token/s | 8,3 von 384,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 60 bis 82 Token/s | 8,0 von 384,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 70 bis 96 Token/s | 5,8 von 384,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 109 bis 150 Token/s | 4,1 von 384,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 117 bis 161 Token/s | 4,1 von 384,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 105 bis 146 Token/s | 5,8 von 384,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 110 bis 162 Token/s | 9,5 von 384,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 168 bis 232 Token/s | 3,6 von 384,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,8 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,4 bis 10 Token/s | 49,5 von 384,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 384,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 384,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 23 bis 34 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 23 bis 34 Token/s | 250,3 von 384,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 33 bis 48 Token/s | 79,1 von 384,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 24 Token/s | 21,0 von 384,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 17 bis 25 Token/s | 122,8 von 384,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 18 bis 25 Token/s | 21,0 von 384,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 20 bis 27 Token/s | 18,2 von 384,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 27 Token/s | 18,5 von 384,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 69 bis 101 Token/s | 65,1 von 384,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 22 bis 31 Token/s | 16,8 von 384,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 35 bis 48 Token/s | 11,3 von 384,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 38 bis 52 Token/s | 10,6 von 384,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 45 bis 61 Token/s | 8,4 von 384,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 109 bis 160 Token/s | 23,1 von 384,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 107 bis 157 Token/s | 23,5 von 384,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 92 bis 135 Token/s | 20,5 von 384,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 92 bis 135 Token/s | 20,5 von 384,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 79 bis 116 Token/s | 18,5 von 384,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 56 bis 78 Token/s | 7,0 von 384,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 58 bis 80 Token/s | 6,9 von 384,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 96 bis 141 Token/s | 12,9 von 384,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 61 bis 85 Token/s | 7,1 von 384,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 63 bis 87 Token/s | 6,9 von 384,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 70 bis 97 Token/s | 5,6 von 384,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 109 bis 151 Token/s | 4,0 von 384,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 120 bis 165 Token/s | 3,9 von 384,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 117 bis 162 Token/s | 4,6 von 384,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 148 bis 217 Token/s | 7,8 von 384,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 181 bis 250 Token/s | 3,1 von 384,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,9 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,5 bis 10 Token/s | 46,9 von 384,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 384,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 384,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 22 bis 33 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 22 bis 33 Token/s | 251,1 von 384,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 47 Token/s | 79,7 von 384,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 23,0 von 384,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 16 bis 23 Token/s | 27,5 von 384,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 19,9 von 384,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 20,1 von 384,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 63 bis 93 Token/s | 66,0 von 384,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 21 bis 29 Token/s | 20,8 von 384,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 31 bis 43 Token/s | 15,4 von 384,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 34 bis 47 Token/s | 14,6 von 384,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 61 Token/s | 8,8 von 384,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 101 bis 148 Token/s | 23,7 von 384,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 100 bis 146 Token/s | 24,1 von 384,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 71 bis 104 Token/s | 23,0 von 384,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 71 bis 104 Token/s | 23,0 von 384,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 75 bis 110 Token/s | 19,0 von 384,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 54 bis 75 Token/s | 7,9 von 384,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 56 bis 77 Token/s | 7,7 von 384,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 89 bis 131 Token/s | 13,5 von 384,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 52 bis 72 Token/s | 10,8 von 384,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 54 bis 75 Token/s | 10,1 von 384,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 69 bis 95 Token/s | 6,0 von 384,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 108 bis 149 Token/s | 4,2 von 384,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 111 bis 154 Token/s | 4,7 von 384,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 88 bis 121 Token/s | 8,2 von 384,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 73 bis 107 Token/s | 13,0 von 384,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 146 bis 202 Token/s | 4,7 von 384,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,5 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,2 bis 9,9 Token/s | 54,9 von 384,0 GB |
| Laguna S 2.1 Q4_K_M Läuft, aber mit rund 7,9 Token pro Sekunde spürbar langsam. Der Speicher für den Kontext ist geschätzt. | Eingeschränkt | 6,4 bis 9,4 Token/s | 195,1 von 384,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 384,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 384,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 22 bis 33 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 22 bis 33 Token/s | 251,1 von 384,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 32 bis 47 Token/s | 79,7 von 384,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 17 bis 23 Token/s | 23,0 von 384,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 16 bis 23 Token/s | 27,5 von 384,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 19,9 von 384,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 19 bis 26 Token/s | 20,1 von 384,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 63 bis 93 Token/s | 66,0 von 384,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 21 bis 29 Token/s | 20,8 von 384,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 31 bis 43 Token/s | 15,4 von 384,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 34 bis 47 Token/s | 14,6 von 384,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 44 bis 61 Token/s | 8,8 von 384,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 101 bis 148 Token/s | 23,7 von 384,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 100 bis 146 Token/s | 24,1 von 384,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 71 bis 104 Token/s | 23,0 von 384,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 71 bis 104 Token/s | 23,0 von 384,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 75 bis 110 Token/s | 19,0 von 384,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 54 bis 75 Token/s | 7,9 von 384,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 56 bis 77 Token/s | 7,7 von 384,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 89 bis 131 Token/s | 13,5 von 384,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 52 bis 72 Token/s | 10,8 von 384,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 54 bis 75 Token/s | 10,1 von 384,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 69 bis 95 Token/s | 6,0 von 384,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 108 bis 149 Token/s | 4,2 von 384,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 111 bis 154 Token/s | 4,7 von 384,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 88 bis 121 Token/s | 8,2 von 384,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 73 bis 107 Token/s | 13,0 von 384,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 146 bis 202 Token/s | 4,7 von 384,0 GB |
| Llama 3.3 70B Q4_K_M Läuft, aber mit rund 8,5 Token pro Sekunde spürbar langsam. | Eingeschränkt | 7,2 bis 9,9 Token/s | 54,9 von 384,0 GB |
| Laguna S 2.1 Q4_K_M Läuft, aber mit rund 7,9 Token pro Sekunde spürbar langsam. Der Speicher für den Kontext ist geschätzt. | Eingeschränkt | 6,4 bis 9,4 Token/s | 195,1 von 384,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 384,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 384,0 GB |
Gerätedaten
- Chip
- M3 Ultra, 80-Kern-GPU
- Arbeitsspeicher
- 512 GB
- Davon für Modelle nutzbar
- 384,0 GB
- Speicherbandbreite
- 819 GB/s
- Rechenschnittstelle
- Metal