ASUS ExpertCenter Pro ET900N G3 (2026), NVIDIA GB300 mit Blackwell-Ultra-GPU, 748 GB
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 77 bis 115 Token pro Sekunde.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 319 bis 478 Token pro Sekunde.
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 76 bis 115 Token pro Sekunde.
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 76 bis 114 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Ja. Auf diesem Gerät läuft Ornith 1.5 397B flüssig, mit rund 76 bis 114 Token pro Sekunde.
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 77 bis 115 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 77 bis 115 Token/s | 250,1 von 252,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft gut | 56 bis 69 Token/s | 45,5 von 252,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 111 bis 167 Token/s | 79,0 von 252,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 127 bis 156 Token/s | 20,7 von 252,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 115 bis 173 Token/s | 110,8 von 252,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 134 bis 164 Token/s | 20,0 von 252,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 145 bis 178 Token/s | 17,9 von 252,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 145 bis 178 Token/s | 18,2 von 252,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 223 bis 334 Token/s | 65,0 von 252,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 167 bis 204 Token/s | 16,1 von 252,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 264 bis 323 Token/s | 10,7 von 252,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 288 bis 352 Token/s | 9,9 von 252,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 331 bis 405 Token/s | 8,3 von 252,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 372 bis 557 Token/s | 23,0 von 252,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 369 bis 554 Token/s | 23,5 von 252,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 334 bis 501 Token/s | 20,1 von 252,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 334 bis 501 Token/s | 20,1 von 252,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 285 bis 427 Token/s | 18,4 von 252,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 423 bis 517 Token/s | 6,9 von 252,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 433 bis 529 Token/s | 6,7 von 252,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 314 bis 471 Token/s | 12,8 von 252,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 470 bis 574 Token/s | 6,5 von 252,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 481 bis 587 Token/s | 6,4 von 252,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 525 bis 641 Token/s | 5,6 von 252,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 814 bis 995 Token/s | 4,0 von 252,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 903 bis 1.103 Token/s | 3,7 von 252,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 925 bis 1.131 Token/s | 4,0 von 252,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 693 bis 1.040 Token/s | 6,9 von 252,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 1.403 bis 1.715 Token/s | 2,8 von 252,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 252,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 252,0 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 319 bis 478 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 397BQ4_K_M · 76 bis 114 Token/s
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 76 bis 114 Token/s | 250,5 von 252,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft gut | 55 bis 67 Token/s | 49,5 von 252,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 111 bis 166 Token/s | 79,3 von 252,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 126 bis 154 Token/s | 21,7 von 252,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 77 bis 116 Token/s | 146,9 von 252,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 129 bis 157 Token/s | 23,2 von 252,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 144 bis 176 Token/s | 18,7 von 252,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 144 bis 176 Token/s | 19,0 von 252,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 220 bis 330 Token/s | 65,4 von 252,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 161 bis 197 Token/s | 18,1 von 252,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 251 bis 307 Token/s | 12,7 von 252,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 273 bis 333 Token/s | 11,9 von 252,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 329 bis 403 Token/s | 8,5 von 252,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 367 bis 551 Token/s | 23,3 von 252,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 365 bis 548 Token/s | 23,7 von 252,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 319 bis 478 Token/s | 21,3 von 252,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 319 bis 478 Token/s | 21,3 von 252,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 283 bis 424 Token/s | 18,6 von 252,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 415 bis 507 Token/s | 7,3 von 252,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 425 bis 520 Token/s | 7,1 von 252,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 311 bis 466 Token/s | 13,1 von 252,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 434 bis 530 Token/s | 8,3 von 252,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 447 bis 546 Token/s | 8,0 von 252,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 519 bis 635 Token/s | 5,8 von 252,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 809 bis 989 Token/s | 4,1 von 252,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 872 bis 1.065 Token/s | 4,1 von 252,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 795 bis 971 Token/s | 5,8 von 252,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 571 bis 857 Token/s | 9,5 von 252,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 1.260 bis 1.539 Token/s | 3,6 von 252,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 252,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 252,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 76 bis 115 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 76 bis 115 Token/s | 250,3 von 252,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft gut | 56 bis 68 Token/s | 46,9 von 252,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 111 bis 167 Token/s | 79,1 von 252,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 127 bis 155 Token/s | 21,0 von 252,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 99 bis 148 Token/s | 122,8 von 252,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 132 bis 162 Token/s | 21,0 von 252,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 145 bis 177 Token/s | 18,2 von 252,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 145 bis 177 Token/s | 18,5 von 252,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 222 bis 333 Token/s | 65,1 von 252,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 165 bis 202 Token/s | 16,8 von 252,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 260 bis 317 Token/s | 11,3 von 252,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 283 bis 346 Token/s | 10,6 von 252,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 331 bis 404 Token/s | 8,4 von 252,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 370 bis 555 Token/s | 23,1 von 252,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 368 bis 552 Token/s | 23,5 von 252,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 329 bis 493 Token/s | 20,5 von 252,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 329 bis 493 Token/s | 20,5 von 252,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 284 bis 426 Token/s | 18,5 von 252,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 420 bis 513 Token/s | 7,0 von 252,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 430 bis 526 Token/s | 6,9 von 252,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 313 bis 470 Token/s | 12,9 von 252,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 457 bis 559 Token/s | 7,1 von 252,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 469 bis 573 Token/s | 6,9 von 252,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 523 bis 639 Token/s | 5,6 von 252,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 812 bis 993 Token/s | 4,0 von 252,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 892 bis 1.090 Token/s | 3,9 von 252,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 877 bis 1.072 Token/s | 4,6 von 252,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 647 bis 971 Token/s | 7,8 von 252,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 1.352 bis 1.652 Token/s | 3,1 von 252,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 252,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 252,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 76 bis 114 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 76 bis 114 Token/s | 251,1 von 252,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft gut | 53 bis 65 Token/s | 54,9 von 252,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 110 bis 165 Token/s | 79,7 von 252,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 124 bis 151 Token/s | 23,0 von 252,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 54 bis 80 Token/s | 195,1 von 252,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 122 bis 149 Token/s | 27,5 von 252,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 141 bis 173 Token/s | 19,9 von 252,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 141 bis 173 Token/s | 20,1 von 252,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 217 bis 325 Token/s | 66,0 von 252,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 155 bis 189 Token/s | 20,8 von 252,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 236 bis 288 Token/s | 15,4 von 252,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 255 bis 311 Token/s | 14,6 von 252,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 327 bis 399 Token/s | 8,8 von 252,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 361 bis 542 Token/s | 23,7 von 252,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 360 bis 540 Token/s | 24,1 von 252,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 301 bis 451 Token/s | 23,0 von 252,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 301 bis 451 Token/s | 23,0 von 252,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 279 bis 419 Token/s | 19,0 von 252,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 405 bis 495 Token/s | 7,9 von 252,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 416 bis 509 Token/s | 7,7 von 252,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 306 bis 459 Token/s | 13,5 von 252,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 393 bis 481 Token/s | 10,8 von 252,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 409 bis 499 Token/s | 10,1 von 252,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 512 bis 626 Token/s | 6,0 von 252,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 803 bis 981 Token/s | 4,2 von 252,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 834 bis 1.019 Token/s | 4,7 von 252,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 669 bis 818 Token/s | 8,2 von 252,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 463 bis 694 Token/s | 13,0 von 252,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 1.109 bis 1.355 Token/s | 4,7 von 252,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 252,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 252,0 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 397BQ4_K_M · 76 bis 114 Token/s
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-397B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 397B Q4_K_M | Läuft gut | 76 bis 114 Token/s | 251,1 von 252,0 GB |
| Llama 3.3 70B Q4_K_M | Läuft gut | 53 bis 65 Token/s | 54,9 von 252,0 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft gut | 110 bis 165 Token/s | 79,7 von 252,0 GB |
| Gemma 4 31B Q4_K_M | Läuft gut | 124 bis 151 Token/s | 23,0 von 252,0 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 54 bis 80 Token/s | 195,1 von 252,0 GB |
| Granite 4.2 30B Q4_K_M | Läuft gut | 122 bis 149 Token/s | 27,5 von 252,0 GB |
| Qwen3.8 27B Q4_K_M | Läuft gut | 141 bis 173 Token/s | 19,9 von 252,0 GB |
| Qwen3.6 27B Q4_K_M | Läuft gut | 141 bis 173 Token/s | 20,1 von 252,0 GB |
| gpt-oss 120B Q4_K_M | Läuft gut | 217 bis 325 Token/s | 66,0 von 252,0 GB |
| Mistral Small 3.2 24B Q4_K_M | Läuft gut | 155 bis 189 Token/s | 20,8 von 252,0 GB |
| Qwen3 14B Q4_K_M | Läuft gut | 236 bis 288 Token/s | 15,4 von 252,0 GB |
| Ministral 3 14B Q4_K_M | Läuft gut | 255 bis 311 Token/s | 14,6 von 252,0 GB |
| Gemma 4 12B Q4_0 | Läuft gut | 327 bis 399 Token/s | 8,8 von 252,0 GB |
| Ornith 1.5 35B A3B Q4_K_M | Läuft gut | 361 bis 542 Token/s | 23,7 von 252,0 GB |
| Qwen3.6 35B A3B Q4_K_M | Läuft gut | 360 bis 540 Token/s | 24,1 von 252,0 GB |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft gut | 301 bis 451 Token/s | 23,0 von 252,0 GB |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft gut | 301 bis 451 Token/s | 23,0 von 252,0 GB |
| Gemma 4 26B A4B Q4_K_M | Läuft gut | 279 bis 419 Token/s | 19,0 von 252,0 GB |
| Ornith 1.5 9B Q4_K_M | Läuft gut | 405 bis 495 Token/s | 7,9 von 252,0 GB |
| Qwen3.5 9B Q4_K_M | Läuft gut | 416 bis 509 Token/s | 7,7 von 252,0 GB |
| gpt-oss 20B Q4_K_M | Läuft gut | 306 bis 459 Token/s | 13,5 von 252,0 GB |
| Qwen3 8B Q4_K_M | Läuft gut | 393 bis 481 Token/s | 10,8 von 252,0 GB |
| Llama 3.1 8B Q4_K_M | Läuft gut | 409 bis 499 Token/s | 10,1 von 252,0 GB |
| Gemma 4 E4B Q4_0 | Läuft gut | 512 bis 626 Token/s | 6,0 von 252,0 GB |
| Gemma 4 E2B Q4_K_M | Läuft gut | 803 bis 981 Token/s | 4,2 von 252,0 GB |
| Qwen3.5 4B Q4_K_M | Läuft gut | 834 bis 1.019 Token/s | 4,7 von 252,0 GB |
| Qwen3 4B Q4_K_M | Läuft gut | 669 bis 818 Token/s | 8,2 von 252,0 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 463 bis 694 Token/s | 13,0 von 252,0 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft gut | 1.109 bis 1.355 Token/s | 4,7 von 252,0 GB |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 252,0 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 252,0 GB |
Gerätedaten
- Chip
- NVIDIA GB300, Blackwell-Ultra-GPU
- Arbeitsspeicher
- 748 GB
- Davon für Modelle nutzbar
- 252,0 GB
- Speicherbandbreite
- 7.100 GB/s
- Rechenschnittstelle
- CUDA