ASUS ROG Strix SCAR 18 (2026), GeForce RTX 5090 Laptop GPU, 64 GB
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 29 bis 36 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Qwen3-Coder 30B A3B flüssig, mit rund 129 bis 194 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 29 bis 36 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 28 bis 34 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 31B flüssig, mit rund 28 bis 34 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 29 bis 36 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 173 bis 260 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 29 bis 36 Token/s * | 20,7 von 23,2 GB |
| Granite 4.2 30B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 31 bis 38 Token/s * | 20,0 von 23,2 GB |
| Qwen3.8 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 34 bis 42 Token/s * | 17,9 von 23,2 GB |
| Qwen3.6 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 34 bis 41 Token/s * | 18,2 von 23,2 GB |
| Mistral Small 3.2 24B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 39 bis 47 Token/s * | 16,1 von 23,2 GB |
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 61 bis 74 Token/s * | 10,7 von 23,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 66 bis 81 Token/s * | 9,9 von 23,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 77 bis 94 Token/s * | 8,3 von 23,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 173 bis 260 Token/s * | 23,0 von 23,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 151 bis 227 Token/s * | 20,1 von 23,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 151 bis 227 Token/s * | 20,1 von 23,2 GB |
| Gemma 4 26B A4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 123 bis 185 Token/s * | 18,4 von 23,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 97 bis 119 Token/s * | 6,9 von 23,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 99 bis 121 Token/s * | 6,7 von 23,2 GB |
| gpt-oss 20B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 153 bis 229 Token/s * | 12,8 von 23,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 107 bis 131 Token/s * | 6,5 von 23,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 110 bis 134 Token/s * | 6,4 von 23,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 122 bis 149 Token/s * | 5,6 von 23,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 183 bis 224 Token/s * | 4,0 von 23,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 204 bis 249 Token/s * | 3,7 von 23,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 205 bis 251 Token/s * | 4,0 von 23,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 274 bis 411 Token/s * | 6,9 von 23,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 316 bis 386 Token/s * | 2,8 von 23,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,0 bis 3,1 Token/s * | 45,5 von 81,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,0 bis 15 Token/s * | 79,0 von 81,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 24 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 12 bis 36 Token/s * | 65,0 von 81,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 194 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 97 bis 290 Token/s * | 23,5 von 81,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 81,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 81,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 81,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 81,2 GB |
Empfehlung für den Anwendungsfall „Programmieren“
Qwen3-Coder 30B A3BQ4_K_M · 129 bis 194 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 20BQ4_K_M · 146 bis 219 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 29 bis 35 Token/s * | 21,7 von 23,2 GB |
| Granite 4.2 30B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 29 bis 35 Token/s * | 23,2 von 23,2 GB |
| Qwen3.8 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 33 bis 41 Token/s * | 18,7 von 23,2 GB |
| Qwen3.6 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 33 bis 40 Token/s * | 19,0 von 23,2 GB |
| Mistral Small 3.2 24B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 36 bis 45 Token/s * | 18,1 von 23,2 GB |
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 56 bis 68 Token/s * | 12,7 von 23,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 60 bis 73 Token/s * | 11,9 von 23,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 76 bis 93 Token/s * | 8,5 von 23,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 129 bis 194 Token/s * | 21,3 von 23,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 129 bis 194 Token/s * | 21,3 von 23,2 GB |
| Gemma 4 26B A4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 120 bis 180 Token/s * | 18,6 von 23,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 7,3 von 23,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 7,1 von 23,2 GB |
| gpt-oss 20B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 146 bis 219 Token/s * | 13,1 von 23,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 93 bis 114 Token/s * | 8,3 von 23,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 97 bis 118 Token/s * | 8,0 von 23,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 120 bis 146 Token/s * | 5,8 von 23,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 181 bis 221 Token/s * | 4,1 von 23,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 191 bis 234 Token/s * | 4,1 von 23,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 159 bis 195 Token/s * | 5,8 von 23,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 164 bis 246 Token/s * | 9,5 von 23,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 262 bis 321 Token/s * | 3,6 von 23,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 0,8 bis 2,5 Token/s * | 49,5 von 81,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,8 bis 15 Token/s * | 79,3 von 81,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 65,4 von 81,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 199 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 99 bis 298 Token/s * | 23,3 von 81,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 172 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 86 bis 258 Token/s * | 23,7 von 81,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 81,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 81,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 81,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 81,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 29 bis 36 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
Ornith 1.5 35B A3BQ4_K_M · 170 bis 256 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 29 bis 36 Token/s * | 21,0 von 23,2 GB |
| Granite 4.2 30B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 30 bis 37 Token/s * | 21,0 von 23,2 GB |
| Qwen3.8 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 34 bis 41 Token/s * | 18,2 von 23,2 GB |
| Qwen3.6 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 33 bis 41 Token/s * | 18,5 von 23,2 GB |
| Mistral Small 3.2 24B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 38 bis 46 Token/s * | 16,8 von 23,2 GB |
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 59 bis 72 Token/s * | 11,3 von 23,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 64 bis 78 Token/s * | 10,6 von 23,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 77 bis 94 Token/s * | 8,4 von 23,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 170 bis 256 Token/s * | 23,1 von 23,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 143 bis 214 Token/s * | 20,5 von 23,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 143 bis 214 Token/s * | 20,5 von 23,2 GB |
| Gemma 4 26B A4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 122 bis 183 Token/s * | 18,5 von 23,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 7,0 von 23,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 98 bis 120 Token/s * | 6,9 von 23,2 GB |
| gpt-oss 20B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 150 bis 226 Token/s * | 12,9 von 23,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 102 bis 125 Token/s * | 7,1 von 23,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 105 bis 128 Token/s * | 6,9 von 23,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 121 bis 148 Token/s * | 5,6 von 23,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 182 bis 223 Token/s * | 4,0 von 23,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 199 bis 244 Token/s * | 3,9 von 23,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 187 bis 229 Token/s * | 4,6 von 23,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 224 bis 336 Token/s * | 7,8 von 23,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 296 bis 361 Token/s * | 3,1 von 23,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,0 bis 2,9 Token/s * | 46,9 von 81,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,9 bis 15 Token/s * | 79,1 von 81,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 23 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 12 bis 35 Token/s * | 65,1 von 81,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 186 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 93 bis 279 Token/s * | 23,5 von 81,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 81,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 81,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 81,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 81,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 28 bis 34 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 20BQ4_K_M · 139 bis 208 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 28 bis 34 Token/s * | 23,0 von 23,2 GB |
| Qwen3.8 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 32 bis 40 Token/s * | 19,9 von 23,2 GB |
| Qwen3.6 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 32 bis 39 Token/s * | 20,1 von 23,2 GB |
| Mistral Small 3.2 24B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 34 bis 41 Token/s * | 20,8 von 23,2 GB |
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 50 bis 61 Token/s * | 15,4 von 23,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 53 bis 65 Token/s * | 14,6 von 23,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 75 bis 92 Token/s * | 8,8 von 23,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 108 bis 162 Token/s * | 23,0 von 23,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 108 bis 162 Token/s * | 23,0 von 23,2 GB |
| Gemma 4 26B A4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 115 bis 173 Token/s * | 19,0 von 23,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 7,9 von 23,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 92 bis 113 Token/s * | 7,7 von 23,2 GB |
| gpt-oss 20B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 139 bis 208 Token/s * | 13,5 von 23,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 79 bis 97 Token/s * | 10,8 von 23,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 102 Token/s * | 10,1 von 23,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 117 bis 143 Token/s * | 6,0 von 23,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 179 bis 218 Token/s * | 4,2 von 23,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 177 bis 217 Token/s * | 4,7 von 23,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 123 bis 150 Token/s * | 8,2 von 23,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 107 bis 160 Token/s * | 13,0 von 23,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 214 bis 262 Token/s * | 4,7 von 23,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 0,7 bis 2,0 Token/s * | 54,9 von 81,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,7 bis 14 Token/s * | 79,7 von 81,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,8 bis 11 Token/s * | 27,5 von 81,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 66,0 von 81,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 166 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 83 bis 249 Token/s * | 23,7 von 81,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 148 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 74 bis 221 Token/s * | 24,1 von 81,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 81,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 81,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 81,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 81,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 31BQ4_K_M · 28 bis 34 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-31B-it-GGUF:Q4_K_MSchnellstes Modell
gpt-oss 20BQ4_K_M · 139 bis 208 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 31B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 28 bis 34 Token/s * | 23,0 von 23,2 GB |
| Qwen3.8 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 32 bis 40 Token/s * | 19,9 von 23,2 GB |
| Qwen3.6 27B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 32 bis 39 Token/s * | 20,1 von 23,2 GB |
| Mistral Small 3.2 24B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 34 bis 41 Token/s * | 20,8 von 23,2 GB |
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 50 bis 61 Token/s * | 15,4 von 23,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 53 bis 65 Token/s * | 14,6 von 23,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 75 bis 92 Token/s * | 8,8 von 23,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 108 bis 162 Token/s * | 23,0 von 23,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 108 bis 162 Token/s * | 23,0 von 23,2 GB |
| Gemma 4 26B A4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 115 bis 173 Token/s * | 19,0 von 23,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 7,9 von 23,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 92 bis 113 Token/s * | 7,7 von 23,2 GB |
| gpt-oss 20B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 139 bis 208 Token/s * | 13,5 von 23,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 79 bis 97 Token/s * | 10,8 von 23,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 102 Token/s * | 10,1 von 23,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 117 bis 143 Token/s * | 6,0 von 23,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 179 bis 218 Token/s * | 4,2 von 23,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 177 bis 217 Token/s * | 4,7 von 23,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 123 bis 150 Token/s * | 8,2 von 23,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 107 bis 160 Token/s * | 13,0 von 23,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 214 bis 262 Token/s * | 4,7 von 23,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 0,7 bis 2,0 Token/s * | 54,9 von 81,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,7 bis 14 Token/s * | 79,7 von 81,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,8 bis 11 Token/s * | 27,5 von 81,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 66,0 von 81,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 166 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 83 bis 249 Token/s * | 23,7 von 81,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 148 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 74 bis 221 Token/s * | 24,1 von 81,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 81,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 81,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 81,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 81,2 GB |
Gerätedaten
- Grafikkarte
- GeForce RTX 5090 Laptop GPU
- Grafikspeicher
- 24 GB
- Prozessor
- Intel Core Ultra 9 290HX Plus
- Arbeitsspeicher
- 64 GB
- Davon für Modelle nutzbar
- 23,2 GB
- Speicherbandbreite
- 896 GB/s
- Rechenschnittstelle
- CUDA