ASUS TUF Gaming F16 (2025), GeForce RTX 5050 Laptop GPU, 8 GB
Ja. Auf diesem Gerät läuft Ornith 1.5 9B flüssig, mit rund 45 bis 55 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Qwen3.5 9B flüssig, mit rund 44 bis 54 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Ornith 1.5 9B flüssig, mit rund 44 bis 54 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 E4B flüssig, mit rund 54 bis 66 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 E4B flüssig, mit rund 54 bis 66 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Größtes Modell, das flüssig läuft
Ornith 1.5 9BQ4_K_M · 45 bis 55 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 142 bis 213 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 45 bis 55 Token/s * | 6,9 von 7,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 46 bis 56 Token/s * | 6,7 von 7,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 49 bis 60 Token/s * | 6,5 von 7,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 50 bis 62 Token/s * | 6,4 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 56 bis 69 Token/s * | 5,6 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 84 bis 103 Token/s * | 4,0 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 93 bis 114 Token/s * | 3,7 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 4,0 von 7,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 142 bis 213 Token/s * | 6,9 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 145 bis 177 Token/s * | 2,8 von 7,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 8,3 von 9,2 GB |
| Ministral 3 14B Q4_K_M | Läuft nicht | 9,9 von 9,2 GB | |
| Qwen3 14B Q4_K_M | Läuft nicht | 10,7 von 9,2 GB | |
| gpt-oss 20B Q4_K_M | Läuft nicht | 12,8 von 9,2 GB | |
| Mistral Small 3.2 24B Q4_K_M | Läuft nicht | 16,1 von 9,2 GB | |
| Qwen3.8 27B Q4_K_M | Läuft nicht | 17,9 von 9,2 GB | |
| Qwen3.6 27B Q4_K_M | Läuft nicht | 18,2 von 9,2 GB | |
| Gemma 4 26B A4B Q4_K_M | Läuft nicht | 18,4 von 9,2 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 20,0 von 9,2 GB | |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft nicht | 20,1 von 9,2 GB | |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft nicht | 20,1 von 9,2 GB | |
| Gemma 4 31B Q4_K_M | Läuft nicht | 20,7 von 9,2 GB | |
| Ornith 1.5 35B A3B Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 23,5 von 9,2 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 45,5 von 9,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,0 von 9,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 9,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 9,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 9,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 9,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 9,2 GB |
Größtes Modell, das flüssig läuft
Qwen3.5 9BQ4_K_M · 44 bis 54 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3.5-9B-GGUF:Q4_K_MSchnellstes Modell
Gemma 4 E2BQ4_K_M · 83 bis 101 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 44 bis 54 Token/s * | 7,1 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 55 bis 67 Token/s * | 5,8 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 101 Token/s * | 4,1 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 87 bis 107 Token/s * | 4,1 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 72 bis 88 Token/s * | 5,8 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 119 bis 145 Token/s * | 3,6 von 7,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 30 Token/s * | 8,5 von 9,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 44 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 22 bis 66 Token/s * | 7,3 von 9,2 GB |
| Qwen3 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 8,3 von 9,2 GB |
| Llama 3.1 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 42 Token/s * | 8,0 von 9,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 9,5 von 9,2 GB | |
| Ministral 3 14B Q4_K_M | Läuft nicht | 11,9 von 9,2 GB | |
| Qwen3 14B Q4_K_M | Läuft nicht | 12,7 von 9,2 GB | |
| gpt-oss 20B Q4_K_M | Läuft nicht | 13,1 von 9,2 GB | |
| Mistral Small 3.2 24B Q4_K_M | Läuft nicht | 18,1 von 9,2 GB | |
| Gemma 4 26B A4B Q4_K_M | Läuft nicht | 18,6 von 9,2 GB | |
| Qwen3.8 27B Q4_K_M | Läuft nicht | 18,7 von 9,2 GB | |
| Qwen3.6 27B Q4_K_M | Läuft nicht | 19,0 von 9,2 GB | |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft nicht | 21,3 von 9,2 GB | |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft nicht | 21,3 von 9,2 GB | |
| Gemma 4 31B Q4_K_M | Läuft nicht | 21,7 von 9,2 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 23,2 von 9,2 GB | |
| Ornith 1.5 35B A3B Q4_K_M | Läuft nicht | 23,3 von 9,2 GB | |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 23,7 von 9,2 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 49,5 von 9,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 9,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 9,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 9,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 9,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 9,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 9,2 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 9BQ4_K_M · 44 bis 54 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_MSchnellstes Modell
Gemma 4 E2BQ4_K_M · 84 bis 102 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 44 bis 54 Token/s * | 7,0 von 7,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 45 bis 55 Token/s * | 6,9 von 7,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 47 bis 57 Token/s * | 7,1 von 7,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 48 bis 59 Token/s * | 6,9 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 56 bis 68 Token/s * | 5,6 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 84 bis 102 Token/s * | 4,0 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 91 bis 112 Token/s * | 3,9 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 85 bis 104 Token/s * | 4,6 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 135 bis 165 Token/s * | 3,1 von 7,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 32 Token/s * | 8,4 von 9,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 95 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 48 bis 143 Token/s * | 7,8 von 9,2 GB |
| Ministral 3 14B Q4_K_M | Läuft nicht | 10,6 von 9,2 GB | |
| Qwen3 14B Q4_K_M | Läuft nicht | 11,3 von 9,2 GB | |
| gpt-oss 20B Q4_K_M | Läuft nicht | 12,9 von 9,2 GB | |
| Mistral Small 3.2 24B Q4_K_M | Läuft nicht | 16,8 von 9,2 GB | |
| Qwen3.8 27B Q4_K_M | Läuft nicht | 18,2 von 9,2 GB | |
| Gemma 4 26B A4B Q4_K_M | Läuft nicht | 18,5 von 9,2 GB | |
| Qwen3.6 27B Q4_K_M | Läuft nicht | 18,5 von 9,2 GB | |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft nicht | 20,5 von 9,2 GB | |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft nicht | 20,5 von 9,2 GB | |
| Gemma 4 31B Q4_K_M | Läuft nicht | 21,0 von 9,2 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 21,0 von 9,2 GB | |
| Ornith 1.5 35B A3B Q4_K_M | Läuft nicht | 23,1 von 9,2 GB | |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 23,5 von 9,2 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 46,9 von 9,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,1 von 9,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 9,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 9,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 9,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 9,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 9,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 E4BQ4_0 · 54 bis 66 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Schnellstes Modell
Gemma 4 E2BQ4_K_M · 82 bis 100 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 54 bis 66 Token/s * | 6,0 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 82 bis 100 Token/s * | 4,2 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 98 Token/s * | 4,7 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 4,7 von 7,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,1 bis 27 Token/s * | 8,8 von 9,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 7,9 von 9,2 GB |
| Qwen3.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 7,7 von 9,2 GB |
| Qwen3 4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 8,2 von 9,2 GB |
| Llama 3.1 8B Q4_K_M | Läuft nicht | 10,1 von 9,2 GB | |
| Qwen3 8B Q4_K_M | Läuft nicht | 10,8 von 9,2 GB | |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 13,0 von 9,2 GB | |
| gpt-oss 20B Q4_K_M | Läuft nicht | 13,5 von 9,2 GB | |
| Ministral 3 14B Q4_K_M | Läuft nicht | 14,6 von 9,2 GB | |
| Qwen3 14B Q4_K_M | Läuft nicht | 15,4 von 9,2 GB | |
| Gemma 4 26B A4B Q4_K_M | Läuft nicht | 19,0 von 9,2 GB | |
| Qwen3.8 27B Q4_K_M | Läuft nicht | 19,9 von 9,2 GB | |
| Qwen3.6 27B Q4_K_M | Läuft nicht | 20,1 von 9,2 GB | |
| Mistral Small 3.2 24B Q4_K_M | Läuft nicht | 20,8 von 9,2 GB | |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Gemma 4 31B Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Ornith 1.5 35B A3B Q4_K_M | Läuft nicht | 23,7 von 9,2 GB | |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 24,1 von 9,2 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 27,5 von 9,2 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 9,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 9,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 9,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 9,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 9,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 9,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 9,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 E4BQ4_0 · 54 bis 66 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Schnellstes Modell
Gemma 4 E2BQ4_K_M · 82 bis 100 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 54 bis 66 Token/s * | 6,0 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 82 bis 100 Token/s * | 4,2 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 98 Token/s * | 4,7 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 4,7 von 7,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,1 bis 27 Token/s * | 8,8 von 9,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 7,9 von 9,2 GB |
| Qwen3.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 7,7 von 9,2 GB |
| Qwen3 4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 8,2 von 9,2 GB |
| Llama 3.1 8B Q4_K_M | Läuft nicht | 10,1 von 9,2 GB | |
| Qwen3 8B Q4_K_M | Läuft nicht | 10,8 von 9,2 GB | |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 13,0 von 9,2 GB | |
| gpt-oss 20B Q4_K_M | Läuft nicht | 13,5 von 9,2 GB | |
| Ministral 3 14B Q4_K_M | Läuft nicht | 14,6 von 9,2 GB | |
| Qwen3 14B Q4_K_M | Läuft nicht | 15,4 von 9,2 GB | |
| Gemma 4 26B A4B Q4_K_M | Läuft nicht | 19,0 von 9,2 GB | |
| Qwen3.8 27B Q4_K_M | Läuft nicht | 19,9 von 9,2 GB | |
| Qwen3.6 27B Q4_K_M | Läuft nicht | 20,1 von 9,2 GB | |
| Mistral Small 3.2 24B Q4_K_M | Läuft nicht | 20,8 von 9,2 GB | |
| Qwen3 30B A3B 2507 Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Qwen3-Coder 30B A3B Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Gemma 4 31B Q4_K_M | Läuft nicht | 23,0 von 9,2 GB | |
| Ornith 1.5 35B A3B Q4_K_M | Läuft nicht | 23,7 von 9,2 GB | |
| Qwen3.6 35B A3B Q4_K_M | Läuft nicht | 24,1 von 9,2 GB | |
| Granite 4.2 30B Q4_K_M | Läuft nicht | 27,5 von 9,2 GB | |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 9,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 9,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 9,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 9,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 9,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 9,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 9,2 GB |
Gerätedaten
- Grafikkarte
- GeForce RTX 5050 Laptop GPU
- Grafikspeicher
- 8 GB
- Prozessor
- Intel Core i5 14450HX oder Intel Core i7 14650HX oder Intel Core i9 14900HX oder 13th Gen Intel Core i5-13450HX oder 13th Gen Intel Core i7-13650HX oder Intel Core Ultra 7 255HX oder Intel Core Ultra 9 275HX
- Arbeitsspeicher
- 8 GB
- Davon für Modelle nutzbar
- 7,2 GB
- Speicherbandbreite
- 384 GB/s
- Rechenschnittstelle
- CUDA