ASUS ROG Strix G18 (2025), GeForce RTX 5070 Ti Laptop GPU, 32 GB
Ja. Auf diesem Gerät läuft Qwen3 14B flüssig, mit rund 47 bis 58 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 59 bis 72 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Ministral 3 14B flüssig, mit rund 49 bis 60 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 58 bis 71 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 58 bis 71 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Größtes Modell, das flüssig läuft
Qwen3 14BQ4_K_M · 47 bis 58 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 222 bis 334 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 47 bis 58 Token/s * | 10,7 von 11,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 51 bis 63 Token/s * | 9,9 von 11,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 60 bis 73 Token/s * | 8,3 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 75 bis 92 Token/s * | 6,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 77 bis 94 Token/s * | 6,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 101 Token/s * | 6,5 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 85 bis 104 Token/s * | 6,4 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 5,6 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 141 bis 173 Token/s * | 4,0 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 157 bis 192 Token/s * | 3,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 158 bis 193 Token/s * | 4,0 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 222 bis 334 Token/s * | 6,9 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 244 bis 298 Token/s * | 2,8 von 11,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,3 bis 6,8 Token/s * | 20,7 von 37,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,5 Token/s * | 20,0 von 37,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,2 bis 9,6 Token/s * | 17,9 von 37,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,1 bis 9,2 Token/s * | 18,2 von 37,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 16,1 von 37,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 42 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 21 bis 62 Token/s * | 23,0 von 37,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 40 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 23,5 von 37,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 20,1 von 37,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 20,1 von 37,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 51 Token/s * | 18,4 von 37,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 89 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 44 bis 133 Token/s * | 12,8 von 37,2 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 45,5 von 37,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,0 von 37,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 37,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 37,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 37,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 37,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 37,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 59 bis 72 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
LFM2.5 8B A1BQ4_K_M · 129 bis 193 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 59 bis 72 Token/s * | 8,5 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 73 bis 89 Token/s * | 7,3 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 7,1 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 72 bis 87 Token/s * | 8,3 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 8,0 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 93 bis 113 Token/s * | 5,8 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 140 bis 171 Token/s * | 4,1 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 148 bis 180 Token/s * | 4,1 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 122 bis 149 Token/s * | 5,8 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 129 bis 193 Token/s * | 9,5 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 202 bis 246 Token/s * | 3,6 von 11,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 6,1 Token/s * | 21,7 von 37,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,2 von 37,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,8 bis 8,5 Token/s * | 18,7 von 37,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,8 bis 8,2 Token/s * | 19,0 von 37,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,0 bis 8,9 Token/s * | 18,1 von 37,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 19 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,7 bis 29 Token/s * | 12,7 von 37,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 11,9 von 37,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 38 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 19 bis 57 Token/s * | 23,3 von 37,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 37 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 18 bis 55 Token/s * | 23,7 von 37,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 21,3 von 37,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 21,3 von 37,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 32 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 48 Token/s * | 18,6 von 37,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 77 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 39 bis 116 Token/s * | 13,1 von 37,2 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 49,5 von 37,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 37,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 37,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 37,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 37,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 37,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 37,2 GB |
Größtes Modell, das flüssig läuft
Ministral 3 14BQ4_K_M · 49 bis 60 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/mistralai/Ministral-3-14B-Instruct-2512-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 179 bis 269 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 49 bis 60 Token/s * | 10,6 von 11,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 59 bis 73 Token/s * | 8,4 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 7,0 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 76 bis 93 Token/s * | 6,9 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 79 bis 96 Token/s * | 7,1 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 99 Token/s * | 6,9 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 5,6 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 141 bis 172 Token/s * | 4,0 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 154 bis 188 Token/s * | 3,9 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 144 bis 176 Token/s * | 4,6 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 179 bis 269 Token/s * | 7,8 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 228 bis 278 Token/s * | 3,1 von 11,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,2 bis 6,6 Token/s * | 21,0 von 37,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,2 bis 6,6 Token/s * | 21,0 von 37,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,1 bis 9,2 Token/s * | 18,2 von 37,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,0 bis 8,9 Token/s * | 18,5 von 37,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,7 bis 11 Token/s * | 16,8 von 37,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 45 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 23 bis 68 Token/s * | 11,3 von 37,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 40 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 61 Token/s * | 23,1 von 37,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 19 bis 58 Token/s * | 23,5 von 37,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 35 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 20,5 von 37,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 35 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 20,5 von 37,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 18,5 von 37,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 85 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 42 bis 127 Token/s * | 12,9 von 37,2 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 46,9 von 37,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,1 von 37,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 37,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 37,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 37,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 37,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 37,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 58 bis 71 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
Gemma 4 E4BQ4_0 · 90 bis 110 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Modelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 58 bis 71 Token/s * | 8,8 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 69 bis 85 Token/s * | 7,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 71 bis 87 Token/s * | 7,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 61 bis 74 Token/s * | 10,8 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 64 bis 78 Token/s * | 10,1 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 6,0 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 138 bis 168 Token/s * | 4,2 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 136 bis 167 Token/s * | 4,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 114 Token/s * | 8,2 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 164 bis 200 Token/s * | 4,7 von 11,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,0 von 37,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,2 bis 3,7 Token/s * | 27,5 von 37,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,3 Token/s * | 19,9 von 37,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,4 bis 7,2 Token/s * | 20,1 von 37,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,2 Token/s * | 20,8 von 37,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 15,4 von 37,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,9 bis 15 Token/s * | 14,6 von 37,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 23,7 von 37,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 24,1 von 37,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 37,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 37,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 19,0 von 37,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 65 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 32 bis 97 Token/s * | 13,5 von 37,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 13,0 von 37,2 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 37,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 37,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 37,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 37,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 37,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 37,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 37,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 58 bis 71 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
Gemma 4 E4BQ4_0 · 90 bis 110 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Modelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 58 bis 71 Token/s * | 8,8 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 69 bis 85 Token/s * | 7,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 71 bis 87 Token/s * | 7,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 61 bis 74 Token/s * | 10,8 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 64 bis 78 Token/s * | 10,1 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 6,0 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 138 bis 168 Token/s * | 4,2 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 136 bis 167 Token/s * | 4,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 114 Token/s * | 8,2 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 164 bis 200 Token/s * | 4,7 von 11,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,0 von 37,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,2 bis 3,7 Token/s * | 27,5 von 37,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,3 Token/s * | 19,9 von 37,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,4 bis 7,2 Token/s * | 20,1 von 37,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,2 Token/s * | 20,8 von 37,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 15,4 von 37,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,9 bis 15 Token/s * | 14,6 von 37,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 23,7 von 37,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 24,1 von 37,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 37,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 37,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 19,0 von 37,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 65 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 32 bis 97 Token/s * | 13,5 von 37,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 13,0 von 37,2 GB |
| Llama 3.3 70B Q4_K_M | Läuft nicht | 54,9 von 37,2 GB | |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 37,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 37,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 37,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 37,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 37,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 37,2 GB |
Gerätedaten
- Grafikkarte
- GeForce RTX 5070 Ti Laptop GPU
- Grafikspeicher
- 12 GB
- Prozessor
- Intel Core Ultra 7 255HX oder Intel Core Ultra 9 275HX
- Arbeitsspeicher
- 32 GB
- Davon für Modelle nutzbar
- 11,2 GB
- Speicherbandbreite
- 672 GB/s
- Rechenschnittstelle
- CUDA