Dell Pro Max 16 Plus (2025), RTX PRO 3000 Blackwell Laptop GPU, 128 GB
Ja. Auf diesem Gerät läuft Qwen3 14B flüssig, mit rund 47 bis 58 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 59 bis 72 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Ministral 3 14B flüssig, mit rund 49 bis 60 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 58 bis 71 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 12B flüssig, mit rund 58 bis 71 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Größtes Modell, das flüssig läuft
Qwen3 14BQ4_K_M · 47 bis 58 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 222 bis 334 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 47 bis 58 Token/s * | 10,7 von 11,2 GB |
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 51 bis 63 Token/s * | 9,9 von 11,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 60 bis 73 Token/s * | 8,3 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 75 bis 92 Token/s * | 6,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 77 bis 94 Token/s * | 6,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 101 Token/s * | 6,5 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 85 bis 104 Token/s * | 6,4 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 5,6 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 141 bis 173 Token/s * | 4,0 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 157 bis 192 Token/s * | 3,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 158 bis 193 Token/s * | 4,0 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 222 bis 334 Token/s * | 6,9 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 244 bis 298 Token/s * | 2,8 von 11,2 GB |
| Llama 3.3 70B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 0,7 bis 2,1 Token/s * | 45,5 von 133,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,2 bis 13 Token/s * | 79,0 von 133,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,3 bis 6,8 Token/s * | 20,7 von 133,2 GB |
| Laguna S 2.1 Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,0 Token pro Sekunde. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 6,0 Token/s * | 110,8 von 133,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,5 Token/s * | 20,0 von 133,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,2 bis 9,6 Token/s * | 17,9 von 133,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,1 bis 9,2 Token/s * | 18,2 von 133,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 19 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,6 bis 29 Token/s * | 65,0 von 133,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 16,1 von 133,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 42 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 21 bis 62 Token/s * | 23,0 von 133,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 40 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 23,5 von 133,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 20,1 von 133,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 20,1 von 133,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 51 Token/s * | 18,4 von 133,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 89 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 44 bis 133 Token/s * | 12,8 von 133,2 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 133,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 133,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 133,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 59 bis 72 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
LFM2.5 8B A1BQ4_K_M · 129 bis 193 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 59 bis 72 Token/s * | 8,5 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 73 bis 89 Token/s * | 7,3 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 7,1 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 72 bis 87 Token/s * | 8,3 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 8,0 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 93 bis 113 Token/s * | 5,8 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 140 bis 171 Token/s * | 4,1 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 148 bis 180 Token/s * | 4,1 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 122 bis 149 Token/s * | 5,8 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 129 bis 193 Token/s * | 9,5 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 202 bis 246 Token/s * | 3,6 von 11,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 79,3 von 133,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 6,1 Token/s * | 21,7 von 133,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,2 von 133,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,8 bis 8,5 Token/s * | 18,7 von 133,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,8 bis 8,2 Token/s * | 19,0 von 133,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 8,8 bis 27 Token/s * | 65,4 von 133,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,0 bis 8,9 Token/s * | 18,1 von 133,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 19 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,7 bis 29 Token/s * | 12,7 von 133,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 11,9 von 133,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 38 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 19 bis 57 Token/s * | 23,3 von 133,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 37 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 18 bis 55 Token/s * | 23,7 von 133,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 21,3 von 133,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 21,3 von 133,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 32 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 48 Token/s * | 18,6 von 133,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 77 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 39 bis 116 Token/s * | 13,1 von 133,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,6 bis 1,8 Token/s * | 49,5 von 133,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 133,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 133,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 133,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 133,2 GB |
Größtes Modell, das flüssig läuft
Ministral 3 14BQ4_K_M · 49 bis 60 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/mistralai/Ministral-3-14B-Instruct-2512-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 179 bis 269 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ministral 3 14B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 49 bis 60 Token/s * | 10,6 von 11,2 GB |
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 59 bis 73 Token/s * | 8,4 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 74 bis 91 Token/s * | 7,0 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 76 bis 93 Token/s * | 6,9 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 79 bis 96 Token/s * | 7,1 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 99 Token/s * | 6,9 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 5,6 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 141 bis 172 Token/s * | 4,0 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 154 bis 188 Token/s * | 3,9 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 144 bis 176 Token/s * | 4,6 von 11,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 179 bis 269 Token/s * | 7,8 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 228 bis 278 Token/s * | 3,1 von 11,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,2 bis 12 Token/s * | 79,1 von 133,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,2 bis 6,6 Token/s * | 21,0 von 133,2 GB |
| Laguna S 2.1 Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,7 Token pro Sekunde. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,4 bis 4,0 Token/s * | 122,8 von 133,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,2 bis 6,6 Token/s * | 21,0 von 133,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,1 bis 9,2 Token/s * | 18,2 von 133,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,0 bis 8,9 Token/s * | 18,5 von 133,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 19 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,3 bis 28 Token/s * | 65,1 von 133,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,7 bis 11 Token/s * | 16,8 von 133,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 45 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 23 bis 68 Token/s * | 11,3 von 133,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 40 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 61 Token/s * | 23,1 von 133,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 19 bis 58 Token/s * | 23,5 von 133,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 35 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 20,5 von 133,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 35 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 20,5 von 133,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 18,5 von 133,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 85 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 42 bis 127 Token/s * | 12,9 von 133,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,7 bis 2,0 Token/s * | 46,9 von 133,2 GB |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 133,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 133,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 133,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 58 bis 71 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
Gemma 4 E4BQ4_0 · 90 bis 110 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Modelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 58 bis 71 Token/s * | 8,8 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 69 bis 85 Token/s * | 7,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 71 bis 87 Token/s * | 7,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 61 bis 74 Token/s * | 10,8 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 64 bis 78 Token/s * | 10,1 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 6,0 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 138 bis 168 Token/s * | 4,2 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 136 bis 167 Token/s * | 4,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 114 Token/s * | 8,2 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 164 bis 200 Token/s * | 4,7 von 11,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,9 bis 12 Token/s * | 79,7 von 133,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,0 von 133,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,2 bis 3,7 Token/s * | 27,5 von 133,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,3 Token/s * | 19,9 von 133,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,4 bis 7,2 Token/s * | 20,1 von 133,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 16 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 8,0 bis 24 Token/s * | 66,0 von 133,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,2 Token/s * | 20,8 von 133,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 15,4 von 133,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,9 bis 15 Token/s * | 14,6 von 133,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 23,7 von 133,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 24,1 von 133,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 133,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 133,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 19,0 von 133,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 65 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 32 bis 97 Token/s * | 13,5 von 133,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 13,0 von 133,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,5 bis 1,6 Token/s * | 54,9 von 133,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 133,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 133,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 133,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 133,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 12BQ4_0 · 58 bis 71 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0Schnellstes Modell
Gemma 4 E4BQ4_0 · 90 bis 110 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Modelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 12B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 58 bis 71 Token/s * | 8,8 von 11,2 GB |
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 69 bis 85 Token/s * | 7,9 von 11,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 71 bis 87 Token/s * | 7,7 von 11,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 61 bis 74 Token/s * | 10,8 von 11,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 64 bis 78 Token/s * | 10,1 von 11,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 90 bis 110 Token/s * | 6,0 von 11,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 138 bis 168 Token/s * | 4,2 von 11,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 136 bis 167 Token/s * | 4,7 von 11,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 114 Token/s * | 8,2 von 11,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 164 bis 200 Token/s * | 4,7 von 11,2 GB |
| Qwen3.5 122B A10B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,9 bis 12 Token/s * | 79,7 von 133,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 23,0 von 133,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,2 bis 3,7 Token/s * | 27,5 von 133,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,3 Token/s * | 19,9 von 133,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,4 bis 7,2 Token/s * | 20,1 von 133,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 16 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 8,0 bis 24 Token/s * | 66,0 von 133,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,2 Token/s * | 20,8 von 133,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,1 bis 12 Token/s * | 15,4 von 133,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,9 bis 15 Token/s * | 14,6 von 133,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 52 Token/s * | 23,7 von 133,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 24,1 von 133,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 133,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,9 bis 30 Token/s * | 23,0 von 133,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 44 Token/s * | 19,0 von 133,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 65 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 32 bis 97 Token/s * | 13,5 von 133,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 13,0 von 133,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,5 bis 1,6 Token/s * | 54,9 von 133,2 GB |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 133,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 133,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 133,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 133,2 GB |
Gerätedaten
- Grafikkarte
- RTX PRO 3000 Blackwell Laptop GPU
- Grafikspeicher
- 12 GB
- Prozessor
- Intel Core Ultra 5 245HX oder Intel Core Ultra 7 265HX oder Intel Core Ultra 9 285HX
- Arbeitsspeicher
- 128 GB
- Davon für Modelle nutzbar
- 11,2 GB
- Speicherbandbreite
- 672 GB/s
- Rechenschnittstelle
- CUDA