Dell Alienware 16 Area-51 (2025), GeForce RTX 5060 Laptop GPU, 64 GB
Ja. Auf diesem Gerät läuft Ornith 1.5 9B flüssig, mit rund 45 bis 55 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Qwen3.5 9B flüssig, mit rund 44 bis 54 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 16.384 Token Kontext (Anwendungsfall „Programmieren“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Ornith 1.5 9B flüssig, mit rund 44 bis 54 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 8.192 Token Kontext (Anwendungsfall „Texte schreiben, übersetzen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 E4B flüssig, mit rund 54 bis 66 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Dokumente auswerten“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Ja. Auf diesem Gerät läuft Gemma 4 E4B flüssig, mit rund 54 bis 66 Token pro Sekunde (nicht an Messungen abgeglichen).
Berechnet für 32.768 Token Kontext (Anwendungsfall „Kundendaten, interne Unterlagen“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.
Größtes Modell, das flüssig läuft
Ornith 1.5 9BQ4_K_M · 45 bis 55 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_MSchnellstes Modell
LFM2.5 8B A1BQ4_K_M · 142 bis 213 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 45 bis 55 Token/s * | 6,9 von 7,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 46 bis 56 Token/s * | 6,7 von 7,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 49 bis 60 Token/s * | 6,5 von 7,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 50 bis 62 Token/s * | 6,4 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 56 bis 69 Token/s * | 5,6 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 84 bis 103 Token/s * | 4,0 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 93 bis 114 Token/s * | 3,7 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 94 bis 115 Token/s * | 4,0 von 7,2 GB |
| LFM2.5 8B A1B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 142 bis 213 Token/s * | 6,9 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 145 bis 177 Token/s * | 2,8 von 7,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,6 bis 4,9 Token/s * | 20,7 von 65,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,8 bis 5,3 Token/s * | 20,0 von 65,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,3 Token/s * | 17,9 von 65,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,1 bis 6,1 Token/s * | 18,2 von 65,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,0 bis 27 Token/s * | 65,0 von 65,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,4 Token/s * | 16,1 von 65,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,4 bis 16 Token/s * | 10,7 von 65,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 13 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 6,6 bis 20 Token/s * | 9,9 von 65,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 8,3 von 65,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 32 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 48 Token/s * | 23,0 von 65,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 31 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 46 Token/s * | 23,5 von 65,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 20,1 von 65,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 20,1 von 65,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 23 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 12 bis 35 Token/s * | 18,4 von 65,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 20 bis 59 Token/s * | 12,8 von 65,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,6 bis 1,9 Token/s * | 45,5 von 65,2 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,0 von 65,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 110,8 von 65,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,1 von 65,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 381,5 von 65,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 895,4 von 65,2 GB |
Größtes Modell, das flüssig läuft
Qwen3.5 9BQ4_K_M · 44 bis 54 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3.5-9B-GGUF:Q4_K_MSchnellstes Modell
Gemma 4 E2BQ4_K_M · 83 bis 101 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 44 bis 54 Token/s * | 7,1 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 55 bis 67 Token/s * | 5,8 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 83 bis 101 Token/s * | 4,1 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 87 bis 107 Token/s * | 4,1 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 72 bis 88 Token/s * | 5,8 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 119 bis 145 Token/s * | 3,6 von 7,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,5 bis 4,5 Token/s * | 21,7 von 65,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,4 bis 4,1 Token/s * | 23,2 von 65,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,9 bis 5,8 Token/s * | 18,7 von 65,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,9 bis 5,7 Token/s * | 19,0 von 65,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,9 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 5,9 Token/s * | 18,1 von 65,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 3,6 bis 11 Token/s * | 12,7 von 65,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,0 bis 12 Token/s * | 11,9 von 65,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 20 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 30 Token/s * | 8,5 von 65,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 30 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 45 Token/s * | 23,3 von 65,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 23,7 von 65,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 32 Token/s * | 21,3 von 65,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 32 Token/s * | 21,3 von 65,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 18,6 von 65,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 44 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 22 bis 66 Token/s * | 7,3 von 65,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 35 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 18 bis 53 Token/s * | 13,1 von 65,2 GB |
| Qwen3 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 33 Token/s * | 8,3 von 65,2 GB |
| Llama 3.1 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 28 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 42 Token/s * | 8,0 von 65,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 9,5 von 65,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,6 bis 1,7 Token/s * | 49,5 von 65,2 GB |
| gpt-oss 120B Q4_K_M | Läuft nicht | 65,4 von 65,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,3 von 65,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 146,9 von 65,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,5 von 65,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 480,0 von 65,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.127,0 von 65,2 GB |
Größtes Modell, das flüssig läuft
Ornith 1.5 9BQ4_K_M · 44 bis 54 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_MSchnellstes Modell
Gemma 4 E2BQ4_K_M · 84 bis 102 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Ornith 1.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 44 bis 54 Token/s * | 7,0 von 7,2 GB |
| Qwen3.5 9B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 45 bis 55 Token/s * | 6,9 von 7,2 GB |
| Qwen3 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 47 bis 57 Token/s * | 7,1 von 7,2 GB |
| Llama 3.1 8B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 48 bis 59 Token/s * | 6,9 von 7,2 GB |
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 56 bis 68 Token/s * | 5,6 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 84 bis 102 Token/s * | 4,0 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 91 bis 112 Token/s * | 3,9 von 7,2 GB |
| Qwen3 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 85 bis 104 Token/s * | 4,6 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 135 bis 165 Token/s * | 3,1 von 7,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,6 bis 4,8 Token/s * | 21,0 von 65,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,6 bis 4,8 Token/s * | 21,0 von 65,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 6,1 Token/s * | 18,2 von 65,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,0 bis 6,0 Token/s * | 18,5 von 65,2 GB |
| gpt-oss 120B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 17 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 8,7 bis 26 Token/s * | 65,1 von 65,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,3 bis 6,8 Token/s * | 16,8 von 65,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 9,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,7 bis 14 Token/s * | 11,3 von 65,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,5 bis 16 Token/s * | 10,6 von 65,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 11 bis 32 Token/s * | 8,4 von 65,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 31 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 47 Token/s * | 23,1 von 65,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 30 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 15 bis 45 Token/s * | 23,5 von 65,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 26 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 39 Token/s * | 20,5 von 65,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 26 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 39 Token/s * | 20,5 von 65,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 23 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 12 bis 35 Token/s * | 18,5 von 65,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 38 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 19 bis 57 Token/s * | 12,9 von 65,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 95 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 48 bis 143 Token/s * | 7,8 von 65,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,2 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,6 bis 1,8 Token/s * | 46,9 von 65,2 GB |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,1 von 65,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 122,8 von 65,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 250,3 von 65,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 414,3 von 65,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 972,6 von 65,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 E4BQ4_0 · 54 bis 66 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Schnellstes Modell
Gemma 4 E2BQ4_K_M · 82 bis 100 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 54 bis 66 Token/s * | 6,0 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 82 bis 100 Token/s * | 4,2 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 98 Token/s * | 4,7 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 4,7 von 7,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,4 bis 4,1 Token/s * | 23,0 von 65,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,1 bis 3,4 Token/s * | 27,5 von 65,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,7 bis 5,2 Token/s * | 19,9 von 65,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,7 bis 5,2 Token/s * | 20,1 von 65,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,5 bis 4,6 Token/s * | 20,8 von 65,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,3 bis 6,9 Token/s * | 15,4 von 65,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,5 Token/s * | 14,6 von 65,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,1 bis 27 Token/s * | 8,8 von 65,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 23,7 von 65,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 26 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 24,1 von 65,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 15 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 7,7 bis 23 Token/s * | 23,0 von 65,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 15 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 7,7 bis 23 Token/s * | 23,0 von 65,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 19,0 von 65,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 7,9 von 65,2 GB |
| Qwen3.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 7,7 von 65,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 31 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 47 Token/s * | 13,5 von 65,2 GB |
| Qwen3 8B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,4 bis 13 Token/s * | 10,8 von 65,2 GB |
| Llama 3.1 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,3 bis 16 Token/s * | 10,1 von 65,2 GB |
| Qwen3 4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 8,2 von 65,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,7 bis 17 Token/s * | 13,0 von 65,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,5 bis 1,6 Token/s * | 54,9 von 65,2 GB |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 65,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 65,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 65,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 65,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 65,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 65,2 GB |
Größtes Modell, das flüssig läuft
Gemma 4 E4BQ4_0 · 54 bis 66 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
So starten Sie es mit Ollama:
$ ollama run hf.co/ggml-org/gemma-4-E4B-it-GGUF:Q4_0Schnellstes Modell
Gemma 4 E2BQ4_K_M · 82 bis 100 Token/s
Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.
Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/gemma-4-E2B-it-GGUF:Q4_K_MModelle auf diesem Gerät
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
| Modell | Urteil | Tempo | Speicher |
|---|---|---|---|
| Gemma 4 E4B Q4_0 Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 54 bis 66 Token/s * | 6,0 von 7,2 GB |
| Gemma 4 E2B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 82 bis 100 Token/s * | 4,2 von 7,2 GB |
| Qwen3.5 4B Q4_K_M Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 81 bis 98 Token/s * | 4,7 von 7,2 GB |
| LFM2.5 2.6B Q4_K_M Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft gut | 96 bis 117 Token/s * | 4,7 von 7,2 GB |
| Gemma 4 31B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,7 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,4 bis 4,1 Token/s * | 23,0 von 65,2 GB |
| Granite 4.2 30B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 2,3 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,1 bis 3,4 Token/s * | 27,5 von 65,2 GB |
| Qwen3.8 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,7 bis 5,2 Token/s * | 19,9 von 65,2 GB |
| Qwen3.6 27B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,4 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,7 bis 5,2 Token/s * | 20,1 von 65,2 GB |
| Mistral Small 3.2 24B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 1,5 bis 4,6 Token/s * | 20,8 von 65,2 GB |
| Qwen3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,6 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,3 bis 6,9 Token/s * | 15,4 von 65,2 GB |
| Ministral 3 14B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 2,5 bis 7,5 Token/s * | 14,6 von 65,2 GB |
| Gemma 4 12B Q4_0 Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 9,1 bis 27 Token/s * | 8,8 von 65,2 GB |
| Ornith 1.5 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 27 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 23,7 von 65,2 GB |
| Qwen3.6 35B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 26 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 13 bis 40 Token/s * | 24,1 von 65,2 GB |
| Qwen3 30B A3B 2507 Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 15 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 7,7 bis 23 Token/s * | 23,0 von 65,2 GB |
| Qwen3-Coder 30B A3B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 15 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 7,7 bis 23 Token/s * | 23,0 von 65,2 GB |
| Gemma 4 26B A4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 19,0 von 65,2 GB |
| Ornith 1.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 14 bis 43 Token/s * | 7,9 von 65,2 GB |
| Qwen3.5 9B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 33 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 17 bis 50 Token/s * | 7,7 von 65,2 GB |
| gpt-oss 20B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 31 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 16 bis 47 Token/s * | 13,5 von 65,2 GB |
| Qwen3 8B Q4_K_M Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,8 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 4,4 bis 13 Token/s * | 10,8 von 65,2 GB |
| Llama 3.1 8B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,3 bis 16 Token/s * | 10,1 von 65,2 GB |
| Qwen3 4B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 10 bis 31 Token/s * | 8,2 von 65,2 GB |
| LFM2.5 8B A1B Q4_K_M Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig. Der Speicher für den Kontext ist geschätzt. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Eingeschränkt | 5,7 bis 17 Token/s * | 13,0 von 65,2 GB |
| Llama 3.3 70B Q4_K_M Passt in den Speicher, erzeugt aber nur rund 1,0 Token pro Sekunde. Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher. | Läuft nicht | 0,5 bis 1,6 Token/s * | 54,9 von 65,2 GB |
| gpt-oss 120B Q4_K_M | Läuft nicht | 66,0 von 65,2 GB | |
| Qwen3.5 122B A10B Q4_K_M | Läuft nicht | 79,7 von 65,2 GB | |
| Laguna S 2.1 Q4_K_M Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 195,1 von 65,2 GB | |
| Ornith 1.5 397B Q4_K_M | Läuft nicht | 251,1 von 65,2 GB | |
| GLM-5.3 Flash Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 611,4 von 65,2 GB | |
| GLM-5.3 Q8_0 Der Speicher für den Kontext ist geschätzt. | Läuft nicht | 1.435,8 von 65,2 GB |
Gerätedaten
- Grafikkarte
- GeForce RTX 5060 Laptop GPU
- Grafikspeicher
- 8 GB
- Prozessor
- Intel Core Ultra 7 270HX Plus oder Intel Core Ultra 9 290HX Plus
- Arbeitsspeicher
- 64 GB
- Davon für Modelle nutzbar
- 7,2 GB
- Speicherbandbreite
- 384 GB/s
- Rechenschnittstelle
- CUDA