Dell Pro Max 16 Plus (2025), RTX PRO 3000 Blackwell Laptop GPU, 128 GB

Ja. Auf diesem Gerät läuft Qwen3 14B flüssig, mit rund 47 bis 58 Token pro Sekunde (nicht an Messungen abgeglichen).

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Qwen3 14B

Q4_K_M · 47 bis 58 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

So starten Sie es mit Ollama:

$ ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_M

Schnellstes Modell

LFM2.5 8B A1B

Q4_K_M · 222 bis 334 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Qwen3 14B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut47 bis 58 Token/s *10,7 von 11,2 GB
Ministral 3 14B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut51 bis 63 Token/s *9,9 von 11,2 GB
Gemma 4 12B
Q4_0
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut60 bis 73 Token/s *8,3 von 11,2 GB
Ornith 1.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut75 bis 92 Token/s *6,9 von 11,2 GB
Qwen3.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut77 bis 94 Token/s *6,7 von 11,2 GB
Qwen3 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut83 bis 101 Token/s *6,5 von 11,2 GB
Llama 3.1 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut85 bis 104 Token/s *6,4 von 11,2 GB
Gemma 4 E4B
Q4_0
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut94 bis 115 Token/s *5,6 von 11,2 GB
Gemma 4 E2B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut141 bis 173 Token/s *4,0 von 11,2 GB
Qwen3.5 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut157 bis 192 Token/s *3,7 von 11,2 GB
Qwen3 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut158 bis 193 Token/s *4,0 von 11,2 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut222 bis 334 Token/s *6,9 von 11,2 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut244 bis 298 Token/s *2,8 von 11,2 GB
Llama 3.3 70B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,4 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt0,7 bis 2,1 Token/s *45,5 von 133,2 GB
Qwen3.5 122B A10B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,4 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt4,2 bis 13 Token/s *79,0 von 133,2 GB
Gemma 4 31B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,5 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,3 bis 6,8 Token/s *20,7 von 133,2 GB
Laguna S 2.1
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,0 Token pro Sekunde.
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,0 bis 6,0 Token/s *110,8 von 133,2 GB
Granite 4.2 30B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 5,0 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,5 bis 7,5 Token/s *20,0 von 133,2 GB
Qwen3.8 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,4 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt3,2 bis 9,6 Token/s *17,9 von 133,2 GB
Qwen3.6 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 6,1 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt3,1 bis 9,2 Token/s *18,2 von 133,2 GB
gpt-oss 120B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 19 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt9,6 bis 29 Token/s *65,0 von 133,2 GB
Mistral Small 3.2 24B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,3 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt4,1 bis 12 Token/s *16,1 von 133,2 GB
Ornith 1.5 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 42 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt21 bis 62 Token/s *23,0 von 133,2 GB
Qwen3.6 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 40 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt20 bis 59 Token/s *23,5 von 133,2 GB
Qwen3 30B A3B 2507
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt20 bis 59 Token/s *20,1 von 133,2 GB
Qwen3-Coder 30B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt20 bis 59 Token/s *20,1 von 133,2 GB
Gemma 4 26B A4B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 34 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt17 bis 51 Token/s *18,4 von 133,2 GB
gpt-oss 20B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 89 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt44 bis 133 Token/s *12,8 von 133,2 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 133,2 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 133,2 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 133,2 GB

Gerätedaten

Grafikkarte
RTX PRO 3000 Blackwell Laptop GPU
Grafikspeicher
12 GB
Prozessor
Intel Core Ultra 5 245HX oder Intel Core Ultra 7 265HX oder Intel Core Ultra 9 285HX
Arbeitsspeicher
128 GB
Davon für Modelle nutzbar
11,2 GB
Speicherbandbreite
672 GB/s
Rechenschnittstelle
CUDA