Dell Pro Max 16 Plus (2025), RTX PRO 4000 Blackwell Laptop GPU, 96 GB

Ja. Auf diesem Gerät läuft Qwen3 14B flüssig, mit rund 61 bis 74 Token pro Sekunde (nicht an Messungen abgeglichen).

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Qwen3 14B

Q4_K_M · 61 bis 74 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

So starten Sie es mit Ollama:

$ ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_M

Schnellstes Modell

gpt-oss 20B

Q4_K_M · 153 bis 229 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Qwen3 14B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut61 bis 74 Token/s *10,7 von 15,2 GB
Ministral 3 14B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut66 bis 81 Token/s *9,9 von 15,2 GB
Gemma 4 12B
Q4_0
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut77 bis 94 Token/s *8,3 von 15,2 GB
Ornith 1.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut97 bis 119 Token/s *6,9 von 15,2 GB
Qwen3.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut99 bis 121 Token/s *6,7 von 15,2 GB
gpt-oss 20B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut153 bis 229 Token/s *12,8 von 15,2 GB
Qwen3 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut107 bis 131 Token/s *6,5 von 15,2 GB
Llama 3.1 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut110 bis 134 Token/s *6,4 von 15,2 GB
Gemma 4 E4B
Q4_0
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut122 bis 149 Token/s *5,6 von 15,2 GB
Gemma 4 E2B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut183 bis 224 Token/s *4,0 von 15,2 GB
Qwen3.5 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut204 bis 249 Token/s *3,7 von 15,2 GB
Qwen3 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut205 bis 251 Token/s *4,0 von 15,2 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut274 bis 411 Token/s *6,9 von 15,2 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut316 bis 386 Token/s *2,8 von 15,2 GB
Llama 3.3 70B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 1,6 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt0,8 bis 2,3 Token/s *45,5 von 105,2 GB
Qwen3.5 122B A10B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,9 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt4,4 bis 13 Token/s *79,0 von 105,2 GB
Gemma 4 31B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 7,3 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt3,6 bis 11 Token/s *20,7 von 105,2 GB
Granite 4.2 30B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 8,3 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt4,2 bis 13 Token/s *20,0 von 105,2 GB
Qwen3.8 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 13 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt6,5 bis 20 Token/s *17,9 von 105,2 GB
Qwen3.6 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 12 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt6,0 bis 18 Token/s *18,2 von 105,2 GB
gpt-oss 120B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 21 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt10 bis 31 Token/s *65,0 von 105,2 GB
Mistral Small 3.2 24B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 25 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt12 bis 37 Token/s *16,1 von 105,2 GB
Ornith 1.5 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 58 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt29 bis 87 Token/s *23,0 von 105,2 GB
Qwen3.6 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 55 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt27 bis 82 Token/s *23,5 von 105,2 GB
Qwen3 30B A3B 2507
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 62 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt31 bis 93 Token/s *20,1 von 105,2 GB
Qwen3-Coder 30B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 62 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt31 bis 93 Token/s *20,1 von 105,2 GB
Gemma 4 26B A4B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 62 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt31 bis 92 Token/s *18,4 von 105,2 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 105,2 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 105,2 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 105,2 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 105,2 GB

Gerätedaten

Grafikkarte
RTX PRO 4000 Blackwell Laptop GPU
Grafikspeicher
16 GB
Prozessor
Intel Core Ultra 5 245HX oder Intel Core Ultra 7 265HX oder Intel Core Ultra 9 285HX
Arbeitsspeicher
96 GB
Davon für Modelle nutzbar
15,2 GB
Speicherbandbreite
896 GB/s
Rechenschnittstelle
CUDA