Dell Pro Max 16 Plus (2025), RTX PRO 2000 Blackwell Laptop GPU, 64 GB

Ja. Auf diesem Gerät läuft Ornith 1.5 9B flüssig, mit rund 45 bis 55 Token pro Sekunde (nicht an Messungen abgeglichen).

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind aus der Speicherbandbreite des Grafikchips berechnet. Für Grafikchips in Notebooks gibt es keinen Abgleich an Messungen, weil die Hersteller ihre Leistung unterschiedlich begrenzen.

Wofür möchten Sie das Gerät nutzen?

Größtes Modell, das flüssig läuft

Ornith 1.5 9B

Q4_K_M · 45 bis 55 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

So starten Sie es mit Ollama:

$ ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_M

Schnellstes Modell

LFM2.5 8B A1B

Q4_K_M · 142 bis 213 Token/s

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte.

So starten Sie es mit Ollama:

$ ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-GGUF:Q4_K_M

Modelle auf diesem Gerät

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

ModellUrteilTempoSpeicher
Ornith 1.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut45 bis 55 Token/s *6,9 von 7,2 GB
Qwen3.5 9B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut46 bis 56 Token/s *6,7 von 7,2 GB
Qwen3 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut49 bis 60 Token/s *6,5 von 7,2 GB
Llama 3.1 8B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut50 bis 62 Token/s *6,4 von 7,2 GB
Gemma 4 E4B
Q4_0
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut56 bis 69 Token/s *5,6 von 7,2 GB
Gemma 4 E2B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut84 bis 103 Token/s *4,0 von 7,2 GB
Qwen3.5 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut93 bis 114 Token/s *3,7 von 7,2 GB
Qwen3 4B
Q4_K_M
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut94 bis 115 Token/s *4,0 von 7,2 GB
LFM2.5 8B A1B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut142 bis 213 Token/s *6,9 von 7,2 GB
LFM2.5 2.6B
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft gut145 bis 177 Token/s *2,8 von 7,2 GB
Gemma 4 31B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,3 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt1,6 bis 4,9 Token/s *20,7 von 65,2 GB
Granite 4.2 30B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 3,5 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt1,8 bis 5,3 Token/s *20,0 von 65,2 GB
Qwen3.8 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,2 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,1 bis 6,3 Token/s *17,9 von 65,2 GB
Qwen3.6 27B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,1 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,1 bis 6,1 Token/s *18,2 von 65,2 GB
gpt-oss 120B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 18 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt9,0 bis 27 Token/s *65,0 von 65,2 GB
Mistral Small 3.2 24B
Q4_K_M
Passt nicht ganz in den Grafikspeicher. Ein Teil liegt im Arbeitsspeicher und bremst auf rund 4,9 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt2,5 bis 7,4 Token/s *16,1 von 65,2 GB
Qwen3 14B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 11 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt5,4 bis 16 Token/s *10,7 von 65,2 GB
Ministral 3 14B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 13 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt6,6 bis 20 Token/s *9,9 von 65,2 GB
Gemma 4 12B
Q4_0
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 22 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt11 bis 33 Token/s *8,3 von 65,2 GB
Ornith 1.5 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 32 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt16 bis 48 Token/s *23,0 von 65,2 GB
Qwen3.6 35B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 31 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt15 bis 46 Token/s *23,5 von 65,2 GB
Qwen3 30B A3B 2507
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt14 bis 43 Token/s *20,1 von 65,2 GB
Qwen3-Coder 30B A3B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 29 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt14 bis 43 Token/s *20,1 von 65,2 GB
Gemma 4 26B A4B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 23 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt12 bis 35 Token/s *18,4 von 65,2 GB
gpt-oss 20B
Q4_K_M
Passt nicht ganz in den Grafikspeicher und lagert einen Teil in den Arbeitsspeicher aus. Mit rund 39 Token pro Sekunde bleibt es trotzdem flüssig.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Eingeschränkt20 bis 59 Token/s *12,8 von 65,2 GB
Llama 3.3 70B
Q4_K_M
Passt in den Speicher, erzeugt aber nur rund 1,2 Token pro Sekunde.
Für diese Konfiguration ist das Tempo nicht an Messungen abgeglichen und deshalb unsicher.
Läuft nicht0,6 bis 1,9 Token/s *45,5 von 65,2 GB
Qwen3.5 122B A10B
Q4_K_M
Läuft nicht79,0 von 65,2 GB
Laguna S 2.1
Q4_K_M
Der Speicher für den Kontext ist geschätzt.
Läuft nicht110,8 von 65,2 GB
Ornith 1.5 397B
Q4_K_M
Läuft nicht250,1 von 65,2 GB
GLM-5.3 Flash
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht381,5 von 65,2 GB
GLM-5.3
Q8_0
Der Speicher für den Kontext ist geschätzt.
Läuft nicht895,4 von 65,2 GB

Gerätedaten

Grafikkarte
RTX PRO 2000 Blackwell Laptop GPU
Grafikspeicher
8 GB
Prozessor
Intel Core Ultra 5 245HX oder Intel Core Ultra 7 265HX oder Intel Core Ultra 9 285HX
Arbeitsspeicher
64 GB
Davon für Modelle nutzbar
7,2 GB
Speicherbandbreite
384 GB/s
Rechenschnittstelle
CUDA