Microsoft Surface Laptop Ultra (2026), NVIDIA RTX Spark mit Blackwell RTX (iGPU), 128 GB

Vergleichen

Voraussichtlich ja. Auf diesem Gerät läuft Qwen3.5 122B A10B voraussichtlich flüssig, mit rund 23 bis 36 Token pro Sekunde (nicht an Messungen abgeglichen).

Die Grenze dieses Geräts: Ling-3.0-flash-VL läuft noch, Laguna S 2.1 nicht mehr. Dafür fehlen 8,4 GB nutzbarer Speicher.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten und eigenen Messungen abgeglichen, aber nicht auf diesem Gerät gemessen. Ausgenommen sind Werte mit dem Zusatz „nicht an Messungen abgeglichen“: für sie fehlt der Abgleich, sie sind unsicher.

„Läuft“ heißt: das Modell passt und antwortet so schnell wie angegeben. Ob die Antwort stimmt, sagt das nicht. Ein lokales Modell kann sich irren und ist keine Nachschlagequelle; prüfen Sie jede Zusammenfassung und jeden Entwurf gegen das Original, bevor Sie ihn verwenden. Was lokale Modelle gut und schlecht können

Wofür möchten Sie das Gerät nutzen?
Mehr zu diesem Einsatzzweck: Modelle und Geräte nach Preis

Stärkstes Modell, das voraussichtlich flüssig läuft

Qwen3.5 122B A10B

Q4_K_M · 23 bis 36 Token/s

Eine Seite Text (rund 500 Wörter) schreibt es damit in etwa 25 bis 39 Sekunden; dazu kommt die Zeit, bis es zu schreiben beginnt.

Dieses Tempo ist auf diesem Gerät nicht an Messungen abgeglichen und deshalb unsicher.

Oder mit llama.cpp, mit dem Kontext dieser Seite (lädt das Modell von Hugging Face):

$ llama-server -hf unsloth/Qwen3.5-122B-A10B-GGUF:Q4_K_M -c 4096

Lieber ohne Terminal? So starten Sie das Modell in LM Studio

Schnellstes Modell

gpt-oss 120B

Q4_K_M · 50 bis 80 Token/s

Eine Seite Text (rund 500 Wörter) schreibt es damit in etwa 11 bis 18 Sekunden; dazu kommt die Zeit, bis es zu schreiben beginnt.

Das schnellste unter den flüssig laufenden Modellen mit mindestens halb so vielen Parametern wie das größte unter ihnen.

So starten Sie es mit Ollama:

$ ollama run gpt-oss:120b
>>> /set parameter num_ctx 4096

Ollama wählt auf diesem Gerät von selbst 131.072 Token Kontext, die Zahlen hier gelten für 4.096 Token. Damit sie stimmen, geben Sie die zweite Zeile nach dem Start in Ollama ein. Spricht ein Programm Ollama über die Schnittstelle an, etwa ein Agent, gilt die zweite Zeile nicht; dann starten Sie Ollama mit OLLAMA_CONTEXT_LENGTH=4096.

Oder mit llama.cpp, mit dem Kontext dieser Seite (lädt das Modell von Hugging Face):

$ llama-server -hf unsloth/gpt-oss-120b-GGUF:Q4_K_M -c 4096

Lieber ohne Terminal? So starten Sie das Modell in LM Studio

Modelle auf diesem Gerät

Die Tempowerte sind berechnet, nicht auf dem Gerät gemessen, und an veröffentlichten und eigenen Messungen abgeglichen. Ausgenommen sind die mit * markierten Werte: sie sind nicht abgeglichen und deshalb unsicher.

Mit anderer Kontextlänge rechnen

Die Tabelle oben rechnet mit der Kontextlänge des gewählten Anwendungsfalls und empfiehlt, was im Mittel mindestens 10 Token/s schafft. Hier wählen Sie beides selbst: mehr Kontext, etwa 65.536 Token für lange Dokumente oder Agenten, braucht mehr Speicher und macht langsamer; ein höheres Mindesttempo empfiehlt ein kleineres, schnelleres Modell, etwa für Code oder Agenten, die viel Text erzeugen.

Was die Angaben bedeuten
  • Token: Ein Modell liest und schreibt in Wortstücken, den Token. Ein deutsches Wort sind rund 1,5 bis 1,8 Token.
  • Token/s: So viele Token schreibt das Modell je Sekunde. Angegeben ist eine Spanne, gerechnet, nicht auf diesem Gerät gemessen.
  • Kontext: Wie viel Text das Modell auf einmal im Blick behält, also Ihre Frage, angehängte Dokumente und den bisherigen Verlauf, gezählt in Token. Mehr Kontext braucht mehr Speicher.
  • Mrd.: Milliarden Parameter, die Größe des Modells. Größere Modelle antworten in der Regel besser und brauchen mehr Speicher.
  • „davon … aktiv“: Das Modell (Mixture-of-Experts) rechnet je Token nur mit einem Teil seiner Parameter. Das macht es schneller; Speicher braucht es trotzdem für alle.
  • Q4_K_M, Q8_0 und ähnlich: die Stufe der Quantisierung. Die Zahlen des Modells werden mit weniger Bits gespeichert; je kleiner die Zahl hinter dem Q, desto kleiner die Datei und desto größer die Abweichung vom Original.
  • VL im Namen steht für Vision-Language: solche Modelle lesen auch Bilder. Was ein Modell entgegennimmt, steht auf seiner Seite unter „Nimmt entgegen“.
  • „Läuft gut“: Das Modell passt ganz in den Speicher und schafft in der Mitte der Spanne mindestens 10 Token/s. „Eingeschränkt“: Es passt, ist aber langsamer, oder ein Teil liegt im Arbeitsspeicher. Ob die Antworten stimmen, sagt beides nicht.
  • „21,9 von 48,0 GB“: Links steht, was das Modell an Speicher braucht, rechts, was das Gerät für Modelle frei hat. Das ist weniger als eingebaut, weil ein Teil für Betriebssystem, Anzeige und Programme bleibt; wie viel, steht bei den Gerätedaten unter „Davon für Modelle nutzbar“.
  • „*“ am Tempo: Die Rechnung geht hier über ihre Messungen hinaus, der Wert ist unsicherer.
  • „Der Speicher für den Kontext ist geschätzt“: Für die Bauart dieses Modells lesen wir den Speicher für den Kontext nicht aus der Modelldatei ab, sondern schätzen ihn aus der Modellgröße.
  • Wie wir rechnen

Gerätedaten

Chip
NVIDIA RTX Spark, Blackwell RTX (iGPU)
Arbeitsspeicher
128 GB
Davon für Modelle nutzbar
102,4 GBSo viel des gemeinsamen Speichers gibt der Hersteller der Grafik nach eigener Angabe frei; den Rest behält das Betriebssystem.
Speicherbandbreite
300 GB/s
Rechenschnittstelle
CUDA

Bildmodelle auf diesem Gerät

Ob ein Bildmodell in den Speicher passt, für ein Bild mit 1024 × 1024 Pixeln. Eine Zeit je Bild rechnen wir nicht.

ModellStandardstufeGrößte StufeSpeicher
Qwen-Image-2.1-Turbo
Qwen Research License
passt (Q4_K_M)Q8_012,1 von 102,4 GB
Qwen-Image-2.1
Qwen Research License
passt (Q4_K)Q8_010,0 von 102,4 GB
FLUX.2 [klein] 9B
FLUX Non-Commercial License
passt (Q4_K_M)Q8_011,3 von 102,4 GB
FLUX.2 [klein] 4B
Apache 2.0
passt (Q4_K_M)Q8_05,9 von 102,4 GB
Qwen-Image-2512
Apache 2.0
passt (Q4_K_M)Q8_020,4 von 102,4 GB
FLUX.2 [dev]
FLUX Non-Commercial License
passt (Q4_K_M)Q8_037,3 von 102,4 GB
Chroma1-HD
Apache 2.0
passt (Q4_K_M)Q8_09,4 von 102,4 GB
Stable Diffusion 3.5 Medium
Stability AI Community License
passt (Q4_0)Q8_06,6 von 102,4 GB
Stable Diffusion 3.5 Large
Stability AI Community License
passt (Q4_0)Q8_09,4 von 102,4 GB
FLUX.1 [schnell]
Apache 2.0
passt (Q4_0)Q8_010,7 von 102,4 GB
FLUX.1 [dev]
flux-1-dev-non-commercial-license
passt (Q4_0)Q8_010,8 von 102,4 GB
Stable Diffusion XL 1.0
CreativeML Open RAIL++-M
passt (F16)F167,4 von 102,4 GB

Audiomodelle auf diesem Gerät

Transkription mit Whisper: ob das Modell in den Speicher passt. Eine Zeit rechnen wir nicht. Alle Audiomodelle, auch die ohne belegten Speicherbedarf, stehen in der Modellübersicht.

ModellPasstGrößte Stufe, die passtSpeicher beim Laufen
Whisper large-v3-turbo
Transkription, MIT
Passt (q5_0)f161,4 von 102,4 GB
Whisper large-v3
Transkription, MIT
Passt (q5_0)f161,9 von 102,4 GB
Whisper medium
Transkription, MIT
Passt (q5_0)f161,0 von 102,4 GB
Whisper small
Transkription, MIT
Passt (q5_1)f160,6 von 102,4 GB

Weitere Ratgeber