So rechnen wir: Speicher, Tempo und Urteil

Alle Zahlen zu Speicherbedarf und Tempo auf welche.ai sind berechnet, nicht auf dem jeweiligen Gerät gemessen. Diese Seite zeigt die Formeln, die Faktoren, die Messungen, an denen sie abgeglichen sind, und die Stellen, an denen die Rechnung an ihre Grenze kommt.

Stand der Formel: 2026-09-30.1. Die Faktoren und Schwellen unten werden aus demselben Code gelesen, mit dem die Geräte- und Modellseiten rechnen; sie können davon nicht abweichen. Ändern wir eine Konstante, erhöhen wir diese Version.

Speicherbedarf

Speicherbedarf = Gewichte + Bildprojektor (nur bei Modellen, die Bilder lesen) + KV-Cache + Laufzeitpuffer

  • Gewichte: die Dateigröße der gewählten Quantisierung, gelesen an der Quelle (Hugging Face), in Gigabyte zu 10⁹ Byte.
  • KV-Cache: die Bytes je Token leiten wir je Architektur aus dem Kopf der GGUF-Datei ab, gerechnet in f16 wie in llama.cpp voreingestellt. Schichten mit gleitendem Fenster wachsen nur bis zur Fenstergröße. Fehlen die Angaben, schätzen wir aus der Parameterzahl (25 kB je Token und Milliarde Parameter, bewusst hoch) und sagen es auf der Seite.
  • Laufzeitpuffer: 0,8 GB Grundlast plus 2 % der Gewichte. Das ist eine Annahme, nicht gemessen.
  • Kontext: Er hängt am Einsatzzweck und steht auf jeder Seite („Gerechnet mit … Token Kontext“). Eine Zahl für „Ausprobieren“ und eine für „Programmieren“ sind deshalb nicht dieselbe Rechnung.

Nutzbarer Speicher des Geräts

Ob ein Modell läuft, entscheidet der Speicher, den das Gerät dem Modell geben kann:

  • Grafikkarte mit eigenem Speicher: die Herstellerangabe minus 0,8 GB für Betriebssystem und Anzeige. Eine Karte mit 24 GB hat damit 23,2 GB nutzbar.
  • Apple Silicon: bis 36 GB Arbeitsspeicher zwei Drittel, darüber drei Viertel. macOS gibt der Grafik nur einen Teil frei; die Grenze bei 36 GB ist eine Annahme.
  • Andere Geräte mit gemeinsamem Speicher (etwa AMD Ryzen AI Max oder NVIDIA GB10): drei Viertel, sofern der Hersteller keine feste Zuteilung nennt. Auch das ist eine Annahme.
  • Nur Prozessor: der Arbeitsspeicher minus 6 GB für Betriebssystem und Anwendungen.
  • Auslagerung: Bei Geräten mit eigener Grafik rechnen wir zusätzlich den Arbeitsspeicher mit, der nach der Reserve bleibt; ein Modell, das nur so passt, gilt als „eingeschränkt“. Die Listen der einzelnen Grafikkarten rechnen ohne Auslagerung.
  • Einheit: Die Herstellerangaben (zum Beispiel „24 GB“) sind binär gemeint, 24 GB sind 24 GiB oder rund 25,8 GB. Wir rechnen sie ohne Umrechnung. Das fällt vorsichtig aus: ein Modell, das knapp passt, kann in der Praxis auf einer 24-GB-Karte laufen, obwohl wir „läuft nicht“ sagen.

Tempo

Sekunden je Token = Faktor × gelesene Gigabyte ÷ Speicherbandbreite + Boden × aktive Parameter. Tempo = 1 ÷ Sekunden je Token.

Beim Erzeugen liest das Gerät je Token alle aktiven Gewichte und den KV-Cache aus dem Speicher. Das Tempo folgt deshalb vor allem der Speicherbandbreite. Der Boden ist ein fester Zeitanteil je Token und wächst mit der Zahl der aktiven Parameter.

Gelesene Gigabyte: bei dichten Modellen die ganze Datei, bei Mixture-of-Experts nur der aktive Anteil (Datei × aktive Parameter ÷ alle Parameter), jeweils plus KV-Cache. Wir nehmen an, dass der Kontext beim Erzeugen im Mittel halb gefüllt ist.

Die Spanne um den berechneten Wert ist so breit gewählt, dass sie 90 % der Messungen des jeweiligen Abgleichs einschließt.

Faktoren für dichte Modelle

RechenschnittstelleFaktorBoden (ms je Mrd. aktive Parameter)SpanneMesspunktemittlere Abweichungabgeglichen
Apple (Metal)1,080,77±16 %875,8 %ja
NVIDIA (CUDA)1,250,12±10 %195,6 %ja
AMD (ROCm)1,020,59±27 %1612,4 %ja
Vulkan (AMD, Intel und andere)1,20,15±30 %5612,3 %ja
Prozessor1,61±50 %keine Messungennein

Faktoren für Mixture-of-Experts

RechenschnittstelleFaktorBoden (ms je Mrd. aktive Parameter)SpanneMesspunktemittlere Abweichungabgeglichen bis (Mrd. aktive Parameter)
Apple (Metal)1,781,08±19 %1013,3 %5,1
NVIDIA (CUDA)1,320,59±23 %189,3 %12
AMD (ROCm)nur Geräte mit gemeinsamem Speicher1,271,65±26 %1014,6 %12
Vulkan (AMD, Intel und andere)1,480,49±30 %2413,7 %12

Das Sternchen: Ein Tempowert trägt „*“ und den Zusatz „nicht an Messungen abgeglichen“, wenn die Rechnung über ihre Messungen hinausgeht. Das ist der Fall bei einer Schnittstelle ohne Abgleich (Prozessor), bei Mixture-of-Experts ohne eigenen Abgleich für diese Schnittstelle oder mit mehr aktiven Parametern als gemessen, bei dichten Modellen über 27,32 Mrd. Parametern, bei Grafikkarten vor 2020, bei Notebook-Grafik (die Hersteller begrenzen die Leistung unterschiedlich) und bei Auslagerung.

Das Urteil: läuft gut, eingeschränkt, läuft nicht

  • Läuft gut: das Modell liegt ganz im Speicher des Beschleunigers, und die Mitte der Spanne liegt bei mindestens 10 Token pro Sekunde.
  • Eingeschränkt: das Modell passt, aber die Mitte liegt unter 10 Token pro Sekunde, oder ein Teil liegt im Arbeitsspeicher. Im zweiten Fall kann das Tempo hoch bleiben, es gilt trotzdem als eingeschränkt; der Satz auf der Geräteseite nennt es dann.
  • Läuft nicht: das Modell braucht mehr Speicher, als das Gerät auch mit Auslagerung hergibt, oder die Obergrenze der Spanne liegt unter 2 Token pro Sekunde, oder das Modell verarbeitet den Kontext des Einsatzzwecks gar nicht.

Die Messungen dahinter

Der Abgleich beruht auf 178 Messpunkten für dichte Modelle und 62 für Mixture-of-Experts, entnommen aus veröffentlichten Messreihen und unseren eigenen. Gemessen wurde mit llama.cpp bei leerem Kontext.

175 der 178 dichten Punkte sind dasselbe Modell, Llama 2 7B (6,74 Mrd. Parameter), das Bezugsmodell der veröffentlichten Messreihen.

Quellen der dichten Messpunkte

  • https://github.com/ggml-org/llama.cpp/discussions/4167 (Apple Silicon, Stand 2026-08-31; Bandbreite laut Tabelle)
  • https://github.com/ggml-org/llama.cpp/discussions/15013 (CUDA-Scoreboard, Stand 2026-09-16)
  • https://github.com/ggml-org/llama.cpp/discussions/15021 (ROCm-Scoreboard, Stand 2026-09-13)
  • https://github.com/ggml-org/llama.cpp/discussions/10879 (Vulkan-Scoreboard, Stand 2026-09-15)
  • eigene Messung: Speicherbandbreite der Grafikkarten aus dbgpu 2025.12 (https://github.com/painebenjamin/dbgpu, MIT-Lizenz, Daten aus der TechPowerUp GPU Database)
  • eigene Messung: Eigene Messung der Sitzung localLLMS auf sercan-linux, 2026-09-19: AMD Radeon AI PRO R9700, Qwen3.8-27B Q4_K_M, Q5_K_M und Q6_K, llama-bench b10666 ohne MTP, -dev Vulkan0 -ngl 999 -p 512 -n 128 -r 5, Mesa 25.2.8, Karte allein; am Rohprotokoll gegengeprüft (memory-bank/facts.md, Abschnitt zur ersten eigenen Messung der Flotte)
  • eigene Messung: Eigene Messreihe der Sitzung localLLMS auf sercan-linux, 2026-09-22: llama-bench b10666 (4e97ac86e), Vulkan RADV, Mesa 25.2.8, -p 512 -n 128 -r 5, ohne spekulatives Dekodieren, Grafikspeicher und GTT mitgeschrieben (GTT-Zuwachs 4 bis 17 MiB, also kein Auslagern). Bericht mit allen 88 Messungen in memory-bank/extra/messreihe-r9700-cpu-2026-09-22.md, Rohprotokoll ~/localLLMS/berichte/messreihe-2026-09-22_*/ergebnisse.jsonl auf sercan-linux; die sechs Llama-2-7B-Stufen am 2026-09-23 am Rohprotokoll gegengeprüft. Dateigrößen aus llama-bench (GB, dezimal).

Quellen der Mixture-of-Experts-Punkte

Grenzen der Rechnung

  • Das Tempo ist an keinem einzelnen Gerät gemessen. Die Spanne gilt für den Abgleich, nicht für Ihr Gerät; Software-Version, Einstellungen und Kühlung verschieben es.
  • Wir rechnen das Erzeugungstempo. Die Zeit bis zum ersten Token, also das Verarbeiten des Eingabetextes, rechnen wir nicht.
  • Die Formel kennt keinen Term für die Quantisierung. An der einzigen Karte mit mehreren gemessenen Stufen rechnet sie höhere Stufen zu langsam.
  • Der Abgleich für dichte Modelle stützt sich fast ganz auf ein kleines Modell. Für Modelle über 27,32 Mrd. Parametern setzen wir das Sternchen.
  • Bei Notebooks mit eigener Grafik gibt es keinen Abgleich; die Rechnung nutzt die Speicherbandbreite des Chips.
  • Wie gut ein Modell antwortet, sagen wir nicht. Eignungen für einen Einsatzzweck stammen aus den Angaben der Anbieter und stehen mit Zitat daneben, sie sind kein Urteil von uns.

Fehler melden

Stimmt eine Zahl nicht, schreiben Sie uns bitte über das Kontaktformular, am besten mit Gerät, Modell und Ihrer Messung. Preise stammen von den Händlern und tragen auf der Geräteseite ihr eigenes Datum.

Zum Kontaktformular