So rechnen wir: Speicher, Tempo und Urteil
Alle Zahlen zu Speicherbedarf und Tempo auf welche.ai sind berechnet, nicht auf dem jeweiligen Gerät gemessen. Diese Seite zeigt die Formeln, die Faktoren, die Messungen, an denen sie abgeglichen sind, und die Stellen, an denen die Rechnung an ihre Grenze kommt.
Stand der Formel: 2026-09-30.1. Die Faktoren und Schwellen unten werden aus demselben Code gelesen, mit dem die Geräte- und Modellseiten rechnen; sie können davon nicht abweichen. Ändern wir eine Konstante, erhöhen wir diese Version.
Speicherbedarf
Speicherbedarf = Gewichte + Bildprojektor (nur bei Modellen, die Bilder lesen) + KV-Cache + Laufzeitpuffer
- Gewichte: die Dateigröße der gewählten Quantisierung, gelesen an der Quelle (Hugging Face), in Gigabyte zu 10⁹ Byte.
- KV-Cache: die Bytes je Token leiten wir je Architektur aus dem Kopf der GGUF-Datei ab, gerechnet in f16 wie in llama.cpp voreingestellt. Schichten mit gleitendem Fenster wachsen nur bis zur Fenstergröße. Fehlen die Angaben, schätzen wir aus der Parameterzahl (25 kB je Token und Milliarde Parameter, bewusst hoch) und sagen es auf der Seite.
- Laufzeitpuffer: 0,8 GB Grundlast plus 2 % der Gewichte. Das ist eine Annahme, nicht gemessen.
- Kontext: Er hängt am Einsatzzweck und steht auf jeder Seite („Gerechnet mit … Token Kontext“). Eine Zahl für „Ausprobieren“ und eine für „Programmieren“ sind deshalb nicht dieselbe Rechnung.
Nutzbarer Speicher des Geräts
Ob ein Modell läuft, entscheidet der Speicher, den das Gerät dem Modell geben kann:
- Grafikkarte mit eigenem Speicher: die Herstellerangabe minus 0,8 GB für Betriebssystem und Anzeige. Eine Karte mit 24 GB hat damit 23,2 GB nutzbar.
- Apple Silicon: bis 36 GB Arbeitsspeicher zwei Drittel, darüber drei Viertel. macOS gibt der Grafik nur einen Teil frei; die Grenze bei 36 GB ist eine Annahme.
- Andere Geräte mit gemeinsamem Speicher (etwa AMD Ryzen AI Max oder NVIDIA GB10): drei Viertel, sofern der Hersteller keine feste Zuteilung nennt. Auch das ist eine Annahme.
- Nur Prozessor: der Arbeitsspeicher minus 6 GB für Betriebssystem und Anwendungen.
- Auslagerung: Bei Geräten mit eigener Grafik rechnen wir zusätzlich den Arbeitsspeicher mit, der nach der Reserve bleibt; ein Modell, das nur so passt, gilt als „eingeschränkt“. Die Listen der einzelnen Grafikkarten rechnen ohne Auslagerung.
- Einheit: Die Herstellerangaben (zum Beispiel „24 GB“) sind binär gemeint, 24 GB sind 24 GiB oder rund 25,8 GB. Wir rechnen sie ohne Umrechnung. Das fällt vorsichtig aus: ein Modell, das knapp passt, kann in der Praxis auf einer 24-GB-Karte laufen, obwohl wir „läuft nicht“ sagen.
Tempo
Sekunden je Token = Faktor × gelesene Gigabyte ÷ Speicherbandbreite + Boden × aktive Parameter. Tempo = 1 ÷ Sekunden je Token.
Beim Erzeugen liest das Gerät je Token alle aktiven Gewichte und den KV-Cache aus dem Speicher. Das Tempo folgt deshalb vor allem der Speicherbandbreite. Der Boden ist ein fester Zeitanteil je Token und wächst mit der Zahl der aktiven Parameter.
Gelesene Gigabyte: bei dichten Modellen die ganze Datei, bei Mixture-of-Experts nur der aktive Anteil (Datei × aktive Parameter ÷ alle Parameter), jeweils plus KV-Cache. Wir nehmen an, dass der Kontext beim Erzeugen im Mittel halb gefüllt ist.
Die Spanne um den berechneten Wert ist so breit gewählt, dass sie 90 % der Messungen des jeweiligen Abgleichs einschließt.
Faktoren für dichte Modelle
| Rechenschnittstelle | Faktor | Boden (ms je Mrd. aktive Parameter) | Spanne | Messpunkte | mittlere Abweichung | abgeglichen |
|---|---|---|---|---|---|---|
| Apple (Metal) | 1,08 | 0,77 | ±16 % | 87 | 5,8 % | ja |
| NVIDIA (CUDA) | 1,25 | 0,12 | ±10 % | 19 | 5,6 % | ja |
| AMD (ROCm) | 1,02 | 0,59 | ±27 % | 16 | 12,4 % | ja |
| Vulkan (AMD, Intel und andere) | 1,2 | 0,15 | ±30 % | 56 | 12,3 % | ja |
| Prozessor | 1,6 | 1 | ±50 % | keine Messungen | nein |
Faktoren für Mixture-of-Experts
| Rechenschnittstelle | Faktor | Boden (ms je Mrd. aktive Parameter) | Spanne | Messpunkte | mittlere Abweichung | abgeglichen bis (Mrd. aktive Parameter) |
|---|---|---|---|---|---|---|
| Apple (Metal) | 1,78 | 1,08 | ±19 % | 10 | 13,3 % | 5,1 |
| NVIDIA (CUDA) | 1,32 | 0,59 | ±23 % | 18 | 9,3 % | 12 |
| AMD (ROCm)nur Geräte mit gemeinsamem Speicher | 1,27 | 1,65 | ±26 % | 10 | 14,6 % | 12 |
| Vulkan (AMD, Intel und andere) | 1,48 | 0,49 | ±30 % | 24 | 13,7 % | 12 |
Das Sternchen: Ein Tempowert trägt „*“ und den Zusatz „nicht an Messungen abgeglichen“, wenn die Rechnung über ihre Messungen hinausgeht. Das ist der Fall bei einer Schnittstelle ohne Abgleich (Prozessor), bei Mixture-of-Experts ohne eigenen Abgleich für diese Schnittstelle oder mit mehr aktiven Parametern als gemessen, bei dichten Modellen über 27,32 Mrd. Parametern, bei Grafikkarten vor 2020, bei Notebook-Grafik (die Hersteller begrenzen die Leistung unterschiedlich) und bei Auslagerung.
Das Urteil: läuft gut, eingeschränkt, läuft nicht
- Läuft gut: das Modell liegt ganz im Speicher des Beschleunigers, und die Mitte der Spanne liegt bei mindestens 10 Token pro Sekunde.
- Eingeschränkt: das Modell passt, aber die Mitte liegt unter 10 Token pro Sekunde, oder ein Teil liegt im Arbeitsspeicher. Im zweiten Fall kann das Tempo hoch bleiben, es gilt trotzdem als eingeschränkt; der Satz auf der Geräteseite nennt es dann.
- Läuft nicht: das Modell braucht mehr Speicher, als das Gerät auch mit Auslagerung hergibt, oder die Obergrenze der Spanne liegt unter 2 Token pro Sekunde, oder das Modell verarbeitet den Kontext des Einsatzzwecks gar nicht.
Die Messungen dahinter
Der Abgleich beruht auf 178 Messpunkten für dichte Modelle und 62 für Mixture-of-Experts, entnommen aus veröffentlichten Messreihen und unseren eigenen. Gemessen wurde mit llama.cpp bei leerem Kontext.
175 der 178 dichten Punkte sind dasselbe Modell, Llama 2 7B (6,74 Mrd. Parameter), das Bezugsmodell der veröffentlichten Messreihen.
Quellen der dichten Messpunkte
- https://github.com/ggml-org/llama.cpp/discussions/4167 (Apple Silicon, Stand 2026-08-31; Bandbreite laut Tabelle)
- https://github.com/ggml-org/llama.cpp/discussions/15013 (CUDA-Scoreboard, Stand 2026-09-16)
- https://github.com/ggml-org/llama.cpp/discussions/15021 (ROCm-Scoreboard, Stand 2026-09-13)
- https://github.com/ggml-org/llama.cpp/discussions/10879 (Vulkan-Scoreboard, Stand 2026-09-15)
- eigene Messung: Speicherbandbreite der Grafikkarten aus dbgpu 2025.12 (https://github.com/painebenjamin/dbgpu, MIT-Lizenz, Daten aus der TechPowerUp GPU Database)
- eigene Messung: Eigene Messung der Sitzung localLLMS auf sercan-linux, 2026-09-19: AMD Radeon AI PRO R9700, Qwen3.8-27B Q4_K_M, Q5_K_M und Q6_K, llama-bench b10666 ohne MTP, -dev Vulkan0 -ngl 999 -p 512 -n 128 -r 5, Mesa 25.2.8, Karte allein; am Rohprotokoll gegengeprüft (memory-bank/facts.md, Abschnitt zur ersten eigenen Messung der Flotte)
- eigene Messung: Eigene Messreihe der Sitzung localLLMS auf sercan-linux, 2026-09-22: llama-bench b10666 (4e97ac86e), Vulkan RADV, Mesa 25.2.8, -p 512 -n 128 -r 5, ohne spekulatives Dekodieren, Grafikspeicher und GTT mitgeschrieben (GTT-Zuwachs 4 bis 17 MiB, also kein Auslagern). Bericht mit allen 88 Messungen in memory-bank/extra/messreihe-r9700-cpu-2026-09-22.md, Rohprotokoll ~/localLLMS/berichte/messreihe-2026-09-22_*/ergebnisse.jsonl auf sercan-linux; die sechs Llama-2-7B-Stufen am 2026-09-23 am Rohprotokoll gegengeprüft. Dateigrößen aus llama-bench (GB, dezimal).
Quellen der Mixture-of-Experts-Punkte
- https://github.com/ggml-org/llama.cpp/blob/master/benches/dgx-spark/dgx-spark.md (Stand 3795cc1e8, 2026-02-05; tg32)
- https://github.com/ggml-org/llama.cpp/blob/master/benches/nemotron/nemotron-dgx-spark.md (Stand 9b342d0a9, 2026-03-16; tg32)
- https://github.com/ggml-org/llama.cpp/blob/master/benches/mac-m2-ultra/mac-m2-ultra.md (Stand 3795cc1e8, 2026-02-05; tg32)
- https://github.com/ggml-org/llama.cpp/discussions/15396 (Leitfaden gpt-oss, Messungen im Kopf des Beitrags, Stand 2026-07-01; tg128)
- https://github.com/ggml-org/llama.cpp/discussions/15396#discussioncomment-14224424 (MacBook Pro M3 Max 128 GB, 2025-08-26; tg128)
- https://github.com/ggml-org/llama.cpp/discussions/15396#discussioncomment-14226807 (Mac mini M4 Pro 64 GB, 2025-08-26; tg128)
- eigene Messung: Grafikkarten aus dbgpu 2025.12 (https://github.com/painebenjamin/dbgpu), DGX Spark 273 GB/s laut https://docs.nvidia.com/dgx/dgx-spark/hardware.html (gelesen 2026-09-17), Apple wie in messungen.json; AMD Ryzen AI Max+ 395 256 GB/s laut AMD-Blog (facts.md)
- https://github.com/kyuz0/amd-strix-halo-toolboxes/tree/fdd4ee05b402ea5873262da6e02314c7788a14a1/benchmark/results (Dateien *__rocm-7_2_3__fa1.log; ROCm 7.2.3, llama.cpp 0253fb21f und 1a68ec937, Flash Attention an, tg128; Repo ohne Lizenzangabe, gelesen 2026-09-17)
- https://github.com/kyuz0/amd-strix-halo-toolboxes/tree/fdd4ee05b402ea5873262da6e02314c7788a14a1/benchmark/results (Dateien *__vulkan_radv__fa1.log; Vulkan RADV, sonst wie ROCm)
- https://dsmike.de/en/posts/ai/compare_gpus/ (Steven, 2026-01-15; llama-bench tg128, Werte laut Seite gerundet („roughly“, „~“); Quantisierung nur als „Q4“ genannt, Dateigröße und llama.cpp-Stand nicht; angesetzt wie die übrigen gpt-oss-20B-Punkte mit 12,101 GB, weil die Experten bei gpt-oss in jeder Stufe in MXFP4 bleiben; gelesen 2026-09-21)
- eigene Messung: Eigene Messreihe der Sitzung localLLMS auf sercan-linux (AMD Radeon AI PRO R9700, 32 GB, Vulkan RADV, Mesa 25.2.8, llama-bench b10666 4e97ac86e, -p 512 -n 128 -r 5, ohne spekulatives Dekodieren, GTT-Zuwachs unter 33 MiB, also vollständig im Grafikspeicher); Bericht in memory-bank/extra/messreihe-r9700-cpu-2026-09-22.md, Rohprotokoll ~/localLLMS/berichte/messreihe-2026-09-22_*/ergebnisse.jsonl; tg128, 14 MoE-Dateien ohne BF16 (Regel: BF16 nicht im Abgleich).
Grenzen der Rechnung
- Das Tempo ist an keinem einzelnen Gerät gemessen. Die Spanne gilt für den Abgleich, nicht für Ihr Gerät; Software-Version, Einstellungen und Kühlung verschieben es.
- Wir rechnen das Erzeugungstempo. Die Zeit bis zum ersten Token, also das Verarbeiten des Eingabetextes, rechnen wir nicht.
- Die Formel kennt keinen Term für die Quantisierung. An der einzigen Karte mit mehreren gemessenen Stufen rechnet sie höhere Stufen zu langsam.
- Der Abgleich für dichte Modelle stützt sich fast ganz auf ein kleines Modell. Für Modelle über 27,32 Mrd. Parametern setzen wir das Sternchen.
- Bei Notebooks mit eigener Grafik gibt es keinen Abgleich; die Rechnung nutzt die Speicherbandbreite des Chips.
- Wie gut ein Modell antwortet, sagen wir nicht. Eignungen für einen Einsatzzweck stammen aus den Angaben der Anbieter und stehen mit Zitat daneben, sie sind kein Urteil von uns.
Fehler melden
Stimmt eine Zahl nicht, schreiben Sie uns bitte über das Kontaktformular, am besten mit Gerät, Modell und Ihrer Messung. Preise stammen von den Händlern und tragen auf der Geräteseite ihr eigenes Datum.