gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechner
gpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
Stand: 2026-09-21
gpt-oss ist ein Sprachmodell von OpenAI, das Sie herunterladen und auf Ihrem eigenen Rechner betreiben können. Es erschien im August 2025 in zwei Größen, gpt-oss-20b und gpt-oss-120b, und steht unter einer Lizenz, die auch den geschäftlichen Einsatz erlaubt.
Dieser Text ordnet die beiden Größen ein: was sie unterscheidet, welche auf Ihrem Gerät Platz hat und warum bei diesem Modell eine Eigenheit gilt, die bei den meisten anderen nicht gilt. Die Zahlen zu Speicher und Geräten stammen aus unserem Katalog, der gpt-oss gegen 527 Geräte rechnet.
Zwei Größen, und nur eine passt auf einen gewöhnlichen Rechner
Die Namen tragen die Größe in sich. gpt-oss-20b hat 21 Milliarden Parameter, gpt-oss-120b hat 117 Milliarden; so steht es in der Modellkarte bei Hugging Face.
Für Ihren Rechner zählt vor allem, was daraus an Speicher folgt. Die kleine Größe braucht in der verbreiteten Variante Q4_K_M rund 12,8 GB und läuft auf 319 von 527 geführten Geräten flüssig. Die große braucht rund 65 GB und läuft auf 69 Geräten, keines davon mit weniger als 96 GB Arbeitsspeicher. Mit 96 GB reicht es auf Geräten ganz verschiedener Bauart: Mac Studio, MacBook Pro und Mini-PCs mit Ryzen AI Max+ 395.
Für die meisten heißt das: gpt-oss-20b. Die große Fassung braucht einen Rechner mit mindestens 96 GB Arbeitsspeicher oder einen Server.
Warum ein großes Modell hier schnell rechnet
gpt-oss besteht aus vielen Teilnetzen, sogenannten Experten, und für jedes Textstück rechnet nur eine kleine Auswahl davon. Die Modellkarte nennt deshalb zwei Zahlen: von den 21 Milliarden Parametern der kleinen Größe sind je Schritt 3,6 Milliarden aktiv, bei der großen 5,1 von 117 Milliarden. Der Fachbegriff dafür lautet Mixture of Experts.
Daraus folgt zweierlei. Das Modell rechnet so schnell wie ein kleines, weil je Schritt nur wenig zu tun ist. Es braucht aber so viel Speicher wie ein großes, weil alle Experten geladen sein müssen, auch die gerade untätigen.
Wie schnell das praktisch ist, zeigt ein Beispiel aus unserem Katalog: mit einer GeForce RTX 5080 und 16 GB Grafikspeicher rechnen wir für gpt-oss-20b mit 159 bis 238 Token je Sekunde. Ein Token ist ungefähr ein Wortteil. Die Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen.
Die Eigenheit: eine kleinere Stufe spart hier fast nichts
Bei den meisten Modellen wählen Sie zwischen mehreren Varianten desselben Modells, sogenannten Quantisierungsstufen. Eine niedrigere Stufe macht die Datei kleiner und das Modell etwas ungenauer; wer wenig Speicher hat, greift zur kleineren. Bei gpt-oss geht diese Rechnung nicht auf. Die Varianten der kleinen Größe liegen fast gleichauf:
| Variante | Datei | Speicherbedarf |
|---|---|---|
| Q3_K_M | 11,5 GB | 12,6 GB |
| Q4_0 | 11,5 GB | 12,6 GB |
| Q4_K_M | 11,6 GB | 12,8 GB |
| Q5_K_M | 11,7 GB | 12,9 GB |
| Q6_K | 12,0 GB | 13,2 GB |
| Q8_0 | 12,1 GB | 13,3 GB |
Zwischen der kleinsten und der größten geführten Variante liegen 0,6 GB Dateigröße und 0,7 GB Speicherbedarf. Der Grund: OpenAI hat die Experten schon im Nachtraining in ein stark verdichtetes Format gebracht, und sie machen laut der ausführlichen Modellkarte auf arXiv über 90 Prozent der Parameter aus. Die Kurzfassung bei Hugging Face sagt es so:
„The models were post-trained with MXFP4 quantization of the MoE weights, making gpt-oss-120b run on a single 80GB GPU (like NVIDIA H100 or AMD MI300X) and the gpt-oss-20b model run within 16GB of memory.“
Die verbreiteten Varianten lassen diesen verdichteten Teil unangetastet und unterscheiden sich nur im kleinen Rest. Die Wahl der Stufe ist bei gpt-oss deshalb keine Speicherfrage. Bei der großen Fassung gilt dasselbe: der Speicherbedarf aller geführten Varianten liegt zwischen 64,8 und 65,6 GB.
Was 16 Gigabyte praktisch heißen
OpenAI verspricht für die kleine Größe, dass sie mit 16 GB Speicher auskommt. Für eine Grafikkarte mit 16 GB stimmt das: davon sind in unserer Rechnung 15,2 GB nutzbar, und die 12,8 GB der Variante Q4_K_M passen hinein.
Für einen Mac mit 16 GB stimmt es nicht. Bei einem Mac teilen sich Prozessor und Grafik denselben Arbeitsspeicher, und macOS gibt der Grafik davon nur einen Teil frei. Bei 16 GB rechnen wir mit 10,7 GB, und das ist weniger, als selbst die kleinste Variante braucht. Bei einem Mac Studio mit 96 GB rechnen wir mit 72 GB.
Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite der jeweiligen Größe; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?
Wie lange das Modell nachdenkt, stellen Sie selbst ein
gpt-oss denkt vor der Antwort nach, und wie gründlich, legen Sie fest. Die Modellkarte beschreibt drei Stufen:
„Easily adjust the reasoning effort (low, medium, high) based on your specific use case and latency needs.“
Die niedrige Stufe antwortet schnell und ist laut Modellkarte für gewöhnliche Gespräche gedacht, die hohe für eine gründliche, ausführliche Auswertung. Gesetzt wird die Stufe über die Systemanweisung, laut Modellkarte etwa mit der Zeile Reasoning: high.
Was Sie damit tun dürfen
gpt-oss steht unter der Apache-2.0-Lizenz. Sie dürfen das Modell damit auch geschäftlich einsetzen, verändern und weitergeben; wer es weitergibt, legt den Lizenztext bei. Was eine solche Lizenz im Einzelnen erlaubt und wie sie sich von anderen unterscheidet, erklärt der Ratgeber Open Source KI.
Neben der Lizenz liegt eine Nutzungsrichtlinie, und sie ist kurz. Die einzige Verpflichtung darin lautet:
„By using OpenAI gpt-oss-20b, you agree to comply with all applicable law.“
Wann gpt-oss nicht die richtige Wahl ist
Wenn Ihr Gerät zu wenig Speicher hat. Auf 208 der 527 geführten Geräte läuft auch die kleine Größe nicht. Eine niedrigere Stufe hilft hier nicht, das zeigt die Tabelle oben; es braucht dann ein kleineres Modell. Welche Modelle auf Ihrem Gerät laufen, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite des jeweiligen Modells.
Wenn Sie ein Nachschlagewerk suchen. gpt-oss ist wie jedes lokale Modell gut darin, Text zu verarbeiten, den Sie mitliefern, und unzuverlässig, wenn es Wissen beisteuern soll. Warum das so ist, steht im Ratgeber Lokale KI.
Wenn Sie die große Fassung wollen, aber keinen Rechner mit mindestens 96 GB haben. Die Modellkarte nennt zwar eine Grafikkarte mit 80 GB, doch das ist eine Karte für Rechenzentren. Unter den Geräten, die wir führen, läuft gpt-oss-120b erst ab 96 GB flüssig.
Beide Größen mit allen Varianten, Startbefehlen und der vollständigen Geräteliste finden Sie auf den Modellseiten: gpt-oss 20B und gpt-oss 120B.
Weitere Ratgeber
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.