gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechner

gpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.

Stand: 2026-09-21

gpt-oss ist ein Sprachmodell von OpenAI, das Sie herunterladen und auf Ihrem eigenen Rechner betreiben können. Es erschien im August 2025 in zwei Größen, gpt-oss-20b und gpt-oss-120b, und steht unter einer Lizenz, die auch den geschäftlichen Einsatz erlaubt.

Dieser Text ordnet die beiden Größen ein: was sie unterscheidet, welche auf Ihrem Gerät Platz hat und warum bei diesem Modell eine Eigenheit gilt, die bei den meisten anderen nicht gilt. Die Zahlen zu Speicher und Geräten stammen aus unserem Katalog, der gpt-oss gegen 527 Geräte rechnet.

Zwei Größen, und nur eine passt auf einen gewöhnlichen Rechner

Die Namen tragen die Größe in sich. gpt-oss-20b hat 21 Milliarden Parameter, gpt-oss-120b hat 117 Milliarden; so steht es in der Modellkarte bei Hugging Face.

Für Ihren Rechner zählt vor allem, was daraus an Speicher folgt. Die kleine Größe braucht in der verbreiteten Variante Q4_K_M rund 12,8 GB und läuft auf 319 von 527 geführten Geräten flüssig. Die große braucht rund 65 GB und läuft auf 69 Geräten, keines davon mit weniger als 96 GB Arbeitsspeicher. Mit 96 GB reicht es auf Geräten ganz verschiedener Bauart: Mac Studio, MacBook Pro und Mini-PCs mit Ryzen AI Max+ 395.

Für die meisten heißt das: gpt-oss-20b. Die große Fassung braucht einen Rechner mit mindestens 96 GB Arbeitsspeicher oder einen Server.

Warum ein großes Modell hier schnell rechnet

gpt-oss besteht aus vielen Teilnetzen, sogenannten Experten, und für jedes Textstück rechnet nur eine kleine Auswahl davon. Die Modellkarte nennt deshalb zwei Zahlen: von den 21 Milliarden Parametern der kleinen Größe sind je Schritt 3,6 Milliarden aktiv, bei der großen 5,1 von 117 Milliarden. Der Fachbegriff dafür lautet Mixture of Experts.

Daraus folgt zweierlei. Das Modell rechnet so schnell wie ein kleines, weil je Schritt nur wenig zu tun ist. Es braucht aber so viel Speicher wie ein großes, weil alle Experten geladen sein müssen, auch die gerade untätigen.

Wie schnell das praktisch ist, zeigt ein Beispiel aus unserem Katalog: mit einer GeForce RTX 5080 und 16 GB Grafikspeicher rechnen wir für gpt-oss-20b mit 159 bis 238 Token je Sekunde. Ein Token ist ungefähr ein Wortteil. Die Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen.

Die Eigenheit: eine kleinere Stufe spart hier fast nichts

Bei den meisten Modellen wählen Sie zwischen mehreren Varianten desselben Modells, sogenannten Quantisierungsstufen. Eine niedrigere Stufe macht die Datei kleiner und das Modell etwas ungenauer; wer wenig Speicher hat, greift zur kleineren. Bei gpt-oss geht diese Rechnung nicht auf. Die Varianten der kleinen Größe liegen fast gleichauf:

VarianteDateiSpeicherbedarf
Q3_K_M11,5 GB12,6 GB
Q4_011,5 GB12,6 GB
Q4_K_M11,6 GB12,8 GB
Q5_K_M11,7 GB12,9 GB
Q6_K12,0 GB13,2 GB
Q8_012,1 GB13,3 GB

Zwischen der kleinsten und der größten geführten Variante liegen 0,6 GB Dateigröße und 0,7 GB Speicherbedarf. Der Grund: OpenAI hat die Experten schon im Nachtraining in ein stark verdichtetes Format gebracht, und sie machen laut der ausführlichen Modellkarte auf arXiv über 90 Prozent der Parameter aus. Die Kurzfassung bei Hugging Face sagt es so:

„The models were post-trained with MXFP4 quantization of the MoE weights, making gpt-oss-120b run on a single 80GB GPU (like NVIDIA H100 or AMD MI300X) and the gpt-oss-20b model run within 16GB of memory.“

Quelle: OpenAI, gpt-oss-20b auf Hugging Face, gelesen am

Die verbreiteten Varianten lassen diesen verdichteten Teil unangetastet und unterscheiden sich nur im kleinen Rest. Die Wahl der Stufe ist bei gpt-oss deshalb keine Speicherfrage. Bei der großen Fassung gilt dasselbe: der Speicherbedarf aller geführten Varianten liegt zwischen 64,8 und 65,6 GB.

Was 16 Gigabyte praktisch heißen

OpenAI verspricht für die kleine Größe, dass sie mit 16 GB Speicher auskommt. Für eine Grafikkarte mit 16 GB stimmt das: davon sind in unserer Rechnung 15,2 GB nutzbar, und die 12,8 GB der Variante Q4_K_M passen hinein.

Für einen Mac mit 16 GB stimmt es nicht. Bei einem Mac teilen sich Prozessor und Grafik denselben Arbeitsspeicher, und macOS gibt der Grafik davon nur einen Teil frei. Bei 16 GB rechnen wir mit 10,7 GB, und das ist weniger, als selbst die kleinste Variante braucht. Bei einem Mac Studio mit 96 GB rechnen wir mit 72 GB.

Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite der jeweiligen Größe; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?

Wie lange das Modell nachdenkt, stellen Sie selbst ein

gpt-oss denkt vor der Antwort nach, und wie gründlich, legen Sie fest. Die Modellkarte beschreibt drei Stufen:

„Easily adjust the reasoning effort (low, medium, high) based on your specific use case and latency needs.“

Quelle: OpenAI, gpt-oss-20b auf Hugging Face, gelesen am

Die niedrige Stufe antwortet schnell und ist laut Modellkarte für gewöhnliche Gespräche gedacht, die hohe für eine gründliche, ausführliche Auswertung. Gesetzt wird die Stufe über die Systemanweisung, laut Modellkarte etwa mit der Zeile Reasoning: high.

Was Sie damit tun dürfen

gpt-oss steht unter der Apache-2.0-Lizenz. Sie dürfen das Modell damit auch geschäftlich einsetzen, verändern und weitergeben; wer es weitergibt, legt den Lizenztext bei. Was eine solche Lizenz im Einzelnen erlaubt und wie sie sich von anderen unterscheidet, erklärt der Ratgeber Open Source KI.

Neben der Lizenz liegt eine Nutzungsrichtlinie, und sie ist kurz. Die einzige Verpflichtung darin lautet:

„By using OpenAI gpt-oss-20b, you agree to comply with all applicable law.“

Quelle: OpenAI, Nutzungsrichtlinie zu gpt-oss-20b, gelesen am

Wann gpt-oss nicht die richtige Wahl ist

Wenn Ihr Gerät zu wenig Speicher hat. Auf 208 der 527 geführten Geräte läuft auch die kleine Größe nicht. Eine niedrigere Stufe hilft hier nicht, das zeigt die Tabelle oben; es braucht dann ein kleineres Modell. Welche Modelle auf Ihrem Gerät laufen, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite des jeweiligen Modells.

Wenn Sie ein Nachschlagewerk suchen. gpt-oss ist wie jedes lokale Modell gut darin, Text zu verarbeiten, den Sie mitliefern, und unzuverlässig, wenn es Wissen beisteuern soll. Warum das so ist, steht im Ratgeber Lokale KI.

Wenn Sie die große Fassung wollen, aber keinen Rechner mit mindestens 96 GB haben. Die Modellkarte nennt zwar eine Grafikkarte mit 80 GB, doch das ist eine Karte für Rechenzentren. Unter den Geräten, die wir führen, läuft gpt-oss-120b erst ab 96 GB flüssig.

Beide Größen mit allen Varianten, Startbefehlen und der vollständigen Geräteliste finden Sie auf den Modellseiten: gpt-oss 20B und gpt-oss 120B.

Weitere Ratgeber