Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuft
Ornith 1.5 gibt es in drei Größen. Die kleine läuft nach unserer Rechnung beim Ausprobieren auf 509 von 527 geführten Geräten, die größte auf 9. Was jede Größe braucht und wann ein Verbund aus mehreren Geräten hilft.
Stand: 2026-09-22
Ornith 1.5 ist eine Familie von Sprachmodellen des Anbieters Ornith AI, die Sie herunterladen und auf eigener Hardware betreiben können. Es gibt sie in drei Größen: Ornith 1.5 9B, Ornith 1.5 35B A3B und Ornith 1.5 397B. Die Zahl im Namen steht für die Milliarden Parameter, also für die Größe des Modells.
Die Modellkarten bei Hugging Face beschreiben die Herkunft so:
„Ornith-1.5 extends Ornith-1.0 (which was developed on top of Qwen3.5 and Gemma4 with additional continued pretraining, mid-training, and post-training) by expanding the self-improvement loop from scaffold and rollout optimization to jointly optimizing task generation, scaffold construction, and solution rollouts.“
Schon Ornith 1.0 entstand laut Karte auf Grundlage von Qwen3.5 von Alibaba und Gemma 4 von Google und wurde darüber hinaus weitertrainiert. Die drei Größen von Ornith 1.5 tragen laut ihren Konfigurationsdateien alle den Aufbau von Qwen3.5. Neu an Version 1.5 ist laut Karte, dass das Modell nicht mehr nur seine Lösungswege, sondern auch die Aufgaben, an denen es trainiert, selbst erzeugt.
Dieser Text ordnet die drei Größen ein: wie viel Speicher sie brauchen, auf wie vielen der 527 Geräte in unserem Katalog sie flüssig laufen und was geht, wenn kein einzelnes Gerät reicht.
Drei Größen im Überblick
| Größe | Parameter | Bauart | Speicher (Q4_K_M) | läuft flüssig auf |
|---|---|---|---|---|
| Ornith 1.5 9B | 9,2 Mrd. | dicht | 6,8 GB | 509 von 527 Geräten |
| Ornith 1.5 35B A3B | 35,5 Mrd., davon rund 3 Mrd. aktiv | Mixture of Experts | 23,0 GB | 202 von 527 Geräten |
| Ornith 1.5 397B | 402,9 Mrd. | Mixture of Experts | 250,1 GB | 9 von 527 Geräten |
Q4_K_M ist die verbreitete Variante, eine verkleinerte Fassung der Modelldatei. Speicherbedarf und Gerätezahl gelten für 4.096 Token Kontext, unseren Anwendungsfall „Ausprobieren“; ein Token ist ungefähr ein Wortteil. Alle drei Größen verarbeiten laut Modellkarten bis zu 262.144 Token auf einmal. Wer diesen langen Kontext ausschöpft, braucht mehr Speicher, und das Modell läuft dann auf weniger Geräten, als die Tabelle zeigt.
Dicht heißt: für jedes Textstück rechnet das ganze Modell. Bei Mixture of Experts rechnet je Textstück nur eine Auswahl von Teilnetzen, den sogenannten Experten. Der Name der größten Fassung nennt 397 Milliarden Parameter, die Modelldatei, die unsere Startbefehle von Hugging Face laden, zählt 402,9 Milliarden, und diese Zahl führt unser Katalog.
Unsere Rechnung umfasst nur den Textteil des Modells, auch bei den Gerätezahlen, und sie gilt für 4.096 Token Kontext. Mit Ollama kommt zweierlei dazu. Alle drei Größen bringen einen Bildteil mit, in den Dateien für Ollama eine eigene Datei von rund 0,9 GB. Laut dem Quelltext von Ollama, gelesen am 2026-09-22, lädt das Programm ihn beim Start mit, auch wenn Sie nur Text eingeben. Außerdem stellt Ollama den Kontext von sich aus nach dem Grafikspeicher ein, beim Mac nach dem Teil, den macOS der Grafik freigibt: ab 24 GB auf 32.768 Token, ab 48 GB auf 262.144 Token. Dafür hält es von Anfang an Speicher frei. Wo unsere Rechnung wenig Spielraum lässt, passt das Modell mit Ollama deshalb womöglich nicht mehr ganz in den Grafikspeicher, und ein Teil rechnet dann langsamer über den Prozessor. Den Kontext legen Sie mit der Einstellung OLLAMA_CONTEXT_LENGTH selbst fest.
Ornith 1.5 9B: läuft fast überall
Die kleinste Größe ist laut Modellkarte ein dichtes Modell für den Betrieb auf einer einzelnen Grafikkarte. In der Variante Q4_K_M ist die Datei 5,8 GB groß, im Betrieb braucht das Modell rund 6,8 GB. Auf einer Grafikkarte mit 8 GB rechnen wir 7,2 GB als nutzbar; das reicht für den Textteil, aber voraussichtlich nicht mehr für Text- und Bildteil zusammen, wie Ollama sie lädt. Mit 10 GB Grafikspeicher bleibt genug Platz, ebenso auf einem Mac mit 16 GB, bei dem macOS der Grafik in unserer Rechnung 10,7 GB freigibt. Auf einem Mac mit 8 GB reicht es nicht, dort sind es 5,3 GB. Wie wir den nutzbaren Speicher rechnen, erklärt der Ratgeber Lokale KI-Modelle.
Auf einer GeForce RTX 3080 mit 10 GB rechnen wir mit 84 bis 103 Token je Sekunde. Die Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen.
Ornith 1.5 35B A3B: groß im Speicher, schnell im Rechnen
Die mittlere Größe ist ein Mixture-of-Experts-Modell. Von ihren 35,5 Milliarden Parametern rechnen laut Modellkarte je Textstück nur rund 3 Milliarden; dafür steht der Zusatz A3B im Namen. Sie rechnet deshalb schneller, als ihre Größe vermuten lässt, braucht aber den Speicher eines großen Modells, weil alle Experten geladen sein müssen. Wie das zusammenhängt, erklärt der Ratgeber zu gpt-oss, das ebenso gebaut ist.
Wie groß der Unterschied ist, zeigt eine Karte, auf der beide Größen samt Bildteil ganz in den Grafikspeicher passen: auf einer GeForce RTX 5090 mit 32 GB rechnen wir für Ornith 1.5 9B mit 173 bis 212 Token je Sekunde, für Ornith 1.5 35B A3B mit 244 bis 390. Die fast viermal größere Fassung ist dort also die schnellere.
In der Variante Q4_K_M braucht sie rund 23,0 GB. Auf einer Grafikkarte mit 24 GB rechnen wir 23,2 GB als nutzbar; das reicht knapp für den Textteil, für Text- und Bildteil zusammen voraussichtlich nicht mehr. Mit Platz für den Bildteil passt die mittlere Größe erst ab 32 GB Grafikspeicher. Beim Mac reichen nach unserer Rechnung 36 GB für den Textteil, denn macOS gibt davon 24,0 GB frei; bei 32 GB sind es 21,3 GB, und das reicht nicht. Bei 36 GB bleibt nach unserer Rechnung rund 1 GB Spielraum, etwa so viel, wie der Bildteil allein braucht; weil Ollama dort zudem 32.768 Token Kontext einstellt, reicht es in der Grundeinstellung voraussichtlich nicht mehr ganz. Sicher genug ist es ab 48 GB, bei denen wir 36,0 GB rechnen. Welche Speicherklasse wie viele Modelle trägt, beschreibt der Ratgeber Grafikkarte für KI.
Ornith 1.5 397B: nur auf den größten Geräten
In voller Genauigkeit braucht die größte Fassung einen Server mit mehreren Grafikkarten. Ihre Modellkarte sagt es so:
„Ornith-1.5-397B is a ~397B mixture-of-experts model (≈800 GB in bf16), so multi-GPU serving is required.“
Die Startbeispiele der Karte verteilen das Modell auf acht Grafikkarten in einem Server, etwa vom Typ H200 mit je 141 GB; für kleinere Aufbauten verweist sie auf verkleinerte Fassungen (FP8 oder INT4). Wie viele Parameter je Textstück rechnen, nennt die Karte nicht.
In der Variante Q4_K_M ist die Datei 244,3 GB groß, im Betrieb braucht das Modell rund 250,1 GB. Das bringen beim Ausprobieren, also mit 4.096 Token Kontext, von den 527 Geräten in unserem Katalog 9 allein auf: zwei Mac Studio mit 512 GB, bei denen wir 384,0 GB als nutzbar rechnen, und sieben Arbeitsplatzrechner verschiedener Hersteller mit NVIDIA GB300, bei denen wir von 748 GB Speicher 252,0 GB als nutzbar rechnen. Eine einzelne Grafikkarte, in die das Modell ganz passt, führt unser Katalog nicht. Auf den Rechnern mit GB300 bleiben nach unserer Rechnung nur 1,9 GB Spielraum. Ollama lädt dort in der Grundeinstellung den Bildteil mit und stellt 262.144 Token Kontext ein; damit reicht es voraussichtlich nicht. Legen Sie den Kontext dort selbst kürzer fest; auch dann bleibt es nach unserer Rechnung knapp.
Auf dem Mac Studio mit M3 Ultra rechnen wir mit 23 bis 34 Token je Sekunde, mit M5 Ultra mit 28 bis 41, auf den Rechnern mit GB300 mit 75 bis 120. Auch diese Werte sind berechnet, nicht auf den Geräten gemessen.
Wenn kein Gerät reicht: mehrere zusammen
Wer keines dieser neun Geräte hat, kann mehrere kleinere zu einem Verbund zusammenschalten. Die Geräte teilen sich dann das Modell, und ihr Speicher zählt zusammen. Unsere Modellseite führt drei solche Verbünde auf, jeweils aus zwei gleichen Apple-Geräten mit M2 Ultra und 192 GB: Mac Studio in zwei Ausstattungen und Mac Pro. Je Gerät rechnen wir 144,0 GB als nutzbar, zusammen 288,0 GB, und das reicht beim Ausprobieren für die 250,1 GB der Variante Q4_K_M.
Dafür braucht es Software, die das Modell über mehrere Rechner verteilt. Unsere Modellseite nennt zwei: exo und den RPC-Server von llama.cpp. llama.cpp ist der Unterbau, auf dem auch Ollama rechnet; was die beiden unterscheidet, erklärt der Ratgeber Was ist Ollama.
Die Rechnung auf unserer Modellseite ist eine reine Speicherrechnung. Sie sagt, dass das Modell in den Verbund passt, nicht wie schnell es dort läuft. Ein Tempo rechnen wir für einen Verbund nicht aus: die Aufteilung über mehrere Rechner kostet Zeit, und unsere Tempowerte sind nur an Messungen auf einzelnen Geräten abgeglichen.
Eine Messung an einem anderen Modell
Wie sich ein Verbund verhalten kann, zeigt eine einzelne Messung an anderen Geräten. Ein Teilnehmer hat sie am 19. Februar 2026 im Entwicklerforum von NVIDIA veröffentlicht (gelesen 2026-09-22). Sie betrifft nicht Ornith, sondern Qwen3.5-397B, ein Modell derselben Größenklasse und desselben Aufbaus: die Konfigurationsdateien beider Modelle nennen 60 Schichten und 512 Experten, von denen je Textstück 10 ausgewählt werden. Gemessen wurde auf vier Rechnern vom Typ NVIDIA DGX Spark, verbunden über Ethernet mit 100 Gbit/s, mit dem RPC-Server von llama.cpp und in der Variante Q6_K, die genauer und größer ist als Q4_K_M.
| Eingabe | Zeit bis zur ersten Ausgabe | Tempo beim Schreiben |
|---|---|---|
| 512 Token | rund 6 Sekunden | 7,03 Token/s |
| 2.048 Token | rund 24 Sekunden | 6,82 Token/s |
| 8.192 Token | rund 93 Sekunden | 6,51 Token/s |
| 16.384 Token | rund 3,3 Minuten | 6,15 Token/s |
| 32.768 Token | rund 7,5 Minuten | 5,64 Token/s |
Die Werte stammen aus der Aufteilung nach Zeilen (split_mode=row), je 128 geschriebene Token, gemittelt über fünf Läufe. Bei 65.535 Token Eingabe kam es zu Ausfällen: auf dem steuernden Rechner und auf einem der übrigen versagten die Dienste, auf zweien liefen sie weiter. Die andere Art der Aufteilung, nach Schichten, hilft laut dem Verfasser nur gegen den fehlenden Speicher und nicht beim Tempo, weil die vier Rechner dabei nacheinander arbeiten.
Auf Ornith übertragen lassen sich diese Zahlen nicht: das Modell, die Variante und die Geräte sind andere. Was sie zeigen: je länger die Eingabe, desto länger dauert es in diesem Verbund bis zur ersten Ausgabe, bei 32.768 Token rund siebeneinhalb Minuten.
Für vertrauliche Daten wichtig
Der RPC-Server von llama.cpp befindet sich nach Auskunft seiner Entwickler noch im Versuchsstadium:
„This example and the RPC backend are currently in a proof-of-concept development stage. As such, the functionality is fragile and insecure. Never run the RPC server on an open network or in a sensitive environment!“
Die Entwickler nennen ihn damit störanfällig und unsicher und warnen davor, ihn in einem offenen Netz oder in einem sensiblen Umfeld zu betreiben.
Mit Ollama starten
Ornith 1.5 steht in der Bibliothek von Ollama, in allen drei Größen. Die Bibliothek nennt für die kleine Größe denselben Befehl wie deren Modellkarte:
ollama run ornith-1.5:9b
Für die anderen Größen heißt der Zusatz :35b oder :397b; alle drei laden die Variante Q4_K_M. Die Befehle auf unseren Modellseiten laden dieselbe Variante direkt von Hugging Face, etwa ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_M.
Eine Eigenheit gilt für alle drei: Ollama bedient Ornith 1.5 immer nur mit einer Anfrage nach der anderen, auch wenn Sie mit der Einstellung OLLAMA_NUM_PARALLEL mehr zulassen. Ollama nimmt die Bauart Qwen3.5, die Ornith trägt, davon aus. Für einen Rechner, auf den mehrere Menschen zugreifen, ist das ein Engpass; was dann zählt, beschreibt der Ratgeber KI selbst hosten.
Alle drei Größen denken laut Modellkarten in der Grundeinstellung vor der Antwort nach: sie schreiben zuerst einen Denkteil und dann die eigentliche Antwort. Bis die Antwort erscheint, dauert es deshalb länger, als die Angabe in Token je Sekunde vermuten lässt.
Die Bibliothek von Ollama weist bei allen drei Größen neben Text auch Bilder als Eingabe aus. Die Modellkarten erwähnen das nicht, die Konfigurationsdateien enthalten aber einen Bildteil; was er für den Speicher bedeutet, steht oben im Überblick. Unsere Modellseiten führen nur Text, und ausprobiert haben wir die Bildeingabe nicht.
Was Sie damit tun dürfen
Die Modellkarten aller drei Größen nennen die MIT-Lizenz. Sie erlaubt auch den geschäftlichen Einsatz, das Verändern und das Weitergeben, solange der Urhebervermerk und der Lizenztext mitgehen. Wie sich offene Lizenzen unterscheiden, erklärt der Ratgeber Open Source KI.
Einen Haken hat die Angabe: die Lizenzdatei, auf die jede der drei Karten verweist, gibt es in keinem der drei Verzeichnisse bei Hugging Face; der Verweis führt ins Leere (geprüft am 2026-09-22). Wer Ornith weitergeben oder in ein eigenes Angebot einbauen will, findet damit keinen Urhebervermerk, also keine Angabe, wer die Rechte hält; die MIT-Lizenz verlangt, dass dieser Vermerk beim Weitergeben mitgeht. Vor einem geschäftlichen Einsatz lohnt eine Nachfrage beim Anbieter.
Was die Modellkarten über die Güte sagen
Die Modellkarten tragen Vergleichstabellen gegen Modelle von Qwen, Google, Anthropic und weiteren Anbietern. Die Karte der mittleren Größe fasst ihre so zusammen:
„It activates only ~3B parameters per token, yet significantly outperforms its similar-sized peer Qwen 3.6-35B across all coding and agentic benchmarks, and outperforms dense models such as Gemma 4-31B and Muse Glimmer-30B by wide margins on agentic coding.“
Das ist die Aussage des Herstellers. Wir messen Speicher und Tempo, nicht die Güte, und nachgerechnet haben wir diese Vergleiche nicht. Ob Ornith für Ihre Aufgaben taugt, zeigt ein Versuch mit Ihren eigenen Texten.
Wann Ornith 1.5 nicht die richtige Wahl ist
Wenn Sie lange Dokumente verarbeiten und Ihr Gerät gerade eben reicht. Die Gerätezahlen oben gelten für 4.096 Token; für längere Eingaben braucht es einen längeren Kontext und damit mehr Speicher. Ein Gerät, auf dem das Modell beim Ausprobieren knapp passt, reicht dafür womöglich nicht.
Wenn mehrere Menschen gleichzeitig zugreifen und Sie Ollama nutzen. Dann wartet jede Anfrage, bis die vorige fertig ist. Die Modellkarten zeigen den Serverbetrieb mit vLLM und SGLang, in voller Genauigkeit auf Grafikkarten mit 80 GB und mehr. vLLM ist für Linux-Server gebaut, die viele Nutzer gleichzeitig bedienen.
Wenn Sie die größte Fassung über den RPC-Server von llama.cpp für vertrauliche Daten betreiben wollen. Dessen Entwickler raten selbst davon ab, ihn in einem sensiblen Umfeld zu betreiben.
Wenn Sie einen Lizenztext brauchen, bevor Sie loslegen. Die Modellkarten nennen die Lizenz, eine Lizenzdatei mit Urhebervermerk fehlt zurzeit.
Alle drei Größen mit Varianten, Startbefehlen und der vollständigen Geräteliste finden Sie auf den Modellseiten: Ornith 1.5 9B, Ornith 1.5 35B A3B und Ornith 1.5 397B. Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite der jeweiligen Größe; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?
Weitere Ratgeber
- Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuftTeuken aus Deutschland, EuroLLM aus einem EU-Projekt, Mistral aus Paris, Apertus aus der Schweiz. Lizenz, Größe und auf wie vielen der 527 Geräte sie flüssig laufen.
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.