Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuft

Ornith 1.5 gibt es in drei Größen. Die kleine läuft nach unserer Rechnung beim Ausprobieren auf 509 von 527 geführten Geräten, die größte auf 9. Was jede Größe braucht und wann ein Verbund aus mehreren Geräten hilft.

Stand: 2026-09-22

Ornith 1.5 ist eine Familie von Sprachmodellen des Anbieters Ornith AI, die Sie herunterladen und auf eigener Hardware betreiben können. Es gibt sie in drei Größen: Ornith 1.5 9B, Ornith 1.5 35B A3B und Ornith 1.5 397B. Die Zahl im Namen steht für die Milliarden Parameter, also für die Größe des Modells.

Die Modellkarten bei Hugging Face beschreiben die Herkunft so:

„Ornith-1.5 extends Ornith-1.0 (which was developed on top of Qwen3.5 and Gemma4 with additional continued pretraining, mid-training, and post-training) by expanding the self-improvement loop from scaffold and rollout optimization to jointly optimizing task generation, scaffold construction, and solution rollouts.“

Quelle: Ornith AI, Ornith-1.5-9B auf Hugging Face, gelesen am

Schon Ornith 1.0 entstand laut Karte auf Grundlage von Qwen3.5 von Alibaba und Gemma 4 von Google und wurde darüber hinaus weitertrainiert. Die drei Größen von Ornith 1.5 tragen laut ihren Konfigurationsdateien alle den Aufbau von Qwen3.5. Neu an Version 1.5 ist laut Karte, dass das Modell nicht mehr nur seine Lösungswege, sondern auch die Aufgaben, an denen es trainiert, selbst erzeugt.

Dieser Text ordnet die drei Größen ein: wie viel Speicher sie brauchen, auf wie vielen der 527 Geräte in unserem Katalog sie flüssig laufen und was geht, wenn kein einzelnes Gerät reicht.

Drei Größen im Überblick

GrößeParameterBauartSpeicher (Q4_K_M)läuft flüssig auf
Ornith 1.5 9B9,2 Mrd.dicht6,8 GB509 von 527 Geräten
Ornith 1.5 35B A3B35,5 Mrd., davon rund 3 Mrd. aktivMixture of Experts23,0 GB202 von 527 Geräten
Ornith 1.5 397B402,9 Mrd.Mixture of Experts250,1 GB9 von 527 Geräten

Q4_K_M ist die verbreitete Variante, eine verkleinerte Fassung der Modelldatei. Speicherbedarf und Gerätezahl gelten für 4.096 Token Kontext, unseren Anwendungsfall „Ausprobieren“; ein Token ist ungefähr ein Wortteil. Alle drei Größen verarbeiten laut Modellkarten bis zu 262.144 Token auf einmal. Wer diesen langen Kontext ausschöpft, braucht mehr Speicher, und das Modell läuft dann auf weniger Geräten, als die Tabelle zeigt.

Dicht heißt: für jedes Textstück rechnet das ganze Modell. Bei Mixture of Experts rechnet je Textstück nur eine Auswahl von Teilnetzen, den sogenannten Experten. Der Name der größten Fassung nennt 397 Milliarden Parameter, die Modelldatei, die unsere Startbefehle von Hugging Face laden, zählt 402,9 Milliarden, und diese Zahl führt unser Katalog.

Unsere Rechnung umfasst nur den Textteil des Modells, auch bei den Gerätezahlen, und sie gilt für 4.096 Token Kontext. Mit Ollama kommt zweierlei dazu. Alle drei Größen bringen einen Bildteil mit, in den Dateien für Ollama eine eigene Datei von rund 0,9 GB. Laut dem Quelltext von Ollama, gelesen am 2026-09-22, lädt das Programm ihn beim Start mit, auch wenn Sie nur Text eingeben. Außerdem stellt Ollama den Kontext von sich aus nach dem Grafikspeicher ein, beim Mac nach dem Teil, den macOS der Grafik freigibt: ab 24 GB auf 32.768 Token, ab 48 GB auf 262.144 Token. Dafür hält es von Anfang an Speicher frei. Wo unsere Rechnung wenig Spielraum lässt, passt das Modell mit Ollama deshalb womöglich nicht mehr ganz in den Grafikspeicher, und ein Teil rechnet dann langsamer über den Prozessor. Den Kontext legen Sie mit der Einstellung OLLAMA_CONTEXT_LENGTH selbst fest.

Ornith 1.5 9B: läuft fast überall

Die kleinste Größe ist laut Modellkarte ein dichtes Modell für den Betrieb auf einer einzelnen Grafikkarte. In der Variante Q4_K_M ist die Datei 5,8 GB groß, im Betrieb braucht das Modell rund 6,8 GB. Auf einer Grafikkarte mit 8 GB rechnen wir 7,2 GB als nutzbar; das reicht für den Textteil, aber voraussichtlich nicht mehr für Text- und Bildteil zusammen, wie Ollama sie lädt. Mit 10 GB Grafikspeicher bleibt genug Platz, ebenso auf einem Mac mit 16 GB, bei dem macOS der Grafik in unserer Rechnung 10,7 GB freigibt. Auf einem Mac mit 8 GB reicht es nicht, dort sind es 5,3 GB. Wie wir den nutzbaren Speicher rechnen, erklärt der Ratgeber Lokale KI-Modelle.

Auf einer GeForce RTX 3080 mit 10 GB rechnen wir mit 84 bis 103 Token je Sekunde. Die Werte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf der Karte selbst gemessen.

Ornith 1.5 35B A3B: groß im Speicher, schnell im Rechnen

Die mittlere Größe ist ein Mixture-of-Experts-Modell. Von ihren 35,5 Milliarden Parametern rechnen laut Modellkarte je Textstück nur rund 3 Milliarden; dafür steht der Zusatz A3B im Namen. Sie rechnet deshalb schneller, als ihre Größe vermuten lässt, braucht aber den Speicher eines großen Modells, weil alle Experten geladen sein müssen. Wie das zusammenhängt, erklärt der Ratgeber zu gpt-oss, das ebenso gebaut ist.

Wie groß der Unterschied ist, zeigt eine Karte, auf der beide Größen samt Bildteil ganz in den Grafikspeicher passen: auf einer GeForce RTX 5090 mit 32 GB rechnen wir für Ornith 1.5 9B mit 173 bis 212 Token je Sekunde, für Ornith 1.5 35B A3B mit 244 bis 390. Die fast viermal größere Fassung ist dort also die schnellere.

In der Variante Q4_K_M braucht sie rund 23,0 GB. Auf einer Grafikkarte mit 24 GB rechnen wir 23,2 GB als nutzbar; das reicht knapp für den Textteil, für Text- und Bildteil zusammen voraussichtlich nicht mehr. Mit Platz für den Bildteil passt die mittlere Größe erst ab 32 GB Grafikspeicher. Beim Mac reichen nach unserer Rechnung 36 GB für den Textteil, denn macOS gibt davon 24,0 GB frei; bei 32 GB sind es 21,3 GB, und das reicht nicht. Bei 36 GB bleibt nach unserer Rechnung rund 1 GB Spielraum, etwa so viel, wie der Bildteil allein braucht; weil Ollama dort zudem 32.768 Token Kontext einstellt, reicht es in der Grundeinstellung voraussichtlich nicht mehr ganz. Sicher genug ist es ab 48 GB, bei denen wir 36,0 GB rechnen. Welche Speicherklasse wie viele Modelle trägt, beschreibt der Ratgeber Grafikkarte für KI.

Ornith 1.5 397B: nur auf den größten Geräten

In voller Genauigkeit braucht die größte Fassung einen Server mit mehreren Grafikkarten. Ihre Modellkarte sagt es so:

„Ornith-1.5-397B is a ~397B mixture-of-experts model (≈800 GB in bf16), so multi-GPU serving is required.“

Quelle: Ornith AI, Ornith-1.5-397B auf Hugging Face, gelesen am

Die Startbeispiele der Karte verteilen das Modell auf acht Grafikkarten in einem Server, etwa vom Typ H200 mit je 141 GB; für kleinere Aufbauten verweist sie auf verkleinerte Fassungen (FP8 oder INT4). Wie viele Parameter je Textstück rechnen, nennt die Karte nicht.

In der Variante Q4_K_M ist die Datei 244,3 GB groß, im Betrieb braucht das Modell rund 250,1 GB. Das bringen beim Ausprobieren, also mit 4.096 Token Kontext, von den 527 Geräten in unserem Katalog 9 allein auf: zwei Mac Studio mit 512 GB, bei denen wir 384,0 GB als nutzbar rechnen, und sieben Arbeitsplatzrechner verschiedener Hersteller mit NVIDIA GB300, bei denen wir von 748 GB Speicher 252,0 GB als nutzbar rechnen. Eine einzelne Grafikkarte, in die das Modell ganz passt, führt unser Katalog nicht. Auf den Rechnern mit GB300 bleiben nach unserer Rechnung nur 1,9 GB Spielraum. Ollama lädt dort in der Grundeinstellung den Bildteil mit und stellt 262.144 Token Kontext ein; damit reicht es voraussichtlich nicht. Legen Sie den Kontext dort selbst kürzer fest; auch dann bleibt es nach unserer Rechnung knapp.

Auf dem Mac Studio mit M3 Ultra rechnen wir mit 23 bis 34 Token je Sekunde, mit M5 Ultra mit 28 bis 41, auf den Rechnern mit GB300 mit 75 bis 120. Auch diese Werte sind berechnet, nicht auf den Geräten gemessen.

Wenn kein Gerät reicht: mehrere zusammen

Wer keines dieser neun Geräte hat, kann mehrere kleinere zu einem Verbund zusammenschalten. Die Geräte teilen sich dann das Modell, und ihr Speicher zählt zusammen. Unsere Modellseite führt drei solche Verbünde auf, jeweils aus zwei gleichen Apple-Geräten mit M2 Ultra und 192 GB: Mac Studio in zwei Ausstattungen und Mac Pro. Je Gerät rechnen wir 144,0 GB als nutzbar, zusammen 288,0 GB, und das reicht beim Ausprobieren für die 250,1 GB der Variante Q4_K_M.

Dafür braucht es Software, die das Modell über mehrere Rechner verteilt. Unsere Modellseite nennt zwei: exo und den RPC-Server von llama.cpp. llama.cpp ist der Unterbau, auf dem auch Ollama rechnet; was die beiden unterscheidet, erklärt der Ratgeber Was ist Ollama.

Die Rechnung auf unserer Modellseite ist eine reine Speicherrechnung. Sie sagt, dass das Modell in den Verbund passt, nicht wie schnell es dort läuft. Ein Tempo rechnen wir für einen Verbund nicht aus: die Aufteilung über mehrere Rechner kostet Zeit, und unsere Tempowerte sind nur an Messungen auf einzelnen Geräten abgeglichen.

Eine Messung an einem anderen Modell

Wie sich ein Verbund verhalten kann, zeigt eine einzelne Messung an anderen Geräten. Ein Teilnehmer hat sie am 19. Februar 2026 im Entwicklerforum von NVIDIA veröffentlicht (gelesen 2026-09-22). Sie betrifft nicht Ornith, sondern Qwen3.5-397B, ein Modell derselben Größenklasse und desselben Aufbaus: die Konfigurationsdateien beider Modelle nennen 60 Schichten und 512 Experten, von denen je Textstück 10 ausgewählt werden. Gemessen wurde auf vier Rechnern vom Typ NVIDIA DGX Spark, verbunden über Ethernet mit 100 Gbit/s, mit dem RPC-Server von llama.cpp und in der Variante Q6_K, die genauer und größer ist als Q4_K_M.

EingabeZeit bis zur ersten AusgabeTempo beim Schreiben
512 Tokenrund 6 Sekunden7,03 Token/s
2.048 Tokenrund 24 Sekunden6,82 Token/s
8.192 Tokenrund 93 Sekunden6,51 Token/s
16.384 Tokenrund 3,3 Minuten6,15 Token/s
32.768 Tokenrund 7,5 Minuten5,64 Token/s

Die Werte stammen aus der Aufteilung nach Zeilen (split_mode=row), je 128 geschriebene Token, gemittelt über fünf Läufe. Bei 65.535 Token Eingabe kam es zu Ausfällen: auf dem steuernden Rechner und auf einem der übrigen versagten die Dienste, auf zweien liefen sie weiter. Die andere Art der Aufteilung, nach Schichten, hilft laut dem Verfasser nur gegen den fehlenden Speicher und nicht beim Tempo, weil die vier Rechner dabei nacheinander arbeiten.

Auf Ornith übertragen lassen sich diese Zahlen nicht: das Modell, die Variante und die Geräte sind andere. Was sie zeigen: je länger die Eingabe, desto länger dauert es in diesem Verbund bis zur ersten Ausgabe, bei 32.768 Token rund siebeneinhalb Minuten.

Für vertrauliche Daten wichtig

Der RPC-Server von llama.cpp befindet sich nach Auskunft seiner Entwickler noch im Versuchsstadium:

„This example and the RPC backend are currently in a proof-of-concept development stage. As such, the functionality is fragile and insecure. Never run the RPC server on an open network or in a sensitive environment!“

Quelle: llama.cpp, Anleitung zum RPC-Server, gelesen am

Die Entwickler nennen ihn damit störanfällig und unsicher und warnen davor, ihn in einem offenen Netz oder in einem sensiblen Umfeld zu betreiben.

Mit Ollama starten

Ornith 1.5 steht in der Bibliothek von Ollama, in allen drei Größen. Die Bibliothek nennt für die kleine Größe denselben Befehl wie deren Modellkarte:

ollama run ornith-1.5:9b

Für die anderen Größen heißt der Zusatz :35b oder :397b; alle drei laden die Variante Q4_K_M. Die Befehle auf unseren Modellseiten laden dieselbe Variante direkt von Hugging Face, etwa ollama run hf.co/ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_M.

Eine Eigenheit gilt für alle drei: Ollama bedient Ornith 1.5 immer nur mit einer Anfrage nach der anderen, auch wenn Sie mit der Einstellung OLLAMA_NUM_PARALLEL mehr zulassen. Ollama nimmt die Bauart Qwen3.5, die Ornith trägt, davon aus. Für einen Rechner, auf den mehrere Menschen zugreifen, ist das ein Engpass; was dann zählt, beschreibt der Ratgeber KI selbst hosten.

Alle drei Größen denken laut Modellkarten in der Grundeinstellung vor der Antwort nach: sie schreiben zuerst einen Denkteil und dann die eigentliche Antwort. Bis die Antwort erscheint, dauert es deshalb länger, als die Angabe in Token je Sekunde vermuten lässt.

Die Bibliothek von Ollama weist bei allen drei Größen neben Text auch Bilder als Eingabe aus. Die Modellkarten erwähnen das nicht, die Konfigurationsdateien enthalten aber einen Bildteil; was er für den Speicher bedeutet, steht oben im Überblick. Unsere Modellseiten führen nur Text, und ausprobiert haben wir die Bildeingabe nicht.

Was Sie damit tun dürfen

Die Modellkarten aller drei Größen nennen die MIT-Lizenz. Sie erlaubt auch den geschäftlichen Einsatz, das Verändern und das Weitergeben, solange der Urhebervermerk und der Lizenztext mitgehen. Wie sich offene Lizenzen unterscheiden, erklärt der Ratgeber Open Source KI.

Einen Haken hat die Angabe: die Lizenzdatei, auf die jede der drei Karten verweist, gibt es in keinem der drei Verzeichnisse bei Hugging Face; der Verweis führt ins Leere (geprüft am 2026-09-22). Wer Ornith weitergeben oder in ein eigenes Angebot einbauen will, findet damit keinen Urhebervermerk, also keine Angabe, wer die Rechte hält; die MIT-Lizenz verlangt, dass dieser Vermerk beim Weitergeben mitgeht. Vor einem geschäftlichen Einsatz lohnt eine Nachfrage beim Anbieter.

Was die Modellkarten über die Güte sagen

Die Modellkarten tragen Vergleichstabellen gegen Modelle von Qwen, Google, Anthropic und weiteren Anbietern. Die Karte der mittleren Größe fasst ihre so zusammen:

„It activates only ~3B parameters per token, yet significantly outperforms its similar-sized peer Qwen 3.6-35B across all coding and agentic benchmarks, and outperforms dense models such as Gemma 4-31B and Muse Glimmer-30B by wide margins on agentic coding.“

Quelle: Ornith AI, Ornith-1.5-35B-A3B auf Hugging Face, gelesen am

Das ist die Aussage des Herstellers. Wir messen Speicher und Tempo, nicht die Güte, und nachgerechnet haben wir diese Vergleiche nicht. Ob Ornith für Ihre Aufgaben taugt, zeigt ein Versuch mit Ihren eigenen Texten.

Wann Ornith 1.5 nicht die richtige Wahl ist

Wenn Sie lange Dokumente verarbeiten und Ihr Gerät gerade eben reicht. Die Gerätezahlen oben gelten für 4.096 Token; für längere Eingaben braucht es einen längeren Kontext und damit mehr Speicher. Ein Gerät, auf dem das Modell beim Ausprobieren knapp passt, reicht dafür womöglich nicht.

Wenn mehrere Menschen gleichzeitig zugreifen und Sie Ollama nutzen. Dann wartet jede Anfrage, bis die vorige fertig ist. Die Modellkarten zeigen den Serverbetrieb mit vLLM und SGLang, in voller Genauigkeit auf Grafikkarten mit 80 GB und mehr. vLLM ist für Linux-Server gebaut, die viele Nutzer gleichzeitig bedienen.

Wenn Sie die größte Fassung über den RPC-Server von llama.cpp für vertrauliche Daten betreiben wollen. Dessen Entwickler raten selbst davon ab, ihn in einem sensiblen Umfeld zu betreiben.

Wenn Sie einen Lizenztext brauchen, bevor Sie loslegen. Die Modellkarten nennen die Lizenz, eine Lizenzdatei mit Urhebervermerk fehlt zurzeit.

Alle drei Größen mit Varianten, Startbefehlen und der vollständigen Geräteliste finden Sie auf den Modellseiten: Ornith 1.5 9B, Ornith 1.5 35B A3B und Ornith 1.5 397B. Ob Ihr Gerät reicht, zeigt seine Seite in unserem Katalog, für eine einzeln gekaufte Grafikkarte die Seite der jeweiligen Größe; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?

Weitere Ratgeber