K2-Horizon 375B A23B

Dieses Modell ist aus seiner Modellkarte automatisch übernommen und von uns noch nicht gegengelesen; Größen, Kontext und Lizenz sind gemessen, die Einordnung nicht.

K2-Horizon 375B A23B braucht mit der Variante Q4_K_M rund 282,2 GB Speicher und läuft auf 2 von 703 geführten Geräten flüssig.

Mit dem wenigsten Speicher schafft es: Apple Mac Studio (2026), M5 Ultra mit 80-Kern-GPU, 512 GB.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten und eigenen Messungen abgeglichen, aber nicht auf diesem Gerät gemessen. Ausgenommen sind Werte mit dem Zusatz „nicht an Messungen abgeglichen“: für sie fehlt der Abgleich, sie sind unsicher.

Wofür möchten Sie das Modell nutzen?
Mehr zu diesem Einsatzzweck: Modelle und Geräte nach Preis
Anbieter
IFM
Parameter
379,2 Mrd., davon 23 Mrd. aktiv
Längster Kontext
524.288 Token
Nimmt entgegen
Text
Lizenz
Apache 2.0

Oder mit llama.cpp, mit dem Kontext dieser Seite (lädt das Modell von Hugging Face):

$ llama-server -hf bartowski/K2-Horizon-375B-A23B-GGUF:Q4_K_M -c 4096

Nur die größten Geräte reichen allein, mehrere kleinere zusammen auch

K2-Horizon 375B A23B braucht in der Variante Q4_K_M rund 282,2 GB nutzbaren Speicher. Von 703 geführten Geräten bringen das nur 2 allein auf, und es sind die größten. Mehrere gleiche, kleinere Geräte lassen sich zu einem Verbund zusammenschalten und teilen sich das Modell; dann zählt ihr Speicher zusammen.

Womit das geht

Verbünde baut man mit einer Software, die das Modell über mehrere Rechner verteilt. Verbreitet sind exo (verbindet die Geräte selbständig, unterstützt RDMA über Thunderbolt 5) und der RPC-Server von llama.cpp. Die Geräte werden über Netzwerk oder Thunderbolt verbunden; je schneller die Verbindung, desto weniger kostet die Aufteilung.

Für vertrauliche Daten wichtig

Der RPC-Server von llama.cpp ist ausdrücklich als Vorstufe gekennzeichnet: „currently in a proof-of-concept development stage … fragile and insecure. Never run the RPC server on an open network or in a sensitive environment!“ Für geschäftliche Unterlagen scheidet er damit aus, solange das so bleibt; wir beraten zu Alternativen.

Was wir hier nicht sagen

Wie schnell ein Verbund antwortet, rechnen wir nicht aus. Die Aufteilung kostet Zeit, und wir haben dafür keine eigenen oder belegten Messungen. Die Angabe oben ist reine Speicherrechnung: sie sagt, dass das Modell hineinpasst, nicht wie flüssig es läuft.

Geräte, auf denen es flüssig läuft

Die Tempowerte sind berechnet, nicht auf dem Gerät gemessen, und an veröffentlichten und eigenen Messungen abgeglichen. Ausgenommen sind die mit * markierten Werte: sie sind nicht abgeglichen und deshalb unsicher.

GerätUrteilTempoSpeicher
Apple Mac Studio (2026), M5 Ultra mit 80-Kern-GPU, 512 GBLäuft gut11 bis 16 Token/s *512 GB
davon 384,0 GB nutzbar
Apple Mac Studio (2025), M3 Ultra mit 80-Kern-GPU, 512 GBLäuft gut8,2 bis 12 Token/s *512 GB
davon 384,0 GB nutzbar

Grafikkarten, in die es ganz passt

Keine.

Alle Geräte und Grafikkarten für K2-Horizon 375B A23B

Was die Angaben bedeuten
  • Token: Ein Modell liest und schreibt in Wortstücken, den Token. Ein deutsches Wort sind rund 1,5 bis 1,8 Token.
  • Token/s: So viele Token schreibt das Modell je Sekunde. Angegeben ist eine Spanne, gerechnet, nicht auf diesem Gerät gemessen.
  • Kontext: Wie viel Text das Modell auf einmal im Blick behält, also Ihre Frage, angehängte Dokumente und den bisherigen Verlauf, gezählt in Token. Mehr Kontext braucht mehr Speicher.
  • Mrd.: Milliarden Parameter, die Größe des Modells. Größere Modelle antworten in der Regel besser und brauchen mehr Speicher.
  • „davon … aktiv“: Das Modell (Mixture-of-Experts) rechnet je Token nur mit einem Teil seiner Parameter. Das macht es schneller; Speicher braucht es trotzdem für alle.
  • Q4_K_M, Q8_0 und ähnlich: die Stufe der Quantisierung. Die Zahlen des Modells werden mit weniger Bits gespeichert; je kleiner die Zahl hinter dem Q, desto kleiner die Datei und desto größer die Abweichung vom Original.
  • VL im Namen steht für Vision-Language: solche Modelle lesen auch Bilder. Was ein Modell entgegennimmt, steht auf seiner Seite unter „Nimmt entgegen“.
  • „Läuft gut“: Das Modell passt ganz in den Speicher und schafft in der Mitte der Spanne mindestens 10 Token/s. „Eingeschränkt“: Es passt, ist aber langsamer, oder ein Teil liegt im Arbeitsspeicher. Ob die Antworten stimmen, sagt beides nicht.
  • „*“ am Tempo: Die Rechnung geht hier über ihre Messungen hinaus, der Wert ist unsicherer.
  • „Der Speicher für den Kontext ist geschätzt“: Für die Bauart dieses Modells lesen wir den Speicher für den Kontext nicht aus der Modelldatei ab, sondern schätzen ihn aus der Modellgröße.
  • Wie wir rechnen

Varianten

Der Bedarf gilt für 4.096 Token Kontext. Dabei bleibt Ollama, wenn Sie nach dem Start „/set parameter num_ctx 4096“ eingeben.

VarianteDateiSpeicherbedarfStartbefehl
Q3_K_M182,5 GB225,8 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.
Q4_0216,1 GB260,1 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.
Q4_K_M237,8 GB282,2 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.
Q5_K_M289,6 GB335,0 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.
Q6_K334,5 GB380,8 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.
Q8_0403,1 GB450,8 GBIn mehrere Dateien aufgeteilt, mit Ollama nicht direkt startbar.

Quelle: https://huggingface.co/bartowski/K2-Horizon-375B-A23B-GGUF

Weitere Ratgeber