Open Source KI: Welche Modelle wirklich offen sind

Die meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.

Stand: 2026-09-20

„Open Source KI“ steht heute auf fast jedem Modell, das man herunterladen kann. Der Begriff verspricht dabei mehr, als die meisten Lizenzen halten. Wer ein Modell im Unternehmen einsetzen will, merkt das spätestens beim Lesen der Lizenz, und dann ist die Entscheidung oft schon gefallen.

Der Unterschied zu ChatGPT oder Claude beginnt beim Ort. Dort mieten Sie Zugang zu einem Modell, das beim Anbieter läuft und das Sie weder herunterladen noch behalten können. Hier laden Sie eine Datei und betreiben sie selbst. Was ein solches Modell leistet, hängt an seiner Größe, und die hängt an Ihrem Gerät.

Dieser Text geht in fünf Schritten vor: was der Begriff heißt, welche Modellfamilien es gibt, was eine lokale KI im Betrieb kostet, ob sie auf Ihrem Gerät läuft, und was im Unternehmen dazukommt.

Was „Open Source KI“ heißt, und wo der Begriff schummelt

Bei klassischer Software ist die Sache eindeutig: Sie bekommen den Quelltext, dürfen ihn lesen, ändern und weitergeben. Bei einem Sprachmodell gibt es drei Dinge, die offen sein können, und sie werden selten gemeinsam freigegeben.

Die Gewichte. Das ist die Datei, die Sie herunterladen. Sie enthält die Zahlen, die im Training entstanden sind. Mit ihr können Sie das Modell laufen lassen.

Der Quelltext. Der Programmcode, mit dem trainiert und mit dem das Modell ausgeführt wird.

Die Trainingsdaten. Womit das Modell gelernt hat. Dieser Teil fehlt fast immer.

Die Open Source Initiative, dieselbe Organisation, die seit 1998 festlegt, was bei Software als Open Source gilt, hat dafür 2024 eine eigene Definition vorgelegt. Sie verlangt alle drei Bestandteile und beschreibt beim dritten ausdrücklich nicht die Rohdaten, sondern genug Information, um das Modell nachbauen zu können:

„Sufficiently detailed information about the data used to train the system so that a skilled person can build a substantially equivalent system.“

Quelle: Open Source AI Definition 1.0, Open Source Initiative, gelesen am

Dieselbe Definition nennt vier Freiheiten, die ein offenes System einräumen muss. Die erste lautet: „Use the system for any purpose and without having to ask for permission.“ Genau an dieser Freiheit scheitern die bekanntesten Modelle.

Drei Beispiele, an denen man es sieht

Llama von Meta steht unter einer eigenen Lizenz, nicht unter einer anerkannten Open-Source-Lizenz. Solange Sie das Modell im eigenen Haus betreiben, folgt daraus nichts. Sobald Sie es weitergeben oder ein Produkt darauf anbieten, verlangt die Lizenz drei Dinge:

  • Lizenztext mitgeben und den Hinweis sichtbar setzen. „If you distribute or make available the Llama Materials (or any derivative works thereof), or a product or service (including another AI model) that contains any of them, you shall (A) provide a copy of this Agreement with any such Llama Materials; and (B) prominently display ‚Built with Llama‘ on a related website, user interface, blogpost, about page, or product documentation.“
  • Ein abgeleitetes Modell muss den Namen tragen. „If you use the Llama Materials or any outputs or results of the Llama Materials to create, train, fine tune, or otherwise improve an AI model, which is distributed or made available, you shall also include ‚Llama‘ at the beginning of any such AI model name.“
  • Ab 700 Millionen monatlich aktiven Nutzern brauchen Sie eine eigene Lizenz von Meta. „If, on the Llama 4 version release date, the monthly active users of the products or services made available by or for Licensee, or Licensee’s affiliates, is greater than 700 million monthly active users in the preceding calendar month, you must request a license from Meta, which Meta may grant to you in its sole discretion, and you are not authorized to exercise any of the rights under this Agreement unless or until Meta otherwise expressly grants you such rights.“

Quelle: Llama 4 Community License Agreement, gelesen 2026-09-20.

Alle drei greifen erst bei Weitergabe oder einem eigenen Angebot. Wer Llama im eigenen Haus betreibt, ist von keiner betroffen; die Nutzerschwelle trifft ohnehin keinen Mittelständler. Ob Meta daneben eine eigene Nutzungsrichtlinie führt, prüfen Sie wie bei jedem anderen Anbieter vor dem gewerblichen Einsatz.

Gemma von Google geht weiter. Die Nutzungsbedingungen behalten Google einen Eingriff vor:

„To the maximum extent permitted by law, Google reserves the right to restrict (remotely or otherwise) usage of any of the Gemma Services that Google reasonably believes are in violation of this Agreement.“

Quelle: Gemma Terms of Use, Google, gelesen am

Ein Anbieter, der sich einen Eingriff aus der Ferne vorbehält, räumt die erste der vier Freiheiten nicht vollständig ein. Das ist kein Vorwurf an Google, sondern ein Hinweis darauf, dass „offen“ hier etwas anderes meint.

gpt-oss von OpenAI ist der klarste Fall, weil OpenAI den Begriff gar nicht erst beansprucht. Die Modelle stehen unter Apache 2.0, einer anerkannten Open-Source-Lizenz, die auch den gewerblichen Einsatz erlaubt, solange Sie den Lizenztext mitgeben. OpenAI nennt sie in der Beschreibung trotzdem nicht Open Source, sondern Modelle mit offenen Gewichten: „Welcome to the gpt-oss series, OpenAI’s open-weight models designed for powerful reasoning, agentic tasks, and versatile developer use cases.“ (Quelle: gpt-oss-20b, Hugging Face, gelesen 2026-09-20).

Wie vollständige Offenheit aussieht

Es gibt sie, nur selten und meist aus der Forschung. OLMo 2 des Allen Institute for AI gibt Gewichte, Quelltext, Zwischenstände (also die Modellfassungen aus der Mitte des Trainings) und die Trainingsdatensätze heraus; das Modell steht unter Apache 2.0, die beiden Datensätze sind einzeln abrufbar (Quelle: OLMo-2-1124-7B, Hugging Face, gelesen 2026-09-20). Wer nachvollziehen will, woran ein Modell gelernt hat, kann das hier tatsächlich tun. Diese Modelle sind kleiner als die der großen Familien, und das merkt man an den Antworten.

Welche Familien es gibt und wofür sie taugen

Qwen (Alibaba). Von allen hier genannten Familien die meisten Größen, von sehr kleinen Fassungen für schwache Geräte bis zu großen Modellen. Praktisch für den Einstieg auf vorhandener Hardware, weil für fast jede Speichergröße eine passende Variante existiert, also eine verkleinerte Fassung desselben Modells, die weniger Speicher braucht und etwas ungenauer antwortet. Qwen3 steht unter Apache 2.0 (Quelle: Qwen3-8B, Hugging Face, gelesen 2026-09-20). Die Trainingsdaten sind nicht veröffentlicht.

Llama (Meta). Verbreitet, gut dokumentiert, viele fertige Anleitungen. Dafür die oben beschriebene Lizenz mit Namens- und Hinweispflicht bei Weitergabe.

Gemma (Google). Klein und effizient, deshalb brauchbar auf Geräten mit wenig Speicher. Dafür die Lizenz mit dem Eingriffsvorbehalt von oben.

Mistral (Frankreich). Der in Europa am häufigsten genannte Anbieter; die kleineren Modelle laufen auf gewöhnlicher Hardware. Zugleich ein gutes Beispiel dafür, dass man je Modell nachsehen muss: Ein Teil der Modelle steht unter Apache 2.0, ein anderer unter einer eigenen Lizenz, die nach Angaben des Anbieters weder Verkauf noch gewerblichen Einsatz deckt: „This license allows developers to use our technology for non-commercial purposes and to support research work.“ (Quelle: Mistral AI Non-Production License, gelesen 2026-09-20).

gpt-oss (OpenAI). Zwei Größen, beide auf Textarbeit und Aufgabenlösung ausgelegt, Apache 2.0 laut Modellkarte und ohne Namens- oder Hinweispflicht in der Lizenz. Prüfen Sie vor einem gewerblichen Einsatz, ob OpenAI daneben eine eigene Nutzungsrichtlinie führt; das ändert nichts an der Lizenz, wohl aber an dem, was Sie zusagen können.

DeepSeek (China). Auf Aufgaben mit mehreren Schritten ausgelegt; die großen Modelle der Reihe brauchen Hardware weit über einem Arbeitsplatzrechner. Der Quelltext steht unter der MIT-Lizenz, der kürzesten der anerkannten Open-Source-Lizenzen, die praktisch alles erlaubt, solange der Urhebervermerk bleibt; die Gewichte stehen unter einer eigenen Modellvereinbarung. Der Anbieter hält fest: „DeepSeek-V3 series (including Base and Chat) supports commercial use.“ (Quelle: DeepSeek-V3, Hugging Face, gelesen 2026-09-20).

Deutsche KI-Modelle und europäische Alternativen

Wer eine europäische KI-Alternative sucht, landet neben Mistral bei Teuken-7B aus dem Projekt OpenGPT-X. Die Zahl im Namen steht für sieben Milliarden Parameter und damit für die Größe des Modells. Gebaut haben es Fraunhofer, das Forschungszentrum Jülich, die TU Dresden und das DFKI, das Deutsche Forschungszentrum für Künstliche Intelligenz, gefördert vom Bundeswirtschaftsministerium. Das Modell ist auf alle 24 Amtssprachen der EU ausgelegt und soll in ihnen gleichmäßig arbeiten statt nur im Englischen:

„Teuken-7B-instruct-research-v0.4 focuses on covering all 24 EU languages and therefore renders more stable results across these languages and better reflects European values in its answers than English-centric models.“

Quelle: Teuken-7B-instruct-research-v0.4, Hugging Face, gelesen am

Achten Sie hier besonders auf die Fassung. Es gibt eine Forschungsfassung und eine kommerzielle Fassung; nur letztere steht unter Apache 2.0: „Teuken-7B-instruct-commercial-v0.4 is intended for commercial and research use in all official 24 European languages.“ (Quelle: Teuken-7B-instruct-commercial-v0.4, Hugging Face, gelesen 2026-09-20).

Welche Modelle in welchen Varianten verfügbar sind und wie viel Speicher jede davon braucht, führen wir unter welche.ai/modelle fortlaufend nach, mit Quelle je Eintrag.

Was es kostet, KI selbst zu hosten

Der Download kostet nichts, der Betrieb schon. Ob Sie ein Modell gewerblich einsetzen dürfen, entscheidet dagegen die Lizenz und nicht der Preis. Fünf Posten fallen an.

Die Hardware. Oft null, weil das vorhandene Gerät eine kleinere Variante trägt; dazu gleich mehr. Wenn doch etwas dazukommt, ist es der größte Einzelposten, und er fällt einmalig an. Entscheidend ist dabei nicht die Rechenleistung, sondern der Arbeitsspeicher: Ein Modell muss vollständig hineinpassen, sonst läuft es gar nicht oder quälend langsam.

Der Plattenplatz. Modelldateien liegen je nach Variante bei einigen bis vielen Gigabyte, und mehrere Modelle nebeneinander summieren sich schnell.

Der Strom. Ein Arbeitsplatzrechner zieht unter Last grob 100 bis 300 Watt. Bei gelegentlicher Nutzung fällt das nicht ins Gewicht, bei Dauerbetrieb schon.

Ihre Zeit. Einrichtung, Aktualisierungen, das Ausprobieren verschiedener Varianten.

Die Lizenz. Bei den meisten Familien null, weil Apache 2.0 und MIT nichts kosten. Bei einem Modell unter einer eigenen Lizenz ohne gewerbliche Nutzung ist der gewerbliche Einsatz eine Frage an den Anbieter, und damit auch eine Preisfrage.

Ob sich der Selbstbetrieb gegenüber einem Abonnement rechnet, hängt an der Zahl der Nutzer und am Umfang. Wir haben beides gegenübergestellt, mit Zahlen statt Gefühl: ChatGPT-Kosten gegen eigene Hardware. Wie die Einrichtung ohne Befehlszeile abläuft, steht Schritt für Schritt in KI lokal betreiben.

Läuft das auf meinem Gerät?

In den meisten Fällen ja, in einer kleineren Variante. Als grobe Orientierung: LM Studio empfiehlt 16 GB Arbeitsspeicher und rät einem Mac mit 8 GB zu kleineren Modellen; unter Windows empfiehlt es zusätzlich eine Grafikkarte mit mindestens 4 GB eigenem Speicher. Die Herleitung steht im Ratgeber KI lokal betreiben. Macs mit Apple-Chip haben einen Vorteil, weil sich Prozessor und Grafikeinheit denselben Speicher teilen.

Was auf Ihrem Gerät läuft, müssen Sie nicht schätzen. Geben Sie Ihr Gerät in die Suche auf welche.ai ein, dann sehen Sie die passenden Modelle samt Variante. Wenn Sie nicht sicher sind, welches Gerät Sie genau haben oder wie viel Speicher darin steckt, zeigt der Geräte-Finder, wo diese Angaben stehen.

Wenn es ums Unternehmen geht, reicht die Technikfrage nicht

Für eine Einzelperson endet der Text hier: Modell aussuchen, installieren, arbeiten. Im Betrieb kommen drei Fragen dazu, die keine Hardwarefragen mehr sind. Alle drei lassen sich klein beantworten, bevor sie groß werden.

Wer darf welches Modell einsetzen? Legen Sie eine kurze Liste erlaubter Modelle an, statt jeden Einzelfall zu prüfen. Ein Modell unter einer Lizenz ohne gewerbliche Nutzung gehört nicht darauf, auch nicht zum Ausprobieren.

Was wird dokumentiert? Eine Zeile je Modell genügt: Name, Variante, seit wann, wofür, wer freigegeben hat. Ohne diese Zeile lässt sich später nicht beantworten, womit eine Auskunft zustande kam.

Wer entscheidet über neue Modelle? Benennen Sie eine Person, die neue Modelle freigibt, und einen festen Termin dafür. Offene Modelle erscheinen wöchentlich; ohne Zuständigkeit installiert sie jeder selbst.

Wer das für mehrere Personen oder über mehrere Abteilungen hinweg ordnen muss, findet den Rahmen dafür hier:

Wenn Ihre Frage dagegen konkret lautet, welche Daten bei welchem Aufbau Ihr Haus verlassen, ist das ein eigenes Thema. Wir haben vier gängige Aufbauten gegenübergestellt und dabei aus den Datenschutzerklärungen der Anbieter zitiert: DSGVO-konforme KI. Für eine schnelle Einordnung eines einzelnen Werkzeugs gibt es die Datenschutz-Ampel.

Quellen

Alle gelesen am 20. September 2026.

Weitere Ratgeber