Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuft
Teuken aus Deutschland, EuroLLM aus einem EU-finanzierten Verbund, Mistral aus Paris. Lizenz, Größe und auf wie vielen von 527 Geräten die Modelle flüssig laufen.
Stand: 2026-09-21
Wer nach deutschen KI-Modellen sucht, bekommt eine kurze Antwort. Wir haben ein Sprachmodell gefunden, das ein deutsches Forschungsprojekt von Grund auf trainiert hat und das Unternehmen frei nutzen und auf dem eigenen Rechner betreiben dürfen: Teuken 7B. Deutsche Weiterentwicklungen fremder Modelle gibt es mehrere; sie behandelt dieser Text nicht. Aus Europa führt unser Katalog zwei Familien dazu: EuroLLM von einem Verbund europäischer Hochschulen und Firmen und die offenen Modelle von Mistral AI aus Paris.
Dieser Text ordnet fünf dieser Modelle aus unserem Katalog ein: woher sie kommen, was ihre Lizenz erlaubt, wie groß sie sind und auf wie vielen der 527 geführten Geräte sie flüssig laufen. Er sagt auch, was wir nicht gefunden haben, denn die Lücke gehört zur Antwort.
Warum die Herkunft zählt, und wofür sie nicht reicht
Für ein Unternehmen ist die Herkunft eines Modells aus drei Gründen interessant. Die Lizenz legt fest, ob Sie es geschäftlich einsetzen dürfen. Die Dokumentation zeigt im besten Fall, wer es gebaut und bezahlt hat und womit es trainiert wurde; in den Modellkarten der Mistral-Modelle fehlen Angaben zu Geldgebern und Trainingsdaten. Und die Sprachen, mit denen ein Modell trainiert wurde, bestimmen mit, wie es mit deutschen Texten umgeht.
Für den Datenschutz zählt weniger die Herkunft als die Frage, wie und wo Sie das Modell betreiben. Das Modell selbst schickt keine Daten an seinen Hersteller, gleich ob es aus Heidelberg, Paris oder Kalifornien stammt; das Programm, das es startet, kann das sehr wohl. Was lokal betrieben wirklich im Haus bleibt und was nicht, erklärt der Ratgeber DSGVO-konforme KI. Herkunft ist ein Merkmal, kein Siegel.
Die fünf Modelle im Überblick
| Modell | Herkunft | Lizenz | Parameter | Kontext | Speicher (Q4_K_M) | läuft flüssig auf |
|---|---|---|---|---|---|---|
| Teuken 7B | OpenGPT-X, Deutschland | Apache 2.0 | 7,5 Mrd. | 4.096 Token | 6,1 GB | 509 von 527 Geräten |
| EuroLLM 9B | EU-finanzierter Verbund | Apache 2.0 | 9,2 Mrd. | 32.768 Token | 7,2 GB | 503 von 527 Geräten |
| Ministral 3 14B | Mistral AI, Frankreich | Apache 2.0 | 13,5 Mrd. | 262.144 Token | 9,9 GB | 378 von 527 Geräten |
| EuroLLM 22B | EU-finanzierter Verbund | Apache 2.0 | 22,6 Mrd. | 32.768 Token | 15,6 GB | 229 von 527 Geräten |
| Mistral Small 3.2 24B | Mistral AI, Frankreich | Apache 2.0 | 23,6 Mrd. | 131.072 Token | 16,1 GB | 219 von 527 Geräten |
Q4_K_M ist die verbreitete Quantisierungsstufe, also eine verkleinerte Fassung der Modelldatei. Speicherbedarf und Gerätezahl sind für 4.096 Token Kontext berechnet. Wer den längeren Kontext eines Modells ausschöpft, braucht mehr Speicher, und das Modell läuft dann auf weniger Geräten.
Alle fünf stehen unter der Apache-2.0-Lizenz und dürfen damit auch geschäftlich eingesetzt, verändert und weitergegeben werden. Wer sie weitergibt, muss unter anderem den Lizenztext beilegen und eigene Änderungen kennzeichnen. Was eine solche Lizenz im Einzelnen erlaubt, erklärt der Ratgeber Open Source KI. Der Kontext gibt an, wie viel Text ein Modell auf einmal verarbeiten kann; ein Token ist ungefähr ein Wortteil.
Teuken 7B: das Modell aus Deutschland, in der richtigen Fassung
Teuken stammt aus dem Forschungsprojekt OpenGPT-X. Entwickelt haben es laut Modellkarte Fraunhofer, das Forschungszentrum Jülich, die TU Dresden und das DFKI, gefördert vom Bundesministerium für Wirtschaft und Klimaschutz (BMWK). Die Karte beschreibt das Modell so:
„Teuken-7B-instruct-commercial-v0.4 is an instruction-tuned 7B parameter multilingual large language model (LLM) pre-trained with 4T tokens in all official 24 European languages and released under Apache 2.0 in the research project OpenGPT-X.“
Wichtig ist der Zusatz im Namen. Von Teuken gibt es drei Fassungen, die auf Anweisungen trainiert sind, und nur eine davon dürfen Sie im Unternehmen einsetzen:
| Fassung | Lizenz | geschäftlich nutzbar |
|---|---|---|
| instruct-commercial-v0.4 | Apache 2.0 | ja |
| instruct-research-v0.4 | eigene Lizenz von Fraunhofer | nein |
| instruct-v0.6 | CC BY-NC 4.0 | nein |
Die Forschungsfassung erlaubt laut ihrem Lizenztext nur nicht-kommerzielle wissenschaftliche Forschung und schließt das Verändern und Weitergeben aus. Die neuere Fassung v0.6 wurde mit mehr Daten trainiert, ist aber ebenfalls nicht für den geschäftlichen Einsatz freigegeben:
„Teuken 7B-instruct-v0.6 is designed for private, non-commercial, research, and educational use in all 24 official European Union languages.“
Unser Katalog führt deshalb die kommerzielle Fassung. Mit der Variante Q4_K_M braucht sie rund 6,1 GB Speicher und läuft auf 509 von 527 geführten Geräten flüssig.
Die Grenze liegt beim Kontext: 4.096 Token sind für längere Dokumente eng. EuroLLM verarbeitet das Achtfache.
EuroLLM: ein Verbund statt eines Labors
EuroLLM kommt nicht von einer einzelnen Firma, sondern von einem Verbund aus Hochschulen und Unternehmen, darunter die Universitäten von Lissabon, Edinburgh und Amsterdam, Unbabel und die Sorbonne. Finanziert hat es laut Modellkarte die Europäische Union. Das Ziel beschreibt die Karte so:
„The EuroLLM project has the goal of creating a suite of LLMs capable of understanding and generating text in all European Union languages as well as some additional relevant languages.“
Deutsch steht in der Sprachliste beider Größen. Die Karte des 22B-Modells hebt außerdem Übersetzungen zwischen den EU-Amtssprachen hervor.
Die kleine Größe, EuroLLM 9B, braucht mit Q4_K_M rund 7,2 GB und läuft auf 503 von 527 Geräten. Die große, EuroLLM 22B, braucht rund 15,6 GB und läuft auf 229 Geräten. Beide verarbeiten 32.768 Token Kontext. Auch EuroLLM steht nicht in der offiziellen Bibliothek von Ollama; die Startbefehle auf unseren Modellseiten laden die Dateien von Hugging Face, auch hier in Umwandlungen Dritter.
Mistral: das Unternehmen aus Paris
Mistral AI sitzt in Paris, so steht es im Impressum des Unternehmens. Zwei seiner offenen Modelle führen wir. Ministral 3 14B braucht mit Q4_K_M rund 9,9 GB und läuft auf 378 Geräten; sein Kontext von 262.144 Token ist der größte der fünf. Mistral Small 3.2 24B braucht rund 16,1 GB und läuft auf 219 Geräten.
Deutsch steht bei beiden in der Sprachliste, und beide werten laut ihren Modellkarten neben Text auch Bilder aus. Anders als Teuken und EuroLLM stehen sie in der offiziellen Bibliothek von Ollama. Die Startbefehle auf unseren Modellseiten laden beide trotzdem von Hugging Face, Ministral in der Fassung von Mistral selbst, Mistral Small 3.2 in der Umwandlung eines Dritten.
Was wir nicht gefunden haben
Ein weiteres Sprachmodell, das in Deutschland von Grund auf trainiert wurde und das Unternehmen frei nutzen dürfen, haben wir nicht gefunden. Zwei Kandidaten, auf die man dabei stößt, scheitern an der Lizenz oder am Zugang.
Aleph Alpha aus Heidelberg veröffentlicht die Gewichte seiner Pharia-Modelle, aber nicht für den geschäftlichen Einsatz:
„They are publicly available under the Open Aleph License, a license explicitly allowing for non-commercial research and educational use.“
SOOFI begegnet Ihnen, wenn Sie nach einem neuen deutschen Modell suchen. Die Modelle liegen seit Juni 2026 bei Hugging Face, tragen dort aber die Lizenzangabe closed-beta. Die Dateien erhalten Sie erst, wenn Sie Ihre Kontaktdaten angeben und der Anbieter Ihre Anfrage freigibt. Eine spätere offene Fassung kündigt die Seite an, ohne Termin:
„The final model will be released openly under a permissive license, without gated access.“
Außerhalb Deutschlands stößt man zudem auf Salamandra aus Barcelona. Das Modell steht unter Apache 2.0, wurde beim Nachtraining auf Anweisungen aber vor allem auf drei andere Sprachen ausgerichtet:
„This instructed-tuned variant has been fine-tuned with a collection of 273k instructions, focusing on the performance of Catalan, English and Spanish.“
Was ebenfalls fehlt: ein Urteil über die Qualität. Wenn die Sprachliste einer Modellkarte Deutsch nennt, heißt das nicht, dass das Modell auf Deutsch gut schreibt. Gemessen haben wir das bei keinem der fünf. Bevor Sie sich festlegen, probieren Sie das Modell mit Ihren eigenen Texten aus.
Welches für Sie passt
Wenn die Herkunft aus Deutschland zählt: Teuken 7B, und zwar in der kommerziellen Fassung. Es läuft auf fast jedem der 527 Geräte in unserem Katalog, ist aber für lange Texte knapp bemessen.
Wenn Sie längere Dokumente verarbeiten: EuroLLM mit 32.768 Token, Mistral Small 3.2 24B mit 131.072 oder Ministral 3 14B mit 262.144. Rechnen Sie dabei mit mehr Speicher als in der Tabelle oben, denn sie gilt für kurze Eingaben. Welches Modell auf Ihr Gerät passt, zeigt die Seite Ihres Geräts in unserem Katalog; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?
Wenn auch Bilder dazugehören: Mistral Small 3.2 24B, bei dem unsere Modellseite die Bildeingabe ausweist; es braucht rund 16,1 GB. Ministral 3 14B wertet laut Modellkarte ebenfalls Bilder aus; auf unserer Modellseite ist das nicht vermerkt.
Welches Modell im Unternehmen eingesetzt wird, ist selten allein eine Technikfrage. Zur selben Auswahl gehören drei Fragen: wer entscheidet, wer zugreifen darf und wie der Einsatz dokumentiert wird.
Weitere Ratgeber
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.