Lokale KI: Was das heißt, was Sie brauchen, was sie kann
Lokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
Stand: 2026-09-21
Lokale KI heißt zuerst etwas sehr Einfaches: die Modelldatei liegt auf Ihrem Gerät, und das Rechnen findet dort statt. Nicht auf einem Server, den jemand anderes betreibt, sondern auf dem Rechner, der vor Ihnen steht.
Das ist der ganze Unterschied, und alles andere folgt daraus. Beim gemieteten Zugang schicken Sie Ihre Frage an ein Rechenzentrum und bekommen die Antwort zurück. Bei einer lokalen KI laden Sie einmal eine Datei herunter, je nach Größe wenige bis viele Gigabyte, und danach passiert die Arbeit bei Ihnen. Auch ohne Internet. Dasselbe Thema läuft an anderen Stellen unter offline KI oder lokales LLM, gelegentlich auch als LLM lokal.
Dieser Text ordnet das Feld: was dabei wirklich auf Ihrem Gerät bleibt, was Sie brauchen, was heute gut funktioniert und wo die Grenzen liegen. Wie die Einrichtung Schritt für Schritt aussieht, steht in einem eigenen Ratgeber, auf den wir am Ende verweisen.
Was auf Ihrem Gerät bleibt, und was das praktisch bedeutet
Wenn ein Modell bei Ihnen läuft, verlässt der Text, den Sie eingeben, Ihren Rechner nicht: Ihre Eingabe geht an keinen fremden Dienst, weil keiner gefragt wird. Das Modell ist eine Datei, das Programm liest sie, und die Antwort entsteht im Arbeitsspeicher Ihres Geräts. Das Programm selbst hält daneben Verbindung nach außen, unter anderem zum Herunterladen von Modellen und zum Prüfen auf Aktualisierungen; Ihre Eingaben gehen dabei nicht mit, solange Sie kein Modell in der Cloud und keine Websuche nutzen.
Daraus folgen drei Dinge, die den Alltag spürbar verändern. Sie können ohne Netz arbeiten, im Zug genauso wie im Werk ohne WLAN. Es entstehen keine Kosten je Anfrage; was bleibt, sind Strom, Plattenplatz und Ihre Zeit, dazu einmalig das Gerät. Und kein Anbieter kann Ihnen über Nacht den Zugang kündigen, den Preis erhöhen oder das Modell austauschen: die Datei liegt bei Ihnen und läuft weiter. Was Sie damit tun dürfen, steht in der Lizenz des Modells, und die ist je Familie verschieden (Open Source KI).
Dafür tragen Sie selbst, was sonst der Anbieter trägt: die Auswahl des Modells, die Aktualisierung und die Rechenleistung. Das ist kein Nachteil, sondern ein Tausch. Ob er sich lohnt, hängt davon ab, was Sie vorhaben.
Was Sie brauchen: ein Modell, ein Werkzeug, ein Gerät
Ein Modell. Das ist die Datei mit dem eigentlichen Können. Sie kommt in mehreren Größen desselben Namens, und die Größe entscheidet, wie viel Speicher sie braucht und wie gut die Antworten werden. Welche Modelle es gibt und in welchen Varianten, steht in unserem Katalog: alle geführten Modelle.
Ein Werkzeug. Das ist das Programm, das die Datei lädt und bedienbar macht. Die zwei verbreiteten heißen Ollama und LM Studio; im Kern rechnen beide mit demselben Unterbau. Was die Namen bedeuten und worin sie sich unterscheiden, erklärt der Ratgeber Was ist Ollama, den Vergleich der beiden finden Sie unter Ollama oder LM Studio.
Ein Gerät mit genug Arbeitsspeicher. Hier liegt die eigentliche Hürde, und LM Studio sagt es für Windows selbst deutlich:
„At least 16GB of RAM is recommended. GPU: at least 4GB of dedicated VRAM is recommended.“
Für Macs nennt dieselbe Seite nur die Arbeitsspeicher-Zahl und keine für den Grafikspeicher, weil ein Mac keinen getrennten hat; acht Gigabyte sind dort möglich, dann aber nur mit kleineren Modellen und knappem Kontext. Ob Ihr konkretes Gerät reicht und welche Modelle darauf laufen, zeigt seine Seite in unserem Katalog mit 527 geführten Geräten, für eine einzeln gekaufte Grafikkarte die Seite des jeweiligen Modells; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?
Was lokale KI heute kann, und was nicht
Gut funktioniert alles, was mit Text arbeitet, den Sie mitliefern. Zusammenfassen, umformulieren, übersetzen, einen Entwurf ordnen, aus einer Notizsammlung eine Gliederung machen, Code erklären. Bei diesen Aufgaben steht die nötige Information in Ihrer Eingabe, und das Modell muss sie nur verarbeiten.
Schlecht funktioniert alles, wofür das Modell Wissen beisteuern soll. Ein lokales Modell ist keine Nachschlagequelle, und die Hersteller schreiben das in die Modellkarte:
„Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.“
Und der Abstand wächst, je kleiner die Variante ist. Google veröffentlicht für Gemma 3 dieselbe Messung über vier Größen der Rohfassung, in der Modellkarte als PT geführt. Bei Natural Questions, einem Test aus echten Suchanfragen, erreicht die Variante mit einer Milliarde Parametern 9,48 Punkte, die mit vier Milliarden 20,0, die mit zwölf Milliarden 31,4 und die mit 27 Milliarden 36,1. Genau die kleinen Varianten sind aber die, die auf einem gewöhnlichen Notebook laufen. Wer also ein kleines Modell nach Tatsachen fragt, bekommt die schwächste Disziplin der schwächsten Variante.
Die dritte Grenze ist der Kontext, und sie überrascht die meisten. Damit ist gemeint, wie viel Text das Modell gleichzeitig vor Augen hat. Ollama setzt hier voreingestellt einen niedrigen Wert:
„By default, Ollama uses a context window size of 4096 tokens.“
Viertausend Token sind bei deutschem Text grob zweieinhalbtausend Wörter, also ungefähr zehn Seiten. Das Modell selbst könnte deutlich mehr: Qwen3 in der Größe mit acht Milliarden Parametern gibt 32.768 Token an. Wer einen langen Vertrag zusammenfassen lässt und eine Antwort bekommt, die die zweite Hälfte ignoriert, hat meist nicht das falsche Modell, sondern die Voreinstellung übersehen.
Was daraus folgt, ist eine Arbeitsteilung, keine Entscheidung gegen das eine oder andere. Lokal läuft, was vertraulich ist oder ohne Netz stattfinden muss. Gemietet bleibt, was das größte verfügbare Können braucht. In der Praxis schließt das eine das andere selten aus.
Der nächste Schritt
Wenn Sie es privat ausprobieren wollen: mit LM Studio brauchen Sie dafür keine Kommandozeile. Der Weg steht Schritt für Schritt im Ratgeber KI lokal betreiben, ohne Terminal.
Wenn Sie wissen wollen, ob sich das gegenüber einem Abonnement rechnet: wir haben die laufenden Kosten gegen die einmalige Anschaffung gestellt, mit Zahlen statt Gefühl, unter ChatGPT-Kosten gegen eigene Hardware.
Wenn mehrere Menschen darauf zugreifen sollen: dann reden wir nicht mehr über Ihr Notebook, sondern über eine Maschine, die mehrere bedient. Das ist ein eigener Aufbau mit eigenen Fragen, und er steht im Ratgeber KI selbst hosten.
Wenn die Frage rechtlich wird: welche Daten bei welchem Aufbau Ihr Haus verlassen, stellt der Ratgeber DSGVO-konforme KI gegenüber. Für ein einzelnes Werkzeug gibt es die schnelle Einordnung über die Datenschutz-Ampel.
Quellen
Alle gelesen am 21. September 2026.
- LM Studio: System Requirements
- Ollama: häufige Fragen
- Google DeepMind: Gemma 3, Modellkarte
- Alibaba: Qwen3-8B, Modellkarte
Weitere Ratgeber
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.