Lokale KI: Was das heißt, was Sie brauchen, was sie kann

Lokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.

Stand: 2026-09-21

Lokale KI heißt zuerst etwas sehr Einfaches: die Modelldatei liegt auf Ihrem Gerät, und das Rechnen findet dort statt. Nicht auf einem Server, den jemand anderes betreibt, sondern auf dem Rechner, der vor Ihnen steht.

Das ist der ganze Unterschied, und alles andere folgt daraus. Beim gemieteten Zugang schicken Sie Ihre Frage an ein Rechenzentrum und bekommen die Antwort zurück. Bei einer lokalen KI laden Sie einmal eine Datei herunter, je nach Größe wenige bis viele Gigabyte, und danach passiert die Arbeit bei Ihnen. Auch ohne Internet. Dasselbe Thema läuft an anderen Stellen unter offline KI oder lokales LLM, gelegentlich auch als LLM lokal.

Dieser Text ordnet das Feld: was dabei wirklich auf Ihrem Gerät bleibt, was Sie brauchen, was heute gut funktioniert und wo die Grenzen liegen. Wie die Einrichtung Schritt für Schritt aussieht, steht in einem eigenen Ratgeber, auf den wir am Ende verweisen.

Was auf Ihrem Gerät bleibt, und was das praktisch bedeutet

Wenn ein Modell bei Ihnen läuft, verlässt der Text, den Sie eingeben, Ihren Rechner nicht: Ihre Eingabe geht an keinen fremden Dienst, weil keiner gefragt wird. Das Modell ist eine Datei, das Programm liest sie, und die Antwort entsteht im Arbeitsspeicher Ihres Geräts. Das Programm selbst hält daneben Verbindung nach außen, unter anderem zum Herunterladen von Modellen und zum Prüfen auf Aktualisierungen; Ihre Eingaben gehen dabei nicht mit, solange Sie kein Modell in der Cloud und keine Websuche nutzen.

Daraus folgen drei Dinge, die den Alltag spürbar verändern. Sie können ohne Netz arbeiten, im Zug genauso wie im Werk ohne WLAN. Es entstehen keine Kosten je Anfrage; was bleibt, sind Strom, Plattenplatz und Ihre Zeit, dazu einmalig das Gerät. Und kein Anbieter kann Ihnen über Nacht den Zugang kündigen, den Preis erhöhen oder das Modell austauschen: die Datei liegt bei Ihnen und läuft weiter. Was Sie damit tun dürfen, steht in der Lizenz des Modells, und die ist je Familie verschieden (Open Source KI).

Dafür tragen Sie selbst, was sonst der Anbieter trägt: die Auswahl des Modells, die Aktualisierung und die Rechenleistung. Das ist kein Nachteil, sondern ein Tausch. Ob er sich lohnt, hängt davon ab, was Sie vorhaben.

Was Sie brauchen: ein Modell, ein Werkzeug, ein Gerät

Ein Modell. Das ist die Datei mit dem eigentlichen Können. Sie kommt in mehreren Größen desselben Namens, und die Größe entscheidet, wie viel Speicher sie braucht und wie gut die Antworten werden. Welche Modelle es gibt und in welchen Varianten, steht in unserem Katalog: alle geführten Modelle.

Ein Werkzeug. Das ist das Programm, das die Datei lädt und bedienbar macht. Die zwei verbreiteten heißen Ollama und LM Studio; im Kern rechnen beide mit demselben Unterbau. Was die Namen bedeuten und worin sie sich unterscheiden, erklärt der Ratgeber Was ist Ollama, den Vergleich der beiden finden Sie unter Ollama oder LM Studio.

Ein Gerät mit genug Arbeitsspeicher. Hier liegt die eigentliche Hürde, und LM Studio sagt es für Windows selbst deutlich:

„At least 16GB of RAM is recommended. GPU: at least 4GB of dedicated VRAM is recommended.“

Quelle: LM Studio, System Requirements, gelesen am

Für Macs nennt dieselbe Seite nur die Arbeitsspeicher-Zahl und keine für den Grafikspeicher, weil ein Mac keinen getrennten hat; acht Gigabyte sind dort möglich, dann aber nur mit kleineren Modellen und knappem Kontext. Ob Ihr konkretes Gerät reicht und welche Modelle darauf laufen, zeigt seine Seite in unserem Katalog mit 527 geführten Geräten, für eine einzeln gekaufte Grafikkarte die Seite des jeweiligen Modells; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?

Was lokale KI heute kann, und was nicht

Gut funktioniert alles, was mit Text arbeitet, den Sie mitliefern. Zusammenfassen, umformulieren, übersetzen, einen Entwurf ordnen, aus einer Notizsammlung eine Gliederung machen, Code erklären. Bei diesen Aufgaben steht die nötige Information in Ihrer Eingabe, und das Modell muss sie nur verarbeiten.

Schlecht funktioniert alles, wofür das Modell Wissen beisteuern soll. Ein lokales Modell ist keine Nachschlagequelle, und die Hersteller schreiben das in die Modellkarte:

„Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.“

Quelle: Gemma 3, Modellkarte von Google DeepMind, gelesen am

Und der Abstand wächst, je kleiner die Variante ist. Google veröffentlicht für Gemma 3 dieselbe Messung über vier Größen der Rohfassung, in der Modellkarte als PT geführt. Bei Natural Questions, einem Test aus echten Suchanfragen, erreicht die Variante mit einer Milliarde Parametern 9,48 Punkte, die mit vier Milliarden 20,0, die mit zwölf Milliarden 31,4 und die mit 27 Milliarden 36,1. Genau die kleinen Varianten sind aber die, die auf einem gewöhnlichen Notebook laufen. Wer also ein kleines Modell nach Tatsachen fragt, bekommt die schwächste Disziplin der schwächsten Variante.

Die dritte Grenze ist der Kontext, und sie überrascht die meisten. Damit ist gemeint, wie viel Text das Modell gleichzeitig vor Augen hat. Ollama setzt hier voreingestellt einen niedrigen Wert:

„By default, Ollama uses a context window size of 4096 tokens.“

Quelle: Ollama, häufige Fragen, gelesen am

Viertausend Token sind bei deutschem Text grob zweieinhalbtausend Wörter, also ungefähr zehn Seiten. Das Modell selbst könnte deutlich mehr: Qwen3 in der Größe mit acht Milliarden Parametern gibt 32.768 Token an. Wer einen langen Vertrag zusammenfassen lässt und eine Antwort bekommt, die die zweite Hälfte ignoriert, hat meist nicht das falsche Modell, sondern die Voreinstellung übersehen.

Was daraus folgt, ist eine Arbeitsteilung, keine Entscheidung gegen das eine oder andere. Lokal läuft, was vertraulich ist oder ohne Netz stattfinden muss. Gemietet bleibt, was das größte verfügbare Können braucht. In der Praxis schließt das eine das andere selten aus.

Der nächste Schritt

Wenn Sie es privat ausprobieren wollen: mit LM Studio brauchen Sie dafür keine Kommandozeile. Der Weg steht Schritt für Schritt im Ratgeber KI lokal betreiben, ohne Terminal.

Wenn Sie wissen wollen, ob sich das gegenüber einem Abonnement rechnet: wir haben die laufenden Kosten gegen die einmalige Anschaffung gestellt, mit Zahlen statt Gefühl, unter ChatGPT-Kosten gegen eigene Hardware.

Wenn mehrere Menschen darauf zugreifen sollen: dann reden wir nicht mehr über Ihr Notebook, sondern über eine Maschine, die mehrere bedient. Das ist ein eigener Aufbau mit eigenen Fragen, und er steht im Ratgeber KI selbst hosten.

Wenn die Frage rechtlich wird: welche Daten bei welchem Aufbau Ihr Haus verlassen, stellt der Ratgeber DSGVO-konforme KI gegenüber. Für ein einzelnes Werkzeug gibt es die schnelle Einordnung über die Datenschutz-Ampel.

Quellen

Alle gelesen am 21. September 2026.

Weitere Ratgeber