OpenClaw lokal: mit Ollama oder LM Studio einrichten
OpenClaw mit einem lokalen Modell über Ollama oder LM Studio: installieren, einrichten, passende Modelle wählen und wissen, was trotzdem ins Netz geht.
Stand: 2026-09-25
OpenClaw ist ein quelloffener KI-Assistent, der auf Ihrem eigenen Rechner läuft und über Chat-Programme wie WhatsApp, Telegram, Slack oder Discord erreichbar ist. Anders als ein Chatfenster handelt er selbst: Er liest und schreibt Dateien, führt Befehle aus, bedient einen Browser und erledigt Aufgaben nach Zeitplan. Das Projekt steht unter der MIT-Lizenz und wird von der OpenClaw Foundation getragen; einen gehosteten Dienst des Projekts gibt es nicht. Frühere Namen waren unter anderem Clawdbot und Moltbot, seit dem 30. Januar 2026 heißt es OpenClaw.
Welches Sprachmodell dahinter rechnet, entscheiden Sie. Das kann ein Modell in der Cloud sein oder eines auf Ihrer eigenen Hardware. Dieser Text zeigt drei Wege zum lokalen Modell, welche Modelle dafür taugen und was „lokal“ bei OpenClaw heißt.
OpenClaw installieren
Ein Installationsskript richtet OpenClaw ein und bringt die nötige Node.js-Umgebung gleich mit. Unter macOS, Linux und in WSL2 unter Windows:
curl -fsSL https://openclaw.ai/install.sh | bash
In der PowerShell unter Windows:
iwr -useb https://openclaw.ai/install.ps1 | iex
Für Windows gibt es außerdem eine eigene App, den Windows Hub. Danach führt openclaw onboard durch die Einrichtung, auch durch die Wahl des Modells.
OpenClaw zählt seine Versionen nach dem Kalender; Stand 25. September 2026 ist 2026.9.6 die neueste. Die Version 2026.8.1 vom 31. August 2026 nennt das Projekt selbst OpenClaw 2.0. Sie brachte eine neu gebaute Weboberfläche und eine einfachere Einrichtung, die vorhandene Zugänge und lokale Modelle von Anfang an aufgreift.
Weg 1: OpenClaw mit Ollama
OpenClaw findet Ollama und LM Studio beim Einrichten von selbst, sofern sie laufen. Wählen Sie bei openclaw onboard Ollama und dann den Modus Local only. Beim Modus Cloud + Local bietet OpenClaw auch Modelle an, die in der Cloud von Ollama rechnen; wählen Sie eines davon, verlassen Ihre Anfragen das Haus. Einen echten Zugangsschlüssel braucht OpenClaw für ein Ollama auf demselben Rechner oder im eigenen Netz nicht.
Wichtig ist die Adresse. Ollama bietet zwei Schnittstellen an, und OpenClaw braucht die eigene von Ollama, nicht die OpenAI-kompatible unter /v1, die andere Programme verwenden:
„Do not use the /v1 OpenAI-compatible URL (http://host:11434/v1). It breaks tool calling and models can emit raw tool-call JSON as plain text.“
Von Hand eingetragen sieht das in der Einstellungsdatei ~/.openclaw/openclaw.json so aus:
{
agents: {
defaults: { model: { primary: "ollama/qwen3.5:9b" } },
},
models: {
providers: {
ollama: {
apiKey: "ollama-local",
baseUrl: "http://127.0.0.1:11434",
api: "ollama",
models: [{ id: "qwen3.5:9b", name: "qwen3.5:9b" }],
},
},
},
}
Die Kennung hinter id muss so lauten, wie ollama list das Modell anzeigt. Bei openclaw onboard schlägt OpenClaw von sich aus nur Modelle vor, die gerade im Arbeitsspeicher laufen, etwa nach ollama run qwen3.5:9b, die Werkzeugaufrufe beherrschen und mindestens 16.384 Token Kontext haben. Zur Laufzeit rechnet OpenClaw mit Ollama dann mit 32.768 Token Kontext, oder mit weniger, wenn das Modell weniger kann; OpenClaw stellt das bei Ollama selbst ein, anders als Programme, die über /v1 gehen. Das ist deutlich mehr als bei einem kurzen Chat, und mehr Kontext braucht mehr Speicher.
Weg 2: OpenClaw mit LM Studio
OpenClaw bringt LM Studio als eigenen Anbieter mit. Starten Sie in LM Studio den lokalen Server und wählen Sie bei openclaw onboard LM Studio und ein Modell. Verlangt LM Studio keinen Schlüssel, weil die Authentifizierung dort ausgeschaltet ist, bleibt das Feld leer:
„If LM Studio authentication is disabled, leave the API key blank during setup.“
OpenClaw spricht LM Studio unter http://localhost:1234 an und lädt Modelle dort mit bis zu 64.000 Token Kontext. Ist Qwen3.5 9B in LM Studio vorhanden, nimmt OpenClaw es als Standardmodell. Welches der beiden Programme besser zu Ihnen passt, vergleicht unser Ratgeber Ollama oder LM Studio.
Weg 3: OpenClaw verwaltet das Modell selbst
OpenClaw kann einen Server auf Basis von llama.cpp auch selbst herunterladen und betreiben. Dafür installieren Sie zuerst eine Erweiterung und wählen dann bei openclaw onboard die Einstellung Managed local server:
openclaw plugins install @openclaw/llama-cpp-provider
OpenClaw sucht dann ein Modell passend zu Ihrem Speicher aus und prüft mit einem echten Werkzeugaufruf, ob es taugt. Auf dem Mac mit Apple-Chip rechnet dieser Server auf der Grafik, unter Windows mit NVIDIA-Karte ebenfalls. Unter Linux rechnet er immer auf dem Prozessor, auch wenn eine Grafikkarte eingebaut ist; wer sie dort nutzen will, nimmt Ollama oder LM Studio.
Welche Modelle für OpenClaw taugen
Ein Agent stellt andere Anforderungen als ein Chat. Das Modell muss Werkzeuge zuverlässig aufrufen, also in einem festen Format sagen, welche Datei es lesen oder welchen Befehl es ausführen will, und es muss lange Verläufe im Blick behalten. Die Doku warnt ausdrücklich:
„A model that loads or answers a short prompt may still fail an agent turn.“
Für den selbst verwalteten Server empfiehlt OpenClaw diese Modelle, jeweils mit 65.536 Token Kontext und mit Werkzeugaufrufen. Die letzte Spalte stammt aus unserem Katalog und gilt für dieselbe Kontextlänge:
| Modell | Mindestspeicher des Rechners laut OpenClaw | läuft flüssig mit 65.536 Token |
|---|---|---|
| Qwen3.5 4B | 8 GB | auf 526 von 544 Geräten |
| Qwen3.5 9B | 16 GB | auf 407 von 544 Geräten |
| Gemma 4 12B | 24 GB und Grafikbeschleunigung | auf 407 von 544 Geräten |
| Qwen3.8 27B | 32 GB und Grafikbeschleunigung | auf 202 von 544 Geräten |
Für das kleinste empfohlene Modell braucht der Rechner also mindestens 8 GB Arbeitsspeicher, für Qwen3.5 9B 16 GB. OpenClaw nennt Qwen3.8 als erste Wahl, sobald der Speicher reicht. Ein fünftes Modell der Liste, Muse Glimmer 30B, führt unser Katalog nicht. Auf Rechnern ohne Grafikbeschleunigung endet die Empfehlung bei Qwen3.5 9B, und die erste Antwort kann dort mehrere Minuten dauern. Auf welchem Gerät ein Modell läuft, zeigt jede Modellseite; einen Überblick über die Modellgrößen gibt der Ratgeber Lokale KI-Modelle.
Ist OpenClaw komplett lokal?
OpenClaw selbst betreiben Sie; Zustand, Gedächtnis und Zugangsdaten liegen auf Ihrem Gerät. Mit einem lokalen Modell gehen Ihre Anfragen nicht an einen Modellanbieter. Die Doku sagt dazu:
„Local-only is still the strongest privacy path.“
Komplett lokal ist OpenClaw damit aber noch nicht. In der Grundeinstellung oder je nach Einrichtung geht trotzdem einiges ins Netz:
- Die tägliche Versionsabfrage. OpenClaw fragt einmal am Tag, ob es eine neuere Version gibt, und schickt dabei Version, Betriebssystem, Node.js-Version und Prozessorarchitektur mit, keine Nachrichten. Aus Ihrer IP-Adresse leitet der Empfänger einen ungefähren Standort ab und bewahrt die Einträge drei Monate auf. Abschalten lässt sich die Abfrage mit
update.checkOnStart: falsein der Einstellungsdatei. - Das Gedächtnis. Um ähnliche Notizen wiederzufinden, rechnet OpenClaw Texte in Zahlenvektoren um, sogenannte Embeddings, und zwar in der Grundeinstellung bei OpenAI, sobald ein OpenAI-Schlüssel hinterlegt ist. Ohne Schlüssel sucht das Gedächtnis nur nach Stichworten. Wer lokal rechnen will, stellt den Anbieter ausdrücklich auf
ollama,lmstudiooderlocalum. - Die Chat-Kanäle. Schreiben Sie OpenClaw über WhatsApp oder Telegram, laufen Ihre Nachrichten über die Server dieser Dienste, gleich wo das Modell rechnet.
- Websuche und Browser. Die Websuche schickt Ihre Suchbegriffe an den eingestellten Suchdienst, der Browser ruft Seiten im Netz ab.
- Erweiterungen aus ClawHub. Sind Sie bei der Sammlung ClawHub angemeldet, meldet OpenClaw beim Installieren Name und Version der Erweiterung dorthin; abschalten lässt sich das mit
CLAWHUB_DISABLE_TELEMETRY=1. - Ollama und LM Studio selbst. Auch die beiden Programme melden sich bei ihrem Hersteller, etwa um nach Aktualisierungen zu fragen. Was genau, steht im Ratgeber Ollama oder LM Studio.
Kleine Modelle und Sicherheit
Lokal laufen vor allem kleinere Modelle, und genau die hält OpenClaw für riskant, sobald der Agent Werkzeuge benutzt oder fremde Inhalte liest, etwa Webseiten oder E-Mails. Solche Inhalte können versteckte Anweisungen enthalten, die das Modell befolgt:
„For tool-enabled agents or agents that read untrusted content, prompt-injection risk with older/smaller models is often too high. Do not run those workloads on weak model tiers.“
Für reine Gesprächsassistenten ohne Werkzeuge und mit vertrauenswürdigen Eingaben hält dieselbe Seite kleinere Modelle für meist unproblematisch. Wer ein kleines Modell mit Werkzeugen nutzen will, sollte die Rechte eng halten: nur lesende Werkzeuge, wenig Zugriff aufs Dateisystem, Websuche, Seitenabruf und Browser abschalten und die Sandbox einschalten, einen abgeschotteten Bereich, in dem die Werkzeuge laufen. Die ist ab Werk aus; so steht es in der Doku zur Sandbox, und so ist es im Quelltext voreingestellt. In der Grundeinstellung braucht sie Docker, und sie ist laut Doku keine vollständige Grenze, schränkt den Zugriff auf Dateien und Prozesse aber deutlich ein.
Vorsicht gilt auch bei Erweiterungen. Anfang Februar 2026 fand VirusTotal Hunderte schädliche Erweiterungen in der Sammlung ClawHub. Seit dem 7. Februar 2026 prüft ClawHub alle Einträge mit VirusTotal und wiederholt die Prüfung täglich; auch das findet nach eigener Aussage nicht alles. Die Doku rät:
„Treat third-party skills as untrusted code. Read them before enabling.“
Und halten Sie OpenClaw aktuell. Seit Januar 2026 hat das Projekt 722 Sicherheitshinweise veröffentlicht, 14 davon kritisch; für alle kritischen gibt es eine berichtigte Version.
Wann ein lokales Modell nicht reicht
Für längere Aufgaben mit vielen Schritten, für Programmierarbeit über mehrere Dateien oder für einen Agenten, der täglich fremde Webseiten liest, sind die Modelle, die auf einem gewöhnlichen Rechner laufen, oft zu schwach. Dann bleibt die Wahl zwischen einem größeren Gerät, einem Modell in der Cloud mit den bekannten Folgen für den Datenschutz, oder einem enger gefassten Einsatz: OpenClaw als Assistent für Termine, Notizen und Dateien im eigenen Ordner, mit wenigen Rechten. Welche Aufbauten welche Daten wohin schicken, vergleicht unsere Datenschutz-Ampel.
Quellen: OpenClaw auf GitHub (README, LICENSE, Releases, docs/start/lore.md), OpenClaw-Doku zu Local models, Ollama, LM Studio, llama.cpp, Windows, Sandboxing, Prompt injection, Skills, Web tools, Telemetry, ClawHub telemetry, Memory search und Release 2026.8.1, Sicherheitshinweise des Projekts, Blog von VirusTotal vom 2. Februar 2026, Blog von OpenClaw zur Partnerschaft mit VirusTotal, Blog von OpenClaw zu OpenClaw 2.0, alle gelesen 2026-09-25.
Weitere Ratgeber
- Mac mini für lokale KI: Welche Ausstattung reicht und wann es der Mac Studio sein mussBeim Mac zählt der Arbeitsspeicher, nicht die ganze Zahl. Was der Mac mini mit M4, M5 Pro und M6 trägt, wann es der Mac Studio sein muss und was gebraucht zählt.
- DeepSeek Harness installieren und lokal nutzenDeepSeek Harness ist der quelloffene Programmier-Agent von DeepSeek. Wie Sie ihn installieren, mit einem lokalen Modell verbinden und was an DeepSeek geht.
- Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuftTeuken aus Deutschland, EuroLLM aus einem EU-Projekt, Mistral aus Paris, Apertus aus der Schweiz. Lizenz, Größe und auf wie vielen der 544 Geräte sie flüssig laufen.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 326 von 544 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuftOrnith 1.5 in drei Größen: Die kleinste läuft beim Ausprobieren auf 413 von 544 Geräten flüssig, die größte auf 9. Was jede braucht und wann ein Verbund hilft.
- Qwen-Image: KI-Bilder lokal erzeugen und die richtige Fassung wählenQwen-Image erzeugt Bilder auf dem eigenen Rechner. Die neue Fassung 2.1 ist nur für Forschung und Erprobung freigegeben, für Unternehmen ist 2512 die Fassung. Was beide an Speicher brauchen und wie lange ein Bild auf unserer Karte dauerte.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.