KI-Agenten mit lokalem Modell: zwölf Werkzeuge im Vergleich

OpenClaw, Hermes Agent, DeepSeek Harness und neun weitere Agenten mit einem Modell auf dem eigenen Rechner: was jeder verlangt, was Ihr Gerät hergibt und welcher zu Ihnen passt.

Stand: 2026-09-26

Ein KI-Agent ist kein Chatfenster. Er liest und schreibt Dateien, führt Befehle aus, ruft Webseiten ab und arbeitet eine Aufgabe über viele Schritte ab. Dafür braucht er zwei Dinge, die ein Chat nicht braucht: ein Modell, das Werkzeuge zuverlässig aufruft, und Platz für einen langen Verlauf. Beides entscheidet darüber, ob ein Agent auf Ihrem Rechner arbeitet oder nach drei Schritten stehen bleibt.

Dieser Text vergleicht zwölf Agenten, die sich mit einem Modell auf dem eigenen Gerät betreiben lassen. Versionsnummern nennen wir hier bewusst nicht; bei diesen Projekten erscheint oft mehrmals pro Woche eine neue. Die Einzelratgeber führen sie mit Datum, und die Angaben unten sind die, die sich nicht wöchentlich ändern.

Die Grenze ist der Kontext, nicht das Modell

Die häufigste Enttäuschung beim ersten Versuch hat nichts mit dem Modell zu tun. Sie hat damit zu tun, wie viel Text das Modell gleichzeitig im Blick behalten darf. Ollama stellt diesen Wert nach dem verfügbaren Grafikspeicher ein, und zwar in drei Stufen: unter 24 GiB auf 4.096 Token, zwischen 24 und 48 GiB auf 32.768, ab 48 GiB auf 262.144. Auf derselben Seite steht der Satz, der das für einen Agenten zunichtemacht:

„Tasks which require large context like web search, agents, and coding tools should be set to at least 64000 tokens.“

Quelle: Ollama, Context length, gelesen am

Für jeden Rechner unter 24 GiB Grafikspeicher passt das nicht zusammen: eingestellt sind 4.096 Token, empfohlen mindestens 64.000. Das ist der Grund, warum ein Agent mit einem Modell antwortet, das im Chat tadellos läuft, und trotzdem die halbe Aufgabe vergisst. Wer einen Agenten betreibt, stellt den Kontext von Hand ein. Die Regel spricht von Grafikspeicher. Auf einem Mac mit Apple-Chip liegt der Wert, den Ollama als Grafikspeicher zählt, deutlich unter dem verbauten Arbeitsspeicher. Verlassen Sie sich dort nicht auf die Stufen, sondern stellen Sie den Kontext von Hand ein und sehen Sie in der Spalte CONTEXT von ollama ps nach, was wirklich anliegt.

Schlimmer als der kleine Wert ist, dass nichts davon zu sehen ist. Aider beschreibt es am deutlichsten:

„Ollama uses a 2k context window by default, which is very small for working with aider. It also silently discards context that exceeds the window. This is especially dangerous because many users don’t even realize that most of their data is being discarded by Ollama.“

Quelle: Aider, Ollama, gelesen am

Die 2.048 sind Ollamas alter Festwert; seit den Speicherstufen sind es 4.096, an der Sache ändert das nichts. Es gibt keine Fehlermeldung, sondern einen Agenten, der plötzlich vergisst, was drei Schritte vorher besprochen wurde. Drei der zwölf nehmen sich der Sache selbst an: Aider setzt Ollamas Fenster auf die Größe der Anfrage plus 8.000 Token für die Antwort, OpenClaw und Cline stellen es über Ollamas eigene Schnittstelle auf 32.768. Hermes Agent versucht es ebenfalls, kommt damit bei Ollama aber nicht durch; warum, steht weiter unten. Bei den übrigen acht stellen Sie es ein.

Was das für die Gerätewahl bedeutet, zeigt ein Vergleich. Gemma 4 31B läuft bei den 4.096 Token eines Chats auf 202 von 558 Geräten flüssig, bei den 65.536 Token eines Agenten nur noch auf 72. Das kompakte Qwen3.5 9B verliert dagegen kaum: 414 gegen 408. Der Kontext belegt Speicher zusätzlich zum Modell, und deshalb passt ein Modell, das im Chat bequem läuft, als Agent womöglich nicht mehr hinein.

Die zwölf Werkzeuge im Überblick

WerkzeugWas es istLizenzlokal überWas die Doku zum Kontext sagt
OpenClawAssistent, über Chat-Dienste erreichbarMITOllama, LM Studio, eigener llama.cpp-Servererkennt ab 16.384, rechnet mit 32.768; lädt in LM Studio mit 64.000
Hermes AgentAssistent und Programmier-Agent, Terminal, App und Chat-DiensteMITOllama über /v1, LM Studiomindestens 64.000, im Quelltext festgelegt
DeepSeek HarnessProgrammier-Agent, Browser-Oberfläche und Desktop-VorschauMITeigener Modellzugangkeine Angabe
OpenCodeProgrammier-Agent, Terminal und EditorMITOllama, LM Studio, llama.cppeigene Doku 16.000 bis 32.000, Ollama verlangt 64.000
OpenHandsAgenten-Plattform in DockerMITLM Studio, Ollama, vLLM, SGLang, Atomic Chatmindestens 22.000, empfohlen 32.768
GooseAssistent, App und KommandozeileApache 2.0Ollama, LM Studio, Ramalama, Atomic Chat4.096 ist „too low“
ClineEditor-Erweiterung, auch App und KommandozeileApache 2.0Ollama, LM Studio, Atomic Chatkeine Zahl auf der Seite zum lokalen Betrieb
AiderProgrammier-Agent, TerminalApache 2.0Ollama, OpenAI-kompatibelsetzt Anfrage plus 8.000 Token selbst
Codex CLIProgrammier-Agent, TerminalApache 2.0codex --oss gegen Ollama und LM Studiolaut Ollama mindestens 64.000; die Codex-Doku selbst nennt keine Zahl
Claude CodeProgrammier-Agent, Terminal und Editorproprietärvom Hersteller nicht unterstütztlaut Ollama 64.000 und mehr für größere Projekte; Anthropic nennt keine Zahl
Qwen CodeProgrammier-Agent, TerminalApache 2.0alles OpenAI-kompatiblenur ein Beispiel mit 32.768
n8nAblaufsteuerung mit einem Agenten-BausteinSustainable Use LicenseBaustein „Ollama Chat Model“nicht dokumentiert

Zwei Zeilen dieser Tabelle brauchen eine Erklärung. Claude Code lässt sich technisch über einen Vermittlungsdienst auf ein lokales Modell umbiegen, aber Anthropic schließt die Unterstützung dafür ausdrücklich aus:

„Anthropic doesn’t endorse, maintain, or audit third-party gateway products, and doesn’t support routing Claude Code to non-Claude models through any gateway.“

Quelle: Claude Code, LLM gateway, gelesen am

Wer es trotzdem tut, arbeitet ohne Unterstützung des Herstellers. Und n8n steht unter der Sustainable Use License in der Fassung 1.0, die trotz offenem Quelltext keine von der Open Source Initiative anerkannte Lizenz ist; der Anbieter selbst nennt das fair-code. Ein Teil des Quelltexts fällt nicht einmal darunter: Dateien mit .ee. im Namen und Ordner mit .ee im Namen verlangen eine kostenpflichtige Unternehmenslizenz. Wer n8n in einer Firma einsetzt, liest die Bedingungen vorher.

Bei Cline nennt die Seite zum lokalen Betrieb keine Kontextlänge, sondern nur eine Speicherempfehlung: 16 bis 32 GB für kleine und verkleinerte Modelle, 32 bis 64 GB für mittlere Programmiermodelle, 64 GB und mehr für größere Modelle und längere Kontexte. Wir führen hier keine Zahl, die dort nicht steht. Im Programm selbst ist eine gesetzt: Cline verlangt von Ollama 32.768 Token, solange Sie nichts anderes eintragen.

Hermes Agent oder OpenClaw?

Diese Frage wird oft gestellt, und sie lässt sich beantworten, weil die beiden verschiedene Dinge gut können. Über Chat-Dienste laufen übrigens beide, und beide über viele: WhatsApp, Telegram, Slack, Discord und Signal finden sich bei OpenClaw wie bei Hermes Agent.

OpenClaw ist der genügsamere von beiden. Er findet Ollama und LM Studio beim Einrichten von selbst und kann einen Modellserver auf Basis von llama.cpp sogar selbst herunterladen und betreiben. Vor allem aber kommt er mit weniger Kontext aus als Hermes: OpenClaw schlägt Modelle ab 16.384 Token vor und rechnet zur Laufzeit mit 32.768. Damit läuft er auf Geräten, auf denen Hermes gar nicht erst startet.

Hermes Agent ist der strengere. Er verlangt mindestens 64.000 Token, und das ist keine Empfehlung, sondern eine Grenze im Programm: MINIMUM_CONTEXT_LENGTH = 64_000 steht in agent/model_metadata.py, und meldet ein lokaler Server weniger, lehnt Hermes ihn beim Start ab; nur bei LM Studio lässt sich die Grenze mit einem ausdrücklichen Eintrag unterlaufen. Die Doku sagt es selbst:

„By default, Ollama uses a 2048-token context. Hermes requires at least 64,000 tokens for agentic work with tools:“

Quelle: Hermes Agent, Local Ollama setup, gelesen am

Bei Ollama läuft diese Grenze allerdings ins Leere, und der Grund ist eine Schnittstellenfrage. Hermes liest die Kontextlänge über /api/show aus und hängt sie jedem Aufruf als num_ctx an, spricht mit Ollama aber über dessen OpenAI-Schnittstelle /v1. Die kennt dieses Feld nicht und verwirft es: Ollamas Anfrageobjekt für /v1 hat gar keinen Platz dafür, und die Einstellungen, die es weiterreicht, sind abschließend aufgezählt. Ollama bleibt also bei seiner eigenen Stufe, während Hermes mit der gemeldeten Höchstlänge rechnet und seine Prüfung auf 64.000 Token durchgeht, obwohl der Server 4.096 bedient. Setzen Sie die Länge deshalb dort, wo Ollama sie liest: PARAMETER num_ctx 64000 im Modelfile oder OLLAMA_CONTEXT_LENGTH. Hermes' eigene Anleitung macht es genauso.

Ein zweiter Unterschied fällt erst im Betrieb auf. Hermes schickt bei jedem Aufruf denselben festen Block voraus, den Systemtext und die Beschreibungen aller eingeschalteten Werkzeuge, bevor Ihre eigentliche Frage an der Reihe ist. Auf einem Rechner ohne Grafikbeschleunigung kann das Verarbeiten dieses Blocks Minuten dauern, in denen nichts passiert. Hermes rechnet damit und erhöht für lokale Server seine Lesewartezeit von 120 auf 1.800 Sekunden; die Wartezeit der Schnittstelle selbst weiten Sie über HERMES_API_TIMEOUT.

Kurz: OpenClaw, wenn Ihr Gerät wenig Speicher hat. Hermes Agent, wenn genug da ist, aber nur mit einem Server, der sein Fenster ehrlich meldet, also llama.cpp, vLLM oder LM Studio. Bei Ollama müssen Sie die Länge selbst ins Modelfile schreiben, sonst nützt Ihnen Hermes' Grenze nichts. Wer von OpenClaw wechseln will, kann seine Einrichtung mit hermes claw migrate übernehmen.

Welche Modelle mitmachen

Ein Modell taugt für einen Agenten, wenn es Werkzeuge aufruft und die nötige Kontextlänge trägt. Die Projekte nennen in ihren Anleitungen mehr Modelle, als hier Platz haben; OpenClaw allein fünf, mit Qwen3.8 27B als erster Wahl, sobald der Speicher reicht. Vier davon stehen in unserem Katalog: Qwen3.8 27B und Qwen3.5 9B, das OpenClaw und Hermes Agent beide empfehlen, dazu Gemma 4 31B aus Hermes' Ollama-Anleitung und Qwen3-Coder 30B A3B aus OpenCodes Beispielen. Die rechte Spalte gilt für 65.536 Token:

Modellläuft flüssig mit 65.536 Token
Qwen3.5 9Bauf 408 von 558 Geräten
Qwen3.8 27Bauf 202 von 558 Geräten
Qwen3-Coder 30B A3Bauf 138 von 558 Geräten
Gemma 4 31Bauf 72 von 558 Geräten

Wie stark die Zahlen mit der Kontextlänge sinken, hängt am Modell: die kompakten verlieren kaum, die großen die Hälfte und mehr, weil der Kontext zusätzlich zum Modell Speicher belegt. Ein Modell, das im Chat mit 8.192 Token bequem läuft, kann bei 65.536 Token nicht mehr in den Speicher passen. Welche Modellgrößen es überhaupt gibt und was sie unterscheidet, steht im Ratgeber Lokale KI-Modelle.

Was trotz lokalem Modell ins Netz geht

Ein lokales Modell heißt: Ihre Anfragen gehen nicht an einen Modellanbieter. Es heißt nicht, dass nichts mehr Ihren Rechner verlässt. Bei jedem der zwölf Werkzeuge gibt es Wege nach draußen, und die meisten sind ab Werk offen.

  • Versions- und Nutzungsabfragen. OpenClaw fragt einmal täglich nach einer neueren Version. Codex CLI schickt ab Werk Nutzungsdaten und lässt sich mit [analytics] enabled = false abstellen. DeepSeek Harness sendet beim Nutzen der Rückmeldefunktion den Sitzungsverlauf mit, auch wenn ein lokales Modell rechnet; DSH_TELEMETRY_DISABLED schaltet es ab. Hermes Agent fragt beim Start nach einer neuen Version (updates.check: false schaltet das ab) und holt höchstens alle vier Stunden den Modellkatalog von models.dev; Nutzungsdaten sendet er ab Werk nicht.
  • Das Gedächtnis. Damit ein Agent Ähnliches wiederfindet, rechnet er Texte in Zahlenvektoren um. Bei OpenClaw geschieht das in der Grundeinstellung bei OpenAI, sobald dort ein Schlüssel hinterlegt ist. Wer das nicht will, stellt den Anbieter ausdrücklich auf ein lokales Programm um.
  • Websuche und Browser. Jede Suche geht an den eingestellten Suchdienst, jeder Seitenabruf ins Netz. Bei DeepSeek Harness läuft die Websuche über DeepSeek.
  • Chat-Kanäle. Sprechen Sie OpenClaw oder Hermes Agent über WhatsApp oder Telegram an, laufen Ihre Nachrichten über deren Server, gleich wo das Modell rechnet.
  • Die Modellprogramme selbst. Ollama und LM Studio melden sich bei ihrem Hersteller, unabhängig vom Agenten darüber. Was genau, steht im Ratgeber Ollama oder LM Studio.

Welche Aufbauten welche Daten wohin schicken, vergleicht unsere Datenschutz-Ampel.

Sicherheit: kleine Modelle und fremde Inhalte

Lokal laufen vor allem kleinere Modelle, und die sind für einen Agenten mit Werkzeugen ein eigenes Risiko. Liest der Agent fremde Inhalte, eine Webseite, eine E-Mail, eine Fehlermeldung, können darin Anweisungen versteckt sein, die das Modell befolgt. OpenClaw sagt dazu deutlich:

„For tool-enabled agents or agents that read untrusted content, prompt-injection risk with older/smaller models is often too high. Do not run those workloads on weak model tiers.“

Quelle: OpenClaw, Prompt injection, gelesen am

Drei Dinge helfen, und sie gelten für alle zwölf. Halten Sie die Rechte eng: nur lesende Werkzeuge, wenig Zugriff auf Dateien, Websuche und Browser aus, solange Sie sie nicht brauchen. Schalten Sie den abgeschotteten Bereich ein, in dem die Werkzeuge laufen; bei OpenClaw ist er ab Werk aus und braucht Docker. Und behandeln Sie fremde Erweiterungen wie fremden Programmcode: Anfang Februar 2026 fand VirusTotal Hunderte schädliche Erweiterungen in OpenClaws Sammlung ClawHub, die seither täglich mit VirusTotal geprüft wird; das findet nach eigener Aussage nicht alles.

Auch der Reifegrad gehört zur Sicherheitsfrage. DeepSeek Harness liegt bisher nur als Vorabversion vor und sagt in seiner eigenen Sicherheitsdatei, dass es kein Sicherheitsaudit gab und die Software nicht als sicher oder reif für den Produktivbetrieb gelten darf. Aider hat seit dem 22. Mai 2026 keine Änderung mehr bekommen; das Projekt funktioniert, wird aber sichtbar nicht mehr gepflegt. Beides ist kein Ausschlussgrund, aber es gehört in die Entscheidung.

Welches Werkzeug für wen

Sie wollen einen Assistenten für Termine, Notizen und Dateien, erreichbar vom Handy. OpenClaw oder Hermes Agent, beide sprechen über Chat-Dienste. OpenClaw, wenn Ihr Gerät wenig Speicher hat; er verlangt rund halb so viel Kontext.

Sie wollen im Terminal programmieren und haben genug Speicher. Hermes Agent oder OpenCode. Hermes ist bei den Grenzen strenger, OpenCode läuft auch im Editor. Zur Kontextlänge sind die Quellen bei OpenCode uneins: die eigene Doku nennt 16.000 bis 32.000 nur als Einstieg, wenn Werkzeugaufrufe scheitern, und im Beispiel für llama.cpp mit 128.000; im Ollama-Beispiel steht gar keine Zahl. Ollama selbst verlangt 64.000 und mehr.

Sie arbeiten in Visual Studio Code. Cline, als Erweiterung direkt im Editor.

Sie wollen mehrere Agenten nebeneinander und eine Oberfläche dafür. OpenHands, das in Docker läuft und neben Ollama auch vLLM und SGLang anspricht.

Sie wollen Abläufe bauen statt zu chatten. n8n mit dem Baustein „Ollama Chat Model“. Achten Sie darauf, den richtigen zu wählen: der einfachere Baustein „Ollama Model“ kann keine Werkzeuge aufrufen, und ohne Werkzeuge ist ein Agent nur ein Chat. Und öffnen Sie im Baustein die Einstellung „Context Length“: in der Doku steht sie nicht, im Baustein selbst schon, und sie ist mit 2.048 vorbelegt, viel zu wenig für einen Agenten.

Ihr Rechner hat weniger als 16 GB. Dann ist kein Agent mit lokalem Modell eine gute Idee. Dort passen nur die kleinsten Modelle hinein, und die rufen keine Werkzeuge zuverlässig auf; ohne Werkzeuge ist ein Agent aber nur ein Chat. Genau das ist dann auch möglich: ein Chat, kein Agent. Welches Gerät die Schwelle überspringt, zeigt der Geräte-Finder, und was ein Umstieg kostet, rechnet der Ratgeber ChatGPT-Kosten gegen eigene Hardware durch.

Quellen: Ollama, Context length und Ollama zur Codex-Anbindung, OpenClaw-Doku zu Local models, Ollama, LM Studio, Sandboxing, Prompt injection und Skills, Hermes Agent auf GitHub (agent/model_metadata.py, website/docs/guides/local-ollama-setup.md, Releases), DeepSeek Harness auf GitHub, OpenCode-Doku, OpenHands-Doku, Goose-Doku, Cline-Doku, Aider-Doku, Codex-Doku, Claude-Code-Doku, Qwen-Code-Doku, n8n-Doku und n8n zum Baustein ohne Werkzeuge, Ollama zur OpenCode-Anbindung und zur Claude-Code-Anbindung, dazu im Quelltext openai/openai.go in Ollama, sdk/packages/llms/src/providers/builtins.ts in Cline, extensions/lmstudio/src/defaults.ts in OpenClaw und nodes/llms/LMOllama/description.ts in n8n; Lizenzen und letzte Änderungen je Projekt über die GitHub-API, gelesen am 25. und 26. September 2026.

Weitere Ratgeber