DeepSeek Harness installieren und lokal nutzen
DeepSeek Harness ist der quelloffene Programmier-Agent von DeepSeek. Wie Sie ihn installieren, mit einem lokalen Modell verbinden und was an DeepSeek geht.
Stand: 2026-09-25
DeepSeek Harness, kurz dsh, ist ein quelloffener KI-Agent von DeepSeek, gedacht vor allem zum Programmieren: Er bearbeitet Dateien, führt Befehle in der Kommandozeile aus, durchsucht Dateien und das Netz und kann Aufgaben planen und an Unteragenten verteilen. Gleichzeitig ist er ein Baukasten für Entwickler, die eigene Agenten bauen wollen; fast alles daran ist als Erweiterung angelegt. Der Code steht unter der MIT-Lizenz.
Das Wichtigste vorweg: DeepSeek Harness ist eine Vorabversion für Entwickler. Es gibt bisher nur Vorabveröffentlichungen, keine stabile Version, und das Projekt sagt deutlich, was das bedeutet:
„DeepSeek Harness is in developer preview and iterating rapidly. THERE WILL BE COMPATIBILITY-BREAKING CHANGES.“
DeepSeek Harness installieren (Windows, Mac, Linux)
Sie brauchen Node.js in Version 22.19 oder neuer, Version 23 ausgenommen. Die Startseite von DeepSeek nennt dann einen Befehl:
npx @deepseek-ai/dsh web
Er startet eine Oberfläche im Browser unter http://127.0.0.1:3080. Dort wählen Sie zuerst mit Choose workspace den Projektordner, in dem der Agent arbeiten soll. Achtung bei der Version: Dieser Befehl lädt die Fassung, die das Paketverzeichnis npm als aktuell führt, am 25. September 2026 war das 0.1.5-rc.3. Diese Anleitung beschreibt die neuere Vorabversion 0.1.7-rc.2 vom 24. September 2026; die starten Sie mit:
npx @deepseek-ai/dsh@next web
Unter Windows führt der Agent Befehle in PowerShell 7 aus, wenn sie installiert ist, sonst im eingebauten Windows PowerShell 5.1. Dort können laut Dokumentation Umlaute in Eingaben an Befehle falsch ankommen; PowerShell 7 ist deshalb die bessere Wahl.
Gibt es eine Desktop-App?
Ja, als Vorschau. Am 25. September 2026 lagen Installationsdateien der Version 0.1.7-rc.2 für Macs mit Apple-Chip und für Windows auf DeepSeeks eigenem Server download.deepseek.com. Verlinkt hat DeepSeek sie bisher weder auf der Projektseite noch bei GitHub. Für Linux und für Macs mit Intel-Prozessor gibt es keine. Programme unter ähnlichem Namen, die von anderen Adressen stammen, sind nicht von DeepSeek.
Ab Werk: die Cloud von DeepSeek
In der Grundeinstellung arbeitet DeepSeek Harness mit den Modellen von DeepSeek über deren Programmierschnittstelle. Sie tragen dazu unter Settings → Models einen Schlüssel von der DeepSeek-Plattform ein. Ihre Anfragen und der Code, den der Agent liest, gehen dann an DeepSeek.
Ein lokales Modell anbinden
DeepSeek Harness ist an die Cloud nicht gebunden. Unter Settings → Models können Sie einen eigenen Server eintragen:
„Switch the card to Custom model API for a relay, a company gateway, a self-hosted server, or any provider absent from the installed catalog.“
So geht es in Version 0.1.7-rc.2: Wählen Sie Add model provider und stellen Sie die neue Karte auf Custom model API um. Dann tragen Sie ein:
- Eine Kennung in Kleinbuchstaben, etwa
ollama. Sie lässt sich später nicht mehr ändern. - Die Adresse der OpenAI-kompatiblen Schnittstelle Ihres Servers, bei Ollama
http://localhost:11434/v1, bei LM Studiohttp://localhost:1234/v1, bei llama.cpp meisthttp://localhost:8080/v1. - Das Protokoll OpenAI Chat Completions.
- Einen Schlüssel. Lokale Server brauchen meist keinen, die verwendete Bibliothek verlangt aber einen; ein beliebiger Wert genügt.
- Mindestens ein Modell. Fetch available models fragt den Server, welche Modelle er anbietet.
Ollama, LM Studio oder llama.cpp nennt die Dokumentation dabei nicht beim Namen, aber alle drei bieten die passende Schnittstelle an. Wichtig ist die Kontextlänge. Kennt DeepSeek Harness ein Modell nicht, rechnet es mit 262.144 Token Kontext. Ollama stellt aber unterhalb von 24 GB Grafikspeicher, beim Mac unterhalb von 36 GB Arbeitsspeicher, nur 4.096 Token ein und bis 48 GB 32.768. Starten Sie Ollama deshalb mit mehr Kontext, auf Mac und Linux etwa mit OLLAMA_CONTEXT_LENGTH=65536 ollama serve; in der Ollama-App auf Mac und Windows stellen Sie die Kontextlänge in den Einstellungen mit dem Schieberegler ein. Ob es gewirkt hat, zeigt ollama ps in der Spalte CONTEXT. Tragen Sie denselben Wert beim Modell in DeepSeek Harness ein.
Welche Modelle sich eignen
Empfehlungen für lokale Modelle gibt DeepSeek nicht. Für einen Programmier-Agenten braucht ein Modell zuverlässige Werkzeugaufrufe und einen langen Kontext. Aus unserem Katalog kommen dafür etwa diese in Frage, jeweils mit 65.536 Token Kontext gerechnet:
- Qwen3-Coder 30B A3B, fürs Programmieren gebaut, läuft auf 138 von 538 geführten Geräten flüssig.
- Laguna XS 2.1, ebenfalls fürs Programmieren gebaut, läuft auf 29 von 538 Geräten flüssig.
- Qwen3.8 27B, ein allgemeines Modell mit Stärken beim Programmieren, läuft auf 202 von 538 Geräten flüssig.
Welche Modelle sich fürs Programmieren eignen, ordnet unsere Seite KI zum Programmieren ein.
Und die DeepSeek-Modelle selbst?
Die Sprachmodelle von DeepSeek sind offen, aber groß. Das kleinste der Reihe V4, DeepSeek V4-Flash, braucht in der Stufe Q4_K_M rund 160 GB Speicher und läuft mit 65.536 Token Kontext auf 13 von 538 geführten Geräten flüssig. Das neuere V4.1-Flash, mit dem die Cloud von DeepSeek Harness ab Werk arbeitet, ist noch größer. Lokal betrieben binden Sie ein DeepSeek-Modell wie jedes andere über Custom model API an. Soll es auf Wunsch ohne Nachdenkphase antworten, braucht DeepSeek Harness dafür einen Eintrag in seiner Konfigurationsdatei, mit reasoningEfforts samt der Stufe off und compat.thinkingFormat: deepseek. Mehr zu den Modellen steht auf unserer Seite DeepSeek lokal.
MCP-Server anbinden
Über MCP, ein offenes Protokoll, bieten fremde Programme einem Agenten zusätzliche Werkzeuge an. Ab Werk ist in DeepSeek Harness kein MCP-Server eingeschaltet. Eingetragen wird ein Server in der Konfigurationsdatei des Profils, angebunden über stdio oder streamable-http. Was Sie einem solchen Server geben, verarbeitet laut Datenschutzerklärung dessen Betreiber, nicht DeepSeek.
Was trotz eines lokalen Modells an DeepSeek geht
Für eigene Server verspricht DeepSeek in seiner Datenschutzerklärung:
„DeepSeek Harness does not store or process your Input and Output on the server side.“
Das gilt für die Ein- und Ausgaben des Modells. Zwei Wege führen trotzdem zu DeepSeek:
- Die Websuche. Ab Werk sucht DeepSeek Harness über die Suche von DeepSeek, mit demselben Schlüssel wie die Modelle. Die Alternativen im Code, Exa und Perplexity, sind ebenfalls Cloud-Dienste. Wer nichts nach außen geben will, nutzt die Websuche nicht.
- Rückmeldungen. Geben Sie eine Rückmeldung, mit
/feedback, im Rückmeldefenster oder schon mit einer Bewertung einer Antwort, schickt DeepSeek Harness den bisherigen Verlauf der Sitzung mit: Nachrichten, Werkzeugaufrufe samt Ergebnissen, also auch gelesene Dateiinhalte, und das Arbeitsverzeichnis. Das gilt bei jedem Modellanbieter, auch bei einem lokalen:
„OTel releases a Session-log prefix only after explicit user feedback, regardless of model provider.“
Abschalten lässt sich das, indem Sie beim Start die Umgebungsvariable DSH_TELEMETRY_DISABLED mit einem beliebigen Wert setzen, auf Mac und Linux etwa mit DSH_TELEMETRY_DISABLED=1 npx @deepseek-ai/dsh@next web, in der PowerShell unter Windows mit $env:DSH_TELEMETRY_DISABLED="1" vor dem Start. Nutzen Sie dagegen die Cloud von DeepSeek, lädt der Agent ab Werk zusätzlich das Sitzungsprotokoll hoch und meldet, welche Erweiterungen aktiv sind. Laut Datenschutzerklärung speichert DeepSeek diese Daten in der Volksrepublik China und nutzt sie zum Training, wogegen Sie widersprechen können.
Sicherheit
DeepSeek sagt selbst, dass die Vorabversion nicht als sicher gelten darf:
„It has not undergone a security audit and must not be treated as secure or production-ready.“
Ab Werk darf der Agent nur im Arbeitsordner und in temporären Ordnern schreiben und fragt vor heiklen Aktionen nach. Die Abschottung betrifft aber nur das Schreiben von Dateien: Lesen darf der Agent auf allen Systemen überall, und Netz und Prozesse schränkt sie nicht ein. Unter Windows ist zudem der Schreibschutz nur teilweise umgesetzt. Erweiterungen lädt DeepSeek Harness aus dem npm-Verzeichnis, ersatzweise von einem Spiegel in China. Probieren Sie den Agenten deshalb in einem Projekt ohne Zugangsdaten aus, am besten in einer virtuellen Maschine oder einem Container.
Für wen sich DeepSeek Harness heute lohnt
Für Entwickler, die einen Agenten ausprobieren oder erweitern wollen, und für alle, die die Cloud von DeepSeek ohnehin nutzen. Wer einen Programmier-Agenten verlässlich im Alltag mit lokalen Modellen einsetzen will, greift derzeit besser zu einem Werkzeug mit stabiler Version, etwa OpenCode, dessen Dokumentation Ollama, LM Studio und llama.cpp ausdrücklich beschreibt. Allgemeinere Agenten mit eigenem Ratgeber sind OpenClaw und Hermes Agent.
Quellen: DeepSeek Harness auf GitHub (README, LICENSE, SAFETY.md, Releases, Dokumentation zu Providers, Voreinstellungen in packages/bundle/base/cordis.patch.yml, Beschreibungen der Bausteine llm-pi-ai, session-log-deepseek, session-telemetry-otel, sandbox-local, pwsh-local, mcp-client und plugin-manager), Startseite von DeepSeek Harness, Datenschutzerklärung, Ollama zur Kontextlänge, OpenCode, Providers, alle gelesen 2026-09-25.
Weitere Ratgeber
- Deutsche und europäische KI-Modelle: Welche es gibt und was davon lokal läuftTeuken aus Deutschland, EuroLLM aus einem EU-Projekt, Mistral aus Paris, Apertus aus der Schweiz. Lizenz, Größe und auf wie vielen der 538 Geräte sie flüssig laufen.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 326 von 538 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- KI selbst hosten: Was sich ändert, sobald mehrere zugreifenSelbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Mac mini für lokale KI: Welche Ausstattung reicht und wann es der Mac Studio sein mussBeim Mac zählt der Arbeitsspeicher, aber nicht die ganze Zahl. Was die Ausstattungen des Mac mini mit M4, M5 Pro und M6 tragen und wo der Mac Studio anfängt.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- Ornith 1.5: Welche der drei Größen auf Ihrem Rechner läuftOrnith 1.5 in drei Größen: Die kleinste läuft beim Ausprobieren auf 413 von 538 Geräten flüssig, die größte auf 9. Was jede braucht und wann ein Verbund hilft.
- Qwen-Image: KI-Bilder lokal erzeugen und die richtige Fassung wählenQwen-Image erzeugt Bilder auf dem eigenen Rechner. Die neue Fassung 2.1 ist nur für Forschung und Erprobung freigegeben, für Unternehmen ist 2512 die Fassung. Was beide an Speicher brauchen und wie lange ein Bild auf unserer Karte dauerte.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.