KI selbst hosten: Was sich ändert, sobald mehrere zugreifen
Selbst hosten heißt, dass einer betreibt und mehrere nutzen. Was dafür nötig ist, warum die Voreinstellungen dafür nicht gemacht sind und welche Fragen ab dem zweiten Nutzer keine Technikfragen mehr sind.
Stand: 2026-09-21
Wer KI selbst hosten will, meint in aller Regel nicht das eigene Notebook. Gemeint ist eine Maschine, die im Haus steht und die mehrere Menschen benutzen: die Kollegin aus dem Vertrieb, der Werkstudent, die Anwendung, die nachts einen Stapel Texte durchgeht.
Das ist ein anderer Aufbau als lokale KI auf einem Arbeitsgerät, auch wenn dieselben Programme darin vorkommen. Und es ist etwas anderes als der gemietete Zugang bei einem Anbieter, obwohl es sich für die Nutzer fast gleich anfühlt. Der Unterschied liegt darin, wer betreibt: bei Ihnen betreibt jemand aus Ihrem Haus, und damit liegt auch die Verantwortung dort.
Dieser Text zeigt, was dafür nötig ist, was sich ab dem zweiten Nutzer ändert und wo die Technikfrage aufhört.
Selbst hosten heißt: einer betreibt, mehrere nutzen
Drei Aufbauten werden im Alltag durcheinandergeworfen, und sie unterscheiden sich in genau einem Punkt.
| Aufbau | Wo läuft das Modell | Wer betreibt |
|---|---|---|
| Gemieteter Zugang | beim Anbieter | der Anbieter |
| Lokal auf dem Arbeitsgerät | auf Ihrem Rechner | Sie, für sich |
| Selbst gehostet | auf einer Maschine im Haus | jemand bei Ihnen, für andere |
Die mittlere Spalte entscheidet über den Datenschutz, die rechte über den Aufwand. Beim Selbsthosten fallen beide zusammen: die Daten bleiben im Haus, und die Arbeit bleibt es auch.
Wenn Sie nur für sich arbeiten wollen, ist dieser Text der falsche. Dann geht es um lokale KI und um die Anleitung KI lokal betreiben, ohne Terminal.
Was dafür nötig ist
Eine Maschine mit genug Speicher. Das Modell muss vollständig in den Speicher passen, und zwar dauerhaft, nicht nur während einer Anfrage. Welche Modelle ein Gerät trägt, zeigt seine Seite in unserem Katalog mit 527 geführten Geräten, für eine einzeln gekaufte Grafikkarte die Seite des jeweiligen Modells; wie Sie Ihr Gerät finden, beschreibt die Anleitung Welches Gerät habe ich?, und alle Modelle stehen unter Modelle.
Ein Programm, das Anfragen von außen annimmt. Hier kommt die erste Überraschung, denn die Voreinstellung ist genau dafür nicht gemacht:
„Ollama binds 127.0.0.1 port 11434 by default. Change the bind address with the OLLAMA_HOST environment variable.“
Im Auslieferungszustand nimmt das Programm also nur Anfragen vom eigenen Rechner an. Das ist gut so, und es ist der Moment, an dem aus einer Installation ein Dienst wird: wer die Bindung öffnet, macht das Modell im Netz erreichbar und muss ab dann entscheiden, für wen.
Genug Speicher für gleichzeitige Anfragen, und das ist mehr, als die meisten rechnen. Zwei Menschen, die zur selben Zeit etwas fragen, kosten nicht einmal, sondern zweimal Kontext, sobald der Dienst zwei gleichzeitig zulässt:
„Parallel request processing for a given model results in increasing the context size by the number of parallel requests. For example, a 2K context with 4 parallel requests will result in an 8K context and additional memory allocation.“
Dazu kommt, dass die Voreinstellung für gleichzeitige Anfragen bei eins liegt. Ein frisch aufgesetzter Dienst bearbeitet also eine Anfrage nach der anderen, und die zweite wartet. Wer das nicht ändert, hat keinen Mehrbenutzerbetrieb, sondern einen einzigen Bearbeitungsplatz mit einer langen Schlange davor.
Ein Zugang. Wer darf fragen, und woran erkennt der Dienst das? Diese Frage hat keine technische Standardantwort, weil sie an Ihrem Haus hängt: Anmeldung über das vorhandene Verzeichnis, ein Schlüssel je Abteilung, oder eine Anwendung davor, die die Nutzer schon kennt.
Was dazukommt, sobald Kollegen darauf zugreifen
Ab dem zweiten Nutzer entstehen vier Fragen, die kein Programm beantwortet. Sie sind alle klein, solange man sie früh stellt.
Wer betreibt das Ding? Ein Dienst ohne benannte Zuständigkeit läuft, bis er ausfällt, und dann sucht das Haus erst einmal die Person, die ihn aufgesetzt hat. Ein Name und eine Vertretung genügen.
Wer darf was? Die Frage ist selten, ob jemand überhaupt darf, sondern womit. Dürfen Kundendaten in die Eingabe? Personalunterlagen? Ein Satz dazu, bevor es jemand ausprobiert, ist billiger als die Klärung danach.
Was wird festgehalten? Eine Zeile je Modell reicht: Name, Variante, seit wann, wofür, wer freigegeben hat. Ohne sie lässt sich später nicht beantworten, womit eine Auskunft zustande gekommen ist. Das ist keine Bürokratie, sondern die Voraussetzung dafür, einen Fehler später zu finden.
Wer gibt Neues frei? Modelle erscheinen wöchentlich. Ohne eine zuständige Person und einen festen Termin installiert sie irgendwann jeder selbst, und der Überblick ist weg.
Wer das für mehrere Personen oder über Abteilungen hinweg ordnen muss, findet den Rahmen dafür hier:
Wo die Technikfrage endet und die Rechtsfrage anfängt
Ein selbst gehosteter Dienst löst das Datenschutzproblem nicht automatisch, er verschiebt es. Die Daten bleiben zwar im Haus, aber nun verarbeitet eine Maschine im Haus personenbezogene Daten, und dafür gelten dieselben Regeln wie für jede andere Verarbeitung. Die Frage ist nicht mehr, ob etwas hinausgeht, sondern ob die Verarbeitung innen zulässig ist und dokumentiert wird.
Welche Daten bei welchem Aufbau tatsächlich das Haus verlassen, haben wir für vier gängige Varianten gegenübergestellt und dabei aus den Datenschutzerklärungen der Anbieter zitiert: DSGVO-konforme KI. Für die schnelle Einordnung eines einzelnen Werkzeugs gibt es die Datenschutz-Ampel.
Und wenn noch offen ist, ob ein eigener Dienst gegenüber einem Abonnement überhaupt trägt, beginnt die Rechnung bei den laufenden Kosten: ChatGPT-Kosten gegen eigene Hardware.
Quellen
Alle gelesen am 21. September 2026.
- Ollama: häufige Fragen
Weitere Ratgeber
- gpt-oss: OpenAIs offenes Modell auf dem eigenen Rechnergpt-oss gibt es in zwei Größen. Die kleine läuft auf 319 von 527 geführten Geräten flüssig, die große auf 69. Was Sie brauchen und wo das Modell nicht passt.
- Grafikkarte für KI: Worauf es bei lokalen Modellen ankommtFür KI zählt an einer Grafikkarte zuerst der Speicher, dann das Tempo. Welche Speicherklasse wie viele Modelle trägt und warum 24 GB der wichtigste Schritt ist.
- Lokale KI-Modelle: Welches läuft auf Ihrer Hardware?Ob ein lokales KI-Modell auf Ihrem Rechner läuft, entscheidet der Speicher. Wie Sie die richtige Zahl finden und was die Stufen hinter dem Namen bedeuten.
- Lokale KI: Was das heißt, was Sie brauchen, was sie kannLokale KI heißt, dass die Modelldatei auf Ihrem Gerät liegt und die Rechenarbeit dort stattfindet. Was Sie dafür brauchen, was heute gut funktioniert und wo die Grenzen liegen.
- Open Source KI: Welche Modelle wirklich offen sindDie meisten Modelle, die „Open Source KI“ heißen, geben nur die fertigen Modelldateien frei, nicht den Weg dorthin. Was der Begriff bedeutet, welche Familien es gibt und was davon auf eigener Hardware läuft.
- KI lokal betreiben, ohne Terminal: So läuft ein Sprachmodell auf Ihrem RechnerLokale KI-Modelle brauchen auf Mac und Windows keine Befehlszeile mehr. Was Sie an Hardware brauchen, wie die Einrichtung Schritt für Schritt gelingt und wo die Grenzen liegen.
- Ollama oder LM Studio: Was ist der Unterschied, und welches passt zu Ihnen?Beide laden offene Sprachmodelle auf Ihren Rechner und rechnen mit demselben Unterbau. Was sie wirklich unterscheidet, was sie kosten und welche Daten dabei Ihr Haus verlassen.
- Was ist Ollama, und welche Alternativen gibt es?Ollama, LM Studio, llama.cpp und vLLM tauchen in vielen Anleitungen für lokale KI auf. Was jedes davon ist, wie die vier zusammenhängen und welches Sie wofür brauchen.
- Was kostet ChatGPT wirklich, und ab wann lohnt sich eigene Hardware?Die Rechnung hat vier Posten, und drei davon stehen auf keiner Preisliste. Was ein Modell über die Schnittstelle kostet, was eigene Hardware dagegenstellt, und ab welchem Punkt sich der Wechsel rechnet.
- DSGVO-konforme KI: Welche Daten verlassen bei welchem Aufbau Ihr Haus?Lokal heißt nicht telemetriefrei, und eine EU-Zusage hängt am Bereitstellungstyp. Was bei vier gängigen Aufbauten wirklich übertragen wird, mit Zitaten aus den Datenschutzerklärungen der Anbieter.