Lokale KI für Unternehmen: Modelle wie DeepSeek auf eigenen Servern
Ich richte lokale KI für Unternehmen ein: Open-Weight-Modelle wie DeepSeek oder Mistral auf Servern, die Ihr Unternehmen kontrolliert, nach schriftlichen Regeln an Ihre Systeme angebunden. Ihre Prompts und Dokumente bleiben auf Rechnern, die Sie auswählen. Ich übernehme Freelance- und Interim-Projekte, vorwiegend remote. Sprechen wir in einem kostenlosen Videocall von 30 Minuten über Ihren Bedarf.
Was sich für Ihr Unternehmen ändert
-
Erfahrung mit Servern und ihren Nutzern
Ich habe Hardware in Rechenzentren in Europa und den USA eingerichtet und Server selbst betrieben. Den Betrieb eines Modells lege ich für die Mitarbeiter aus, die es nutzen, und für die Daten, die sie eingeben.
-
Daten auf Rechnern Ihrer Wahl
Ein Open-Weight-Modell läuft in Ihrem eigenen Rack oder bei einem Hosting-Anbieter in Deutschland. Prompts und Dokumente erreichen das Unternehmen nicht, das das Modell trainiert hat.
-
Zuerst die Lizenz
DeepSeek veröffentlicht seine Gewichte unter der MIT-Lizenz, Mistral und Qwen unter Apache 2.0. Die Lizenz von Llama 4 gewährt Unternehmen mit Sitz in der EU keine Rechte an den multimodalen Modellen, deshalb prüfe ich die Lizenz vor der Hardware.
-
Ein Modell, das sich austauschen lässt
Die Regeln und das Gedächtnis eines Agenten liegen in Dateien, und ein neues Modell übernimmt sie. Bei einem Wechsel von DeepSeek zu Qwen oder Mistral bleibt der Aufbau um das Modell erhalten.
-
Cloud und Failover
Ich bin zertifizierter AWS Solutions Architect Associate und habe Systeme auf AWS, Azure und Google Cloud betrieben. Einen Node-Betrieb habe ich in eine andere Cloud umgezogen, mit einem zweiten Standort, der übernimmt, wenn der erste ausfällt.
-
Zugriff nach Regeln
Das Modell erreicht Ihre Systeme über eine API oder einen MCP-Server mit einer kurzen Liste von Werkzeugen. Tokens mit begrenzten Rechten legen fest, welche Datensätze es lesen und welche es ändern darf.
Was lokale KI im Unternehmen heißt
Ein selbst gehostetes LLM ist ein Sprachmodell, das auf Hardware läuft, die Ihr Unternehmen kontrolliert: in Ihrem Serverraum oder bei einem Hosting-Anbieter unter Ihrem Vertrag. Möglich machen das Open-Weight-Modelle. Der Hersteller veröffentlicht die trainierten Gewichte, und Serving-Software wie vLLM oder Ollama beantwortet die Anfragen Ihrer Anwendungen über eine API. DeepSeek hat am 10. September 2026 DeepSeek-V4.1-Flash unter der MIT-Lizenz veröffentlicht, mit Anleitungen für vLLM und SGLang auf der Modellseite.
Offene Gewichte sind weniger als Open Source. Sie erhalten das trainierte Modell, meist ohne die Daten, mit denen es trainiert wurde.
Warum Unternehmen in Deutschland nach DeepSeek fragen
Die DeepSeek-App und ein DeepSeek-Modell auf Ihrem eigenen Server sind zwei verschiedene Dinge. Am 27. Juni 2025 hat die Berliner Datenschutzbeauftragte die App bei Apple und Google als rechtswidrigen Inhalt gemeldet, weil sie personenbezogene Daten ihrer Nutzer nach China überträgt (Pressemitteilung). Das betrifft die App und die Cloud von DeepSeek. Gewichte, die auf Ihrem Server laufen, haben keine Verbindung zu DeepSeek.
Bisher nutzen wenige Unternehmen in Deutschland offene Modelle. Bitkom hat 603 Unternehmen mit 20 oder mehr Beschäftigten befragt und das Ergebnis am 9. September 2026 veröffentlicht. Von den Unternehmen, die KI einsetzen, nutzten 76 Prozent ChatGPT, 8 Prozent Llama, 2 Prozent DeepSeek, 1 Prozent Qwen und 0 Prozent Mistral (Bitkom). Bitkom ergänzt, dass viele Aufgaben nicht das größte und neueste Modell brauchen und auf kleineren Systemen günstiger laufen.
Lizenzen offener Modelle, geprüft am 24. September 2026
Offen heißt bei jedem Hersteller etwas anderes. Die Tabelle nennt je Modellfamilie die neueste Version, die ich geprüft habe, und was ein Unternehmen in der EU beachten muss.
| Modellfamilie | Geprüfte Version | Lizenz | Hinweis für ein Unternehmen in der EU |
|---|---|---|---|
| DeepSeek (China) | DeepSeek-V4.1-Flash, 10. September 2026 | MIT | Kommerzielle Nutzung erlaubt. Eine selbst gehostete Kopie schickt keine Daten an DeepSeek. |
| Qwen (Alibaba, China) | Qwen3.6-27B, April 2026 | Apache 2.0 | Kommerzielle Nutzung erlaubt. Einige größere Qwen-Modelle gibt es nur als Cloud-Dienst. |
| Mistral (Frankreich) | Mistral Large 3, 2. Dezember 2025 | Apache 2.0 | Kommerzielle Nutzung erlaubt, von einem Hersteller aus der EU. |
| gpt-oss (OpenAI, USA) | gpt-oss-120b und gpt-oss-20b, August 2025 | Apache 2.0 | Kommerzielle Nutzung erlaubt. Das 120b-Modell passt auf eine einzelne GPU mit 80 GB. |
| Llama 4 (Meta, USA) | Llama 4 Scout und Maverick, April 2025 | Llama 4 Community License | Ein Unternehmen mit Hauptsitz in der EU erhält keine Rechte an den multimodalen Modellen. |
Quellen: DeepSeek, Qwen, Mistral, gpt-oss, Llama 4 Use Policy, Lizenzprüfung vom August 2026. Ein Hersteller kann die Lizenz mit der nächsten Version ändern, deshalb prüft die Analyse sie erneut.
Was ich um das Modell herum einrichte
Das Modell ist ein Teil der Arbeit. Der andere Teil legt fest, wer es was fragen darf und wohin seine Antworten gehen:
- der Server: Ihr eigenes Rack, ein Hosting-Anbieter in Deutschland oder eine Cloud-Region in Frankfurt, mit einem zweiten Standort, wo das Modell nicht ausfallen darf,
- Serving-Software mit einem Token pro Anwendung und einem Protokoll der Anfragen,
- eine Anbindung an Ihre Systeme über eine API oder einen MCP-Server mit einer kurzen Liste von Werkzeugen, so wie KI-Agenten in meinem Kundenprojekt die API erreichen,
- die Agenten, die das Modell nutzen, nach den Regeln auf der Seite KI-Agenten unter denselben Regeln wie Menschen.
Die Agenten können auf einer Open-Source-Control-Plane laufen, wie auf der Seite Open-Source-KI-Agenten beschrieben. Die Regeln für Coding-Agenten stehen auf der Seite Agent Harness Engineering.
Wer ich bin
Ich bin Michael Wutzke, lebe in Frankfurt und arbeite seit mehr als zwanzig Jahren in IT und Medien. Beim Frankfurter Unternehmen Blocksize Capital war ich Head of Decentralized Finance and Node Operations und danach CIO. Dort habe ich Blockchain-Nodes in mehreren Rechenzentren betrieben und die Infrastruktur mit Failover von Azure in eine andere Cloud umgezogen. Heute helfe ich einem Kunden, seine Plattform mit Claude und Codex nach schriftlichen Regeln umzubauen, und ich unterrichte im Claude Hacker House. Neben den Modellen interessiert mich Open-Source-Software für Agenten, die auf dem eigenen Server eines Unternehmens läuft. Details: Berufliche Stationen.
So kommt Ihr eigenes Modell in den Einsatz
-
Kostenloser Videocall
In 30 Minuten sprechen wir über die Aufgaben, die ein Modell übernehmen soll, und über die Daten, die es sehen würde.
-
Gemeinsame Analyse
Wir sortieren Ihre Daten danach, was das Unternehmen verlassen darf, und prüfen die Lizenz jedes infrage kommenden Modells. Die Zahl der Nutzer bestimmt die Hardware.
-
Angebot und Auftrag
Sie erhalten ein Angebot für die Einrichtung. Die Arbeit beginnt, sobald Sie es annehmen.
-
Einrichtung
Ich installiere das Modell auf dem gewählten Server, mit Serving-Software wie vLLM, einem Token pro Anwendung und einem Protokoll der Anfragen.
-
Test mit Ihren Aufgaben
Ihre Mitarbeiter probieren das Modell an ihren eigenen Aufgaben aus. Wo es nicht reicht, ändern wir die Modellgröße oder behalten für diese Aufgabe ein Cloud-Modell.
-
Übergabe
Ihr Team erhält die Dokumentation für Betrieb und Updates und entscheidet, wann eine neue Modellversion die laufende ersetzt.
Fragen, die Unternehmen stellen
Ist DeepSeek in deutschen Unternehmen erlaubt?
Ich leiste keine Rechtsberatung. Am 27. Juni 2025 hat die Berliner Datenschutzbeauftragte die DeepSeek-App bei Apple und Google gemeldet, weil sie personenbezogene Daten nach China überträgt. Ein Modell, das Sie selbst betreiben, schickt nichts an DeepSeek. Welche Daten es verarbeiten darf, entscheidet Ihr Datenschutzbeauftragter.
Welche Hardware braucht ein selbst gehostetes Modell?
Das hängt vom Modell und von der Zahl der Nutzer ab. Laut der Model Card von OpenAI vom August 2025 läuft gpt-oss-20b mit 16 GB Speicher und gpt-oss-120b auf einer einzelnen GPU mit 80 GB. Die Analyse legt die Hardware fest, bevor etwas gekauft wird.
Ist ein offenes Modell so gut wie ChatGPT oder Claude?
Für manche Aufgaben ja, für andere nicht. Bitkom weist darauf hin, dass viele Aufgaben nicht das größte und neueste Modell brauchen. Der Test mit Ihren eigenen Aufgaben zeigt, wo ein offenes Modell genügt und wo ein Cloud-Modell bleibt.
Mit welchen Modellen haben Sie gearbeitet?
In Kundenprojekten laufen meine Agenten auf Claude und Codex, unter einer Regeldatei, die auch die Gemini CLI liest. Regeln und Gedächtnis liegen außerhalb des Modells, sodass ein Open-Weight-Modell den Platz eines Cloud-Modells einnehmen kann.
Welche Formen der Zusammenarbeit bieten Sie an?
Freelance- und Interim-Projekte, in Teilzeit oder Vollzeit, vorwiegend remote. Ich wohne in Frankfurt. Termine vor Ort übernehme ich in Frankfurt Rhein-Main oder dort, wo Ihre Server stehen.
Details zur Arbeit hinter dieser Seite
-
Node-Betrieb und Cloud-Migration mit Failover
Blockchain-Nodes und ein Oracle-Netzwerk in mehreren Rechenzentren, danach der Umzug von Azure mit Failover.
-
Virtuelle Organisationen autonomer Agenten
KI-Agenten können wie ein Team arbeiten, doch wie man sie verlässlich führt, wissen bisher wenige. Ich teste, wie Rollen und Regeln sie in der Spur halten.
-
Datenqualität zu sichern ist eine Herausforderung
KI-Agenten lesen zweifelhafte Quellen und schreiben in gemeinsame Daten. Bleibt das mit einem Regelwerk verlässlich?
-
KI-Agenten unter denselben Regeln wie Menschen
Grenzen an der Ressource, eine blockierende Prüfung vor jedem Tool-Aufruf und Freigaben, die nur ein Mensch erteilt.
Lokale KI für Ihr Unternehmen: Ihr AI Engineer in Deutschland
Ich bin Michael Wutzke, AI Engineer für Open-Source-Modelle in Deutschland, und arbeite von Frankfurt aus. In einem kostenlosen Videocall von 30 Minuten sprechen wir über die Aufgaben und Daten, die ein Modell bearbeiten soll. Sie erfahren, welches Open-Weight-Modell und welche Art von Server zu Ihrem Unternehmen passen.
Suchanfragen zu diesem Thema
- lokale ki für unternehmen
- lokale ki unternehmen
- lokale ki modelle für unternehmen
- lokale ki modelle
- lokale ki modelle vergleich
- lokale ki hardware
- lokale llm für unternehmen
- lokales llm
- lokales llm hardware
- lokales llm betreiben
- lokales llm hosten
- lokales llm aufsetzen
- llm selbst hosten
- llm selbst hosten hardware
- llm lokal betreiben
- llm lokal betreiben hardware
- self hosted llm
- self hosted llm hardware
- self hosted llm server
- ki on premise
- ki on premise open source
- ki on premise hardware
- ki modelle on premise
- ki server on premise
- llm on premise
- llm on premise vs cloud
- ki server für unternehmen
- ki server für kleine unternehmen
- unternehmenseigene ki
- eigene ki für unternehmen
- deepseek lokal betreiben
- deepseek lokal hosten
- deepseek hosting deutschland
- deepseek datenschutz deutschland
- deepseek in deutschland verboten
- open source llm modelle
- open weight modelle
- open weight models vs open source
- dsgvo konforme ki modelle
- datenschutzkonforme ki für unternehmen