Zum Inhalt springen

Was ist ein lokales LLM?

Ein lokales LLM ist ein großes Sprachmodell, das auf Rechnern läuft, die der Nutzer selbst kontrolliert. In einem Unternehmen sind das eigene Server: im Serverraum oder bei einem Hosting-Anbieter unter eigenem Vertrag. Prompts und Dokumente bleiben auf diesen Rechnern. Das Unternehmen, das das Modell trainiert hat, erhält sie nicht.

Wie ein lokales LLM funktioniert

Grundlage ist ein Open-Weight-Modell. Der Hersteller veröffentlicht die trainierten Gewichte, und Sie laden sie herunter. DeepSeek, Qwen und Mistral sind Modellfamilien mit veröffentlichten Gewichten.

Serving-Software wie vLLM oder Ollama lädt die Gewichte und beantwortet Anfragen über eine API. vLLM stellt ein Modell im API-Format von OpenAI bereit (Dokumentation von vLLM). Eine Anwendung, die dieses Format spricht, braucht für den Wechsel zum lokalen Modell eine neue Adresse und einen neuen Schlüssel.

Offene Gewichte sind weniger als Open Source. Sie erhalten das trainierte Modell, meist ohne die Daten, mit denen es trainiert wurde. Die Lizenz ist von Hersteller zu Hersteller verschieden. Deshalb kommt die Lizenzprüfung vor der Hardware.

Was kann ein lokales LLM?

Ein lokales LLM beantwortet Anfragen wie ein Cloud-Modell: Eine Anwendung schickt einen Text und erhält eine Antwort. Für manche Aufgaben reicht ein offenes Modell, für andere nicht. Bitkom weist darauf hin, dass viele Aufgaben nicht das größte und neueste Modell brauchen (Bitkom). Ein Test mit Ihren eigenen Aufgaben zeigt, wo das lokale Modell genügt.

Über eine API oder einen MCP-Server mit einer kurzen Liste von Werkzeugen erreicht das Modell die Systeme des Unternehmens. KI-Agenten können ein lokales Modell dort aufrufen, wo sie sonst ein Cloud-Modell aufrufen würden.

Lokales LLM oder Cloud-API

FrageLokales LLMCloud-API
Wo läuft das Modell?Auf Servern, die das Unternehmen kontrolliertAuf den Servern des Anbieters
Wohin gehen Prompts und Dokumente?Sie bleiben auf den eigenen ServernZum Anbieter
Welche Modelle stehen zur Wahl?Modelle mit veröffentlichten GewichtenDie Modelle des Anbieters
Wer stellt die Hardware?Das Unternehmen kauft oder mietet sieDer Anbieter
Wer betreibt das Modell?Das eigene IT-Team oder der Hosting-AnbieterDer Anbieter

Beides lässt sich verbinden. Daten, die das Unternehmen nicht verlassen dürfen, gehen an das lokale Modell. Andere Aufgaben bleiben bei einem Cloud-Modell.

Was der Betrieb braucht

Die Hardware hängt von der Größe des Modells ab und davon, wie viele Menschen gleichzeitig fragen. Lange Dokumente erhöhen den Speicherbedarf. Vor dem Kauf steht deshalb eine Analyse der Aufgaben.

Das Modell ist ein Teil des Betriebs. Der andere Teil legt fest, wer es was fragen darf:

  • ein Token pro Anwendung und ein Protokoll der Anfragen,
  • eine zweite Maschine oder ein freigegebenes Cloud-Modell, das die Anfragen übernimmt, wenn der erste Server ausfällt,
  • ein Plan für Updates: Das neue Modell läuft neben dem alten, bis die Mitarbeiter es freigeben,
  • eine Person, die das Modell betreibt, mit einem Betriebshandbuch für Neustarts und Störungen.

Bei KI im eigenen Rechenzentrum kommen die Fragen an den Raum hinzu: Strom, Kühlung, Netzwerk und Zutritt.

Meine Arbeit rund um lokale Modelle

Ich bin IT-Experte für Datenplattformen. Der Betrieb rund um ein Modell ist Serverarbeit, und die habe ich selbst gemacht. In Rechenzentren in Deutschland und den USA habe ich Server, Switches, Firewalls und Backup-Systeme aufgebaut und verkabelt. Ich habe Blockchain-Nodes in mehreren Rechenzentren betrieben. Eine Infrastruktur habe ich mit Failover von einer Cloud in eine andere umgezogen.

In einem Kundenprojekt baue ich eine Plattform mit Claude und Codex nach einer gemeinsamen Regeldatei neu auf. Regeln und Gedächtnis der Agenten liegen außerhalb des Modells. Ein Open-Weight-Modell auf eigenen Servern kann in diesem Aufbau an die Stelle eines Cloud-Modells treten. Die Agenten können auf einer Open-Source-Control-Plane für KI-Agenten laufen, die ein Unternehmen auf einem Server seiner Wahl installiert.

Ich plane lokale KI für Unternehmen in Deutschland und richte sie ein. Wir sortieren die Daten danach, was das Haus verlassen darf. Dann prüfen wir die Lizenz der Modelle, die infrage kommen, und legen die Hardware für die Nutzer aus. Diese Arbeit übernehme ich als Freelancer oder in Festanstellung.

Suchanfragen zu diesem Thema

  • was ist ein lokales llm
  • lokale llms
  • llm lokal laufen lassen
  • llm selbst hosten hardware
  • lokales sprachmodell
  • was ist lokale ki
  • was sind lokale ki modelle
  • lokale ki auf eigenem server
  • ki modell selbst hosten
  • ki ohne cloud