·3 Min. Lesezeit
Private KI: LLMs On-Premise betreiben, ohne Daten in die Cloud zu senden
Wenn Kundendaten Ihr Netzwerk nicht verlassen dürfen, ist ein lokal gehostetes Sprachmodell oft der einzig realistische Weg zu KI. Was dazu gehört: Modelle, Hardware, Integration und Kompromisse.
Viele Unternehmen in Deutschland möchten KI einsetzen – und viele dürfen Kunden- oder Firmendaten nicht an einen externen KI-Dienst senden. Verträge, DSGVO-Pflichten, Betriebsvereinbarungen oder schlicht eine vorsichtige IT sagen Nein. Das muss nicht das Ende des KI-Projekts sein. Open-Source-Sprachmodelle laufen auf eigenen Servern, im eigenen Netzwerk, und viele praktische Anwendungsfälle funktionieren damit sehr gut.
Dieser Artikel fasst zusammen, was ich beim Aufbau lokal gehosteter LLMs für Business-Anwendungen gelernt habe: wann es sinnvoll ist, was Sie brauchen und wo die Grenzen liegen.
Wann ein privates LLM die richtige Wahl ist
Ein lokal gehostetes Modell lohnt sich, wenn mindestens einer dieser Punkte zutrifft:
- Die Daten sind sensibel. Kundendaten, Verträge, Gesundheits- oder Finanzdaten, interne Dokumente.
- Die Daten müssen in der EU oder im Haus bleiben – aus vertraglichen oder regulatorischen Gründen.
- Der Anwendungsfall ist klar umrissen und wiederholbar: Dokumente klassifizieren, Felder extrahieren, Fragen aus der eigenen Wissensbasis beantworten, Nutzer durch einen Prozess führen.
- Sie erwarten ein konstant hohes Volumen, bei dem tokenbasierte Cloud-Preise ins Gewicht fallen.
Braucht Ihr Anwendungsfall das beste derzeit verfügbare Reasoning oder sind die Daten nicht sensibel, ist ein Cloud-Modell meist der schnellere Start. Viele Projekte kombinieren beides: ein lokales Modell für alles mit personenbezogenen Daten, ein Cloud-Modell für den Rest.
Was Sie tatsächlich brauchen
Ein Modell, das zur Aufgabe passt
Sie brauchen nicht das größte Modell. Für strukturierte Aufgaben wie Extraktion, Klassifikation, Zusammenfassung oder Tool-Calling reichen Modelle mit 7–14 Milliarden Parametern oft aus, besonders mit klarem Prompt und Beispielen. Größere Modelle (um 70B) sind bei offenem Reasoning spürbar besser, brauchen aber deutlich mehr Hardware.
Entscheidend sind die Sprachqualität (testen Sie auf Deutsch, wenn Ihre Nutzer Deutsch sprechen), die Unterstützung für strukturierte Ausgaben bzw. Function-Calling und die Lizenz.
Hardware
Die Faustregel ist der Grafikspeicher. Auf 4 Bit quantisiert passt ein Modell mit 7–8 Milliarden Parametern in etwa 6–8 GB VRAM; ein 70B-Modell braucht rund 40 GB oder mehr. Planen Sie Reserven für das Kontextfenster und mehrere gleichzeitige Nutzer ein. Für einen Pilot reicht eine einzelne Workstation-GPU; für den Produktivbetrieb mit vielen parallelen Nutzern braucht es eine saubere Dimensionierung.
Eine Serving-Schicht
Werkzeuge wie Ollama oder vLLM laden das Modell und stellen eine HTTP-API bereit, die den Cloud-APIs stark ähnelt. Ihre Anwendungen sprechen mit diesem Endpunkt statt mit dem Internet. Setzen Sie ihn hinter einen Reverse Proxy mit TLS und Authentifizierung, protokollieren Sie Anfragen und überwachen Sie Latenz und GPU-Auslastung wie bei jedem anderen Dienst.
Anbindung an Ihre Systeme
Das Modell allein schafft keinen Mehrwert. Der entsteht erst durch die Verbindung mit Ihren Daten und Prozessen:
- Retrieval (RAG): Indexieren Sie Ihre Dokumente und lassen Sie das Modell daraus antworten – mit Quellenangabe.
- Tool-Calling: Lassen Sie das Modell Ihre bestehenden APIs aufrufen, etwa um einen Kunden zu suchen oder einen Auftrag anzulegen, während die Geschäftslogik im Backend bleibt.
- Leitplanken: Prüfen Sie jede Modellausgabe, bevor sie Daten verändert, und halten Sie bei kritischen Schritten einen Menschen in der Schleife.
Ehrliche Kompromisse
- Qualität: Ein gut gewähltes lokales Modell ist bei fokussierten Aufgaben sehr gut, aber kein Top-Cloud-Modell. Messen Sie es an Ihren echten Daten, bevor Sie etwas versprechen.
- Betrieb: Updates, Monitoring und Kapazität liegen bei Ihnen. Planen Sie Zeit dafür ein.
- Kostenprofil: Hardware ist eine Vorabinvestition; dafür gibt es keine Rechnung pro Anfrage und keine Daten, die das Haus verlassen.
Wie ich solche Projekte angehe
- Einen Anwendungsfall wählen – mit klarem Nutzen und messbaren Erfolgskriterien.
- Ein kleines Evaluationsset aus echten (anonymisierten) Beispielen aufbauen.
- Zwei oder drei Kandidatenmodelle vergleichen – auf diesem Set und auf der Zielhardware.
- Schrittweise integrieren: zuerst nur lesend, dann Aktionen mit Validierung.
- Übergeben – mit Dokumentation, Monitoring und Betriebshandbuch für Ihr Team.
In einem aktuellen Projekt konnten Nutzer so auf Handheld-Terminals, im Web und unter Windows mit einem KI-Assistenten auf Deutsch arbeiten, ohne dass Kundendaten das Firmennetz verlassen haben.
Wenn Sie über KI nachdenken, der Datenschutz die Diskussion aber immer wieder bremst, ist ein privates LLM oft der Weg nach vorn. Gern schaue ich mir Ihren Anwendungsfall in einem kostenlosen Gespräch an.
Holen Sie sich die KI-Readiness-Checkliste
10 Fragen, die Sie vor einem KI-Projekt beantworten sollten, plus gelegentliche Notizen zu angewandter KI und SaaS. Kostenlos.