Lokale KI im Unternehmen: DSGVO, Souveränität und Deployment (2026)
Ein lokaler KI-Server in Frankreich ist ein Rechner mit GPU (in Ihren Räumlichkeiten oder bei einem europäischen Hosting-Anbieter), der ein Open-Weight-Modell wie Mistral Small ausführt und es Ihren Teams über eine Weboberfläche zur Verfügung stellt: Prompts und Dokumente bleiben unter Ihrer Kontrolle. Für ein kleines oder mittleres Unternehmen reicht für einen Pilotbetrieb eine Workstation mit einer GPU mit 24 GB Speicher. Lokal bedeutet nicht außerhalb der DSGVO: Für Zugriff, Protokollierung, das Verzeichnis der Verarbeitungstätigkeiten und Sicherheit bleiben Sie verantwortlich.
Sie möchten ein LLM in Ihrem Unternehmen installieren, ohne Ihre Daten an einen Cloud-Dienst zu senden. Dieser Leitfaden beantwortet die Fragen in der Reihenfolge, in der sie sich stellen: wo der Server stehen soll, welches Modell Sie wählen sollten (und unter welcher Lizenz), welche Hardware für wie viele Nutzer benötigt wird und wie Sie das LLM bereitstellen, absichern und für den Datenschutzbeauftragten (DPO) dokumentieren. Preise finden Sie hier nicht: Sie ändern sich jede Woche.
#Lokaler KI-Server in Frankreich: Für wen und wofür?
Ein lokaler KI-Server hostet ein Sprachmodell auf einer Infrastruktur, die Sie kontrollieren: in Ihren eigenen Räumlichkeiten, in einem Rack bei einem Hostinganbieter oder auf einem gemieteten GPU-Server in Europa. Die Mitarbeitenden greifen mit ihren Konten über eine Weboberfläche oder eine interne API darauf zu. Für ein kleines oder mittleres Unternehmen ist die Ausgangskonfiguration überschaubar: eine Workstation mit einer GPU mit 24 GB Speicher, Ollama als Engine, Open WebUI als Oberfläche und ein Modell mit 24 Milliarden Parametern wie Mistral Small 3.2, das laut QuelLLM-Katalog in Q4 etwa 14 GB belegt. Anschließend entscheiden Sie anhand eines realen Anwendungsfalls, ob Sie die Leistung erhöhen oder nicht.
- Datenschutz
- Verträge, Kundenakten, HR-Daten, Quellcode: Prompts und Dateien werden nicht an einen KI-Anbieter weitergeleitet.
- Weniger Compliance-Aufwand, aber keine Befreiung von den Pflichten
- Für das Modell selbst müssen Sie weder einen KI-Auftragsverarbeiter angeben noch eine Datenübermittlung außerhalb der EU dokumentieren, aber Ihre Pflichten als Verantwortlicher für die Datenverarbeitung bestehen weiterhin.
- Vorhersehbare Kosten
- Kein Abonnement, dessen Kosten mit der Mitarbeiterzahl steigen: Die Kosten beschränken sich auf Hardware, Strom und den Zeitaufwand für die Administration.
- Unabhängigkeit
- Ein heruntergeladenes Open-Weight-Modell funktioniert weiterhin, wenn ein Anbieter seine Preise oder Bedingungen ändert.
#DSGVO und Souveränität: Was der lokale Betrieb verändert und was er nicht verändert
Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die CNIL weist darauf hin, dass die DSGVO personenbezogene Daten an drei Stellen schützt: in den Trainingsdatenbeständen, in den Modellen, die diese Daten möglicherweise gespeichert haben, und bei der Nutzung der Modelle über Eingaben (Prompts). Ihr lokaler Server löst die dritte Frage, die der Prompts: Sie bleiben bei Ihnen. Er löst die zweite Frage nicht: Ein Sprachmodell kann selbst personenbezogene Daten enthalten. Das betrifft die Auswahl des Modells und die Art und Weise, wie Sie es dokumentieren.
Zu Datenübermittlungen erklärt die CNIL, dass eine Übermittlung in Länder außerhalb der Europäischen Union und des Europäischen Wirtschaftsraums nur möglich ist, wenn ein ausreichendes und angemessenes Schutzniveau gewährleistet wird. Bei einem Server in Ihren eigenen Räumlichkeiten stellt sich diese Frage nicht. Bei einem Hosting-Anbieter stellt sie sich je nach dessen Struktur und Tochtergesellschaften.
#In Frankreich gehostetes privates LLM: konkrete Optionen
Je nach gewünschtem Kontrollniveau kommen drei Architekturen für das Hosting eines privaten LLM infrage. Die Tabelle vergleicht sie anhand der wirklich wichtigen Fragen: Wo liegen die Daten, wer übernimmt die Administration und was müssen Sie einem Auditor nachweisen?
| Option | Wo sind die Daten | Wer verwaltet | Achtung |
|---|---|---|---|
| Server in Ihren Räumen (on-premise) | Bei Ihnen, in Ihrem internen Netzwerk | Vous | Am einfachsten gegenüber einem Datenschutzbeauftragten zu rechtfertigen; die Anfangsinvestition und den Betrieb tragen Sie selbst |
| Bei einem europäischen Hosting-Anbieter gemieteter GPU-Server | Beim Anbieter in der gewählten Region | Der Hostinganbieter für die Hardware, Sie für die Software | Prüfen Sie die tatsächliche Region, den Auftragsverarbeitungsvertrag und die Struktur des Hostinganbieters |
| Arbeitsrechner oder leistungsstarker Mini-PC | Auf dem Gerät | Vous | Ideal für ein Pilotprojekt; keine Redundanz, keine Hochverfügbarkeit |
#Hosting in Frankreich, Hosting in Europa, SecNumCloud: drei verschiedene Dinge
„In Frankreich gehostet“ beschreibt einen Standort, keinen rechtlichen Schutz. Scaleway wirbt beispielsweise für seine GPU-Instanzen mit einer garantierten Datenresidenz in Europa und Schutz vor extraterritorialen Gesetzen: Das sind kommerzielle Zusagen, die Sie im Vertrag nachlesen müssen, keine Tatsachen, die dieser Leitfaden für Sie überprüfen kann. Für die sensibelsten Daten bietet die ANSSI die Qualifizierung SecNumCloud an, die sensible Daten und deren Verarbeitung vor cyberkriminellen Bedrohungen und der Anwendung extraterritorialer Gesetze schützen soll.
Zwei hilfreiche Klarstellungen, bevor Sie sich darauf berufen. Zum einen weist die ANSSI darauf hin, dass diese Qualifizierung keine Aussage über das Sicherheitsniveau der Dienste trifft, die Sie auf dem qualifizierten Angebot betreiben: Ihre Anwendung müssen Sie weiterhin absichern. Zum anderen qualifiziert sie bestimmte Cloud-Angebote, keinen Hosting-Anbieter als Ganzes: Prüfen Sie im Katalog der qualifizierten Produkte und Dienste, ob das von Ihnen ins Auge gefasste GPU-Angebot dort aufgeführt ist.
#Welches Modell eignet sich für ein französisches Unternehmen und unter welcher Lizenz?
Die Auswahl erfolgt anhand von drei Kriterien: Qualität auf Französisch, benötigter Speicher und Lizenz. Die Lizenz ist das Kriterium, das man vergisst: Selbst ein sehr gutes Modell kann für die kommerzielle Nutzung verboten sein. Der QuelLLM-Katalog zeigt die Lizenz jedes Modells an; hier sind einige Orientierungshilfen zu französischen oder europäischen Modellen.
| Modell | Größe | Speicherbedarf bei Q4 | Lizenz | Hinweis |
|---|---|---|---|---|
| Mistral Nemo 12B Instruct | 12B | 7 GB | Apache 2.0 | Kontextfenster von 128.000 Tokens; guter Einstieg auf einer kleinen Grafikkarte |
| Mistral Small 3.2 24B | 24B | 14 GB | Apache 2.0 | Mehrsprachig, mit Bildverarbeitung; ausgewogenes Verhältnis zwischen Qualität und Kosten für ein kleines oder mittleres Unternehmen |
| EuroLLM 22B Instruct | 22,6B | 13 GB | Apache 2.0 | Europäisches Modell; Kontextgröße von 32.768 Tokens |
| Mistral Small 4 | 119B (MoE) | 72 GB | Apache 2.0 | Vorbehalten für einen Server mit großem Speicher |
| Codestral 22B v0.1 | 22B | 13 GB | Mistral Non-Production License | Nicht für die kommerzielle Nutzung: Vor jeder Bereitstellung prüfen. |
Das Modell mit 32 Milliarden Parametern, das oft als „guter Kompromiss“ genannt wird, belegt in Q4 allein für die Gewichte 19 bis 20 GB: Auf einer Karte mit 24 GB lässt es fast keinen Platz für den Kontext und mehrere gleichzeitige Nutzer. Für eine erste Bereitstellung ist ein Modell mit 24 Milliarden Parametern eine realistischere Grundlage. Testen Sie die Qualität auf Französisch anhand Ihrer eigenen Dokumente, bevor Sie sich entscheiden: Die in einer Rangliste ausgewiesene Qualität lässt nicht vorhersagen, wie gut das Modell mit Ihrem Fachjargon zurechtkommt.
#Budget und Hardware: nach der Anzahl gleichzeitiger Nutzer dimensionieren
Die richtige Dimensionierung hängt nicht von der Anzahl der Mitarbeiter ab, sondern davon, wie viele Personen gleichzeitig eine Anfrage senden. Laut der Ollama-FAQ verarbeitet ein Modell standardmäßig jeweils eine Anfrage; die anderen warten in einer Warteschlange, und der Speicherbedarf wächst proportional zum Produkt aus der Anzahl paralleler Anfragen und der Kontextlänge. Werden vier parallele Anfragen mit einem Kontext von 8.000 Tokens zugelassen, wird somit Kontextspeicher für umgerechnet 32.000 Tokens zugewiesen.
| Situation | Was man anstreben sollte | Mögliche Softwarelösung |
|---|---|---|
| Pilotprojekt mit 1 bis 5 Personen, gelegentliche Nutzung | Workstation mit einer GPU mit 24 GB Speicher oder Mac mit viel vereinheitlichtem Speicher; Modell mit 12 bis 24 Milliarden Parametern | Ollama und Open WebUI |
| Team aus einigen Dutzend Personen, täglicher Einsatz | Dedizierter GPU-Server mit mehr Speicher; Latenz mit echten Benutzern messen | Ollama mit eingestellter Parallelität oder ein Server mit hohem Durchsatz wie vLLM |
| Mehrere Standorte, Verfügbarkeit erforderlich | Zwei Server, eine Gateway-Instanz, Überwachung | LiteLLM oder eine gleichwertige Lösung als vorgeschaltete Schicht vor mehreren Inferenz-Engines |
Diese Angaben dienen als Orientierung für die Architektur, nicht als Messwerte: Die wahrgenommene Latenz hängt vom Modell, der Quantisierung, dem Kontext und dem Nutzungsprofil ab. Führen Sie einen zwei- bis vierwöchigen Pilotversuch mit einem konkreten Anwendungsfall durch, beobachten Sie die Warteschlangen und die Speicherbelegung und dimensionieren Sie anschließend das System.
#Interner Chatbot und dokumentenbasiertes RAG
Der wirtschaftlich lohnendste Einsatz ist ein Chatbot, der an Ihren Dokumentenbestand angebunden ist: RAG, bei dem der Assistent seine Antworten auf Ihre Verfahren, Verträge oder technische Dokumentation stützt, die bei Bedarf abgerufen werden. Open WebUI, AnythingLLM und PrivateGPT bieten diese Funktionsweise als schlüsselfertige Lösung an. Achten Sie auf die Lizenz der Benutzeroberfläche: Open WebUI untersagt es, sein Branding bei mehr als fünfzig Nutzern innerhalb eines gleitenden Zeitraums von dreißig Tagen zu entfernen, sofern keine Genehmigung oder Unternehmenslizenz vorliegt. Das betrifft unmittelbar einen Unternehmenseinsatz mit eigenem Erscheinungsbild.
Zweiter Punkt: RAG ersetzt keine Zugriffsrechte. Wenn alle Mitarbeiter dieselbe Datenbank abfragen, muss ein der Geschäftsleitung vorbehaltenes Dokument für alle anderen unzugänglich bleiben. Trennen Sie die Sammlungen nach Gruppen voneinander ab und testen Sie mit einem Konto ohne Zugriffsrechte.
- Einen internen KI-Chatbot für kleine und mittlere Unternehmen bereitstellen
- Chat-Frontends vergleichen
#Sicherheit beim Bereitstellen
Der Ausgangspunkt ist einfach: Laut der FAQ von Ollama lauscht Ollama standardmäßig auf 127.0.0.1, Port 11434. Solange Sie OLLAMA_HOST nicht ändern, ist Ollama nur von der Maschine selbst aus erreichbar. Gefährlich wird es, wenn Sie Ollama für das Netzwerk öffnen, damit die Benutzeroberfläche auf einem anderen Server darauf zugreifen kann, ohne eine Schutzschicht davorzuschalten.
- Netzwerkisolation
- Server in einem internen Netzwerk, Zugriff nur über die Oberfläche; vollständige Isolierung (Air-Gap) für die sensibelsten Daten.
- Verwaltung der Zugriffe
- Authentifizierung, Rollen, Deaktivierung der offenen Registrierung, Protokollierung der Anfragen in der Benutzeroberfläche.
- Verschlüsselung
- Verschlüsseln Sie die Datenträger, auf denen Modelle, Dokumentensammlungen und Gesprächsverläufe gespeichert sind.
- Aktualisierungen
- Verfolgen Sie die Versionen der Engine, der Benutzeroberfläche und der Modelle; dokumentieren Sie, wer dafür verantwortlich ist.
- Sicherung und Löschen
- Legen Sie fest, wie lange Gespräche aufbewahrt werden und wie sie auf Wunsch einer Person gelöscht werden.
#Empfohlene Lösungen und Einrichtung in sieben Schritten
- 01Ein Nutzungsszenario definierenWählen Sie einen konkreten Anwendungsfall (Support, interne Dokumentation) und die betreffende Datenkategorie, bevor Sie die Hardware auswählen.
- 02Das Hosting wählenIn den eigenen Räumlichkeiten, bei einem europäischen Hostinganbieter oder auf einem Arbeitsplatzrechner – je nach Sensibilität der Daten und der Übersichtstabelle der Optionen.
- 03Das Modell auswählenPrüfen Sie die Lizenz, testen Sie die Französischkenntnisse des Modells anhand Ihrer Dokumente und behalten Sie den erforderlichen Arbeitsspeicher im Blick.
- 04Die Engine und die Benutzeroberfläche installierenOllama und Open WebUI für einen Pilotversuch, einen Server mit hohem Durchsatz für eine höhere Last.
- 05AbsichernKonten, Rollen, HTTPS hinter einem Reverse-Proxy, kein öffentlich zugänglicher Port der Engine, verschlüsselte Datenträger.
- 06DokumentierenVerzeichnis der Verarbeitungstätigkeiten, Information der betroffenen Personen, Aufbewahrungsdauer, Auftragsverarbeitungsvertrag bei Einsatz eines Hosting-Anbieters.
- 07Mit einem Pilotprojekt messenZwei bis vier Wochen tatsächliche Nutzung, danach die Entscheidung über die Ausweitung des Einsatzes.
Die Software dieses Stacks ist kostenlos, doch der Stack ist nicht „von Grund auf“ regelkonform: Regelkonform ist seine dokumentierte und kontrollierte Nutzung durch Sie. Halten Sie Ihre Entscheidungen fest; genau das wird ein Auditor verlangen.
- Quelle: CNIL, Daten außerhalb der EU übertragen
- Quelle: ANSSI, Qualifizierung SecNumCloud
- Quelle: Scaleway, GPU-Instanzen
- Quelle: FAQ Ollama
Ist lokale KI DSGVO-konform?+
Wie installiert man ein LLM in einem Unternehmen?+
Kann ein privater LLM in Frankreich gehostet werden?+
Welcher Server für eine lokale KI in Unternehmen?+
Gibt es einen privaten französischen LLM?+
Sollte Ollama über das Unternehmensnetzwerk erreichbar sein?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.