Mittelstufe 11 Min.Konformität

Lokale KI im Unternehmen: DSGVO, Souveränität und Deployment (2026)

Direkte Antwort

Ein lokaler KI-Server in Frankreich ist ein Rechner mit GPU (in Ihren Räumlichkeiten oder bei einem europäischen Hosting-Anbieter), der ein Open-Weight-Modell wie Mistral Small ausführt und es Ihren Teams über eine Weboberfläche zur Verfügung stellt: Prompts und Dokumente bleiben unter Ihrer Kontrolle. Für ein kleines oder mittleres Unternehmen reicht für einen Pilotbetrieb eine Workstation mit einer GPU mit 24 GB Speicher. Lokal bedeutet nicht außerhalb der DSGVO: Für Zugriff, Protokollierung, das Verzeichnis der Verarbeitungstätigkeiten und Sicherheit bleiben Sie verantwortlich.

Sie möchten ein LLM in Ihrem Unternehmen installieren, ohne Ihre Daten an einen Cloud-Dienst zu senden. Dieser Leitfaden beantwortet die Fragen in der Reihenfolge, in der sie sich stellen: wo der Server stehen soll, welches Modell Sie wählen sollten (und unter welcher Lizenz), welche Hardware für wie viele Nutzer benötigt wird und wie Sie das LLM bereitstellen, absichern und für den Datenschutzbeauftragten (DPO) dokumentieren. Preise finden Sie hier nicht: Sie ändern sich jede Woche.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Lokaler KI-Server in Frankreich: Für wen und wofür?

Ein lokaler KI-Server hostet ein Sprachmodell auf einer Infrastruktur, die Sie kontrollieren: in Ihren eigenen Räumlichkeiten, in einem Rack bei einem Hostinganbieter oder auf einem gemieteten GPU-Server in Europa. Die Mitarbeitenden greifen mit ihren Konten über eine Weboberfläche oder eine interne API darauf zu. Für ein kleines oder mittleres Unternehmen ist die Ausgangskonfiguration überschaubar: eine Workstation mit einer GPU mit 24 GB Speicher, Ollama als Engine, Open WebUI als Oberfläche und ein Modell mit 24 Milliarden Parametern wie Mistral Small 3.2, das laut QuelLLM-Katalog in Q4 etwa 14 GB belegt. Anschließend entscheiden Sie anhand eines realen Anwendungsfalls, ob Sie die Leistung erhöhen oder nicht.

Datenschutz
Verträge, Kundenakten, HR-Daten, Quellcode: Prompts und Dateien werden nicht an einen KI-Anbieter weitergeleitet.
Weniger Compliance-Aufwand, aber keine Befreiung von den Pflichten
Für das Modell selbst müssen Sie weder einen KI-Auftragsverarbeiter angeben noch eine Datenübermittlung außerhalb der EU dokumentieren, aber Ihre Pflichten als Verantwortlicher für die Datenverarbeitung bestehen weiterhin.
Vorhersehbare Kosten
Kein Abonnement, dessen Kosten mit der Mitarbeiterzahl steigen: Die Kosten beschränken sich auf Hardware, Strom und den Zeitaufwand für die Administration.
Unabhängigkeit
Ein heruntergeladenes Open-Weight-Modell funktioniert weiterhin, wenn ein Anbieter seine Preise oder Bedingungen ändert.

#DSGVO und Souveränität: Was der lokale Betrieb verändert und was er nicht verändert

Das Kit für lokale KI in Unternehmen

Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Die CNIL weist darauf hin, dass die DSGVO personenbezogene Daten an drei Stellen schützt: in den Trainingsdatenbeständen, in den Modellen, die diese Daten möglicherweise gespeichert haben, und bei der Nutzung der Modelle über Eingaben (Prompts). Ihr lokaler Server löst die dritte Frage, die der Prompts: Sie bleiben bei Ihnen. Er löst die zweite Frage nicht: Ein Sprachmodell kann selbst personenbezogene Daten enthalten. Das betrifft die Auswahl des Modells und die Art und Weise, wie Sie es dokumentieren.

Zu Datenübermittlungen erklärt die CNIL, dass eine Übermittlung in Länder außerhalb der Europäischen Union und des Europäischen Wirtschaftsraums nur möglich ist, wenn ein ausreichendes und angemessenes Schutzniveau gewährleistet wird. Bei einem Server in Ihren eigenen Räumlichkeiten stellt sich diese Frage nicht. Bei einem Hosting-Anbieter stellt sie sich je nach dessen Struktur und Tochtergesellschaften.

!
Lokal bedeutet nicht außerhalb des Geltungsbereichs der DSGVO
Sie bleiben für die Verarbeitung verantwortlich: Rechtsgrundlage, Information der betroffenen Personen, Datenminimierung, Aufbewahrungsdauer der Gesprächsverläufe, Zugriffsverwaltung und Protokollierung. Nehmen Sie den Assistenten in das Verzeichnis der Verarbeitungstätigkeiten auf und lassen Sie bei einer Verarbeitung mit hohem Risiko gemeinsam mit Ihrem Datenschutzbeauftragten prüfen, ob eine Datenschutz-Folgenabschätzung erforderlich ist.

#In Frankreich gehostetes privates LLM: konkrete Optionen

Je nach gewünschtem Kontrollniveau kommen drei Architekturen für das Hosting eines privaten LLM infrage. Die Tabelle vergleicht sie anhand der wirklich wichtigen Fragen: Wo liegen die Daten, wer übernimmt die Administration und was müssen Sie einem Auditor nachweisen?

Drei Möglichkeiten, einen privaten LLM zu hosten
OptionWo sind die DatenWer verwaltetAchtung
Server in Ihren Räumen (on-premise)Bei Ihnen, in Ihrem internen NetzwerkVousAm einfachsten gegenüber einem Datenschutzbeauftragten zu rechtfertigen; die Anfangsinvestition und den Betrieb tragen Sie selbst
Bei einem europäischen Hosting-Anbieter gemieteter GPU-ServerBeim Anbieter in der gewählten RegionDer Hostinganbieter für die Hardware, Sie für die SoftwarePrüfen Sie die tatsächliche Region, den Auftragsverarbeitungsvertrag und die Struktur des Hostinganbieters
Arbeitsrechner oder leistungsstarker Mini-PCAuf dem GerätVousIdeal für ein Pilotprojekt; keine Redundanz, keine Hochverfügbarkeit

#Hosting in Frankreich, Hosting in Europa, SecNumCloud: drei verschiedene Dinge

„In Frankreich gehostet“ beschreibt einen Standort, keinen rechtlichen Schutz. Scaleway wirbt beispielsweise für seine GPU-Instanzen mit einer garantierten Datenresidenz in Europa und Schutz vor extraterritorialen Gesetzen: Das sind kommerzielle Zusagen, die Sie im Vertrag nachlesen müssen, keine Tatsachen, die dieser Leitfaden für Sie überprüfen kann. Für die sensibelsten Daten bietet die ANSSI die Qualifizierung SecNumCloud an, die sensible Daten und deren Verarbeitung vor cyberkriminellen Bedrohungen und der Anwendung extraterritorialer Gesetze schützen soll.

Zwei hilfreiche Klarstellungen, bevor Sie sich darauf berufen. Zum einen weist die ANSSI darauf hin, dass diese Qualifizierung keine Aussage über das Sicherheitsniveau der Dienste trifft, die Sie auf dem qualifizierten Angebot betreiben: Ihre Anwendung müssen Sie weiterhin absichern. Zum anderen qualifiziert sie bestimmte Cloud-Angebote, keinen Hosting-Anbieter als Ganzes: Prüfen Sie im Katalog der qualifizierten Produkte und Dienste, ob das von Ihnen ins Auge gefasste GPU-Angebot dort aufgeführt ist.

i
Fordern Sie von einem Hosting-Anbieter diese vier Antworten schriftlich an
Exakte Region des GPU-Servers; Vertragspartner und verbundene Unternehmen mit Administratorzugriff; Auftragsverarbeitungsvertrag gemäß Artikel 28 der DSGVO; ob das betreffende Angebot über eine SecNumCloud-Qualifizierung verfügt oder nicht.

#Welches Modell eignet sich für ein französisches Unternehmen und unter welcher Lizenz?

Die Auswahl erfolgt anhand von drei Kriterien: Qualität auf Französisch, benötigter Speicher und Lizenz. Die Lizenz ist das Kriterium, das man vergisst: Selbst ein sehr gutes Modell kann für die kommerzielle Nutzung verboten sein. Der QuelLLM-Katalog zeigt die Lizenz jedes Modells an; hier sind einige Orientierungshilfen zu französischen oder europäischen Modellen.

Französische oder europäische Modelle für den Einsatz im Unternehmen (QuelLLM-Katalog)
ModellGrößeSpeicherbedarf bei Q4LizenzHinweis
Mistral Nemo 12B Instruct12B7 GBApache 2.0Kontextfenster von 128.000 Tokens; guter Einstieg auf einer kleinen Grafikkarte
Mistral Small 3.2 24B24B14 GBApache 2.0Mehrsprachig, mit Bildverarbeitung; ausgewogenes Verhältnis zwischen Qualität und Kosten für ein kleines oder mittleres Unternehmen
EuroLLM 22B Instruct22,6B13 GBApache 2.0Europäisches Modell; Kontextgröße von 32.768 Tokens
Mistral Small 4119B (MoE)72 GBApache 2.0Vorbehalten für einen Server mit großem Speicher
Codestral 22B v0.122B13 GBMistral Non-Production LicenseNicht für die kommerzielle Nutzung: Vor jeder Bereitstellung prüfen.

Das Modell mit 32 Milliarden Parametern, das oft als „guter Kompromiss“ genannt wird, belegt in Q4 allein für die Gewichte 19 bis 20 GB: Auf einer Karte mit 24 GB lässt es fast keinen Platz für den Kontext und mehrere gleichzeitige Nutzer. Für eine erste Bereitstellung ist ein Modell mit 24 Milliarden Parametern eine realistischere Grundlage. Testen Sie die Qualität auf Französisch anhand Ihrer eigenen Dokumente, bevor Sie sich entscheiden: Die in einer Rangliste ausgewiesene Qualität lässt nicht vorhersagen, wie gut das Modell mit Ihrem Fachjargon zurechtkommt.

#Budget und Hardware: nach der Anzahl gleichzeitiger Nutzer dimensionieren

Die richtige Dimensionierung hängt nicht von der Anzahl der Mitarbeiter ab, sondern davon, wie viele Personen gleichzeitig eine Anfrage senden. Laut der Ollama-FAQ verarbeitet ein Modell standardmäßig jeweils eine Anfrage; die anderen warten in einer Warteschlange, und der Speicherbedarf wächst proportional zum Produkt aus der Anzahl paralleler Anfragen und der Kontextlänge. Werden vier parallele Anfragen mit einem Kontext von 8.000 Tokens zugelassen, wird somit Kontextspeicher für umgerechnet 32.000 Tokens zugewiesen.

Richtwerte für die Dimensionierung (durch einen Test mit Ihren Anwendungsfällen zu überprüfen)
SituationWas man anstreben sollteMögliche Softwarelösung
Pilotprojekt mit 1 bis 5 Personen, gelegentliche NutzungWorkstation mit einer GPU mit 24 GB Speicher oder Mac mit viel vereinheitlichtem Speicher; Modell mit 12 bis 24 Milliarden ParameternOllama und Open WebUI
Team aus einigen Dutzend Personen, täglicher EinsatzDedizierter GPU-Server mit mehr Speicher; Latenz mit echten Benutzern messenOllama mit eingestellter Parallelität oder ein Server mit hohem Durchsatz wie vLLM
Mehrere Standorte, Verfügbarkeit erforderlichZwei Server, eine Gateway-Instanz, ÜberwachungLiteLLM oder eine gleichwertige Lösung als vorgeschaltete Schicht vor mehreren Inferenz-Engines

Diese Angaben dienen als Orientierung für die Architektur, nicht als Messwerte: Die wahrgenommene Latenz hängt vom Modell, der Quantisierung, dem Kontext und dem Nutzungsprofil ab. Führen Sie einen zwei- bis vierwöchigen Pilotversuch mit einem konkreten Anwendungsfall durch, beobachten Sie die Warteschlangen und die Speicherbelegung und dimensionieren Sie anschließend das System.

#Interner Chatbot und dokumentenbasiertes RAG

Der wirtschaftlich lohnendste Einsatz ist ein Chatbot, der an Ihren Dokumentenbestand angebunden ist: RAG, bei dem der Assistent seine Antworten auf Ihre Verfahren, Verträge oder technische Dokumentation stützt, die bei Bedarf abgerufen werden. Open WebUI, AnythingLLM und PrivateGPT bieten diese Funktionsweise als schlüsselfertige Lösung an. Achten Sie auf die Lizenz der Benutzeroberfläche: Open WebUI untersagt es, sein Branding bei mehr als fünfzig Nutzern innerhalb eines gleitenden Zeitraums von dreißig Tagen zu entfernen, sofern keine Genehmigung oder Unternehmenslizenz vorliegt. Das betrifft unmittelbar einen Unternehmenseinsatz mit eigenem Erscheinungsbild.

Zweiter Punkt: RAG ersetzt keine Zugriffsrechte. Wenn alle Mitarbeiter dieselbe Datenbank abfragen, muss ein der Geschäftsleitung vorbehaltenes Dokument für alle anderen unzugänglich bleiben. Trennen Sie die Sammlungen nach Gruppen voneinander ab und testen Sie mit einem Konto ohne Zugriffsrechte.

#Sicherheit beim Bereitstellen

Der Ausgangspunkt ist einfach: Laut der FAQ von Ollama lauscht Ollama standardmäßig auf 127.0.0.1, Port 11434. Solange Sie OLLAMA_HOST nicht ändern, ist Ollama nur von der Maschine selbst aus erreichbar. Gefährlich wird es, wenn Sie Ollama für das Netzwerk öffnen, damit die Benutzeroberfläche auf einem anderen Server darauf zugreifen kann, ohne eine Schutzschicht davorzuschalten.

Netzwerkisolation
Server in einem internen Netzwerk, Zugriff nur über die Oberfläche; vollständige Isolierung (Air-Gap) für die sensibelsten Daten.
Verwaltung der Zugriffe
Authentifizierung, Rollen, Deaktivierung der offenen Registrierung, Protokollierung der Anfragen in der Benutzeroberfläche.
Verschlüsselung
Verschlüsseln Sie die Datenträger, auf denen Modelle, Dokumentensammlungen und Gesprächsverläufe gespeichert sind.
Aktualisierungen
Verfolgen Sie die Versionen der Engine, der Benutzeroberfläche und der Modelle; dokumentieren Sie, wer dafür verantwortlich ist.
Sicherung und Löschen
Legen Sie fest, wie lange Gespräche aufbewahrt werden und wie sie auf Wunsch einer Person gelöscht werden.

#Empfohlene Lösungen und Einrichtung in sieben Schritten

  1. 01
    Ein Nutzungsszenario definieren
    Wählen Sie einen konkreten Anwendungsfall (Support, interne Dokumentation) und die betreffende Datenkategorie, bevor Sie die Hardware auswählen.
  2. 02
    Das Hosting wählen
    In den eigenen Räumlichkeiten, bei einem europäischen Hostinganbieter oder auf einem Arbeitsplatzrechner – je nach Sensibilität der Daten und der Übersichtstabelle der Optionen.
  3. 03
    Das Modell auswählen
    Prüfen Sie die Lizenz, testen Sie die Französischkenntnisse des Modells anhand Ihrer Dokumente und behalten Sie den erforderlichen Arbeitsspeicher im Blick.
  4. 04
    Die Engine und die Benutzeroberfläche installieren
    Ollama und Open WebUI für einen Pilotversuch, einen Server mit hohem Durchsatz für eine höhere Last.
  5. 05
    Absichern
    Konten, Rollen, HTTPS hinter einem Reverse-Proxy, kein öffentlich zugänglicher Port der Engine, verschlüsselte Datenträger.
  6. 06
    Dokumentieren
    Verzeichnis der Verarbeitungstätigkeiten, Information der betroffenen Personen, Aufbewahrungsdauer, Auftragsverarbeitungsvertrag bei Einsatz eines Hosting-Anbieters.
  7. 07
    Mit einem Pilotprojekt messen
    Zwei bis vier Wochen tatsächliche Nutzung, danach die Entscheidung über die Ausweitung des Einsatzes.

Die Software dieses Stacks ist kostenlos, doch der Stack ist nicht „von Grund auf“ regelkonform: Regelkonform ist seine dokumentierte und kontrollierte Nutzung durch Sie. Halten Sie Ihre Entscheidungen fest; genau das wird ein Auditor verlangen.

Häufig gestellte Fragen
Ist lokale KI DSGVO-konform?+
Sie erleichtert die Einhaltung der Datenschutzvorgaben, da Ihre Prompts und Dokumente nicht an einen Auftragsverarbeiter übermittelt werden, garantiert sie aber nicht. Sie bleiben für die Verarbeitung verantwortlich: Rechtsgrundlage, Information der Betroffenen, Datenminimierung, Aufbewahrungsdauer, Zugriff und Protokollierung. Nehmen Sie die Verarbeitung in das Verzeichnis der Verarbeitungstätigkeiten auf und lassen Sie gemeinsam mit Ihrem Datenschutzbeauftragten prüfen, ob eine Datenschutz-Folgenabschätzung erforderlich ist.
Wie installiert man ein LLM in einem Unternehmen?+
Definieren Sie einen Anwendungsfall, wählen Sie das Hosting und anschließend ein Modell, dessen Lizenz die kommerzielle Nutzung erlaubt. Installieren Sie Ollama und eine Benutzeroberfläche wie Open WebUI, aktivieren Sie Benutzerkonten und Protokollierung, verschlüsseln Sie die Laufwerke und dokumentieren Sie die Verarbeitung. Testen Sie zwei bis vier Wochen lang, bevor Sie die Kapazitäten für eine höhere Last planen.
Kann ein privater LLM in Frankreich gehostet werden?+
Ja: in Ihren eigenen Räumlichkeiten, bei einem europäischen Hosting-Anbieter, der die Hosting-Region garantiert, oder für ein Pilotprojekt auf einem Arbeitsplatzrechner. Prüfen Sie die genaue Region, den Auftragsverarbeitungsvertrag und bei sensiblen Daten, ob das betreffende Angebot die SecNumCloud-Qualifizierung der ANSSI besitzt. „In Frankreich gehostet“ reicht allein nicht aus.
Welcher Server für eine lokale KI in Unternehmen?+
Das hängt von der Anzahl gleichzeitiger Anfragen ab, nicht von der Anzahl der Mitarbeiter. Ein Pilotbetrieb mit einem Modell mit 12 bis 24 Milliarden Parametern ist auf einer Workstation mit einer GPU mit 24 GB Speicher möglich. Für einige Dutzend Benutzer sollten Sie mehr Speicher einplanen und während eines Pilotbetriebs die Latenz messen, bevor Sie Hardware kaufen.
Gibt es einen privaten französischen LLM?+
Ja: Die Mistral-Modelle (Nemo, Small) sind französisch und stehen im QuelLLM-Katalog unter der Lizenz Apache 2.0; EuroLLM ist ein europäisches Modell. Achten Sie auf die Lizenz jedes Modells: Codestral 22B steht beispielsweise unter einer nicht kommerziellen Lizenz. Testen Sie die Französischkenntnisse mit Ihren eigenen Dokumenten, bevor Sie sich entscheiden.
Sollte Ollama über das Unternehmensnetzwerk erreichbar sein?+
Am besten machen Sie Ollama nicht über das Netzwerk zugänglich: Standardmäßig lauscht Ollama auf 127.0.0.1. Wenn die Benutzeroberfläche auf einem anderen Server läuft, geben Sie den Port mithilfe einer Firewall ausschließlich für diesen Server frei und lassen Sie die Benutzer über die authentifizierte Oberfläche hinter einem Reverse-Proxy mit HTTPS zugreifen. Machen Sie den Port der Inferenz-Engine niemals über das Internet zugänglich.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.