Mittelstufe 15 minKonformität

Lokale LLM und DSGVO: Datenschutzkonformität in Unternehmen

Kundendaten, Verträge oder Personalakten an ChatGPT oder Claude zu senden, wirft eine einfache Frage auf: Wohin gelangen diese Daten, wer verarbeitet sie und unter welcher Gerichtsbarkeit? Für einen Datenschutzbeauftragten ist die Antwort ohne vertragliche Verrenkungen selten mit der DSGVO vereinbar. Ein lokales LLM — Ollama, vLLM, LM Studio — lässt diese Frage entfallen: Die Daten verlassen niemals die Unternehmensinfrastruktur. Dieser Leitfaden erläutert, warum ein lokales LLM für den DSGVO-konformen Einsatz im Unternehmen 2026 zum Standard-Stack für Datenschutzbeauftragte geworden ist, was sich durch den AI Act ändert, der im August vollständig zur Anwendung kommt, und wie Sie Ihre Bereitstellung auditieren können.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein lokales LLM von Haus aus DSGVO-konform ist

Die DSGVO sagt nicht: „Sie dürfen keine KI nutzen.“ Sie verlangt, dass jede Verarbeitung personenbezogener Daten auf einer Rechtsgrundlage beruht, dokumentiert, minimiert und abgesichert wird und dass Übermittlungen außerhalb der EU rechtlich geregelt sind. Das Problem bei einem Cloud-LLM ist nicht die KI – es ist die Verarbeitung durch einen externen Auftragsverarbeiter, häufig aus den USA, mit einer komplexen Vertragskette und Übermittlungsrisiken im Sinne von Kapitel V der DSGVO.

Ein lokal ausgeführtes LLM kehrt die Ausgangslage um. Die Modellgewichte werden einmal von Hugging Face oder Ollama heruntergeladen, danach erfolgt die Inferenz zu 100 % auf Ihrer Hardware. Kein Prompt wird ins Internet gesendet. Keine Antwort wird bei einem Dritten protokolliert. Die „Verarbeitung“ bleibt intern und unter Ihrer tatsächlichen Kontrolle.

Keine Übermittlung außerhalb der EU
Artikel 44 und Kapitel V der DSGVO: Keine Daten verlassen Ihre Server, daher sind keine Standardvertragsklauseln und kein Transfer Impact Assessment erforderlich, und die Frage nach dem US-amerikanischen Cloud Act stellt sich nicht.
Kein Auftragsverarbeiter im Sinne von Artikel 28
Kein Vertrag zur Auftragsverarbeitung, der ausgehandelt werden muss, kein Anhang 7, der bei jeder Weiterentwicklung des Produkts des Anbieters aktualisiert werden muss, kein Anbieter, der seine Nutzungsbedingungen einseitig ändert.
Integrierte Datenminimierung
Artikel 5.1.c: Sie können nicht versehentlich zu viele Daten an einen Dritten senden, da es keinen Dritten gibt. Datenminimierung wird zu einer Eigenschaft der Architektur statt zu einer Richtlinie, deren Einhaltung durchgesetzt werden muss.
Tatsächliche Löschung
Artikel 17 (Recht auf Löschung): Einen Eintrag in Ihrer eigenen Datenbank zu löschen, ist einfach. OpenAI um die Löschung eines vor 6 Monaten übermittelten Prompts zu bitten, ist ein vertragliches Verfahren, keine technische Garantie.
i
CNIL-Empfehlung
Seit 2024 veröffentlicht die CNIL regelmäßig Informationsblätter zu KI und zur DSGVO. Ihre beständige Position: On-Premise- oder souveräne Lösungen bevorzugen, wenn sensible Daten, Gesundheitsdaten, Personaldaten oder Informationen verarbeitet werden, die einer beruflichen Geheimhaltungspflicht unterliegen.
Das Kit für lokale KI in Unternehmen

Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

In Europa greifen inzwischen zwei Regelwerke ineinander, um den Einsatz von LLMs in Unternehmen zu regeln. Die DSGVO erfasst personenbezogene Daten, der AI Act erfasst KI-Systeme als solche — unabhängig davon, ob sie personenbezogene Daten verarbeiten oder nicht.

#DSGVO: Was für LLMs gilt

Rechtsgrundlage (Art. 6)
Berechtigtes Interesse, Erfüllung eines Vertrags, Einwilligung: Jede Verarbeitung durch ein LLM muss sich auf eine dieser Rechtsgrundlagen stützen. Ein lokales LLM hebt diese Pflicht nicht auf, vereinfacht aber die Dokumentation.
Information der betroffenen Personen (Art. 13–14)
Ihre Datenschutzrichtlinien müssen den Einsatz eines LLM erwähnen, auch wenn es lokal betrieben wird. Sie müssen das Modell nicht namentlich nennen, wohl aber den Verwendungszweck.
DSFA (Art. 35)
Eine Datenschutz-Folgenabschätzung ist für Verarbeitungen mit hohem Risiko erforderlich. Bei einem Cloud-LLM muss sie den Auftragsverarbeiter abdecken; beim lokalen Betrieb beschränkt sie sich auf Ihre eigene Infrastruktur.
Sicherheit (Art. 32)
Verschlüsselung der Festplatten, die Modelle und Protokolle enthalten, Zugriffskontrolle auf die Inferenzserver, Protokollierung. Standard für interne Infrastruktur.

#AI Act: die Frist im August 2026

Der AI Act (Verordnung (EU) 2024/1689) ist am 1. August 2024 in Kraft getreten. Seine Bestimmungen gelten schrittweise. Der wichtigste Schritt für allgemeine LLMs – die Verpflichtungen für allgemein verwendbare Modelle (GPAI) – gilt seit dem 2. August 2025. Die Verpflichtungen für hochrisikobehaftete KI-Systeme gelten ab dem 2. August 2026, also in etwa drei Monaten, wenn Sie diesen Leitfaden lesen.

GPAI (Basismodelle)
Die Verpflichtungen liegen bei den Anbietern (OpenAI, Anthropic, Mistral, Meta...). Wenn Sie Mistral, Qwen oder Granite lokal verwenden, ist der Modellanbieter bereits dafür verantwortlich, eine den Anforderungen entsprechende technische Dokumentation bereitzustellen.
Hochrisikosysteme
Anhang III: Personalwesen, Kreditbewertung, Bildung, grundlegende öffentliche Dienstleistungen, kritische Infrastrukturen. Wenn Ihr LLM in einen dieser Abläufe integriert ist, sind Sie „Betreiber“ im Sinne des AI Act und haben eigene Verpflichtungen.
Transparenz
Alle von KI erzeugten Inhalte müssen als solche erkennbar sein. Jedes System, das mit einer natürlichen Person interagiert, muss sie darauf hinweisen – auch ein interner Chatbot.
Sanktionen
Bis zu 35 Mio. € oder 7 % des weltweiten Umsatzes für die schwerwiegendsten Verstöße (verbotene Nutzung). Bei Verstößen gegen GPAI-Pflichten bis zu 15 Mio. € oder 3 % des Umsatzes.
!
Status als Betreiber vs. Anbieter
Qwen 3.6 35B-A3B lokal zu betreiben macht Sie nicht zu einem GPAI-Anbieter. Sie bleiben „Betreiber“. Wenn Sie hingegen ein Modell feinabstimmen und es anderen Organisationen zur Verfügung stellen, können Sie in die Kategorie der Anbieter fallen, mit den damit verbundenen eigenen Pflichten.

#Konkrete Risiken mit ChatGPT, Claude oder Gemini

Diese Anbieter bieten inzwischen Unternehmensangebote (ChatGPT Enterprise, Claude for Work, Gemini for Workspace) an, die vertraglich zusichern, dass die Daten nicht für das Training verwendet werden, und teilweise Hosting in Europa vorsehen. Das ist besser als eine API für die breite Öffentlichkeit. Es löst aber nicht alles.

Der US-amerikanische CLOUD Act
Eine juristische Person nach US-amerikanischem Recht (OpenAI Inc., Anthropic PBC, Google LLC) bleibt rechtlich verpflichtet, mit den US-amerikanischen Behörden zusammenzuarbeiten, selbst wenn die Daten in der EU gespeichert sind. Der EuGH hat dies 2020 im Urteil Schrems II erneut in Erinnerung gerufen.
Der DPF auf unsicherem Boden
Das EU-US Data Privacy Framework (Juli 2023), das die Grundlage für die meisten Datenübermittlungen bildet, wird vor dem EuGH angefochten. Ein Schrems-III-Urteil würde Tausende von Datenschutz-Folgenabschätzungen über Nacht ungültig machen.
Die Intransparenz des Modells
Sie wissen weder genau, was das Modell beim Training gesehen hat, noch, wie die Moderationsfilter Ihre Prompts protokollieren. Bei ChatGPT werden „Abuse“-Protokolle mindestens 30 Tage lang gespeichert, selbst bei Enterprise.
Shadow IT
Das Risiko #1 in der Praxis ist nicht der Vertrag, sondern dass ein Mitarbeiter einen RH-Datei in die kostenlose Version von ChatGPT kopiert und einfügt. Keine schriftliche Regelung kann einem Browser-Tab widerstehen.
→
Das Argument, das die Geschäftsleitung anspricht
Ein lokales LLM beseitigt sowohl das rechtliche Risiko (Datenübermittlungen, Sanktionen nach dem AI Act) als auch das Shadow-IT-Risiko (die Mitarbeitenden haben endlich eine interne Alternative, die funktioniert). Das ist selten „günstiger als ChatGPT Enterprise“, aber fast immer „weniger riskant und schneller zu auditieren“.

#Der empfohlene Stack für einen Datenschutzbeauftragten (DPO) im Jahr 2026

Es gibt nicht den einen Stack, sondern eine Reihe bewährter Kombinationen, die französische IT-Leiter und Datenschutzbeauftragte seit 18 Monaten einsetzen. Drei typische Profile decken 90 % des Bedarfs ab.

#Profil 1 — Kleines Team, einzelne Arbeitsplatzrechner

Hardware
Arbeitsplatzrechner mit einer RTX 4070 mit 12 GB, einer RTX 4080 mit 16 GB oder einem Mac M4 Pro mit 24–48 GB. Kein zentraler Server.
Software
Ollama (Daemon lokal auf jedem Rechner) + LM Studio oder Open WebUI als Schnittstelle. Keine Daten verlassen den Rechner.
Empfohlenes Modell
Mistral Small 24B Q4 (14 GB, mit nativer Französisch-Unterstützung, hervorragendes Allzweckmodell) oder Qwen 3.8 27B in voller Qualität bei VRAM ≥ 40 GB (262k Kontext, Bildverständnis, Apache 2.0).
Ziel
Anwaltskanzleien, Buchhaltungskanzleien, HR-Teams kleiner und mittlerer Unternehmen, Journalisten. Jede Organisation mit weniger als 30 Personen und individueller Nutzung.

#Profil 2 — interner Inferenzserver

Hardware
Dedizierter GPU-Server: RTX 4090 mit 24 GB, A6000 mit 48 GB oder 2× RTX 3090 mit je 24 GB. Gehostet in der eigenen IT-Infrastruktur oder bei einem souveränen Cloud-Anbieter (OVH, Scaleway, Outscale).
Software
vLLM oder Ollama bietet eine OpenAI-kompatible API im internen Netzwerk. Open WebUI oder LibreChat im Frontend hinter dem Unternehmens-IdP (Keycloak, Azure AD).
Empfohlenes Modell
Mistral Small 24B, Qwen 3.6 35B-A3B oder Granite 4.2 30B je nach VRAM (MoE-Modelle wie Qwen 3.6 35B-A3B nutzen nur 3 Milliarden aktive Parameter und sind daher selbst auf einer GPU mit 24 GB schnell). Embedding-Modell BGE-M3 oder Solon für dokumentenbasiertes RAG.
Ziel
Mittelgroße Unternehmen (ETI), interne Rechtsabteilungen, Datenteams mit 30–500 Personen. Ermöglicht die gemeinsame Nutzung und eine zentralisierte Zugriffskontrolle.

#Profil 3 — Air-gap für sensible Daten

Hardware
Server physisch vom öffentlichen Netzwerk isoliert. Mit LUKS verschlüsselte Laufwerke. Modelle werden über einen physischen Datenträger auf einen Übergangsrechner heruntergeladen.
Software
vLLM lokal kompiliert, llama.cpp aus dem Quellcode. Keine öffentlichen Container, keine zur Laufzeit heruntergeladenen Docker-Images.
Empfohlenes Modell
Validierte Modelle mit permissiver Lizenz (Mistral, Qwen, Granite oder Gemma 4 unter Apache 2.0, mit Prüfung der Modellgewichte). Idealerweise ein Modell, dessen Tarball Sie als lokale Kopie archiviert haben.
Ziel
Gesundheitswesen (DMP, medizinische Berichte), Verteidigung, besonders sensible Geschäftsgeheimnisse, OIV/OSE. Alles, was bei einer Nutzung in der Cloud unter eine Datenschutz-Folgenabschätzung mit hohem Restrisiko fallen würde.

#Umsetzung: die 5 grundlegenden Schritte

  1. 01
    Die Anwendungsfälle erfassen
    Bevor Sie einen Modell auswählen, erstellen Sie eine Liste der tatsächlichen Anwendungsfälle: Schreiben, Übersetzen, Zusammenfassen von Verträgen, Loganalyse, N1-Unterstützung. Für jeden Fall notieren Sie die Sensitivität der verarbeiteten Daten (öffentlich, intern, geheim, Geschäftsgeheimnis). Diese Karte wird zur Anwendungsdokumentation Ihres AIPD.
  2. 02
    Profil und Modell auswählen
    Wählen Sie anhand der Bestandsaufnahme und des Hardware-Inventars eines der drei oben genannten Profile aus. Beginnen Sie bei der Modellwahl mit Mistral Small 24B in Q4_K_M, wenn Sie 16–24 GB VRAM haben — das ist 2026 der ausgewogenste Kompromiss für die französische Sprache. Q4_K_M bleibt die standardmäßig empfohlene Quantisierung (Qualitätsverlust < 2 % gegenüber FP16).
  3. 03
    Den Inferenzserver installieren
    Ollama lauscht standardmäßig auf http://localhost:11434. Um Ollama im internen Netzwerk zugänglich zu machen, setzen Sie OLLAMA_HOST=0.0.0.0:11434 und betreiben Sie die API hinter einem Reverse-Proxy (Caddy, Traefik), der die Authentifizierung übernimmt. Aktivieren Sie die Zugriffsprotokolle und bewahren Sie sie zur Nachvollziehbarkeit 6 Monate lang auf.
  4. 04
    Im Verzeichnis dokumentieren
    Erstellen oder aktualisieren Sie den Eintrag „Unterstützung durch interne generative KI“ in Ihrem Verzeichnis der Verarbeitungstätigkeiten (Artikel 30 DSGVO). Zwecke, Datenkategorien, Aufbewahrungsfristen, technische Maßnahmen. Dass die Verarbeitung lokal erfolgt, muss dort ausdrücklich angegeben sein.
  5. 05
    Schulen und kommunizieren
    Eine Richtlinie zur KI-Nutzung, die von jedem Mitarbeiter unterschrieben wird und folgende Punkte festhält: (1) ausschließliche Nutzung der internen Instanz, (2) Verbot nicht genehmigter Cloud-Tools, (3) zulässige Datentypen je nach Anwendungsfall. Fügen Sie sie nach Anhörung des CSE (französischer Sozial- und Wirtschaftsausschuss) der Betriebsordnung als Anlage bei.
Konfiguration, um Ollama im internen Netzwerk zugänglich zu machen
# Sur Linux (systemd)
sudo systemctl edit ollama.service

# Ajouter :
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=https://chat.interne.entreprise.fr"
Environment="OLLAMA_KEEP_ALIVE=24h"

# Recharger et redémarrer
sudo systemctl daemon-reload
sudo systemctl restart ollama

# Vérifier
curl http://serveur-ia.interne:11434/api/tags
!
0.0.0.0 nicht ohne Reverse-Proxy zugänglich machen
OLLAMA_HOST=0.0.0.0 öffnet die API ohne Authentifizierung. Jeder Benutzer im Netzwerk kann Ihre Modelle abfragen, die Gespräche auflisten und herunterladen. Stellen Sie systematisch einen Reverse-Proxy mit Authentifizierung (OIDC, mTLS, Basic-Auth + IP-Filterung) davor. Das ist unbedingt erforderlich.

#Checkliste für ein Compliance-Audit

Diese Checkliste deckt die Punkte ab, die ein Audit zur DSGVO und zum AI Act beim Einsatz eines lokalen LLM in einem Unternehmen prüfen würde. Drucken Sie sie aus, haken Sie die Punkte ab und archivieren Sie sie.

#Governance und Dokumentation

Verzeichnis nach Art. 30
Aktueller Verarbeitungseintrag „interne generative KI“ mit Zwecken, Daten, Aufbewahrungsfristen, Empfängern (ausschließlich intern) und technischen Maßnahmen.
AIPD
Wird durchgeführt, wenn die Verarbeitung mit einem hohen Risiko verbunden ist (Personalwesen, Gesundheit, Profiling). Wird bei jeder wesentlichen Änderung des Modells oder des Anwendungsfalls aktualisiert.
Richtlinie zur KI-Nutzung
Verteilt, unterzeichnet und nach Anhörung des CSE in die Betriebsordnung aufgenommen.
Übersicht der Anwendungsfälle
Aktuelle Liste der validierten Anwendungsfälle und der genehmigten Daten pro Fall.
Benennung der KI-verantwortlichen Person
Ein benannter Verantwortlicher (DPO, RSSI oder DSI, je nach Organisation) mit formalisiertem Mandat.

#Technische Sicherheit

Verschlüsselung ruhender Daten
Verschlüsselte Datenträger des Inferenzservers (LUKS, BitLocker, FileVault). Die Verschlüsselung umfasst auch heruntergeladene Modelle und eventuell vorhandene Prompt-Caches.
Authentifizierung
API-Zugriff über OIDC oder mTLS absichern. Keine Ollama-Instanz darf ohne Authentifizierung zugänglich sein, auch nicht intern.
Protokollierung
Zugriffsprotokolle (wer, wann, welches Modell abgefragt wurde) werden 6 bis 12 Monate lang aufbewahrt. Die Inhalte der Prompts werden nicht protokolliert, außer bei einem ausdrücklich festgelegten und dokumentierten Anwendungsfall.
Netzwerkisolation
Der Inferenzserver hat im Produktionsbetrieb keinen ausgehenden Internetzugang. Für sensible Bereitstellungen: vollständige Netzwerkisolation (Air-Gap).
Sicherung und Wiederherstellung
Dokumentierter Wiederanlaufplan: Die Modelle können aus einem internen Archiv neu installiert werden, ohne unmittelbar von Hugging Face abhängig zu sein.

#AI-Act-Konformität

Systemklassifizierung
Sie haben die Einstufung festgelegt: Nutzung mit begrenztem, hohem oder minimalem Risiko. Bei hohem Risiko (Anhang III) liegt eine gesonderte Konformitätsdokumentation vor.
Information der Nutzer
Jede Benutzeroberfläche zeigt „KI-generierter Inhalt“ oder einen gleichwertigen Hinweis an. Artikel 50 der KI-Verordnung, anwendbar ab August 2026.
Nachverfolgbarkeit des Modells
Die genaue Version des verwendeten Modells, die Quelle der Modellgewichte, das Downloaddatum und der SHA256-Hash werden archiviert. Damit lässt sich bei einem Audit die Frage beantworten: „Welches Modell hat welche Antwort an welchem Datum generiert?“
Menschliche Überwachung
Für Hochrisikoanwendungen: ein dokumentiertes Verfahren zur menschlichen Überprüfung vor jeder Entscheidung, die eine Person betrifft (Personalrekrutierung, Scoring, Sanktionen).

#Häufige Stolperfallen

"Lokal", aber mit Telemetrie
Einige Benutzeroberflächen (LM Studio in älteren Versionen, bestimmte VSCode-Plugins) senden Telemetriedaten. Prüfen Sie mit einem Sniffer (Wireshark, Little Snitch), dass keine Daten nach außen übertragen werden. Unser Leitfaden mit einer Datenschutz-Checkliste behandelt diesen Schritt.
Modelle mit unklarer Lizenz
Codestral 22B steht beispielsweise unter einer Non-Production-Lizenz: Sein Einsatz in Unternehmen ist verboten. Llama behält seinerseits eine Community-Lizenz bei, die die Nutzung durch sehr große Unternehmen (> 700 Mio. MAU) einschränkt. Prüfen Sie die Lizenz vor dem Einsatz in der Produktion – bevorzugen Sie Modelle unter Apache 2.0 (Mistral Small, Qwen 3.5/3.8, Granite 4.2, Gemma 4) –, insbesondere wenn Sie eine große Organisation oder ein Softwareanbieter sind.
Verwechslung von Modell und Fine-Tuning
Ein Fine-Tuning mit internen Personaldaten schafft eine neue Datenverarbeitung mit einer eigenen Datenschutz-Folgenabschätzung (DSFA). Das feinabgestimmte Modell kann Trainingsdaten preisgeben (Memorization). Bevorzugen Sie bei sensiblen Daten RAG gegenüber Fine-Tuning.
Die Nachvollziehbarkeit unterschätzen
Wenn nach 18 Monaten jemand Ihnen fragt: „Zeigen Sie mir, was die KI auf meinen Akten aus März geantwortet hat“, müssen Sie darauf antworten können. Denken Sie bereits am Tag 1 an Audit-Logs, nicht erst nach dem ersten Vorfall.
Die Annahme, dass ein lokaler LLM alles regelt
Ein lokales LLM löst das Problem der Datenübertragung, nicht das der Nutzung. Ein lokales Modell, das für automatisiertes Scoring im Personalwesen eingesetzt wird, bleibt ein Hochrisikosystem im Sinne des AI Act. Lokal ≠ ausgenommen.
i
Kurzgefasste Stellungnahme der CNIL
Die CNIL hat seit 2024 mehrere Informationsblätter zu KI veröffentlicht (zur Rechtsgrundlage, zur Datenminimierung und zur Datenschutz-Folgenabschätzung für KI). Sie schreibt den lokalen Betrieb nicht vor, bewertet ihn aber als „geeignete technische Maßnahme“ im Sinne von Artikel 32 DSGVO positiv, insbesondere bei sensiblen Daten.

#Weiterführende Informationen

Sobald die Compliance-Grundlagen stehen, bieten sich drei naheliegende Wege an, um die Bereitstellung weiter auszubauen:

Vertraulichkeit technisch absichern
Die Datenschutzcheckliste erläutert die Netzwerk- und Systemprüfungen, die den rechtlichen Rahmen aufseiten der Datenschutzbeauftragten (DPO) ergänzen. Unverzichtbar vor dem Produktiveinsatz.
Ein RAG-System auf Basis Ihrer internen Dokumente aufbauen
Mit RAG (Retrieval-Augmented Generation) lassen sich Verträge, Verfahrensanweisungen und interne Datenbanken ohne Fine-Tuning abfragen, um aus einem allgemeinen Assistenten ein Werkzeug für konkrete berufliche Aufgaben zu machen. Der Einführungsleitfaden zu lokalem RAG vermittelt die Grundlagen.
Die Benutzeroberfläche wählen
Open WebUI deckt 80 % der Anforderungen in Unternehmen ab: Mehrbenutzerbetrieb, OIDC, integriertes RAG, Logs. Der zugehörige Leitfaden beschreibt die Bereitstellung mit Docker hinter einem Reverse-Proxy.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.