Lokale LLM und DSGVO: Datenschutzkonformität in Unternehmen
Kundendaten, Verträge oder Personalakten an ChatGPT oder Claude zu senden, wirft eine einfache Frage auf: Wohin gelangen diese Daten, wer verarbeitet sie und unter welcher Gerichtsbarkeit? Für einen Datenschutzbeauftragten ist die Antwort ohne vertragliche Verrenkungen selten mit der DSGVO vereinbar. Ein lokales LLM — Ollama, vLLM, LM Studio — lässt diese Frage entfallen: Die Daten verlassen niemals die Unternehmensinfrastruktur. Dieser Leitfaden erläutert, warum ein lokales LLM für den DSGVO-konformen Einsatz im Unternehmen 2026 zum Standard-Stack für Datenschutzbeauftragte geworden ist, was sich durch den AI Act ändert, der im August vollständig zur Anwendung kommt, und wie Sie Ihre Bereitstellung auditieren können.
#Warum ein lokales LLM von Haus aus DSGVO-konform ist
Die DSGVO sagt nicht: „Sie dürfen keine KI nutzen.“ Sie verlangt, dass jede Verarbeitung personenbezogener Daten auf einer Rechtsgrundlage beruht, dokumentiert, minimiert und abgesichert wird und dass Übermittlungen außerhalb der EU rechtlich geregelt sind. Das Problem bei einem Cloud-LLM ist nicht die KI – es ist die Verarbeitung durch einen externen Auftragsverarbeiter, häufig aus den USA, mit einer komplexen Vertragskette und Übermittlungsrisiken im Sinne von Kapitel V der DSGVO.
Ein lokal ausgeführtes LLM kehrt die Ausgangslage um. Die Modellgewichte werden einmal von Hugging Face oder Ollama heruntergeladen, danach erfolgt die Inferenz zu 100 % auf Ihrer Hardware. Kein Prompt wird ins Internet gesendet. Keine Antwort wird bei einem Dritten protokolliert. Die „Verarbeitung“ bleibt intern und unter Ihrer tatsächlichen Kontrolle.
- Keine Übermittlung außerhalb der EU
- Artikel 44 und Kapitel V der DSGVO: Keine Daten verlassen Ihre Server, daher sind keine Standardvertragsklauseln und kein Transfer Impact Assessment erforderlich, und die Frage nach dem US-amerikanischen Cloud Act stellt sich nicht.
- Kein Auftragsverarbeiter im Sinne von Artikel 28
- Kein Vertrag zur Auftragsverarbeitung, der ausgehandelt werden muss, kein Anhang 7, der bei jeder Weiterentwicklung des Produkts des Anbieters aktualisiert werden muss, kein Anbieter, der seine Nutzungsbedingungen einseitig ändert.
- Integrierte Datenminimierung
- Artikel 5.1.c: Sie können nicht versehentlich zu viele Daten an einen Dritten senden, da es keinen Dritten gibt. Datenminimierung wird zu einer Eigenschaft der Architektur statt zu einer Richtlinie, deren Einhaltung durchgesetzt werden muss.
- Tatsächliche Löschung
- Artikel 17 (Recht auf Löschung): Einen Eintrag in Ihrer eigenen Datenbank zu löschen, ist einfach. OpenAI um die Löschung eines vor 6 Monaten übermittelten Prompts zu bitten, ist ein vertragliches Verfahren, keine technische Garantie.
#Der rechtliche Rahmen im Mai 2026: DSGVO + AI Act
Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
In Europa greifen inzwischen zwei Regelwerke ineinander, um den Einsatz von LLMs in Unternehmen zu regeln. Die DSGVO erfasst personenbezogene Daten, der AI Act erfasst KI-Systeme als solche — unabhängig davon, ob sie personenbezogene Daten verarbeiten oder nicht.
#DSGVO: Was für LLMs gilt
- Rechtsgrundlage (Art. 6)
- Berechtigtes Interesse, Erfüllung eines Vertrags, Einwilligung: Jede Verarbeitung durch ein LLM muss sich auf eine dieser Rechtsgrundlagen stützen. Ein lokales LLM hebt diese Pflicht nicht auf, vereinfacht aber die Dokumentation.
- Information der betroffenen Personen (Art. 13–14)
- Ihre Datenschutzrichtlinien müssen den Einsatz eines LLM erwähnen, auch wenn es lokal betrieben wird. Sie müssen das Modell nicht namentlich nennen, wohl aber den Verwendungszweck.
- DSFA (Art. 35)
- Eine Datenschutz-Folgenabschätzung ist für Verarbeitungen mit hohem Risiko erforderlich. Bei einem Cloud-LLM muss sie den Auftragsverarbeiter abdecken; beim lokalen Betrieb beschränkt sie sich auf Ihre eigene Infrastruktur.
- Sicherheit (Art. 32)
- Verschlüsselung der Festplatten, die Modelle und Protokolle enthalten, Zugriffskontrolle auf die Inferenzserver, Protokollierung. Standard für interne Infrastruktur.
#AI Act: die Frist im August 2026
Der AI Act (Verordnung (EU) 2024/1689) ist am 1. August 2024 in Kraft getreten. Seine Bestimmungen gelten schrittweise. Der wichtigste Schritt für allgemeine LLMs – die Verpflichtungen für allgemein verwendbare Modelle (GPAI) – gilt seit dem 2. August 2025. Die Verpflichtungen für hochrisikobehaftete KI-Systeme gelten ab dem 2. August 2026, also in etwa drei Monaten, wenn Sie diesen Leitfaden lesen.
- GPAI (Basismodelle)
- Die Verpflichtungen liegen bei den Anbietern (OpenAI, Anthropic, Mistral, Meta...). Wenn Sie Mistral, Qwen oder Granite lokal verwenden, ist der Modellanbieter bereits dafür verantwortlich, eine den Anforderungen entsprechende technische Dokumentation bereitzustellen.
- Hochrisikosysteme
- Anhang III: Personalwesen, Kreditbewertung, Bildung, grundlegende öffentliche Dienstleistungen, kritische Infrastrukturen. Wenn Ihr LLM in einen dieser Abläufe integriert ist, sind Sie „Betreiber“ im Sinne des AI Act und haben eigene Verpflichtungen.
- Transparenz
- Alle von KI erzeugten Inhalte müssen als solche erkennbar sein. Jedes System, das mit einer natürlichen Person interagiert, muss sie darauf hinweisen – auch ein interner Chatbot.
- Sanktionen
- Bis zu 35 Mio. € oder 7 % des weltweiten Umsatzes für die schwerwiegendsten Verstöße (verbotene Nutzung). Bei Verstößen gegen GPAI-Pflichten bis zu 15 Mio. € oder 3 % des Umsatzes.
#Konkrete Risiken mit ChatGPT, Claude oder Gemini
Diese Anbieter bieten inzwischen Unternehmensangebote (ChatGPT Enterprise, Claude for Work, Gemini for Workspace) an, die vertraglich zusichern, dass die Daten nicht für das Training verwendet werden, und teilweise Hosting in Europa vorsehen. Das ist besser als eine API für die breite Öffentlichkeit. Es löst aber nicht alles.
- Der US-amerikanische CLOUD Act
- Eine juristische Person nach US-amerikanischem Recht (OpenAI Inc., Anthropic PBC, Google LLC) bleibt rechtlich verpflichtet, mit den US-amerikanischen Behörden zusammenzuarbeiten, selbst wenn die Daten in der EU gespeichert sind. Der EuGH hat dies 2020 im Urteil Schrems II erneut in Erinnerung gerufen.
- Der DPF auf unsicherem Boden
- Das EU-US Data Privacy Framework (Juli 2023), das die Grundlage für die meisten Datenübermittlungen bildet, wird vor dem EuGH angefochten. Ein Schrems-III-Urteil würde Tausende von Datenschutz-Folgenabschätzungen über Nacht ungültig machen.
- Die Intransparenz des Modells
- Sie wissen weder genau, was das Modell beim Training gesehen hat, noch, wie die Moderationsfilter Ihre Prompts protokollieren. Bei ChatGPT werden „Abuse“-Protokolle mindestens 30 Tage lang gespeichert, selbst bei Enterprise.
- Shadow IT
- Das Risiko #1 in der Praxis ist nicht der Vertrag, sondern dass ein Mitarbeiter einen RH-Datei in die kostenlose Version von ChatGPT kopiert und einfügt. Keine schriftliche Regelung kann einem Browser-Tab widerstehen.
#Der empfohlene Stack für einen Datenschutzbeauftragten (DPO) im Jahr 2026
Es gibt nicht den einen Stack, sondern eine Reihe bewährter Kombinationen, die französische IT-Leiter und Datenschutzbeauftragte seit 18 Monaten einsetzen. Drei typische Profile decken 90 % des Bedarfs ab.
#Profil 1 — Kleines Team, einzelne Arbeitsplatzrechner
- Hardware
- Arbeitsplatzrechner mit einer RTX 4070 mit 12 GB, einer RTX 4080 mit 16 GB oder einem Mac M4 Pro mit 24–48 GB. Kein zentraler Server.
- Software
- Ollama (Daemon lokal auf jedem Rechner) + LM Studio oder Open WebUI als Schnittstelle. Keine Daten verlassen den Rechner.
- Empfohlenes Modell
- Mistral Small 24B Q4 (14 GB, mit nativer Französisch-Unterstützung, hervorragendes Allzweckmodell) oder Qwen 3.8 27B in voller Qualität bei VRAM ≥ 40 GB (262k Kontext, Bildverständnis, Apache 2.0).
- Ziel
- Anwaltskanzleien, Buchhaltungskanzleien, HR-Teams kleiner und mittlerer Unternehmen, Journalisten. Jede Organisation mit weniger als 30 Personen und individueller Nutzung.
#Profil 2 — interner Inferenzserver
- Hardware
- Dedizierter GPU-Server: RTX 4090 mit 24 GB, A6000 mit 48 GB oder 2× RTX 3090 mit je 24 GB. Gehostet in der eigenen IT-Infrastruktur oder bei einem souveränen Cloud-Anbieter (OVH, Scaleway, Outscale).
- Software
- vLLM oder Ollama bietet eine OpenAI-kompatible API im internen Netzwerk. Open WebUI oder LibreChat im Frontend hinter dem Unternehmens-IdP (Keycloak, Azure AD).
- Empfohlenes Modell
- Mistral Small 24B, Qwen 3.6 35B-A3B oder Granite 4.2 30B je nach VRAM (MoE-Modelle wie Qwen 3.6 35B-A3B nutzen nur 3 Milliarden aktive Parameter und sind daher selbst auf einer GPU mit 24 GB schnell). Embedding-Modell BGE-M3 oder Solon für dokumentenbasiertes RAG.
- Ziel
- Mittelgroße Unternehmen (ETI), interne Rechtsabteilungen, Datenteams mit 30–500 Personen. Ermöglicht die gemeinsame Nutzung und eine zentralisierte Zugriffskontrolle.
#Profil 3 — Air-gap für sensible Daten
- Hardware
- Server physisch vom öffentlichen Netzwerk isoliert. Mit LUKS verschlüsselte Laufwerke. Modelle werden über einen physischen Datenträger auf einen Übergangsrechner heruntergeladen.
- Software
- vLLM lokal kompiliert, llama.cpp aus dem Quellcode. Keine öffentlichen Container, keine zur Laufzeit heruntergeladenen Docker-Images.
- Empfohlenes Modell
- Validierte Modelle mit permissiver Lizenz (Mistral, Qwen, Granite oder Gemma 4 unter Apache 2.0, mit Prüfung der Modellgewichte). Idealerweise ein Modell, dessen Tarball Sie als lokale Kopie archiviert haben.
- Ziel
- Gesundheitswesen (DMP, medizinische Berichte), Verteidigung, besonders sensible Geschäftsgeheimnisse, OIV/OSE. Alles, was bei einer Nutzung in der Cloud unter eine Datenschutz-Folgenabschätzung mit hohem Restrisiko fallen würde.
#Umsetzung: die 5 grundlegenden Schritte
- 01Die Anwendungsfälle erfassenBevor Sie einen Modell auswählen, erstellen Sie eine Liste der tatsächlichen Anwendungsfälle: Schreiben, Übersetzen, Zusammenfassen von Verträgen, Loganalyse, N1-Unterstützung. Für jeden Fall notieren Sie die Sensitivität der verarbeiteten Daten (öffentlich, intern, geheim, Geschäftsgeheimnis). Diese Karte wird zur Anwendungsdokumentation Ihres AIPD.
- 02Profil und Modell auswählenWählen Sie anhand der Bestandsaufnahme und des Hardware-Inventars eines der drei oben genannten Profile aus. Beginnen Sie bei der Modellwahl mit Mistral Small 24B in Q4_K_M, wenn Sie 16–24 GB VRAM haben — das ist 2026 der ausgewogenste Kompromiss für die französische Sprache. Q4_K_M bleibt die standardmäßig empfohlene Quantisierung (Qualitätsverlust < 2 % gegenüber FP16).
- 03Den Inferenzserver installierenOllama lauscht standardmäßig auf http://localhost:11434. Um Ollama im internen Netzwerk zugänglich zu machen, setzen Sie OLLAMA_HOST=0.0.0.0:11434 und betreiben Sie die API hinter einem Reverse-Proxy (Caddy, Traefik), der die Authentifizierung übernimmt. Aktivieren Sie die Zugriffsprotokolle und bewahren Sie sie zur Nachvollziehbarkeit 6 Monate lang auf.
- 04Im Verzeichnis dokumentierenErstellen oder aktualisieren Sie den Eintrag „Unterstützung durch interne generative KI“ in Ihrem Verzeichnis der Verarbeitungstätigkeiten (Artikel 30 DSGVO). Zwecke, Datenkategorien, Aufbewahrungsfristen, technische Maßnahmen. Dass die Verarbeitung lokal erfolgt, muss dort ausdrücklich angegeben sein.
- 05Schulen und kommunizierenEine Richtlinie zur KI-Nutzung, die von jedem Mitarbeiter unterschrieben wird und folgende Punkte festhält: (1) ausschließliche Nutzung der internen Instanz, (2) Verbot nicht genehmigter Cloud-Tools, (3) zulässige Datentypen je nach Anwendungsfall. Fügen Sie sie nach Anhörung des CSE (französischer Sozial- und Wirtschaftsausschuss) der Betriebsordnung als Anlage bei.
#Checkliste für ein Compliance-Audit
Diese Checkliste deckt die Punkte ab, die ein Audit zur DSGVO und zum AI Act beim Einsatz eines lokalen LLM in einem Unternehmen prüfen würde. Drucken Sie sie aus, haken Sie die Punkte ab und archivieren Sie sie.
#Governance und Dokumentation
- Verzeichnis nach Art. 30
- Aktueller Verarbeitungseintrag „interne generative KI“ mit Zwecken, Daten, Aufbewahrungsfristen, Empfängern (ausschließlich intern) und technischen Maßnahmen.
- AIPD
- Wird durchgeführt, wenn die Verarbeitung mit einem hohen Risiko verbunden ist (Personalwesen, Gesundheit, Profiling). Wird bei jeder wesentlichen Änderung des Modells oder des Anwendungsfalls aktualisiert.
- Richtlinie zur KI-Nutzung
- Verteilt, unterzeichnet und nach Anhörung des CSE in die Betriebsordnung aufgenommen.
- Übersicht der Anwendungsfälle
- Aktuelle Liste der validierten Anwendungsfälle und der genehmigten Daten pro Fall.
- Benennung der KI-verantwortlichen Person
- Ein benannter Verantwortlicher (DPO, RSSI oder DSI, je nach Organisation) mit formalisiertem Mandat.
#Technische Sicherheit
- Verschlüsselung ruhender Daten
- Verschlüsselte Datenträger des Inferenzservers (LUKS, BitLocker, FileVault). Die Verschlüsselung umfasst auch heruntergeladene Modelle und eventuell vorhandene Prompt-Caches.
- Authentifizierung
- API-Zugriff über OIDC oder mTLS absichern. Keine Ollama-Instanz darf ohne Authentifizierung zugänglich sein, auch nicht intern.
- Protokollierung
- Zugriffsprotokolle (wer, wann, welches Modell abgefragt wurde) werden 6 bis 12 Monate lang aufbewahrt. Die Inhalte der Prompts werden nicht protokolliert, außer bei einem ausdrücklich festgelegten und dokumentierten Anwendungsfall.
- Netzwerkisolation
- Der Inferenzserver hat im Produktionsbetrieb keinen ausgehenden Internetzugang. Für sensible Bereitstellungen: vollständige Netzwerkisolation (Air-Gap).
- Sicherung und Wiederherstellung
- Dokumentierter Wiederanlaufplan: Die Modelle können aus einem internen Archiv neu installiert werden, ohne unmittelbar von Hugging Face abhängig zu sein.
#AI-Act-Konformität
- Systemklassifizierung
- Sie haben die Einstufung festgelegt: Nutzung mit begrenztem, hohem oder minimalem Risiko. Bei hohem Risiko (Anhang III) liegt eine gesonderte Konformitätsdokumentation vor.
- Information der Nutzer
- Jede Benutzeroberfläche zeigt „KI-generierter Inhalt“ oder einen gleichwertigen Hinweis an. Artikel 50 der KI-Verordnung, anwendbar ab August 2026.
- Nachverfolgbarkeit des Modells
- Die genaue Version des verwendeten Modells, die Quelle der Modellgewichte, das Downloaddatum und der SHA256-Hash werden archiviert. Damit lässt sich bei einem Audit die Frage beantworten: „Welches Modell hat welche Antwort an welchem Datum generiert?“
- Menschliche Überwachung
- Für Hochrisikoanwendungen: ein dokumentiertes Verfahren zur menschlichen Überprüfung vor jeder Entscheidung, die eine Person betrifft (Personalrekrutierung, Scoring, Sanktionen).
#Häufige Stolperfallen
- "Lokal", aber mit Telemetrie
- Einige Benutzeroberflächen (LM Studio in älteren Versionen, bestimmte VSCode-Plugins) senden Telemetriedaten. Prüfen Sie mit einem Sniffer (Wireshark, Little Snitch), dass keine Daten nach außen übertragen werden. Unser Leitfaden mit einer Datenschutz-Checkliste behandelt diesen Schritt.
- Modelle mit unklarer Lizenz
- Codestral 22B steht beispielsweise unter einer Non-Production-Lizenz: Sein Einsatz in Unternehmen ist verboten. Llama behält seinerseits eine Community-Lizenz bei, die die Nutzung durch sehr große Unternehmen (> 700 Mio. MAU) einschränkt. Prüfen Sie die Lizenz vor dem Einsatz in der Produktion – bevorzugen Sie Modelle unter Apache 2.0 (Mistral Small, Qwen 3.5/3.8, Granite 4.2, Gemma 4) –, insbesondere wenn Sie eine große Organisation oder ein Softwareanbieter sind.
- Verwechslung von Modell und Fine-Tuning
- Ein Fine-Tuning mit internen Personaldaten schafft eine neue Datenverarbeitung mit einer eigenen Datenschutz-Folgenabschätzung (DSFA). Das feinabgestimmte Modell kann Trainingsdaten preisgeben (Memorization). Bevorzugen Sie bei sensiblen Daten RAG gegenüber Fine-Tuning.
- Die Nachvollziehbarkeit unterschätzen
- Wenn nach 18 Monaten jemand Ihnen fragt: „Zeigen Sie mir, was die KI auf meinen Akten aus März geantwortet hat“, müssen Sie darauf antworten können. Denken Sie bereits am Tag 1 an Audit-Logs, nicht erst nach dem ersten Vorfall.
- Die Annahme, dass ein lokaler LLM alles regelt
- Ein lokales LLM löst das Problem der Datenübertragung, nicht das der Nutzung. Ein lokales Modell, das für automatisiertes Scoring im Personalwesen eingesetzt wird, bleibt ein Hochrisikosystem im Sinne des AI Act. Lokal ≠ ausgenommen.
#Weiterführende Informationen
Sobald die Compliance-Grundlagen stehen, bieten sich drei naheliegende Wege an, um die Bereitstellung weiter auszubauen:
- Vertraulichkeit technisch absichern
- Die Datenschutzcheckliste erläutert die Netzwerk- und Systemprüfungen, die den rechtlichen Rahmen aufseiten der Datenschutzbeauftragten (DPO) ergänzen. Unverzichtbar vor dem Produktiveinsatz.
- Ein RAG-System auf Basis Ihrer internen Dokumente aufbauen
- Mit RAG (Retrieval-Augmented Generation) lassen sich Verträge, Verfahrensanweisungen und interne Datenbanken ohne Fine-Tuning abfragen, um aus einem allgemeinen Assistenten ein Werkzeug für konkrete berufliche Aufgaben zu machen. Der Einführungsleitfaden zu lokalem RAG vermittelt die Grundlagen.
- Die Benutzeroberfläche wählen
- Open WebUI deckt 80 % der Anforderungen in Unternehmen ab: Mehrbenutzerbetrieb, OIDC, integriertes RAG, Logs. Der zugehörige Leitfaden beschreibt die Bereitstellung mit Docker hinter einem Reverse-Proxy.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.