Bestes On-Premise-LLM für Unternehmen im Hinblick auf die DSGVO 2026
Wählen Sie ein DSGVO-konformes On-Premises-LLM ist zu einem zentralen Thema für europäische IT-Leitungen geworden, die die Dokumentenverarbeitung industrialisieren möchten, ohne ihre Daten einem außereuropäischen SaaS-Anbieter offenzulegen. Ein korrekt bereitgestelltes DSGVO-konformes On-Premise-LLM gewährleistet, dass Prompts, Ausgaben und gegebenenfalls Protokolle niemals den vom Unternehmen kontrollierten Bereich verlassen. Das vereinfacht Datenschutz-Folgenabschätzungen (DSFA) und die Erfüllung der Pflichten aus Artikel 32 der Verordnung erheblich. Dieser Artikel gibt einen Überblick über die 2026 relevanten Open-Weights-Modelle, ihren Hardwarebedarf, ihre Lizenz, ihre Anwendungsfälle und die betrieblichen Aspekte, auf die vor einer Bereitstellung in Produktion zu achten ist.
Warum ein DSGVO-konformes LLM im eigenen Unternehmen statt einer verwalteten API
Die Verordnung (EU) 2016/679 (siehe konsolidierter Text auf EUR-Lex) verlangt eine strenge Regelung von Datenübermittlungen außerhalb der EU und einen klaren Nachweis der Rechtsgrundlagen der Verarbeitung. Eine bei einem Drittanbieter gehostete API bringt grundsätzlich einen zusätzlichen Auftragsverarbeiter, aktuell zu haltende Standardvertragsklauseln (SCC) und in bestimmten Fällen die Unterwerfung unter extraterritoriale Gesetze wie den CLOUD Act mit sich. Dagegen beseitigt eine On-Premise-Bereitstellung (oder eine Bereitstellung in einer privaten Cloud unter Kontrolle des Unternehmens) diese Abhängigkeitskette.
Drei weitere Beweggründe werden in Praxisberichten immer wieder genannt:
- Vertragsbasierte Souveränität : Keine Änderung der Nutzungsbedingungen auf Anbieterseite kann den Dienst unterbrechen.
- Kontrolle über das Fine-Tuning : die internen Fachkorpora bleiben im Informationssystem, wodurch das Risiko von Datenlecks durch Embeddings vermieden wird.
- Vorhersehbare Grenzkosten : Sobald sich die Hardware amortisiert hat, hängt die Inferenz nicht mehr vom Preis pro Million Tokens ab.
Das Open-Weights-Ökosystem, verzeichnet auf Hubs wie Hugging Face oder über die vLLM-Inferenzserver, ermöglicht es heute, nahezu alle geschäftlichen Anwendungsfälle ohne externe Abhängigkeiten abzudecken. Für einen breiteren Überblick über die Architekturen siehe auch unseren Leitfaden zu Open-Source-LLMs in Unternehmen.
Welche Open-Weights-Modelle 2026 auswählen
Die Wahl eines Souveränes LLM für Unternehmen hängt von einem Kompromiss zwischen reiner Qualität, Kontextgröße, Lizenz und VRAM-Bedarf ab. Hier ist eine repräsentative Auswahl aus unserem komplettes Katalog, sortiert nach Nutzungsszenario.
Profil „data center dense“ (>200 GB VRAM Q4)
- DeepSeek V4 Pro 1.6T : 1600 Milliarden Parameter, MIT-Lizenz, Kontext von 1.000.000 Tokens, geschätzter VRAM-Bedarf in Q4 von ~960 GB. Ziel: RAG für umfangreiche Dokumentensammlungen in juristischen oder regulatorischen Archiven.
- MiMo V2.5 Pro : 1020B, MIT, Kontext 1M, VRAM Q4 ~595 GB. Gute Vielseitigkeit in mehreren Sprachen.
- Mistral Large 3 675B : 675B, Apache 2.0, Kontext 256.000, VRAM Q4 ~405 GB. Französischer Vorteil: Anbieter mit Sitz in Paris, Hosting vollständig innerhalb der EU kontrollierbar.
- GLM-5.1 : 744B, MIT, Kontextgröße 200.000, VRAM Q4 ~445 GB.
- Llama 4 Maverick 400B : 400B, Lizenz Llama 4 Community (Achtung bei den Nutzungsbedingungen für kommerzielle Zwecke über 700M MAU), Kontext 1M.
Profil „mittlerer Cluster“ (60–200 GB VRAM Q4)
- Qwen 3 235B-A22B : 235B als Mixture-of-Experts-Modell (22B aktiv), Apache 2.0, Kontext 131.072. Hervorragendes Verhältnis von Qualität zu Inferenzkosten dank MoE.
- MiniMax-M2.7 : 229B, Apache 2.0, Kontext 205.000.
- Mixtral 8x22B Instruct : 141B (39B aktiviert), Apache 2.0, Kontext 64.000. Solide europäische Referenz für RAG-Workloads.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, Kontext 262.000.
- gpt-oss 120B : 117B, Apache 2.0, Kontext 128.000.
- Llama 4 Scout 109B : 109B, Lizenz Llama 4 Community, Kontext von 10M Tokens (in der Praxis mit sehr langen Prompts noch zu bestätigen).
Profil „Single-GPU-Server“ (20–60 GB VRAM Q4)
- Llama 3.3 70B Instruct : 70B, Lizenz Llama 3.3 Community, Kontext 128.000. Passt auf zwei RTX 6000 Ada oder einen H100 80 GB in Q4.
- Apertus 70B : 70B, Apache 2.0, Kontext 65 536. Ein Modell schweizerischen Ursprungs, interessant für Organisationen, die einen europäischen Anbieter im weiteren Sinne suchen.
- Mixtral 8x7B : 47B, Apache 2.0, Kontext 32.768. Weiterhin relevant für Batch-Workloads, die wenig auf den allerneuesten Stand der Technik angewiesen sind.
- Salamandra 40B Instruct : 40B, Apache 2.0, Kontext 8192. Stammt vom Barcelona Supercomputing Center und wurde auf einem mehrsprachigen europäischen Korpus trainiert.
- Qwen 3 32B et Qwen 2.5 Coder 32B : 32B, Apache 2.0. Einsatzbereiche: allgemeine RAG-Anwendungen und interne Code-Assistenten.
Für einen detaillierteren Vergleich im 70B-Segment siehe Llama 3.3 70B vs Mixtral 8x22B.
VRAM-Bedarf, Quantisierung und Durchsatz
Der geschätzte VRAM-Bedarf hängt von der gewählten Quantisierung ab. In erster Näherung gilt für ein dichtes Modell:
- FP16 : etwa 2 Bytes pro Parameter
- Q8 : ~1 Byte pro Parameter
- Q5_K_M : ~0,7 Byte pro Parameter (geschätzt)
- Q4_K_M : ~0,55 bis 0,60 Byte pro Parameter
Für MoE-Architekturen wie Mixtral 8x22B Instruct oder Qwen 3 235B-A22B, die benötigte VRAM entspricht dem Speicher für alle Experten, selbst wenn nur einige pro Token aktiviert sind. Es ist der Speicher, der begrenzt, nicht der Rechenaufwand. Der auf Papier Mixtral 8x7B auf arXiv erläutert diesen Mechanismus.
Im Bereich der Durchsatzleistung variieren die Werte in Tok/s stark je nach Inferenz-Engine (vLLM, TensorRT-LLM, llama.cpp, SGLang), die effektive Kontextlänge und das Batching. Einige beobachtete Größenordnungen (unter Ihrer eigenen Arbeitslast zu bestätigen):
- Llama 3.3 70B Q4 auf einem H100 80 GB mit vLLM: ~35–50 Tokens/Sekunde im Single-Stream, mehrere Hunderte im Batch.
- Mixtral 8x7B Q4 auf RTX 4090 mit 24 GB bei teilweisem Offloading: ~20–30 Tokens pro Sekunde (geschätzt).
- Qwen 3 30B-A3B Q4 auf RTX 6000 Ada 48 GB: ~60-80 Tokens/Sekunde im Single-Stream (geschätzt), durch die MoE-Architektur begünstigt.
- DeepSeek R1 671B Q4 auf einem Knoten mit 8×H200: ~15–25 Tokens pro Sekunde im Single-Stream-Betrieb (je nach Inferenzversion noch zu bestätigen).
Um einen Server präzise zu dimensionieren, benötigt man den Konfigurator quelllm.fr gleicht GPU, RAM und kompatible Modelle miteinander ab.
Lizenzen: Was sich im produktiven Einsatz wirklich ändert
Une DSGVO-konforme KI reicht nicht aus: Sie benötigen auch eine Lizenz, die mit Ihrem Geschäftsmodell vereinbar ist. Drei Lizenzfamilien dominieren:
- Apache 2.0 (Mistral, Qwen, gpt-oss, Mixtral, Snowflake, MiniMax, IBM Granite, BSC Salamandra…): freie kommerzielle Nutzung, Weiterverteilung erlaubt, Klausel zum Patentschutz. Dies ist die einfachste Lizenz für einen Einsatz im Unternehmen.
- MIT (DeepSeek V3.2, R1, V4 Pro, GLM-5.1, Ling 2.6, MiMo, Ring-1T, dots.llm1, Seed-OSS): noch freizügiger, aber ohne ausdrückliche Patentklausel.
- Llama Community (Meta): kommerzielle Nutzung erlaubt, außer bei mehr als 700 Millionen monatlich aktiven Nutzern, mit Bestimmungen zur zulässigen Nutzung. Nachzulesen auf der Llama-Website.
- Gemma (Google): kommerziell, aber mit einer Richtlinie zu verbotenen Nutzungen, die eingehalten werden muss.
Für Organisationen, die eine maximale Nachverfolgbarkeit wünschen, OLMo 3 32B von Allen AI veröffentlicht auch seine Trainingsdatensätze, was bestimmte Audits erleichtert (siehe den Blog von Allen AI). Auf europäischer Seite Mistral Large 3 675B et Apertus 70B sind die maßgeblichen Optionen. Weitere Details auf unserer Seite bestes französisches LLM.
Benchmarks und Anwendungsfälle für ein selbst gehostetes Unternehmens-LLM
Öffentliche Benchmark-Ergebnisse sind mit Vorsicht zu interpretieren: Die Methoden unterscheiden sich, und die Kontamination von Testdatensätzen ist inzwischen dokumentiert. Einige Anhaltspunkte aus den Hugging-Face-Modellkarten:
- MMLU (allgemeine Kenntnisse 5-Shot): Modelle >200B erreichen typischerweise 85–89 %. DeepSeek R1 671B, Qwen 3 235B-A22B et Mistral Large 3 675B befinden sich in diesem Bereich (je nach Evaluationspipeline zu bestätigen).
- HumanEval / MBPP (Python-Code): Qwen 2.5 Coder 32B et Qwen3-Coder-Next 80B-A3B sind ernstzunehmende Kandidaten für einen internen Codeassistenten.
- AIME 2024/2025 (mathematisches Schlussfolgern): DeepSeek R1 671B, QwQ 32B et Ring-1T sind in diesem „Reasoning“-Segment positioniert.
- Long-context (RULER, LongBench) : Llama 4 Scout 109B, Seed-OSS 36B Instruct (524.288 Tokens) und MiMo V2.5 Pro zeichnen sich bei langen Kontexten aus.
Typische Anwendungsfälle aus Sicht der IT-Leitung:
- RAG für interne Dokumente : 32–70B reichen vollkommen aus. Siehe bestes LLM für RAG und unser Leitfaden für On-Premises-RAG.
- Assistent für Recht / Compliance : ein Kontextfenster mit ≥ 128.000 Tokens und ein leistungsfähiges mehrsprachiges Modell bevorzugen (Mistral Large 3, Qwen 3 235B).
- Codegenerierung : Qwen 2.5/3 Coder, Laguna XS.2, DeepSeek R2 32B.
- Multimodal : Qwen 3 VL 235B-A22B, Molmo 72B, LLaVA-OneVision 72B für die Analyse von gescannten Dokumenten.
- Leichte Workloads und Edge-Anwendungen : Granite 4.0 H-Small 32B-A9B, Gemma 4 31B, Qwen 3 30B-A3B.
Siehe auch unseren Vergleich DeepSeek R1 vs Llama 3.3 70B um zwischen Schlussfolgerungsfähigkeit und Hardwarekosten abzuwägen.
Zielarchitektur: vom Proof of Concept zur Produktion
Eine robuste On-Premise-Bereitstellung besteht aus vier Schichten:
- Hardware-Ebene : NVIDIA-GPUs (H100/H200/B200, RTX 6000 Ada, L40S) oder AMD MI300X als Alternative. Für Workloads >400B ist ein Knoten mit 8×H100 80 GB oder 8×H200 141 GB das realistische Minimum.
- Inferenzschicht : vLLM oder SGLang für die Durchsatzleistung, TensorRT-LLM für die Latenz, llama.cpp für Server ohne dedizierte GPU. Die vLLM-Dokumentation deckt die meisten hier genannten Modelle ab.
- Orchestrierungsschicht : Kubernetes mit dem NVIDIA GPU Operator, KEDA für die Skalierung und ein Gateway vom Typ LiteLLM oder Envoy zur Vereinheitlichung von OpenAI-kompatiblen APIs.
- Compliance-Schicht : verschlüsselte Protokollierung von Prompts mit kurzer Aufbewahrungsdauer, Maskierung personenbezogener Daten (PII) bei der Eingabe (Presidio, Empfehlungen der CNIL zu KI), aktuelles Verzeichnis der Verarbeitungstätigkeiten, dokumentierte Datenschutz-Folgenabschätzung.
Im Bereich der Beobachtbarkeit können Tools wie Langfuse oder OpenTelemetry ermöglichen es, RAG-Ketten nachzuverfolgen, ohne die Logs an einen SaaS-Dienst zu senden. Für ein strukturiertes Vorgehen lesen Sie unseren Leitfaden zur Bereitstellung von LLMs im Produktionsbetrieb und die LLM-Sicherheitscheckliste.
FAQ
Frage: Ist ein von Hugging Face heruntergeladenes LLM mit offenen Gewichten automatisch DSGVO-konform?
Nein. Die Lizenz des Modells und sein Ausführungsort sind zwei getrennte Fragen. Wenn Sie die Gewichte von Mistral Large 3 oder DeepSeek R1 herunterladen und in einem europäischen Rechenzentrum unter Ihrer Kontrolle ausführen, entfällt die Übermittlung von Nutzerdaten außerhalb der EU. Sie bleiben jedoch für die Verarbeitung verantwortlich (Artikel 24 DSGVO): Datenschutz-Folgenabschätzung, Aufbewahrungsfristen, Rechte der betroffenen Personen und Zugriffssicherheit.
F: Welche Quantisierung sollte man für ein DSGVO-konformes On-Premise-LLM wählen, ohne die Qualität zu beeinträchtigen?
Für die Produktion, Q5_K_M oder Q4_K_M bieten bei Modellen >30B den besten Kompromiss zwischen Qualität und VRAM-Bedarf, laut den auf Hugging Face veröffentlichten Community-Bewertungen. Bei niedrigeren Quantisierungsstufen (Q3, Q2) wird der Leistungsverlust bei Denkaufgaben messbar. Für regulatorisch sensible Anwendungen, Q8 oder FP16 sind weiterhin empfohlen, sofern die VRAM es erlaubt, insbesondere bei Modellen unter 70B.
F: Kann man Fine-Tuning mit personenbezogenen Daten durchführen und dabei regelkonform bleiben?
Ja, sofern Sie die Rechtsgrundlage, die Datenschutz-Folgenabschätzung und die Aufbewahrung dokumentieren. Modelle unter der Apache-2.0-Lizenz (Mistral, Qwen, gpt-oss, IBM Granite) oder der MIT-Lizenz (DeepSeek, GLM) erlauben ausdrücklich kommerzielles Fine-Tuning. Mit LoRA und QLoRA lassen sich die Adapter von den Basisgewichten getrennt halten, was die Löschung auf Antrag einer betroffenen Person erleichtert, sofern das Korpus dies rechtfertigt.
F: Mixtral 8x22B oder Llama 3.3 70B zum Start?
Mixtral 8x22B Instruct benötigt mehr VRAM (82 GB in Q4 gegenüber 40 GB), profitiert aber von einer Apache-2.0-Lizenz, die sich rechtlich einfacher integrieren lässt als die Llama Community License. Llama 3.3 70B Instruct bleibt bei Französisch und allgemeinen Aufgaben sehr leistungsfähig. Für ein erstes internes Projekt ist Llama 3.3 70B hinsichtlich der Hardwareanforderungen oft leichter zugänglich; für ein Produkt zur Weiterverbreitung ist Mixtral lizenzrechtlich einfacher.
F: Ist ein H100-Cluster für ein selbst gehostetes LLM in Unternehmen erforderlich?
Nicht immer. Ein Server mit 2×RTX 6000 Ada 48 GB oder einer H100 80 GB reicht für den Betrieb von Llama 3.3 70B oder Qwen 3 32B in Q4 für RAG-Workloads eines Teams. Ein Multi-GPU-Cluster wird bei Modellen mit >100B in voller Präzision oder >400B in quantisierter Form notwendig. Der Konfigurator quelllm.fr berechnet das minimal erforderliche Hardware-Setup.
F: Stellen Modelle chinesischen Ursprungs (DeepSeek, Qwen, GLM, MiMo) ein Problem im Hinblick auf die DSGVO dar?
Die DSGVO betrifft die Verarbeitung von Daten, nicht die Herkunft der Modellgewichte. Ein lokal ausgeführtes DeepSeek-Modell kommuniziert nicht mit einem Server eines Drittanbieters – es handelt sich um eine Datei mit Modellparametern. Zu prüfen sind die Lizenzbedingungen (MIT für DeepSeek, Apache 2.0 für Qwen) und mögliche interne branchenspezifische Einschränkungen. Eine Sicherheitsprüfung (statische Analyse der Modellgewichte, Sandboxing) bleibt wie bei jedem externen Artefakt empfehlenswert.
Fazit
Die Einführung eines DSGVO-konformes On-Premises-LLM ist 2026 kein exploratives Vorhaben mehr: Das Open-Weights-Ökosystem deckt alle Lastprofile ab, von Qwen 3 30B-A3B auf einer einzelnen GPU bis zu DeepSeek V4 Pro 1.6T auf einem dichten Cluster, mit Apache-2.0- oder MIT-Lizenzen, die den Produktiveinsatz erlauben. Die eigentliche Herausforderung verlagert sich auf die Dimensionierung der Hardware und die Überführung in den produktiven Betrieb. Um das passende Modell für Ihre Hardware und Ihre Anforderungen zu finden, starten Sie den Konfigurator oder durchsuchen Sie den komplettes Katalog der 249 indexierten Modelle.