Bestes On-Premise-LLM für Unternehmen im Hinblick auf die DSGVO 2026

Wählen Sie ein DSGVO-konformes On-Premises-LLM ist zu einem zentralen Thema für europäische IT-Leitungen geworden, die die Dokumentenverarbeitung industrialisieren möchten, ohne ihre Daten einem außereuropäischen SaaS-Anbieter offenzulegen. Ein korrekt bereitgestelltes DSGVO-konformes On-Premise-LLM gewährleistet, dass Prompts, Ausgaben und gegebenenfalls Protokolle niemals den vom Unternehmen kontrollierten Bereich verlassen. Das vereinfacht Datenschutz-Folgenabschätzungen (DSFA) und die Erfüllung der Pflichten aus Artikel 32 der Verordnung erheblich. Dieser Artikel gibt einen Überblick über die 2026 relevanten Open-Weights-Modelle, ihren Hardwarebedarf, ihre Lizenz, ihre Anwendungsfälle und die betrieblichen Aspekte, auf die vor einer Bereitstellung in Produktion zu achten ist.

Warum ein DSGVO-konformes LLM im eigenen Unternehmen statt einer verwalteten API

Die Verordnung (EU) 2016/679 (siehe konsolidierter Text auf EUR-Lex) verlangt eine strenge Regelung von Datenübermittlungen außerhalb der EU und einen klaren Nachweis der Rechtsgrundlagen der Verarbeitung. Eine bei einem Drittanbieter gehostete API bringt grundsätzlich einen zusätzlichen Auftragsverarbeiter, aktuell zu haltende Standardvertragsklauseln (SCC) und in bestimmten Fällen die Unterwerfung unter extraterritoriale Gesetze wie den CLOUD Act mit sich. Dagegen beseitigt eine On-Premise-Bereitstellung (oder eine Bereitstellung in einer privaten Cloud unter Kontrolle des Unternehmens) diese Abhängigkeitskette.

Drei weitere Beweggründe werden in Praxisberichten immer wieder genannt:

Das Open-Weights-Ökosystem, verzeichnet auf Hubs wie Hugging Face oder über die vLLM-Inferenzserver, ermöglicht es heute, nahezu alle geschäftlichen Anwendungsfälle ohne externe Abhängigkeiten abzudecken. Für einen breiteren Überblick über die Architekturen siehe auch unseren Leitfaden zu Open-Source-LLMs in Unternehmen.

Welche Open-Weights-Modelle 2026 auswählen

Die Wahl eines Souveränes LLM für Unternehmen hängt von einem Kompromiss zwischen reiner Qualität, Kontextgröße, Lizenz und VRAM-Bedarf ab. Hier ist eine repräsentative Auswahl aus unserem komplettes Katalog, sortiert nach Nutzungsszenario.

Profil „data center dense“ (>200 GB VRAM Q4)

Profil „mittlerer Cluster“ (60–200 GB VRAM Q4)

Profil „Single-GPU-Server“ (20–60 GB VRAM Q4)

Für einen detaillierteren Vergleich im 70B-Segment siehe Llama 3.3 70B vs Mixtral 8x22B.

VRAM-Bedarf, Quantisierung und Durchsatz

Der geschätzte VRAM-Bedarf hängt von der gewählten Quantisierung ab. In erster Näherung gilt für ein dichtes Modell:

Für MoE-Architekturen wie Mixtral 8x22B Instruct oder Qwen 3 235B-A22B, die benötigte VRAM entspricht dem Speicher für alle Experten, selbst wenn nur einige pro Token aktiviert sind. Es ist der Speicher, der begrenzt, nicht der Rechenaufwand. Der auf Papier Mixtral 8x7B auf arXiv erläutert diesen Mechanismus.

Im Bereich der Durchsatzleistung variieren die Werte in Tok/s stark je nach Inferenz-Engine (vLLM, TensorRT-LLM, llama.cpp, SGLang), die effektive Kontextlänge und das Batching. Einige beobachtete Größenordnungen (unter Ihrer eigenen Arbeitslast zu bestätigen):

Um einen Server präzise zu dimensionieren, benötigt man den Konfigurator quelllm.fr gleicht GPU, RAM und kompatible Modelle miteinander ab.

Lizenzen: Was sich im produktiven Einsatz wirklich ändert

Une DSGVO-konforme KI reicht nicht aus: Sie benötigen auch eine Lizenz, die mit Ihrem Geschäftsmodell vereinbar ist. Drei Lizenzfamilien dominieren:

Für Organisationen, die eine maximale Nachverfolgbarkeit wünschen, OLMo 3 32B von Allen AI veröffentlicht auch seine Trainingsdatensätze, was bestimmte Audits erleichtert (siehe den Blog von Allen AI). Auf europäischer Seite Mistral Large 3 675B et Apertus 70B sind die maßgeblichen Optionen. Weitere Details auf unserer Seite bestes französisches LLM.

Benchmarks und Anwendungsfälle für ein selbst gehostetes Unternehmens-LLM

Öffentliche Benchmark-Ergebnisse sind mit Vorsicht zu interpretieren: Die Methoden unterscheiden sich, und die Kontamination von Testdatensätzen ist inzwischen dokumentiert. Einige Anhaltspunkte aus den Hugging-Face-Modellkarten:

Typische Anwendungsfälle aus Sicht der IT-Leitung:

Siehe auch unseren Vergleich DeepSeek R1 vs Llama 3.3 70B um zwischen Schlussfolgerungsfähigkeit und Hardwarekosten abzuwägen.

Zielarchitektur: vom Proof of Concept zur Produktion

Eine robuste On-Premise-Bereitstellung besteht aus vier Schichten:

  1. Hardware-Ebene : NVIDIA-GPUs (H100/H200/B200, RTX 6000 Ada, L40S) oder AMD MI300X als Alternative. Für Workloads >400B ist ein Knoten mit 8×H100 80 GB oder 8×H200 141 GB das realistische Minimum.
  2. Inferenzschicht : vLLM oder SGLang für die Durchsatzleistung, TensorRT-LLM für die Latenz, llama.cpp für Server ohne dedizierte GPU. Die vLLM-Dokumentation deckt die meisten hier genannten Modelle ab.
  3. Orchestrierungsschicht : Kubernetes mit dem NVIDIA GPU Operator, KEDA für die Skalierung und ein Gateway vom Typ LiteLLM oder Envoy zur Vereinheitlichung von OpenAI-kompatiblen APIs.
  4. Compliance-Schicht : verschlüsselte Protokollierung von Prompts mit kurzer Aufbewahrungsdauer, Maskierung personenbezogener Daten (PII) bei der Eingabe (Presidio, Empfehlungen der CNIL zu KI), aktuelles Verzeichnis der Verarbeitungstätigkeiten, dokumentierte Datenschutz-Folgenabschätzung.

Im Bereich der Beobachtbarkeit können Tools wie Langfuse oder OpenTelemetry ermöglichen es, RAG-Ketten nachzuverfolgen, ohne die Logs an einen SaaS-Dienst zu senden. Für ein strukturiertes Vorgehen lesen Sie unseren Leitfaden zur Bereitstellung von LLMs im Produktionsbetrieb und die LLM-Sicherheitscheckliste.

FAQ

Frage: Ist ein von Hugging Face heruntergeladenes LLM mit offenen Gewichten automatisch DSGVO-konform?

Nein. Die Lizenz des Modells und sein Ausführungsort sind zwei getrennte Fragen. Wenn Sie die Gewichte von Mistral Large 3 oder DeepSeek R1 herunterladen und in einem europäischen Rechenzentrum unter Ihrer Kontrolle ausführen, entfällt die Übermittlung von Nutzerdaten außerhalb der EU. Sie bleiben jedoch für die Verarbeitung verantwortlich (Artikel 24 DSGVO): Datenschutz-Folgenabschätzung, Aufbewahrungsfristen, Rechte der betroffenen Personen und Zugriffssicherheit.

F: Welche Quantisierung sollte man für ein DSGVO-konformes On-Premise-LLM wählen, ohne die Qualität zu beeinträchtigen?

Für die Produktion, Q5_K_M oder Q4_K_M bieten bei Modellen >30B den besten Kompromiss zwischen Qualität und VRAM-Bedarf, laut den auf Hugging Face veröffentlichten Community-Bewertungen. Bei niedrigeren Quantisierungsstufen (Q3, Q2) wird der Leistungsverlust bei Denkaufgaben messbar. Für regulatorisch sensible Anwendungen, Q8 oder FP16 sind weiterhin empfohlen, sofern die VRAM es erlaubt, insbesondere bei Modellen unter 70B.

F: Kann man Fine-Tuning mit personenbezogenen Daten durchführen und dabei regelkonform bleiben?

Ja, sofern Sie die Rechtsgrundlage, die Datenschutz-Folgenabschätzung und die Aufbewahrung dokumentieren. Modelle unter der Apache-2.0-Lizenz (Mistral, Qwen, gpt-oss, IBM Granite) oder der MIT-Lizenz (DeepSeek, GLM) erlauben ausdrücklich kommerzielles Fine-Tuning. Mit LoRA und QLoRA lassen sich die Adapter von den Basisgewichten getrennt halten, was die Löschung auf Antrag einer betroffenen Person erleichtert, sofern das Korpus dies rechtfertigt.

F: Mixtral 8x22B oder Llama 3.3 70B zum Start?

Mixtral 8x22B Instruct benötigt mehr VRAM (82 GB in Q4 gegenüber 40 GB), profitiert aber von einer Apache-2.0-Lizenz, die sich rechtlich einfacher integrieren lässt als die Llama Community License. Llama 3.3 70B Instruct bleibt bei Französisch und allgemeinen Aufgaben sehr leistungsfähig. Für ein erstes internes Projekt ist Llama 3.3 70B hinsichtlich der Hardwareanforderungen oft leichter zugänglich; für ein Produkt zur Weiterverbreitung ist Mixtral lizenzrechtlich einfacher.

F: Ist ein H100-Cluster für ein selbst gehostetes LLM in Unternehmen erforderlich?

Nicht immer. Ein Server mit 2×RTX 6000 Ada 48 GB oder einer H100 80 GB reicht für den Betrieb von Llama 3.3 70B oder Qwen 3 32B in Q4 für RAG-Workloads eines Teams. Ein Multi-GPU-Cluster wird bei Modellen mit >100B in voller Präzision oder >400B in quantisierter Form notwendig. Der Konfigurator quelllm.fr berechnet das minimal erforderliche Hardware-Setup.

F: Stellen Modelle chinesischen Ursprungs (DeepSeek, Qwen, GLM, MiMo) ein Problem im Hinblick auf die DSGVO dar?

Die DSGVO betrifft die Verarbeitung von Daten, nicht die Herkunft der Modellgewichte. Ein lokal ausgeführtes DeepSeek-Modell kommuniziert nicht mit einem Server eines Drittanbieters – es handelt sich um eine Datei mit Modellparametern. Zu prüfen sind die Lizenzbedingungen (MIT für DeepSeek, Apache 2.0 für Qwen) und mögliche interne branchenspezifische Einschränkungen. Eine Sicherheitsprüfung (statische Analyse der Modellgewichte, Sandboxing) bleibt wie bei jedem externen Artefakt empfehlenswert.

Fazit

Die Einführung eines DSGVO-konformes On-Premises-LLM ist 2026 kein exploratives Vorhaben mehr: Das Open-Weights-Ökosystem deckt alle Lastprofile ab, von Qwen 3 30B-A3B auf einer einzelnen GPU bis zu DeepSeek V4 Pro 1.6T auf einem dichten Cluster, mit Apache-2.0- oder MIT-Lizenzen, die den Produktiveinsatz erlauben. Die eigentliche Herausforderung verlagert sich auf die Dimensionierung der Hardware und die Überführung in den produktiven Betrieb. Um das passende Modell für Ihre Hardware und Ihre Anforderungen zu finden, starten Sie den Konfigurator oder durchsuchen Sie den komplettes Katalog der 249 indexierten Modelle.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.