Mittelstufe 20 Min.Anwendungsfall

Einen internen KI-Chatbot für kleine und mittlere Unternehmen bereitstellen (von 0 bis 50 collaborateurs)

Sie führen ein mittelständisches Unternehmen mit weniger als 50 Mitarbeitern und möchten Ihrem Team ein KI-Assistenten anbieten, ohne deren Daten an OpenAI zu senden. Dieser Leitfaden bietet eine vollständige, numerisch aufgebaute Lösung für die internen Einrichtung eines KI-Chatbots in mittelständischen Unternehmen: konkreter Hardware, open source Software, Microsoft SSO, 4-wöchiger Plan, Veränderungsmanagement und ROI-Berechnung. Keine Versprechungen, kein Pitch – nur Einkaufsliste und Kalender.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein interner Chatbot anstatt ChatGPT Business

ChatGPT Team kostet 25 € pro Nutzer und Monat. Bei 30 Mitarbeitenden sind das 9.000 € pro Jahr, auf unbestimmte Zeit. Für dasselbe Budget kaufen Sie eine Workstation, die 4 bis 5 Jahre läuft, und Ihre Gespräche verlassen niemals das Büro. Das ist die zentrale Abwägung.

Doch die eigentliche Frage ist nicht der Preis, sondern was Ihre Teams sich trauen, in das Chatfenster einzufügen. Wenn ein Vertriebsmitarbeiter ein externes LLM bittet, ein Angebot umzuformulieren, enthält dieses einen Kundennamen, einen Betrag und manchmal eine Marge. Eine Personalmitarbeiterin, die ein Vorstellungsgespräch zusammenfasst, legt einen beruflichen Werdegang offen. Multiplizieren Sie das mit 30 Personen über 12 Monate – ein Datenleck ist garantiert, selbst mit einer Richtlinie zur sachgerechten Nutzung.

Datenschutz
Die Gespräche bleiben auf Ihrem LAN. Kein Cloud-Transit, keine Exposition gegenüber einem US-Unternehmen, keine politischen Einstellungen, die alle drei Monate überprüft werden müssen.
Fixkosten
Die Hardware zählt zu den Investitionsausgaben (CAPEX) und wird über 4–5 Jahre abgeschrieben. Das SaaS-Abonnement zählt zu den Betriebsausgaben (OPEX), die mit der Mitarbeiterzahl steigen.
Kontrolle
Sie wählen das Modell, passen den System-Prompt an und binden Ihre internen Dokumente über RAG ein. Niemand ändert Ihr Tool hinter Ihrem Rücken.
Konformität
Die Einhaltung des AI Act und der DSGVO lässt sich mit einem On-Premise-System leichter nachweisen als bei einer Abhängigkeit von einem Anbieter außerhalb der EU.
i
An wen sich dieser Leitfaden richtet
Kleine und mittlere Unternehmen mit 5 bis 50 Mitarbeitenden, mit oder ohne interne IT-Abteilung. Wenn Ihr Unternehmen 200 oder mehr Personen beschäftigt, ändern sich einige Abwägungen (Wechsel zu vLLM, Hochverfügbarkeit, strukturiertes Ticketing) – dieser Leitfaden bleibt als Grundlage gültig.

#1. Hardware-Budget: die Workstation zwischen 5.000 und 10.000 €

Das Kit für lokale KI in Unternehmen

Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Um 30 bis 50 Benutzer gleichzeitig auf einem 20B bis 35B-Modell mit Qualitätsstufe Q4_K_M zu bedienen, benötigen Sie keinen DGX-Server. Eine gut ausgewählte Workstation reicht aus. Hier sind drei Konfigurationen je nach Profil.

#Profil A — 10 bis 20 Benutzer (5.000 €)

GPU
1× RTX 4080 mit 16 GB gebraucht (Preis variabel) oder RTX 5070 Ti mit 16 GB neu (≈ 1.400 € Ende September 2026). Damit lässt sich ein 20–24B-Modell in Q4_K_M mit einem Kontext von 16k Tokens betreiben.
CPU
AMD Ryzen 9 7900X oder Intel Core i7-14700K. Die CPU ist weniger entscheidend, aber 12 oder mehr Kerne helfen bei der Vorbereitung der Embeddings.
System-RAM
64 GB DDR5. Ausreichend für das System, Qdrant und den KV-Cache, der nicht mehr in den GPU-Speicher passt und in den Arbeitsspeicher ausgelagert wird.
Speicher
2 TB NVMe Gen4. Modelle + Vektordatenbank + lokale Sicherungen.
Bereitgestelltes Modell
Mistral Small 24B (Allroundmodell, gut auf Französisch) oder gpt-oss 20B in Q4_K_M (~14 GB VRAM). Latenz ~30 Tok/s.

#Profil B – 20 bis 35 Benutzer (7.500 €)

GPU
1× RTX 4090 24 GB — nicht mehr neu erhältlich, gebraucht suchen (Preis variiert). Der ideale Kompromiss, um ein 27–30B-Modell in Q4_K_M bereitzustellen.
CPU
Ryzen 9 7950X oder Threadripper 7960X. Die Kerne sind nützlich, um mehrere Gespräche gleichzeitig zu verarbeiten.
System-RAM
128 GB DDR5 ECC, wenn möglich. Der RAG-Index wächst schnell.
Speicher
2 TB NVMe Gen4 + 4 TB SATA für Archivierung
Bereitgestelltes Modell
Qwen 3.8 27B (2026 „nahe an Copilot“, 262k Kontext) oder Granite 4.2 30B in Q4_K_M (~18 GB VRAM). Latenz ~20–25 Tokens/s.

#Profil C – 35 bis 50 Benutzer (10.000 €)

NVIDIA-Option
2× RTX 4090 mit jeweils 24 GB im Tensorparallelbetrieb. Damit lässt sich ein Modell mit 27–35B Parametern in Q8 bei voller Qualität bereitstellen (~30–40 GB VRAM, auf beide Karten verteilt), oder es lassen sich zwei Modelle parallel mit akzeptabler Latenz betreiben.
Apple-Option
Mac Studio M4 Max oder Ultra mit 64 bis 128 GB vereinheitlichtem Speicher. Hervorragendes Verhältnis zwischen leisem Betrieb und Leistung, ideal für Großraumbüros.
CPU
Threadripper 7970X / 7980X bei NVIDIA-Konfigurationen. Entscheidend für die Verwaltung von 50 gleichzeitigen WebSocket-Verbindungen.
System-RAM
128 bis 256 GB. Reserve für den Betriebssystem-Cache, Qdrant im RAM und gegebenenfalls ein zusätzliches Embedding-Modell.
Bereitgestelltes Modell
Qwen 3.8 27B in Q8 oder Qwen 3.6 35B-A3B (schnelles MoE) in Q5_K_M. Latenz ~15–20 Tok/s.
→
Übergeben Sie den Tag 1 nicht zu detailliert
Starten Sie mit Profil A, auch wenn Sie 40 sind. Die Mehrheit der Nutzer stellt keine parallelen Fragen. Sie werden die tatsächliche Wartezeit nach 3 Wochen messen und die GPU bei Bedarf aufrüsten. Das Mainboard und das Netzteil müssen jedoch von Anfang an eine größere GPU unterstützen.

#2. Empfohlener Technologie-Stack

Vier Open-Source-Bausteine reichen aus. Kein Softwareanbieter hat ein Mitspracherecht, keine Lizenz muss verlängert werden, alles läuft in Docker auf der Workstation.

Ollama
Der Daemon, der das Modell lädt und bereitstellt. Lauscht standardmäßig auf http://localhost:11434. Erkennt die NVIDIA-GPU automatisch und verwaltet die Quantisierung. MIT-Lizenz.
Open WebUI
Die Weboberfläche im Stil von ChatGPT. Integrierte Mehrbenutzerunterstützung, RBAC, OIDC-Anbindung für SSO, Verlauf pro Benutzer. BSD-3-Lizenz.
Qdrant
Vektordatenbank für RAG. Indexiert Ihre internen Dokumente (Verfahrensanweisungen, Musterverträge, Produktdatenblätter). Bei diesem Datenvolumen schneller und einfacher als pgvector. Apache-2-Lizenz.
Traefik oder Nginx
Reverse Proxy, um Open WebUI im LAN über HTTPS mit einem internen Zertifikat zugänglich zu machen, TLS zu terminieren und Anfragen an die Backends weiterzuleiten.
docker-compose.yml — minimales Grundgerüst
services:
  ollama:
    image: ollama/ollama:latest
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped

  qdrant:
    image: qdrant/qdrant:latest
    volumes:
      - qdrant_data:/qdrant/storage
    restart: unless-stopped

  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
      - QDRANT_URL=http://qdrant:6333
      - ENABLE_OAUTH_SIGNUP=true
      - OAUTH_PROVIDER_NAME=Microsoft
      - MICROSOFT_CLIENT_ID=${ENTRA_CLIENT_ID}
      - MICROSOFT_CLIENT_SECRET=${ENTRA_CLIENT_SECRET}
      - MICROSOFT_CLIENT_TENANT_ID=${ENTRA_TENANT_ID}
    volumes:
      - openwebui_data:/app/backend/data
    depends_on:
      - ollama
      - qdrant
    restart: unless-stopped

volumes:
  ollama_data:
  qdrant_data:
  openwebui_data:

Dieses Grundgerüst ist bewusst kurz gehalten. Sie werden Traefik für HTTPS davorschalten und ein Bind-Mount-Volume für nächtliche Backups auf das NAS hinzufügen. Mehr nicht.

#3. SSO mit Microsoft Entra ID

Die meisten kleinen und mittleren Unternehmen nutzen Microsoft 365. Wenn Sie die Authentifizierung des Chatbots an Entra ID (ehemals Azure AD) anbinden, werden verwaiste Konten beseitigt und es ist gewährleistet, dass ein Mitarbeiter, der das Unternehmen verlässt, noch am selben Tag seinen Zugriff verliert. Open WebUI unterstützt OIDC mit Microsoft von Haus aus.

  1. 01
    Eine App registration erstellen
    Im Entra-ID-Portal: App registrations → New registration. Name: « Chatbot IA Interne ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (als Typ Web).
  2. 02
    Zugangsdaten abrufen
    Notieren Sie die Application (client) ID und die Directory (tenant) ID. Erstellen Sie unter Certificates & secrets ein Client secret mit einer Gültigkeitsdauer von 24 Monaten und notieren Sie es sofort (es wird danach nie wieder angezeigt).
  3. 03
    Die Berechtigungen definieren
    API permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. Application permissions sind nicht erforderlich, da der Flow delegiert ist.
  4. 04
    Zugriff beschränken
    Enterprise applications → Ihre App → Properties → Assignment required = Yes. Anschließend unter Users and groups: Fügen Sie die Gruppe „Alle Mitarbeiter“ oder eine Pilotgruppe hinzu. Ohne diesen Schritt kann sich jedes Konto des Mandanten anmelden.
  5. 05
    In Open WebUI einfügen
    Kopieren Sie CLIENT_ID, CLIENT_SECRET und TENANT_ID in die .env-Datei von docker-compose. Starten Sie neu. Der Button „Sign in with Microsoft“ erscheint auf der Login-Seite.
!
Die klassische Stolperfalle: Assignment required
Wenn Sie Schritt 4 vergessen, können sich möglicherweise alle Benutzer Ihres Microsoft-Tenants anmelden – einschließlich aller externen Gastkonten (Kunden, Dienstleister). Prüfen Sie diese Einstellung zweimal, bevor Sie die URL an die Teams weitergeben.

#4. Bereitstellungsplan über 4 Wochen

Dieser Zeitplan setzt einen internen technischen Ansprechpartner (IT-Leiter, IT-Manager oder Dienstleister) voraus, der etwa 50 % seiner Zeit dem Projekt widmet. Für ein KMU ist nicht mehr nötig.

#Woche 1 — Hardware und Installation

J1-J2
Hardware bestellen (Workstation, USV mit 1500 VA, verwalteter Switch, falls noch nicht vorhanden).
J3-J4
Lieferung, bei Bedarf Zusammenbau, Installation von Ubuntu Server LTS 24.04, NVIDIA-Treibern, Docker + NVIDIA Container Toolkit.
J5
Docker-Images herunterladen, ollama pull mistral-small erstmals ausführen, einen einfachen Chat in der CLI testen. Sie müssen sehen, dass Tokens ausgegeben werden.

#Woche 2 — Stack und Integrationen

J6-J7
docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
J8-J9
Konfiguration von SSO mit Entra ID, Test mit 3 Pilotkonten, Validierung des Login- und Logout-Flows
J10
Traefik als Reverse-Proxy mit internem Zertifikat über Ihre PKI oder mit Let's Encrypt DNS-01, wenn die Domain öffentlich ist. Test von 2–3 Rechnern im LAN aus.

#Woche 3 — RAG und Pilotprojekt

J11-J12
Auswahl von 50 bis 200 relevanten internen Dokumenten (Verfahrensanweisungen, FAQ, Vertriebsunterlagen). Indexierung in Qdrant über Open WebUI oder ein Python-Skript.
J13-J14
System-Prompt im Stil des KMU: Ton, erlaubte Themen, Themen, die abgelehnt werden sollen (sensibles HR, Gehälter usw.). Test an den 3 Piloten.
J15
Freigabe für eine Pilotgruppe von 5–8 repräsentativen Mitarbeitenden (1 aus dem Vertrieb, 1 aus der Personalabteilung, 1 aus der Buchhaltung, 1 aus dem operativen Bereich …). Strukturiertes Feedback sammeln.

#Woche 4 — Schulung und Umstellung

J16-J17
Anpassungen basierend auf Pilotfeedback (Systemprompt, RAG-Dokumente, Temperaturparameter).
J18
Gemeinsame Schulung von 1 Stunde 30 Minuten: Demo, Anwendungsfälle nach Berufsgruppe, Nutzungsregeln, was NICHT in den Chat gehört (Gesundheitsdaten, Kennungen usw.).
J19
Schrittweise Freigabe für alle Mitarbeiter über die Entra-ID-Gruppe. Interne Ankündigung.
J20
Einrichtung des Überwachungssystems (Glances oder Netdata für die Workstation, aggregierter Chat-Log, um die angefragten Themen zu identifizieren).

#5. Schulung und Change-Management

Ein interner Chatbot ohne Schulung bedeutet, dass 70 % der Investition verschwendet sind. Die Mitarbeitenden wissen nicht, was sie ihn fragen sollen, vergleichen ihn gedanklich mit der allgemein verfügbaren Version von ChatGPT und kommen nach zwei Versuchen zu dem Schluss, dass „er schlechter ist“.

Format
Eine gemeinsame Sitzung von 1 Stunde 30 Minuten pro Gruppe von 10 bis 15 Personen. Keine Präsentationen während der 1 Stunde. 20 Minuten Demo plus 1 Stunde Praxis mit ihren echten Themen.
Anwendungsfälle nach Tätigkeitsbereich
Bereiten Sie 3 konkrete Prompts pro Funktionsbereich vor (Personalwesen, Vertrieb, Buchhaltung, operatives Geschäft, Geschäftsleitung). Die Leute kopieren sie und passen sie an – genau das wollen wir.
Nutzungsregeln
Geben Sie klar sichtbar an, was eingefügt werden darf (interne Texte, Entwürfe, bereits öffentliche Daten) und was nicht eingefügt werden darf (Gesundheitsdaten, strafrechtliche Verurteilungen, personenbezogene Bankdaten, technische Kennungen).
Ansprechperson
Benennen Sie 1 KI-Ansprechpartner pro Abteilung. Er verbreitet bewährte Vorgehensweisen vor Ort und meldet Wissenslücken des RAG weiter.
Nachkontrolle nach 30 Tagen
Messen Sie die Nutzung. Wenn bestimmte Abteilungen das Tool nicht nutzen, ist das ein Signal – ihnen fehlt ein klarer Anwendungsfall, oder die Schulung hat nicht gegriffen.
→
Was in der Demo am besten funktioniert
Drei Anwendungsfälle, die Sie zuerst zeigen sollten: eine schwierige E-Mail umformulieren, ein langes Besprechungsprotokoll zusammenfassen, ein technisches Dokument übersetzen. Bei diesen Anwendungsfällen wird der Nutzen innerhalb von 30 Sekunden offensichtlich.

#6. Einhaltung der DSGVO und des AI Act

Dass das System vor Ort betrieben wird, vereinfacht die Einhaltung der Vorschriften erheblich, macht sie aber nicht überflüssig. Die Pflichten aus der DSGVO gelten für die Verarbeitung, unabhängig davon, wo sie stattfindet.

Verzeichnis der Verarbeitungstätigkeiten
Fügen Sie einen Eintrag für den internen Chatbot hinzu. Zweck: Unterstützung beim Verfassen von Texten und bei der Dokumentensuche. Rechtsgrundlage: berechtigtes Interesse des Arbeitgebers. Verarbeitete Daten: Gesprächsinhalte, SSO-Kennung.
Aufbewahrungszeit
Legen Sie eine klare Regel fest: Gesprächsverläufe pro Nutzer 90 Tage aufbewahren und danach automatisch löschen. Dokumentieren Sie diese Regel in der Charta.
Information der Mitarbeitenden
Aktualisierung der IT-Nutzungsrichtlinie und des Informationsschreibens CSE/CSE. Erwähnen Sie ausdrücklich, dass die Gespräche gespeichert werden und bei einem Vorfall für den technischen Administrator zugänglich sind.
KI-Verordnung
Ein interner Chatbot zur Unterstützung der Produktivität fällt in die Kategorie „begrenztes Risiko“ (Artikel 50). Die wichtigste Pflicht: den Nutzer darüber informieren, dass er mit einer KI interagiert — die Benutzeroberfläche von Open WebUI tut dies standardmäßig.
Technische Sicherheit
Verschlüsselte Sicherungen der Basis Open WebUI, adminbezogener Zugriff mit Protokollierung, MFA erforderlich für Entra ID-Konten, monatliche Docker-Image-Updates.
i
DPIA erforderlich?
Eine Datenschutz-Folgenabschätzung (DPIA) ist für einen gewöhnlichen Anwendungsfall zur Produktivitätssteigerung nicht verpflichtend, wird aber empfohlen, wenn Sie RAG an sensible Daten anbinden möchten (Personalakten, identifizierbare Kundendaten). Im Zweifelsfall entscheidet Ihr Datenschutzbeauftragter.

#7. ROI: eine ehrliche Berechnung

Nehmen wir ein kleines oder mittleres Unternehmen mit 30 Mitarbeitern und einer Bereitstellung nach Profil A für 5.000 €. Betrachtungszeitraum: 3 Jahre.

Kosten der SaaS-Alternative
30 × 25 € × 12 Monate × 3 Jahre = 27.000 € (ChatGPT Team).
Interne Kosten
Workstation 5.000 € + Strom ~200 €/Jahr + 5 Personentage Installation im 1. Jahr (~3.500 €) + 2 Personentage/Jahr Wartung (~1.400 €/Jahr × 2 Jahre) = ~11.500 € über 3 Jahre.
Direkte Nettoeinsparung
~15 500 € über 3 Jahre, also etwa 5 200 € pro Jahr ab dem Jahr 2.
Indirekte Vorteile
Verringerung des Risikos von Datenlecks (finanziell bezifferbar mit dem Argument, dass schon ein einziges vermiedenes Datenleck die Projektkosten mehr als deckt), erleichterte DSGVO-Konformität, Unabhängigkeit von SaaS-Preiserhöhungen.
Erhöhung der Produktivität
Vorsichtige Schätzung: 15 Minuten Zeitersparnis pro Nutzer und Arbeitstag. Bei Personalkosten von 35 €/h einschließlich Lohnnebenkosten und 220 Tagen ergibt das rund 38.500 € pro Jahr für 30 Personen. Diese Zahl hängt stark von der tatsächlichen Nutzung ab – seien Sie bei Wirtschaftlichkeitsrechnungen vorsichtig.
!
Der klassische Fehler bei der Berechnung des Produktivitäts-ROI
Rechnen Sie mit 1 Stunde/Tag eingesparter Zeit und multiplizieren Sie – das ist falsch. Die Mehrheit der regelmäßigen Nutzer spart 10 bis 20 Minuten pro Tag, und 40 % der Konten werden nach 2 Monaten inaktiv. Rechnen Sie großzügig mit der Adoption (50–60 %), aber knapp mit dem Gewinn pro Nutzer (15 Min). Die ROI bleibt deutlich positiv.

#Weiterführende Informationen

Dieser Leitfaden schafft die Grundlage. Danach bieten sich drei nächste Schritte an: ein solides RAG-System für Ihre internen Dokumente hinzufügen, damit der Chatbot Ihre Verfahren kennt, die Bereitstellung für mehrere Benutzer im Intranet absichern und die DSGVO-Konformität mit einer sauber geführten Dokumentation formalisieren.

Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.