Einen internen KI-Chatbot für kleine und mittlere Unternehmen bereitstellen (von 0 bis 50 collaborateurs)
Sie führen ein mittelständisches Unternehmen mit weniger als 50 Mitarbeitern und möchten Ihrem Team ein KI-Assistenten anbieten, ohne deren Daten an OpenAI zu senden. Dieser Leitfaden bietet eine vollständige, numerisch aufgebaute Lösung für die internen Einrichtung eines KI-Chatbots in mittelständischen Unternehmen: konkreter Hardware, open source Software, Microsoft SSO, 4-wöchiger Plan, Veränderungsmanagement und ROI-Berechnung. Keine Versprechungen, kein Pitch – nur Einkaufsliste und Kalender.
#Warum ein interner Chatbot anstatt ChatGPT Business
ChatGPT Team kostet 25 € pro Nutzer und Monat. Bei 30 Mitarbeitenden sind das 9.000 € pro Jahr, auf unbestimmte Zeit. Für dasselbe Budget kaufen Sie eine Workstation, die 4 bis 5 Jahre läuft, und Ihre Gespräche verlassen niemals das Büro. Das ist die zentrale Abwägung.
Doch die eigentliche Frage ist nicht der Preis, sondern was Ihre Teams sich trauen, in das Chatfenster einzufügen. Wenn ein Vertriebsmitarbeiter ein externes LLM bittet, ein Angebot umzuformulieren, enthält dieses einen Kundennamen, einen Betrag und manchmal eine Marge. Eine Personalmitarbeiterin, die ein Vorstellungsgespräch zusammenfasst, legt einen beruflichen Werdegang offen. Multiplizieren Sie das mit 30 Personen über 12 Monate – ein Datenleck ist garantiert, selbst mit einer Richtlinie zur sachgerechten Nutzung.
- Datenschutz
- Die Gespräche bleiben auf Ihrem LAN. Kein Cloud-Transit, keine Exposition gegenüber einem US-Unternehmen, keine politischen Einstellungen, die alle drei Monate überprüft werden müssen.
- Fixkosten
- Die Hardware zählt zu den Investitionsausgaben (CAPEX) und wird über 4–5 Jahre abgeschrieben. Das SaaS-Abonnement zählt zu den Betriebsausgaben (OPEX), die mit der Mitarbeiterzahl steigen.
- Kontrolle
- Sie wählen das Modell, passen den System-Prompt an und binden Ihre internen Dokumente über RAG ein. Niemand ändert Ihr Tool hinter Ihrem Rücken.
- Konformität
- Die Einhaltung des AI Act und der DSGVO lässt sich mit einem On-Premise-System leichter nachweisen als bei einer Abhängigkeit von einem Anbieter außerhalb der EU.
#1. Hardware-Budget: die Workstation zwischen 5.000 und 10.000 €
Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Um 30 bis 50 Benutzer gleichzeitig auf einem 20B bis 35B-Modell mit Qualitätsstufe Q4_K_M zu bedienen, benötigen Sie keinen DGX-Server. Eine gut ausgewählte Workstation reicht aus. Hier sind drei Konfigurationen je nach Profil.
#Profil A — 10 bis 20 Benutzer (5.000 €)
- GPU
- 1× RTX 4080 mit 16 GB gebraucht (Preis variabel) oder RTX 5070 Ti mit 16 GB neu (≈ 1.400 € Ende September 2026). Damit lässt sich ein 20–24B-Modell in Q4_K_M mit einem Kontext von 16k Tokens betreiben.
- CPU
- AMD Ryzen 9 7900X oder Intel Core i7-14700K. Die CPU ist weniger entscheidend, aber 12 oder mehr Kerne helfen bei der Vorbereitung der Embeddings.
- System-RAM
- 64 GB DDR5. Ausreichend für das System, Qdrant und den KV-Cache, der nicht mehr in den GPU-Speicher passt und in den Arbeitsspeicher ausgelagert wird.
- Speicher
- 2 TB NVMe Gen4. Modelle + Vektordatenbank + lokale Sicherungen.
- Bereitgestelltes Modell
- Mistral Small 24B (Allroundmodell, gut auf Französisch) oder gpt-oss 20B in Q4_K_M (~14 GB VRAM). Latenz ~30 Tok/s.
#Profil B – 20 bis 35 Benutzer (7.500 €)
- GPU
- 1× RTX 4090 24 GB — nicht mehr neu erhältlich, gebraucht suchen (Preis variiert). Der ideale Kompromiss, um ein 27–30B-Modell in Q4_K_M bereitzustellen.
- CPU
- Ryzen 9 7950X oder Threadripper 7960X. Die Kerne sind nützlich, um mehrere Gespräche gleichzeitig zu verarbeiten.
- System-RAM
- 128 GB DDR5 ECC, wenn möglich. Der RAG-Index wächst schnell.
- Speicher
- 2 TB NVMe Gen4 + 4 TB SATA für Archivierung
- Bereitgestelltes Modell
- Qwen 3.8 27B (2026 „nahe an Copilot“, 262k Kontext) oder Granite 4.2 30B in Q4_K_M (~18 GB VRAM). Latenz ~20–25 Tokens/s.
#Profil C – 35 bis 50 Benutzer (10.000 €)
- NVIDIA-Option
- 2× RTX 4090 mit jeweils 24 GB im Tensorparallelbetrieb. Damit lässt sich ein Modell mit 27–35B Parametern in Q8 bei voller Qualität bereitstellen (~30–40 GB VRAM, auf beide Karten verteilt), oder es lassen sich zwei Modelle parallel mit akzeptabler Latenz betreiben.
- Apple-Option
- Mac Studio M4 Max oder Ultra mit 64 bis 128 GB vereinheitlichtem Speicher. Hervorragendes Verhältnis zwischen leisem Betrieb und Leistung, ideal für Großraumbüros.
- CPU
- Threadripper 7970X / 7980X bei NVIDIA-Konfigurationen. Entscheidend für die Verwaltung von 50 gleichzeitigen WebSocket-Verbindungen.
- System-RAM
- 128 bis 256 GB. Reserve für den Betriebssystem-Cache, Qdrant im RAM und gegebenenfalls ein zusätzliches Embedding-Modell.
- Bereitgestelltes Modell
- Qwen 3.8 27B in Q8 oder Qwen 3.6 35B-A3B (schnelles MoE) in Q5_K_M. Latenz ~15–20 Tok/s.
#2. Empfohlener Technologie-Stack
Vier Open-Source-Bausteine reichen aus. Kein Softwareanbieter hat ein Mitspracherecht, keine Lizenz muss verlängert werden, alles läuft in Docker auf der Workstation.
- Ollama
- Der Daemon, der das Modell lädt und bereitstellt. Lauscht standardmäßig auf http://localhost:11434. Erkennt die NVIDIA-GPU automatisch und verwaltet die Quantisierung. MIT-Lizenz.
- Open WebUI
- Die Weboberfläche im Stil von ChatGPT. Integrierte Mehrbenutzerunterstützung, RBAC, OIDC-Anbindung für SSO, Verlauf pro Benutzer. BSD-3-Lizenz.
- Qdrant
- Vektordatenbank für RAG. Indexiert Ihre internen Dokumente (Verfahrensanweisungen, Musterverträge, Produktdatenblätter). Bei diesem Datenvolumen schneller und einfacher als pgvector. Apache-2-Lizenz.
- Traefik oder Nginx
- Reverse Proxy, um Open WebUI im LAN über HTTPS mit einem internen Zertifikat zugänglich zu machen, TLS zu terminieren und Anfragen an die Backends weiterzuleiten.
Dieses Grundgerüst ist bewusst kurz gehalten. Sie werden Traefik für HTTPS davorschalten und ein Bind-Mount-Volume für nächtliche Backups auf das NAS hinzufügen. Mehr nicht.
#3. SSO mit Microsoft Entra ID
Die meisten kleinen und mittleren Unternehmen nutzen Microsoft 365. Wenn Sie die Authentifizierung des Chatbots an Entra ID (ehemals Azure AD) anbinden, werden verwaiste Konten beseitigt und es ist gewährleistet, dass ein Mitarbeiter, der das Unternehmen verlässt, noch am selben Tag seinen Zugriff verliert. Open WebUI unterstützt OIDC mit Microsoft von Haus aus.
- 01Eine App registration erstellenIm Entra-ID-Portal: App registrations → New registration. Name: « Chatbot IA Interne ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (als Typ Web).
- 02Zugangsdaten abrufenNotieren Sie die Application (client) ID und die Directory (tenant) ID. Erstellen Sie unter Certificates & secrets ein Client secret mit einer Gültigkeitsdauer von 24 Monaten und notieren Sie es sofort (es wird danach nie wieder angezeigt).
- 03Die Berechtigungen definierenAPI permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. Application permissions sind nicht erforderlich, da der Flow delegiert ist.
- 04Zugriff beschränkenEnterprise applications → Ihre App → Properties → Assignment required = Yes. Anschließend unter Users and groups: Fügen Sie die Gruppe „Alle Mitarbeiter“ oder eine Pilotgruppe hinzu. Ohne diesen Schritt kann sich jedes Konto des Mandanten anmelden.
- 05In Open WebUI einfügenKopieren Sie CLIENT_ID, CLIENT_SECRET und TENANT_ID in die .env-Datei von docker-compose. Starten Sie neu. Der Button „Sign in with Microsoft“ erscheint auf der Login-Seite.
#4. Bereitstellungsplan über 4 Wochen
Dieser Zeitplan setzt einen internen technischen Ansprechpartner (IT-Leiter, IT-Manager oder Dienstleister) voraus, der etwa 50 % seiner Zeit dem Projekt widmet. Für ein KMU ist nicht mehr nötig.
#Woche 1 — Hardware und Installation
- J1-J2
- Hardware bestellen (Workstation, USV mit 1500 VA, verwalteter Switch, falls noch nicht vorhanden).
- J3-J4
- Lieferung, bei Bedarf Zusammenbau, Installation von Ubuntu Server LTS 24.04, NVIDIA-Treibern, Docker + NVIDIA Container Toolkit.
- J5
- Docker-Images herunterladen, ollama pull mistral-small erstmals ausführen, einen einfachen Chat in der CLI testen. Sie müssen sehen, dass Tokens ausgegeben werden.
#Woche 2 — Stack und Integrationen
- J6-J7
- docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
- J8-J9
- Konfiguration von SSO mit Entra ID, Test mit 3 Pilotkonten, Validierung des Login- und Logout-Flows
- J10
- Traefik als Reverse-Proxy mit internem Zertifikat über Ihre PKI oder mit Let's Encrypt DNS-01, wenn die Domain öffentlich ist. Test von 2–3 Rechnern im LAN aus.
#Woche 3 — RAG und Pilotprojekt
- J11-J12
- Auswahl von 50 bis 200 relevanten internen Dokumenten (Verfahrensanweisungen, FAQ, Vertriebsunterlagen). Indexierung in Qdrant über Open WebUI oder ein Python-Skript.
- J13-J14
- System-Prompt im Stil des KMU: Ton, erlaubte Themen, Themen, die abgelehnt werden sollen (sensibles HR, Gehälter usw.). Test an den 3 Piloten.
- J15
- Freigabe für eine Pilotgruppe von 5–8 repräsentativen Mitarbeitenden (1 aus dem Vertrieb, 1 aus der Personalabteilung, 1 aus der Buchhaltung, 1 aus dem operativen Bereich …). Strukturiertes Feedback sammeln.
#Woche 4 — Schulung und Umstellung
- J16-J17
- Anpassungen basierend auf Pilotfeedback (Systemprompt, RAG-Dokumente, Temperaturparameter).
- J18
- Gemeinsame Schulung von 1 Stunde 30 Minuten: Demo, Anwendungsfälle nach Berufsgruppe, Nutzungsregeln, was NICHT in den Chat gehört (Gesundheitsdaten, Kennungen usw.).
- J19
- Schrittweise Freigabe für alle Mitarbeiter über die Entra-ID-Gruppe. Interne Ankündigung.
- J20
- Einrichtung des Überwachungssystems (Glances oder Netdata für die Workstation, aggregierter Chat-Log, um die angefragten Themen zu identifizieren).
#5. Schulung und Change-Management
Ein interner Chatbot ohne Schulung bedeutet, dass 70 % der Investition verschwendet sind. Die Mitarbeitenden wissen nicht, was sie ihn fragen sollen, vergleichen ihn gedanklich mit der allgemein verfügbaren Version von ChatGPT und kommen nach zwei Versuchen zu dem Schluss, dass „er schlechter ist“.
- Format
- Eine gemeinsame Sitzung von 1 Stunde 30 Minuten pro Gruppe von 10 bis 15 Personen. Keine Präsentationen während der 1 Stunde. 20 Minuten Demo plus 1 Stunde Praxis mit ihren echten Themen.
- Anwendungsfälle nach Tätigkeitsbereich
- Bereiten Sie 3 konkrete Prompts pro Funktionsbereich vor (Personalwesen, Vertrieb, Buchhaltung, operatives Geschäft, Geschäftsleitung). Die Leute kopieren sie und passen sie an – genau das wollen wir.
- Nutzungsregeln
- Geben Sie klar sichtbar an, was eingefügt werden darf (interne Texte, Entwürfe, bereits öffentliche Daten) und was nicht eingefügt werden darf (Gesundheitsdaten, strafrechtliche Verurteilungen, personenbezogene Bankdaten, technische Kennungen).
- Ansprechperson
- Benennen Sie 1 KI-Ansprechpartner pro Abteilung. Er verbreitet bewährte Vorgehensweisen vor Ort und meldet Wissenslücken des RAG weiter.
- Nachkontrolle nach 30 Tagen
- Messen Sie die Nutzung. Wenn bestimmte Abteilungen das Tool nicht nutzen, ist das ein Signal – ihnen fehlt ein klarer Anwendungsfall, oder die Schulung hat nicht gegriffen.
#6. Einhaltung der DSGVO und des AI Act
Dass das System vor Ort betrieben wird, vereinfacht die Einhaltung der Vorschriften erheblich, macht sie aber nicht überflüssig. Die Pflichten aus der DSGVO gelten für die Verarbeitung, unabhängig davon, wo sie stattfindet.
- Verzeichnis der Verarbeitungstätigkeiten
- Fügen Sie einen Eintrag für den internen Chatbot hinzu. Zweck: Unterstützung beim Verfassen von Texten und bei der Dokumentensuche. Rechtsgrundlage: berechtigtes Interesse des Arbeitgebers. Verarbeitete Daten: Gesprächsinhalte, SSO-Kennung.
- Aufbewahrungszeit
- Legen Sie eine klare Regel fest: Gesprächsverläufe pro Nutzer 90 Tage aufbewahren und danach automatisch löschen. Dokumentieren Sie diese Regel in der Charta.
- Information der Mitarbeitenden
- Aktualisierung der IT-Nutzungsrichtlinie und des Informationsschreibens CSE/CSE. Erwähnen Sie ausdrücklich, dass die Gespräche gespeichert werden und bei einem Vorfall für den technischen Administrator zugänglich sind.
- KI-Verordnung
- Ein interner Chatbot zur Unterstützung der Produktivität fällt in die Kategorie „begrenztes Risiko“ (Artikel 50). Die wichtigste Pflicht: den Nutzer darüber informieren, dass er mit einer KI interagiert — die Benutzeroberfläche von Open WebUI tut dies standardmäßig.
- Technische Sicherheit
- Verschlüsselte Sicherungen der Basis Open WebUI, adminbezogener Zugriff mit Protokollierung, MFA erforderlich für Entra ID-Konten, monatliche Docker-Image-Updates.
#7. ROI: eine ehrliche Berechnung
Nehmen wir ein kleines oder mittleres Unternehmen mit 30 Mitarbeitern und einer Bereitstellung nach Profil A für 5.000 €. Betrachtungszeitraum: 3 Jahre.
- Kosten der SaaS-Alternative
- 30 × 25 € × 12 Monate × 3 Jahre = 27.000 € (ChatGPT Team).
- Interne Kosten
- Workstation 5.000 € + Strom ~200 €/Jahr + 5 Personentage Installation im 1. Jahr (~3.500 €) + 2 Personentage/Jahr Wartung (~1.400 €/Jahr × 2 Jahre) = ~11.500 € über 3 Jahre.
- Direkte Nettoeinsparung
- ~15 500 € über 3 Jahre, also etwa 5 200 € pro Jahr ab dem Jahr 2.
- Indirekte Vorteile
- Verringerung des Risikos von Datenlecks (finanziell bezifferbar mit dem Argument, dass schon ein einziges vermiedenes Datenleck die Projektkosten mehr als deckt), erleichterte DSGVO-Konformität, Unabhängigkeit von SaaS-Preiserhöhungen.
- Erhöhung der Produktivität
- Vorsichtige Schätzung: 15 Minuten Zeitersparnis pro Nutzer und Arbeitstag. Bei Personalkosten von 35 €/h einschließlich Lohnnebenkosten und 220 Tagen ergibt das rund 38.500 € pro Jahr für 30 Personen. Diese Zahl hängt stark von der tatsächlichen Nutzung ab – seien Sie bei Wirtschaftlichkeitsrechnungen vorsichtig.
#Weiterführende Informationen
Dieser Leitfaden schafft die Grundlage. Danach bieten sich drei nächste Schritte an: ein solides RAG-System für Ihre internen Dokumente hinzufügen, damit der Chatbot Ihre Verfahren kennt, die Bereitstellung für mehrere Benutzer im Intranet absichern und die DSGVO-Konformität mit einer sauber geführten Dokumentation formalisieren.
Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.