Bestes LLM für technischen Support bei IT-Dienstleistern (ESN)
Die Einrichtung einer lokalen IT-Support-KI trägt einer konkreten Anforderung von IT-Dienstleistungsunternehmen Rechnung: Tickets, Logs und Runbooks enthalten Kundendaten, die Vertraulichkeitsklauseln unterliegen. Mit einer lokalen IT-Support-KI bleiben diese Informationen auf einem Rechner, den Sie kontrollieren, und jede Antwort lässt sich einer Quelle zuordnen.
Diese Seite behandelt ausschließlich den internen IT-Support: Einordnung technischer Tickets, Lesen bereinigter Logs, Suche in Runbooks, Nachvollziehbarkeit und Eskalation. Handel, Rückerstattungen und Übersetzungen im Kundenservice werden im folgenden Leitfaden behandelt: multilingualer Kundensupport mit lokalem LLM.
Der Plan: Auswahlkriterien, Modellauswahl, Speicherbedarf je Quantisierung, Durchsatz und Benchmarks, Lizenzen und anschließend die Bereitstellungskette.
Was der IT-Support eines IT-Dienstleistungsunternehmens von einem Modell verlangt
Der interne Support erfordert nicht die gleichen Qualitäten wie ein allgemeiner Assistent. Vier Kriterien zählen:
- Kontextfenster : Ein Log-Auszug, ein Runbook und der Ticket-Verlauf überschreiten schnell 30.000 Tokens. Modelle mit einer Grenze von 4.096 Tokens (Snowflake Arctic Instruct) oder 8.192 Tokens (Grok-1 (base)) werden für diesen Zweck ausgeschlossen.
- Strukturierte Ausgabe : Das Modell muss stabiles JSON (Kategorie, Schweregrad, zuständiges Team) erzeugen, das das Ticketing-Tool verarbeiten kann.
- Treue zu den Quellen : Die Antwort muss das verwendete Runbook oder die verwendete Logzeile als Quelle angeben, sonst geht die Nachvollziehbarkeit verloren.
- Lizenz : das Modell läuft häufig im Rahmen einer fakturierten Leistung, also im kommerziellen Gebrauch.
Die Auswahl: sieben Modelle zwischen 68 und 85 GB in Q4
Die folgenden Modelle sind die leichtesten im Referenzkatalog dieser Seite. Alle benötigen einen Server oder eine Workstation mit viel Speicher, keinen Arbeitsplatzrechner für Techniker.
- Mistral Small 4 : 119B, Apache 2.0, ~72 GB in Q4, Kontextfenster von 256.000. Erste Wahl als Standard dank der permissiven Lizenz und des großen Kontextfensters. Modellgewichte auf der Hugging Face-Seite von Mistral.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, ~73 GB in Q4, Kontext 262.000. Das Suffix A10B steht für etwa 10 Milliarden aktive Parameter pro Token, was den Durchsatz begünstigt. Siehe Alibaba auf Hugging Face.
- Nemotron 3 Super 120B : 120B, NVIDIA Open Model License, ~72 GB in Q4, Kontext 128.000. Sinnvoll auf einer Infrastruktur, die bereits mit NVIDIA-Hardware ausgestattet ist (NVIDIA auf Hugging Face).
- Laguna S 2.1 : 118B, OpenMDW 1.1, ~68 GB in Q4, Kontext 262.144. Das leichteste Modell der Auswahl, auf Code ausgerichtet und nützlich für Tickets, die Skripte und Pipelines betreffen.
- Qwen3.8 Flash Next 125B-A6B : 125B, Lizenz „Sonstige (Open Weights)“, ~72 GB in Q4, Kontext 256.000. Die Lizenz vor jedem Einsatz bei einem Kunden lesen.
- Mistral Medium 3.5 128B : 128B, modifizierte MIT-Lizenz, ca. 74 GB bei Q4, Kontextgröße 256.000.
- Mixtral 8x22B Instruct : 141B, Apache 2.0, ~82 GB in Q4, Kontextgröße 64.000. Kürzeres Kontextfenster, ausreichend für ein Ticket und ein Runbook, für lange Logauszüge jedoch knapp.
Zwei Modelle sind auf einen Kontext von 32.768 Tokens begrenzt: dots.llm1 Instruct (142B, MIT, ~85 GB) und DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Sie eignen sich zum Sortieren von Tickets, weniger zur Analyse von Logs.
Für ein Team mit mehr Arbeitsspeicher, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) und MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) bilden den nächsten Schritt.
Speicherbedarf nach Quantisierung und Hardware
Nur die Q4-Werte stammen aus dem Katalog. Die anderen Stufen sind anhand einer Proportionalitätsregel geschätzte Größenordnungen, die auf der jeweiligen Modellseite bestätigt werden müssen.
Für die Klasse 118B–128B:
- Q4 : 68 bis 74 GB (Katalog)
- Q5 : ~82 bis 90 GB (geschätzt)
- Q8 : ~120 bis 135 GB (geschätzt)
- FP16 : ~236 bis 256 GB (geschätzt)
Für Mixtral 8x22B Instruct (141B):
- Q4 : ~82 GB (Katalog)
- Q5 : ~97 GB (geschätzt)
- Q8 : ~150 GB (geschätzt)
- FP16 : ~282 GB (geschätzt)
Diese Werte berücksichtigen den Kontext nicht: Das Laden von 100.000 Tokens aus Logs benötigt mehrere zusätzliche GB Cache. Planen Sie eine Reserve von mindestens 15 bis 20 % ein (geschätzt).
Was die Hardware betrifft, passt ein Q4-Modell mit 72 GB auf einen Rechner mit 96 GB vereinheitlichtem Speicher, allerdings mit wenig Spielraum; mit 128 GB passt es komfortabler. Die Seiten Mac 96 GB et Mac 128 GB beschreiben diese Konfigurationen im Detail. Auf einem PC müssen mehrere Grafikkarten kombiniert werden: siehe den Leitfaden eine GPU für ein lokales LLM auswählen.
Durchsatz und Benchmarks: Was noch bestätigt werden muss
Kein gemessener Durchsatz wird hier für diese sieben Modelle veröffentlicht: Die Tokens pro Sekunde müssen auf Ihrem Hardware-Setup bestätigt werden. Zwei qualitative Hinweise:
- MoE-Architektur : Bei gleicher Größe liest ein Modell mit wenigen aktiven Parametern (A6B, A10B) pro Token weniger Daten und generiert schneller als ein dichtes Modell.
- Parallelität : Ein Support-Team sendet mehrere Anfragen gleichzeitig. Ein Server wie vLLM verarbeitet Anfragen in Batches und erhöht den Gesamtdurchsatz, während llama.cpp bleibt für einen einzelnen Anfragestrom mit GGUF die einfachste Lösung.
Die MMLU- oder HumanEval-Scores finden Sie imOpen LLM Leaderboard und die Datenblätter im Katalog. Diese Werte müssen für jedes Modell einzeln noch bestätigt werden und bilden die Arbeit im Support nur unzureichend ab.
Ein interner Testdatensatz ist zuverlässiger: 50 abgeschlossene und anonymisierte Tickets mit der tatsächlichen Kategorie, dem tatsächlichen Schweregrad und der tatsächlichen Lösung. Messen Sie den Anteil korrekter Kategorisierungen, den Anteil korrekter Runbook-Zitate und die Anzahl ungerechtfertigter Eskalationen. Die Seite lokaler Benchmark beschreibt die Methode zur Messung des Durchsatzes.
Lizenzen: vor der Installation bei einem Kunden prüfen
- Apache 2.0 (Mistral Small 4, Qwen 3.5 122B-A10B, Mixtral 8x22B Instruct): kommerzieller Einsatz erlaubt, mit Beibehaltung der Lizenzangaben.
- MIT (dots.llm1 Instruct) : kommerzieller Gebrauch erlaubt, minimale Einschränkungen.
- Modified MIT (Mistral Medium 3.5 128B): Die hinzugefügten Klauseln sind zu lesen, die Bedingungen noch zu bestätigen.
- NVIDIA Open Model License, OpenMDW 1.1, Databricks Open Model License : anbieterspezifische Lizenzen, die vor dem Einsatz im Rahmen einer Dienstleistung zur Prüfung vorgelegt werden sollten.
- Andere (offene Modellgewichte) (Qwen3.8 Flash Next 125B-A6B): Bedingungen im Einzelfall zu bestätigen.
Die Anleitung Lokaler LLM im Unternehmen und DSGVO ergänzt diesen Punkt im Hinblick auf die personenbezogenen Daten in den Tickets.
Bereitstellungskette: Tickets, bereinigte Logs, Runbooks, Eskalation
Ein lokaler Support-Workflow besteht aus fünf Schritten:
- Deterministische Bereinigung : Ein Skript ersetzt vor jedem Modellaufruf IP-Adressen, Hostnamen, Tokens und E-Mail-Adressen durch neutrale Identifikatoren. Die Zuordnungsliste bleibt außerhalb des Modells.
- Suche in den Runbooks : Die Verfahren werden aufgeteilt und indiziert, danach erhält das Modell ausschließlich die relevanten Abschnitte mit deren Referenz.
- Einstufung : das Modell gibt ein JSON mit Kategorie, Schweregrad, Ursachenhypothese und zitierten Quellen zurück.
- Eskalationsregel : jede Antwort ohne Quellenangabe, jeder Vorfall mit hohem Schweregrad und jede Aktion, die die Produktionsumgebung verändert, werden an einen Techniker weitergeleitet.
- Protokoll : Jeder Austausch wird mit der Modellversion, der Quantisierung, dem Prompt und den eingesetzten Abschnitten gespeichert.
Als Teamoberfläche Open WebUI verbindet sich mit einem lokalen Server. Der Leitfaden einen Teamchatbot im Intranet bereitstellen erläutert die Installation und Architektur eines lokalen Agenten behandelt den Aufruf von Tools.
FAQ
F: Laufen diese Modelle auf einem Techniker-PC?
Nein. Das kleinste Modell der Auswahl, Laguna S 2.1, benötigt etwa 68 GB in Q4, ohne den Speicherbedarf für den Kontext. Realistisch ist ein gemeinsam genutzter Server oder eine Workstation mit 96–128 GB Speicher, die das Team über das interne Netzwerk abfragt. Für weniger leistungsstarke Rechner schlägt der Konfigurator der Website Modelle vor, die zum verfügbaren Speicher passen.
F: Sollte das Modell mit unseren Tickets feinabgestimmt werden?
Nicht als Erstes. Die Suche in den Runbooks mit Quellenzitaten liefert bereits das Vokabular und die Verfahren des IT-Dienstleisters, ohne erneutes Training. Eine Feinabstimmung wird sinnvoll, wenn das Ausgabeformat instabil bleibt oder die Kategorisierung auf Ihrem Testdatensatz keine weiteren Fortschritte macht. Sie erfordert anonymisierte Daten und eine Prüfung der Modelllizenz.
F: Kann das Modell die Logs selbst bereinigen?
Das wird nicht empfohlen. Ein Modell kann in einem langen Auszug eine IP-Adresse oder einen Token übersehen. Die Bereinigung muss durch ein deterministisches, getestetes und versioniertes Skript erfolgen, das dem Modell vorgeschaltet ist. Das Modell arbeitet dann mit neutralen Kennungen, und die Zuordnung zu den tatsächlichen Werten verbleibt in einem separaten System.
F: Kann das Modell ein Ticket allein schließen?
Zu Beginn sollte man darauf besser verzichten. Das Modell schlägt eine Einordnung und einen Lösungsansatz vor, die anschließend von einem Techniker geprüft und freigegeben werden. Nach einigen Wochen der Auswertung können bestimmte Kategorien mit geringem Risiko automatisiert werden, beispielsweise Dokumentationsanfragen. Störungen im Produktivbetrieb und Aktionen mit erhöhten Berechtigungen bedürfen weiterhin einer menschlichen Freigabe.
Q: Welchen minimalen Kontext soll für die Log-Analyse angestrebt werden?
Streben Sie mindestens 64.000 Tokens an, wie sie Mixtral 8x22B Instruct bietet, und vorzugsweise 128.000 oder mehr, um Zusammenhänge zwischen mehreren Dateien herzustellen. Modelle mit 32.768 Tokens erfordern, dass die Auszüge in deutlich kleinere Abschnitte zerlegt werden. Ein großes Kontextfenster benötigt mehr Speicher und verlangsamt die Generierung: Filtern Sie die Logs vor dem Senden.
F: Deckt diese Auswahl auch den Kundenservice ab?
Nein. Sie richtet sich an den internen IT-Support eines IT-Dienstleistungsunternehmens: Störungen, Logs, Runbooks und Eskalation. Geschäftliche Kommunikation, Rückerstattungen und die Übersetzung von Gesprächen mit Endkunden unterliegen anderen Kriterien, insbesondere der mehrsprachigen Qualität. Diese Themen werden im Leitfaden zum mehrsprachigen Kundensupport mit einem lokalen LLM behandelt.
Fazit
Für eine lokale KI für den IT-Support bei einem IT-Dienstleister bilden Mistral Small 4 und Qwen 3.5 122B-A10B den sichersten Ausgangspunkt: Apache-2.0-Lizenz, Kontext von etwa 256.000 Tokens, 72 bis 73 GB in Q4. Durchsatz und Scores müssen noch auf Ihrer Hardware und anhand Ihrer eigenen Supporttickets bestätigt werden. Geben Sie Ihren verfügbaren Speicher im Konfigurator um die Kompatibilität zu prüfen, oder durchstöbern Sie den Katalog um Lizenzen und VRAM-Anforderungen zu vergleichen.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.