Bestes LLM für den Kundenservice im Einzelhandel und E-Commerce
Eine lokale E-Commerce-KI für den Kundenservice einzurichten bedeutet, einen LLM auf Ihren eigenen Rechnern zu betreiben, um Kunden eines Onlineshops zu antworten, ohne Katalog, Bestellungen oder Postanschriften an einen Drittanbieter zu senden. Das richtige Modell für diese lokale E-Commerce-KI ist weder das größte noch das in einem allgemeinen Benchmark bestplatzierte: Es ist dasjenige, das ein Produktdatenblatt korrekt liest, den richtigen Bestellstatus nennt, die Rückgaberichtlinie genau befolgt und an einen Menschen übergibt, wenn es nicht weiterweiß. Dieser Artikel erläutert die vier abzudeckenden Aufgaben, bietet eine Auswahl nach Hardwarestufe aus dem Katalog von WelchesLLM, beschreibt ein Evaluierungsprotokoll zur Verankerung der Antworten in den Daten und geht anschließend auf Lizenzen und Bereitstellung ein, bevor eine FAQ folgt.
Die vier Aufgaben eines LLM für den Kundenservice im E-Commerce
Der Umfang ist bewusst eng gefasst. Informationen zum mehrsprachigen Support finden Sie im spezieller Leitfaden zum mehrsprachigen Kundensupport mit lokalen Modellen und der interne IT-Support wird hier nicht behandelt. Es bleiben vier Funktionen, die das Anforderungsprofil bestimmen:
- Suche im Produktkatalog : Das Modell erhält über ein Suchsystem einen Katalogauszug (Produktdatenblätter, Lagerbestand, Varianten, Preise) und muss ausschließlich auf Grundlage dieses Auszugs antworten. Eine erfundene Kleidungsgröße oder eine erratene Kompatibilität eines Zubehörteils verursacht eine Retoure.
- Bestellstatus : Das Modell ruft ein Tool (eine Funktion) auf, das Ihre Bestelldatenbank abfragt und das Ergebnis umformuliert. Das Modell darf niemals eine Sendungsverfolgungsnummer oder ein Lieferdatum erzeugen, die nicht aus diesem Aufruf stammen.
- Rückgabepolitik und Rückerstattungsbedingungen : Der Text der Richtlinie wird im Kontext bereitgestellt. Das Modell muss die genauen Fristen und Bedingungen einschließlich der Ausschlüsse zitieren und darf „14 Tage“ nicht zu „etwa zwei Wochen“ runden.
- Eskalation an einen Menschen : Sobald eine Anfrage außerhalb des Zuständigkeitsbereichs liegt (Streitfall, Kulanzleistung, fehlende Daten), muss das Modell eine Antwort zur Übergabe und eine strukturierte Zusammenfassung für den menschlichen Mitarbeiter erstellen.
Die Fähigkeit, die den Unterschied zwischen den Modellen ausmacht, ist daher dieancrage : auf Grundlage der bereitgestellten Daten antworten und eine Antwort angemessen verweigern, wenn Informationen fehlen. Eine Beschreibung der empfohlenen Architektur (Dokumentenrecherche, Toolaufrufe, Ablehnungsregeln) finden Sie im Leitfaden für die Architektur eines lokalen Agenten.
Auswahl für einen Mac mit 128 GB und eine Workstation mit zwei GPUs (in Q4 zwischen 68 und 75 GB)
Diese Stufe entspricht einem Mac Studio mit 128 GB Unified Memory oder einer Workstation mit einer professionellen Grafikkarte mit 96 GB. Die folgenden Modelle nutzen Mixture-of-Experts-Architekturen (MoE): wenige aktive Parameter pro Token und damit trotz der Größe der Modellgewichte ein Durchsatz, der einen Chat in Echtzeit ermöglicht. Alle Durchsatzwerte sind Schätzungen, die aus der Anzahl der aktiven Parameter und der Speicherbandbreite abgeleitet wurden und auf Ihrem Rechner bestätigt werden müssen.
Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parameter : 122B insgesamt, etwa 10B pro Token aktiv - VRAM Q4 : ~73 GB; Q5 ~88 GB (geschätzt); Q8 ~130 GB (geschätzt); FP16 ~245 GB (geschätzt) - Kontext : 262.000 Tokens, mehr als ausreichend für vollständige Rückgaberichtlinien, einen Gesprächsverlauf und etwa zehn Produktbeschreibungen - Durchsatz : geschätzte 30 bis 45 Tokens/s auf einem Mac Studio M4 Max mit 128 GB in Q4; geschätzte 80 Tokens/s und mehr auf einer Karte mit 96 GB unter vLLM - Warum für E-Commerce : Die Qwen-Modellfamilie hält sich gut an Formatvorgaben und unterstützt Tool-Aufrufe zuverlässig, was beim Umgang mit dem Bestellstatus wichtig ist. Modellgewichte veröffentlicht von Alibaba auf Hugging Face.
Mistral Small 4 (Mistral, Apache 2.0) - Parameter : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (geschätzt); FP16 ~240 GB (geschätzt) - Kontext : 256 000 Tokens - Durchsatz : je nach Anzahl der aktiven Parameter der Architektur noch zu bestätigen; rechnen Sie mit einer vergleichbaren Größenordnung wie zuvor, wenn es sich um ein MoE-Modell handelt - Warum für E-Commerce : Qualität der französischen Texte für Kunden, Apache-2.0-Lizenz ohne kommerzielle Klausel. Modellgewichte veröffentlicht von Mistral auf Hugging Face.
Qwen3.8 Flash Next 125B-A6B (Qwen, Open-Weights-Lizenz, Bedingungen vor kommerzieller Nutzung prüfen) - Parameter : insgesamt 125B, etwa 6B aktiv - VRAM Q4 : ~72 GB; Q8 ~133 GB (geschätzt) - Kontext : 256 000 Tokens - Durchsatz : das schnellste Modell dieser Leistungsklasse, geschätzte 50 bis 70 Tokens/s auf einem Mac Studio mit 128 GB – Warum für E-Commerce : kurze Latenz für einen Chat mit hohem Anfrageaufkommen. Der Nachteil: weniger aktive Parameter, daher bei mehrdeutigen Fragen sorgfältig testen.
Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (geschätzt) - Kontext : 256 000 Tokens - Warum für E-Commerce : Alternative zu Mistral Small 4, wenn Sie bei Streitfällen etwas mehr Schlussfolgerungsfähigkeit wünschen, allerdings auf Kosten eines geringeren Durchsatzes (noch zu bestätigen).
Für die Auswahl des Rechners: Die Seite für Macs mit 128 GB listet die Modelle auf, die tatsächlich einschließlich Kontext in den Speicher passen.
Serverklasse: 140 GB und mehr
Wenn Sie einen Server mit mehreren Grafikkarten oder einen Rechner mit mindestens 192 GB haben, bieten drei Modelle einen Qualitätsvorsprung bei komplexen Fällen (mehrstufige Reklamationen, teilweise versandte Bestellungen).
- Qwen 3 235B-A22B (Alibaba, Apache 2.0): ~142 GB bei Q4, ~250 GB bei Q8 (geschätzt), 131.072 Tokens Kontext, etwa 22 Milliarden aktive Parameter. Eine verlässliche Wahl für sequenzielle Tool-Aufrufe.
- MiniMax-M2.7 (MiniMax, Apache 2.0): ~138 GB bei Q4, 205.000 Tokens Kontext. Auf Agenten ausgerichtet, sinnvoll, wenn der Kundenservice zuerst den Katalog durchsucht und anschließend ein Ticket aktualisiert.
- DeepSeek V4 Flash 284B (DeepSeek, MIT): ~170 GB in Q4, Kontext 1.000.000 Tokens. Der sehr lange Kontext ermöglicht es, einen ganzen Katalog mit mehreren Tausend Artikeln ohne vorherige Suche zu laden, allerdings steigt die Prefill-Latenz proportional an. Modellgewichte veröffentlicht von DeepSeek auf Hugging Face. Näheres zur Wahl zwischen Flash und Pro finden Sie im Vergleich DeepSeek V4 Pro vs Flash.
- GLM 5.3 Flash 320B-A18B (Zhipu, MIT): ~186 GB in Q4, 128.000 Tokens, 18B aktive Parameter. Modellgewichte veröffentlicht von Zhipu auf Hugging Face.
Die Modelle im Katalog mit einem Speicherbedarf von mehr als 400 GB (DeepSeek V4 Pro, Kimi K3, GLM 5.2) sind für den Einsatz in einem Shop nicht praktikabel und bieten bei so klar umrissenen Aufgaben keinen messbaren Vorteil.
Quellenbezug und Antwortverweigerung bewerten: das entscheidende Protokoll
Die öffentlichen Benchmarks (MMLU, HumanEval, AIME) messen Allgemeinwissen, Programmierfähigkeiten oder Mathematikkenntnisse. Keiner prüft: „Hat das Modell eine Rückgabefrist erfunden?“ Das Open LLM Leaderboard dient dazu, ein schwaches Modell auszuschließen, nicht dazu, eines für diesen Anwendungsfall auszuwählen. Erstellen Sie Ihr eigenes Testset – ein halber Tag reicht aus:
- 50 Fragen in drei Kategorien : 20, deren Antwort in den bereitgestellten Daten enthalten ist, 20, deren Antwort fehlt, 10 mehrdeutige Fragen (Produkt in zwei Varianten, Bestellung mit zwei Paketen).
- Identischer Kontext für alle Modelle : dieselben Produktdatenblätter, dieselben Rückgabebedingungen, dieselbe simulierte Ausgabe des Bestelltools.
- Drei Metriken : Genauigkeit bei den enthaltenen Fragen; Anteil korrekter Ablehnungen bei nicht enthaltenen Fragen („Ich habe diese Information nicht, ich leite Sie an einen Berater weiter“); Anteil erfundener Antworten, also selbstsicher formulierter Antworten ohne Grundlage im Kontext.
- Akzeptanzschwellwert : Eine Halluzinationsrate von über 2 % bei nicht enthaltenen Fragen disqualifiziert das Modell, unabhängig von seiner Qualität in anderen Bereichen. Ein Kunde, der einen falschen Liefertermin erhält, verursacht ein Supportticket, eine Reklamation und manchmal eine negative Bewertung.
- Systemprompt-Test : Fügen Sie die ausdrückliche Anweisung hinzu: „Wenn die Information nicht im Kontext enthalten ist, antworte, dass du es nicht weißt, und schlage eine Weiterleitung vor.“ Vergleichen Sie die Ergebnisse vorher und nachher. Die oben aufgeführten Modelle reagieren im Allgemeinen gut auf diese Anweisung, doch die Unterschiede zwischen ihnen zeigen sich vor allem bei mehrdeutigen Fragen.
Für die Ebene der Dokumentensuche: Der Leitfaden zu Firecrawl und lokalem RAG zeigt, wie der Katalogindex erstellt wird; der Leitfaden GraphRAG-Leitfaden behandelt Kataloge mit vielen Beziehungen zwischen Produkten.
Lizenzen und Kundendaten
Ein Kundenservice verarbeitet personenbezogene Daten: Name, Adresse, Kaufhistorie. Beim lokalen Betrieb entfällt die Übertragung an einen Auftragsverarbeiter, aber zwei Punkte müssen noch geregelt werden.
- Modelllizenz : Apache 2.0 (Qwen 3.5, Mistral Small 4, Qwen 3 235B, MiniMax-M2.7) und MIT (DeepSeek V4 Flash, GLM 5.3 Flash) erlauben die kommerzielle Nutzung ohne volumenabhängige Bedingungen. Bei der Modified-MIT-Lizenz von Mistral Medium 3.5 und der als „andere“ bezeichneten Lizenz von Qwen3.8 Flash Next muss der Lizenztext vor dem produktiven Einsatz gelesen werden. Die NVIDIA Open Model License von Nemotron 3 Super 120B enthält seine eigenen Klauseln.
- Protokollierung : Bewahren Sie die Gespräche zur Auswertung auf, aber mit einer festgelegten Aufbewahrungsfrist und pseudonymisierten Bestellkennungen. Der Leitfaden zu lokalen LLMs in Unternehmen und zur DSGVO beschreibt das Verzeichnis der Verarbeitungstätigkeiten im Detail.
Deployment: Engine, Interface, Latenzziel
- Inferenz-Engine : llama.cpp für einen Mac Studio oder eine Workstation für einen einzelnen Benutzer mit Modellen im GGUF-Format; vLLM sobald mehrere Clients parallel chatten, da die Stapelverarbeitung den Gesamtdurchsatz auf derselben Grafikkarte vervielfacht.
- Interface und Tools : Open WebUI bietet eine Testoberfläche und die Verwaltung von Tools (Funktionen), um Ihre Bestell-API anzubinden. Im Produktivbetrieb erfolgt die Integration eher in Ihr bestehendes Chat-Widget über die vom Ausführungsmodul bereitgestellte OpenAI-kompatible API.
- Einzuplanender Kontext : Rechnen Sie mit 8.000 bis 16.000 Tokens pro Gespräch (Rückgabebedingungen, 5 bis 10 Produktdatenblätter, Gesprächsverlauf). Auf einem Mac mit 128 GB und einem 73 GB großen Q4-Modell bleibt noch Spielraum für mehrere gleichzeitige Sitzungen.
- Ziellatenz : erster Token in weniger als 2 Sekunden, vollständige Antwort in weniger als 10 Sekunden. Die MoE-Modelle der 72-GB-Klasse erreichen dieses Ziel; dichte Modelle vergleichbarer Größe nicht.
Le Leitfaden zur Bereitstellung eines Team-Chatbots im Intranet erklärt die Inbetriebnahme Schritt für Schritt.
FAQ
Frage: Welches Modell sollte man für den Start mit einem Mac Studio 128 GB wählen?
Qwen 3.5 122B-A10B in Q4 (~73 GB) ist der ausgewogenste Ausgangspunkt: Apache-2.0-Lizenz, gute Tool-Aufrufe, geschätzter Durchsatz von 30 bis 45 Tokens/s. Wenn die Latenz wichtiger ist als die Feinheit der Antworten, ist Qwen3.8 Flash Next 125B-A6B schneller, sollte aber bei mehrdeutigen Fragen ausführlicher getestet werden. Führen Sie das Protokoll mit 50 Fragen mit beiden Modellen durch, bevor Sie sich entscheiden.
Q: Würde ein kleineres Modell als ein 100B-Modell für diesen Anwendungsfall ausreichen?
Oft ja bei der Katalogsuche und bei Bestellstatusabfragen, wo das Modell hauptsächlich bereitgestellte Daten umformuliert. Der Vorteil der Modelle dieser Stufe zeigt sich bei mehrdeutigen Fällen und Ablehnungen. Der Katalog filtert nach VRAM, um einen Vergleich mit weniger ressourcenintensiven Modellen zu ermöglichen; das Bewertungsprotokoll bleibt gleich.
F: Wie verhindert man, dass das Modell eine Lieferzeit erfindet?
Drei Ebenen: Der Status stammt immer aus einem Toolaufruf, niemals aus dem Gedächtnis des Modells; der Systemprompt schreibt „kein Datum ohne Toolergebnis“ vor; eine Regel auf Anwendungsebene blockiert jede Antwort, die ein Datum enthält, wenn kein Toolaufruf stattgefunden hat. Messen Sie anschließend den Anteil erfundener Antworten bei Ihren 20 Fragen ohne Antwort: Er muss unter 2 % bleiben.
F: Ist ein Kontextfenster von 1.000.000 Tokens erforderlich, um den gesamten Katalog zu laden?
Selten. Einen gesamten Katalog bei jeder Nachricht zu laden, vervielfacht die Prefill-Latenz und den Speicherbedarf des Caches. Eine Suche, die 5 bis 10 relevante Produktdatenblätter in einem Kontext von 8.000 bis 16.000 Tokens zurückliefert, liefert bessere Ergebnisse und eine schnellere Antwort. Der sehr lange Kontext von DeepSeek V4 Flash dient eher punktuellen Analysen.
F: Was ist der Unterschied zum Leitfaden zum mehrsprachigen Support?
Dieser Vergleich beschränkt sich auf transaktionale Aufgaben auf Französisch: Katalog, Bestellungen, Rücksendungen, Eskalation. Der Leitfaden für mehrsprachigen Kundensupport behandelt die Spracherkennung, die Übersetzung und die Testdatensätze für jede Sprache. Beides lässt sich kombinieren: Wählen Sie hier das Modell aus und ergänzen Sie anschließend die mehrsprachige Ebene, wenn Ihr Shop außerhalb des französischsprachigen Raums liefert.
F: Wie messe ich den tatsächlichen Durchsatz auf meinem Rechner?
Laden Sie das Modell in Q4 mit llama.cpp oder vLLM, senden Sie zehnmal dieselbe typische Konversation mit 8.000 Kontexttokens und erfassen Sie die Tokens/s bei der Generierung sowie die Zeit bis zum ersten Token. Die Zahlen in diesem Artikel sind Schätzungen; Ihre Werte hängen von der Speicherbandbreite, der Quantisierung und der Anzahl gleichzeitiger Sitzungen ab. Die Seite mit Benchmark-Werten für lokale Modelle beschreibt eine reproduzierbare Methode.
Fazit
Eine lokal betriebene KI für den Kundenservice im Handel wird anhand ihrer Verankerung in den bereitgestellten Informationen und ihrer Fähigkeit, Antworten zu verweigern, beurteilt, nicht anhand eines MMLU-Scores. Auf einem Mac mit 128 GB oder einer Workstation mit 96 GB decken Qwen 3.5 122B-A10B und Mistral Small 4 Katalog, Bestellungen, Rückgaben und Eskalation unter einer Apache-2.0-Lizenz ab. Bei mehr als 140 GB bieten Qwen 3 235B-A22B und MiniMax-M2.7 zusätzlichen Spielraum für komplexe Fälle. Prüfen Sie die Kompatibilität mit Ihrer Hardware im Konfigurator, und validieren Sie anschließend das ausgewählte Modell mit Ihren eigenen 50 Fragen.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.