Bestes LLM für den Kundenservice im Einzelhandel und E-Commerce

Eine lokale E-Commerce-KI für den Kundenservice einzurichten bedeutet, einen LLM auf Ihren eigenen Rechnern zu betreiben, um Kunden eines Onlineshops zu antworten, ohne Katalog, Bestellungen oder Postanschriften an einen Drittanbieter zu senden. Das richtige Modell für diese lokale E-Commerce-KI ist weder das größte noch das in einem allgemeinen Benchmark bestplatzierte: Es ist dasjenige, das ein Produktdatenblatt korrekt liest, den richtigen Bestellstatus nennt, die Rückgaberichtlinie genau befolgt und an einen Menschen übergibt, wenn es nicht weiterweiß. Dieser Artikel erläutert die vier abzudeckenden Aufgaben, bietet eine Auswahl nach Hardwarestufe aus dem Katalog von WelchesLLM, beschreibt ein Evaluierungsprotokoll zur Verankerung der Antworten in den Daten und geht anschließend auf Lizenzen und Bereitstellung ein, bevor eine FAQ folgt.

Die vier Aufgaben eines LLM für den Kundenservice im E-Commerce

Der Umfang ist bewusst eng gefasst. Informationen zum mehrsprachigen Support finden Sie im spezieller Leitfaden zum mehrsprachigen Kundensupport mit lokalen Modellen und der interne IT-Support wird hier nicht behandelt. Es bleiben vier Funktionen, die das Anforderungsprofil bestimmen:

Die Fähigkeit, die den Unterschied zwischen den Modellen ausmacht, ist daher dieancrage : auf Grundlage der bereitgestellten Daten antworten und eine Antwort angemessen verweigern, wenn Informationen fehlen. Eine Beschreibung der empfohlenen Architektur (Dokumentenrecherche, Toolaufrufe, Ablehnungsregeln) finden Sie im Leitfaden für die Architektur eines lokalen Agenten.

Auswahl für einen Mac mit 128 GB und eine Workstation mit zwei GPUs (in Q4 zwischen 68 und 75 GB)

Diese Stufe entspricht einem Mac Studio mit 128 GB Unified Memory oder einer Workstation mit einer professionellen Grafikkarte mit 96 GB. Die folgenden Modelle nutzen Mixture-of-Experts-Architekturen (MoE): wenige aktive Parameter pro Token und damit trotz der Größe der Modellgewichte ein Durchsatz, der einen Chat in Echtzeit ermöglicht. Alle Durchsatzwerte sind Schätzungen, die aus der Anzahl der aktiven Parameter und der Speicherbandbreite abgeleitet wurden und auf Ihrem Rechner bestätigt werden müssen.

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parameter : 122B insgesamt, etwa 10B pro Token aktiv - VRAM Q4 : ~73 GB; Q5 ~88 GB (geschätzt); Q8 ~130 GB (geschätzt); FP16 ~245 GB (geschätzt) - Kontext : 262.000 Tokens, mehr als ausreichend für vollständige Rückgaberichtlinien, einen Gesprächsverlauf und etwa zehn Produktbeschreibungen - Durchsatz : geschätzte 30 bis 45 Tokens/s auf einem Mac Studio M4 Max mit 128 GB in Q4; geschätzte 80 Tokens/s und mehr auf einer Karte mit 96 GB unter vLLM - Warum für E-Commerce : Die Qwen-Modellfamilie hält sich gut an Formatvorgaben und unterstützt Tool-Aufrufe zuverlässig, was beim Umgang mit dem Bestellstatus wichtig ist. Modellgewichte veröffentlicht von Alibaba auf Hugging Face.

Mistral Small 4 (Mistral, Apache 2.0) - Parameter : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (geschätzt); FP16 ~240 GB (geschätzt) - Kontext : 256 000 Tokens - Durchsatz : je nach Anzahl der aktiven Parameter der Architektur noch zu bestätigen; rechnen Sie mit einer vergleichbaren Größenordnung wie zuvor, wenn es sich um ein MoE-Modell handelt - Warum für E-Commerce : Qualität der französischen Texte für Kunden, Apache-2.0-Lizenz ohne kommerzielle Klausel. Modellgewichte veröffentlicht von Mistral auf Hugging Face.

Qwen3.8 Flash Next 125B-A6B (Qwen, Open-Weights-Lizenz, Bedingungen vor kommerzieller Nutzung prüfen) - Parameter : insgesamt 125B, etwa 6B aktiv - VRAM Q4 : ~72 GB; Q8 ~133 GB (geschätzt) - Kontext : 256 000 Tokens - Durchsatz : das schnellste Modell dieser Leistungsklasse, geschätzte 50 bis 70 Tokens/s auf einem Mac Studio mit 128 GB – Warum für E-Commerce : kurze Latenz für einen Chat mit hohem Anfrageaufkommen. Der Nachteil: weniger aktive Parameter, daher bei mehrdeutigen Fragen sorgfältig testen.

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (geschätzt) - Kontext : 256 000 Tokens - Warum für E-Commerce : Alternative zu Mistral Small 4, wenn Sie bei Streitfällen etwas mehr Schlussfolgerungsfähigkeit wünschen, allerdings auf Kosten eines geringeren Durchsatzes (noch zu bestätigen).

Für die Auswahl des Rechners: Die Seite für Macs mit 128 GB listet die Modelle auf, die tatsächlich einschließlich Kontext in den Speicher passen.

Serverklasse: 140 GB und mehr

Wenn Sie einen Server mit mehreren Grafikkarten oder einen Rechner mit mindestens 192 GB haben, bieten drei Modelle einen Qualitätsvorsprung bei komplexen Fällen (mehrstufige Reklamationen, teilweise versandte Bestellungen).

Die Modelle im Katalog mit einem Speicherbedarf von mehr als 400 GB (DeepSeek V4 Pro, Kimi K3, GLM 5.2) sind für den Einsatz in einem Shop nicht praktikabel und bieten bei so klar umrissenen Aufgaben keinen messbaren Vorteil.

Quellenbezug und Antwortverweigerung bewerten: das entscheidende Protokoll

Die öffentlichen Benchmarks (MMLU, HumanEval, AIME) messen Allgemeinwissen, Programmierfähigkeiten oder Mathematikkenntnisse. Keiner prüft: „Hat das Modell eine Rückgabefrist erfunden?“ Das Open LLM Leaderboard dient dazu, ein schwaches Modell auszuschließen, nicht dazu, eines für diesen Anwendungsfall auszuwählen. Erstellen Sie Ihr eigenes Testset – ein halber Tag reicht aus:

Für die Ebene der Dokumentensuche: Der Leitfaden zu Firecrawl und lokalem RAG zeigt, wie der Katalogindex erstellt wird; der Leitfaden GraphRAG-Leitfaden behandelt Kataloge mit vielen Beziehungen zwischen Produkten.

Lizenzen und Kundendaten

Ein Kundenservice verarbeitet personenbezogene Daten: Name, Adresse, Kaufhistorie. Beim lokalen Betrieb entfällt die Übertragung an einen Auftragsverarbeiter, aber zwei Punkte müssen noch geregelt werden.

Deployment: Engine, Interface, Latenzziel

Le Leitfaden zur Bereitstellung eines Team-Chatbots im Intranet erklärt die Inbetriebnahme Schritt für Schritt.

FAQ

Frage: Welches Modell sollte man für den Start mit einem Mac Studio 128 GB wählen?

Qwen 3.5 122B-A10B in Q4 (~73 GB) ist der ausgewogenste Ausgangspunkt: Apache-2.0-Lizenz, gute Tool-Aufrufe, geschätzter Durchsatz von 30 bis 45 Tokens/s. Wenn die Latenz wichtiger ist als die Feinheit der Antworten, ist Qwen3.8 Flash Next 125B-A6B schneller, sollte aber bei mehrdeutigen Fragen ausführlicher getestet werden. Führen Sie das Protokoll mit 50 Fragen mit beiden Modellen durch, bevor Sie sich entscheiden.

Q: Würde ein kleineres Modell als ein 100B-Modell für diesen Anwendungsfall ausreichen?

Oft ja bei der Katalogsuche und bei Bestellstatusabfragen, wo das Modell hauptsächlich bereitgestellte Daten umformuliert. Der Vorteil der Modelle dieser Stufe zeigt sich bei mehrdeutigen Fällen und Ablehnungen. Der Katalog filtert nach VRAM, um einen Vergleich mit weniger ressourcenintensiven Modellen zu ermöglichen; das Bewertungsprotokoll bleibt gleich.

F: Wie verhindert man, dass das Modell eine Lieferzeit erfindet?

Drei Ebenen: Der Status stammt immer aus einem Toolaufruf, niemals aus dem Gedächtnis des Modells; der Systemprompt schreibt „kein Datum ohne Toolergebnis“ vor; eine Regel auf Anwendungsebene blockiert jede Antwort, die ein Datum enthält, wenn kein Toolaufruf stattgefunden hat. Messen Sie anschließend den Anteil erfundener Antworten bei Ihren 20 Fragen ohne Antwort: Er muss unter 2 % bleiben.

F: Ist ein Kontextfenster von 1.000.000 Tokens erforderlich, um den gesamten Katalog zu laden?

Selten. Einen gesamten Katalog bei jeder Nachricht zu laden, vervielfacht die Prefill-Latenz und den Speicherbedarf des Caches. Eine Suche, die 5 bis 10 relevante Produktdatenblätter in einem Kontext von 8.000 bis 16.000 Tokens zurückliefert, liefert bessere Ergebnisse und eine schnellere Antwort. Der sehr lange Kontext von DeepSeek V4 Flash dient eher punktuellen Analysen.

F: Was ist der Unterschied zum Leitfaden zum mehrsprachigen Support?

Dieser Vergleich beschränkt sich auf transaktionale Aufgaben auf Französisch: Katalog, Bestellungen, Rücksendungen, Eskalation. Der Leitfaden für mehrsprachigen Kundensupport behandelt die Spracherkennung, die Übersetzung und die Testdatensätze für jede Sprache. Beides lässt sich kombinieren: Wählen Sie hier das Modell aus und ergänzen Sie anschließend die mehrsprachige Ebene, wenn Ihr Shop außerhalb des französischsprachigen Raums liefert.

F: Wie messe ich den tatsächlichen Durchsatz auf meinem Rechner?

Laden Sie das Modell in Q4 mit llama.cpp oder vLLM, senden Sie zehnmal dieselbe typische Konversation mit 8.000 Kontexttokens und erfassen Sie die Tokens/s bei der Generierung sowie die Zeit bis zum ersten Token. Die Zahlen in diesem Artikel sind Schätzungen; Ihre Werte hängen von der Speicherbandbreite, der Quantisierung und der Anzahl gleichzeitiger Sitzungen ab. Die Seite mit Benchmark-Werten für lokale Modelle beschreibt eine reproduzierbare Methode.

Fazit

Eine lokal betriebene KI für den Kundenservice im Handel wird anhand ihrer Verankerung in den bereitgestellten Informationen und ihrer Fähigkeit, Antworten zu verweigern, beurteilt, nicht anhand eines MMLU-Scores. Auf einem Mac mit 128 GB oder einer Workstation mit 96 GB decken Qwen 3.5 122B-A10B und Mistral Small 4 Katalog, Bestellungen, Rückgaben und Eskalation unter einer Apache-2.0-Lizenz ab. Bei mehr als 140 GB bieten Qwen 3 235B-A22B und MiniMax-M2.7 zusätzlichen Spielraum für komplexe Fälle. Prüfen Sie die Kompatibilität mit Ihrer Hardware im Konfigurator, und validieren Sie anschließend das ausgewählte Modell mit Ihren eigenen 50 Fragen.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Amazon RTX 5070 Ti →

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.