Mittelstufe 16 Min.Support

Mehrsprachiger Kundensupport mit lokalem LLM: 6 Sprachen ohne cloud

Sie betreuen einen Kundenservice, der Tickets in Französisch, Englisch, Spanisch, Deutsch, Italienisch und Arabisch erhält. Jeden Nachrichten an eine Cloud-API zu senden, bedeutet, E-Mail-Adressen, Bestellnummern und manchmal personenbezogene Daten an Dritte zu übermitteln – und Token zu bezahlen. Dieser Leitfaden zeigt einen multilingualen Kundenservice-Chatbot mit 100 % Lokalität auf, mit Qwen 3.8 27B, automatischer Spracherkennung, einem passenden Ton für jede Kultur und direkter Integration in Zendesk oder Freshdesk über Webhook.

Von Marie L.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein lokales LLM für mehrsprachigen Support?

Cloud-APIs (GPT-4o, Claude, Gemini) rechnen pro Token ab und erfordern eine Übertragung der Kundennachrichten außerhalb der EU. Bei einem B2C-Kundensupport, der täglich 5.000 Tickets bearbeitet, übersteigt die monatliche Rechnung schnell 1.500 €, und die Einhaltung der DSGVO wird zu einem Balanceakt, sobald ein Kunde eine IBAN oder eine Sozialversicherungsnummer im Tickettext sendet.

Ein lokales LLM löst beide Probleme auf einmal. Qwen 3.8 27B (Alibaba, veröffentlicht am 14. August 2026) unterstützt von Haus aus mehr als 100 Sprachen, beherrscht die sechs europäischen Sprachen aus dem Briefing mit einer Qualität, die mit Cloud-Modellen der Einstiegsklasse mithalten kann, und läuft auf einer einzigen RTX 4090 oder einem Mac M4 Max. Grenzkosten pro Ticket: null.

i
Warum genau Qwen 3.8 27B?
Es ist Alibabas führendes Allzweckmodell für 2026: ein Kontextfenster von 262.000 Tokens, Bildverarbeitung und die Apache-2.0-Lizenz (freie kommerzielle Nutzung). Im Support ermöglicht dieses riesige Kontextfenster, den gesamten Verlauf eines Tickets einzubinden, ohne ihn zu kürzen. Die mehrsprachige Qualität bleibt die beste in seiner Größenklasse (18 GB in Q4, passt auf eine Grafikkarte mit 24 GB). Eine wichtige Einstellung: Setzen Sie den Reasoning-Aufwand auf „low“. Standardmäßig denkt das Modell zu lange nach, wodurch sich die Latenz bei Supportantworten unnötig erhöht.

#Voraussetzungen

Das Kit für lokale KI in Unternehmen

Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
GPU mit mindestens 24 GB VRAM
RTX 3090, 4090, 5090 oder Mac M3/M4 Max mit 32 GB gemeinsamem Arbeitsspeicher. Qwen 3.8 27B in Q4_K_M beansprucht etwa 18 GB.
Ollama installiert
Aktuelle Version für die native Unterstützung von Qwen 3.8 (Bildverarbeitung und langer Kontext).
Ein Zendesk- oder Freshdesk-Konto
Mit den Administratorrechten zum Erstellen einer Webhook-Integration und eines Triggers.
Ein über HTTPS erreichbarer Endpoint
Entweder ein VPS, der als Reverse-Proxy Anfragen an Ihre Ollama-Instanz weiterleitet, oder ngrok / Cloudflare Tunnel, um den lokalen Server von außen erreichbar zu machen.
Python 3.11+
Für die Spracherkennungsschicht und den Webhook-Router. FastAPI + langdetect reichen aus.

#1. Qwen 3.8 27B mit Ollama installieren

Das Modell ist direkt in der Ollama-Bibliothek verfügbar. Starten Sie den Download und einen kurzen Test:

Terminal
ollama pull qwen3.8:27b
ollama run qwen3.8:27b "Réponds en une phrase : qu'est-ce qu'un LLM open-weight ?"

Der Pull lädt etwa 18 GB herunter. Auf einer RTX 4090 läuft die Inferenz in Q4 mit 40–60 Tokens pro Sekunde – genug, um eine Supportantwort in 3 bis 5 Sekunden zu generieren. Wenn der Reasoning-Aufwand auf „low“ eingestellt ist, sinkt die Latenz weiter.

→
Mehrsprachigkeit sofort testen
Stellen Sie mit ollama run dieselbe Frage nacheinander in 6 Sprachen. Qwen 3.8 wechselt nicht unbemerkt zwischen den Sprachen, anders als ältere Llama-Generationen, die manchmal ins Englische abglitten. Genau das ist für den Kundensupport erwünscht.

Stellen Sie Ollama im Netzwerk bereit, damit Ihr Webhook darauf zugreifen kann:

systemd-Überschreibung
sudo systemctl edit ollama
# Ajoutez :
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=30m"

sudo systemctl restart ollama

OLLAMA_KEEP_ALIVE=30m hält das Modell nach der letzten Anfrage noch 30 Minuten im VRAM. So wird in Zeiten geringer Auslastung ein Kaltstart bei jedem Ticket vermieden.

#2. Automatische Spracherkennung

Bevor eine Nachricht an Qwen3 gesendet wird, wird ihre Sprache erkannt, um den passenden System-Prompt auszuwählen. Die Bibliothek fast-langdetect (basierend auf fastText von Meta) erkennt 176 Sprachen in weniger als 5 ms pro Anfrage mit einer Genauigkeit von über 99 % bei Nachrichten mit mehr als 50 Zeichen.

Installation
pip install fast-langdetect fastapi uvicorn httpx
detector.py
from fast_langdetect import detect

SUPPORTED = {"fr", "en", "es", "de", "it", "ar"}

def detect_language(text: str) -> str:
    text = text.replace("\n", " ").strip()
    if len(text) < 10:
        return "en"  # message trop court, fallback raisonnable
    result = detect(text, low_memory=False)
    lang = result["lang"]
    return lang if lang in SUPPORTED else "en"
!
Stolperfalle: Nachrichten mit gemischten Sprachen
Ein französischer Kunde, der eine englische Fehlermeldung einfügt, kann die Spracherkennung auf Englisch umschalten lassen. Erkennen Sie die Sprache nur anhand des ersten Absatzes (vor der ersten Leerzeile), nicht anhand der gesamten Nachricht. Sonst antworten Sie einem französischsprachigen Kunden auf Englisch.

#3. System-Prompts für jede Sprache und ein angepasster Ton

Guter mehrsprachiger Kundensupport übersetzt einen französischen Prompt nicht ins Englische – er passt das Sprachregister an. Im beruflichen Französisch wird gesiezt, im Geschäftsenglisch bleibt der Ton direkter, im Deutschen wird deutlich formelle Höflichkeit erwartet, im lateinamerikanischen Spanisch darf der Ton herzlicher sein, im Italienischen ist er ausdrucksstärker, und im Arabischen sind Höflichkeitsformeln am Anfang und Ende der Nachricht erforderlich.

prompts.py
SYSTEM_PROMPTS = {
    "fr": (
        "Tu es un agent de support client professionnel. "
        "Réponds en français, avec vouvoiement systématique. "
        "Sois concis, empathique, factuel. Ne promets jamais de remboursement "
        "sans validation. Si tu ne sais pas, propose une escalade humaine."
    ),
    "en": (
        "You are a professional customer support agent. "
        "Reply in English, business-friendly tone, direct and concise. "
        "Never commit to a refund without confirmation. "
        "Escalate to a human if uncertain."
    ),
    "es": (
        "Eres un agente de soporte profesional. Responde en español, "
        "trato de usted, tono cálido pero conciso. Nunca prometas reembolsos "
        "sin confirmación. Escala a un humano en caso de duda."
    ),
    "de": (
        "Du bist ein professioneller Kundensupport-Agent. Antworte auf Deutsch "
        "mit Sie-Form, höflich-formell, präzise und sachlich. Versprich nie eine "
        "Rückerstattung ohne Bestätigung. Eskaliere im Zweifel an einen Menschen."
    ),
    "it": (
        "Sei un agente di assistenza clienti professionale. Rispondi in italiano, "
        "forma di cortesia (Lei), tono cordiale e conciso. Mai promettere rimborsi "
        "senza conferma. Scala a un umano in caso di dubbio."
    ),
    "ar": (
        "أنت موظف دعم عملاء محترف. أجب باللغة العربية الفصحى، "
        "بأسلوب رسمي ومهذب يبدأ بتحية وينتهي بعبارة لطيفة. "
        "لا تعد بأي استرداد دون تأكيد. إذا لم تكن متأكدًا، اطلب تدخل موظف بشري."
    ),
}
→
Fachliche Leitplanken im Prompt
Die drei Zeilen „Versprich niemals eine Rückerstattung“, „Eskaliere den Fall, wenn du die Antwort nicht weißt“ und „Gewähre keinen Rabatt“ sind die einzigen, die verhindern, dass ein LLM im Kundensupport echten Schaden anrichtet. Nehmen Sie sie in allen Sprachen auf. Der Ton ändert sich, die Geschäftsregeln nicht.

#4. Einen Zendesk- oder Freshdesk-Webhook integrieren

Zendesk und Freshdesk lösen bei jedem neuen Ticket einen HTTP-POST-Webhook aus. Dazu stellen wir einen FastAPI-Endpunkt bereit, der die Sprache erkennt, den Prompt auswählt, Ollama aufruft und die Antwort an die Support-API zurücksendet, damit sie als interner Kommentar hinzugefügt wird (der menschliche Supportmitarbeiter gibt sie vor dem Versand frei).

webhook_server.py
from fastapi import FastAPI, Request
import httpx
from detector import detect_language
from prompts import SYSTEM_PROMPTS

app = FastAPI()
OLLAMA_URL = "http://localhost:11434/api/chat"

@app.post("/webhook/zendesk")
async def handle_ticket(req: Request):
    payload = await req.json()
    ticket_id = payload["ticket"]["id"]
    message = payload["ticket"]["description"]

    lang = detect_language(message)
    system = SYSTEM_PROMPTS[lang]

    async with httpx.AsyncClient(timeout=60) as client:
        r = await client.post(OLLAMA_URL, json={
            "model": "qwen3.8:27b",
            "messages": [
                {"role": "system", "content": system},
                {"role": "user", "content": message},
            ],
            "stream": False,
            "options": {"temperature": 0.3, "num_ctx": 8192},
        })
    draft = r.json()["message"]["content"]

    # Ajoute la réponse en note interne sur le ticket
    await post_internal_note(ticket_id, lang, draft)
    return {"status": "ok", "lang": lang}

Die Funktion post_internal_note sendet den Entwurf als privaten Kommentar über die Zendesk-API (PUT /api/v2/tickets/{id}.json) oder die Freshdesk-API (POST /api/v2/tickets/{id}/notes). Der menschliche Agent liest ihn noch einmal, passt ihn an und klickt auf "Senden". Sie sparen etwa 60 % der Schreibzeit, ohne den Bot jemals allein antworten zu lassen.

  1. 01
    Endpoint veröffentlichen
    Cloudflare Tunnel oder ngrok verweist auf http://localhost:8000. Notieren Sie die öffentliche HTTPS-URL.
  2. 02
    Webhook-Ziel erstellen
    Erstellen Sie in Zendesk Admin → Apps & Integrations → Webhooks ein Ziel mit Ihrer URL und der Methode POST.
  3. 03
    Einen Trigger anschließen
    In Triggers die Bedingung "Ticket Created" und die Aktion "Notify webhook" mit einem JSON-Payload verwenden, der {ticket: {id, description, requester}} enthält.
  4. 04
    Mit einem fiktiven Ticket testen
    Erstellen Sie ein Ticket auf Deutsch. Der Endpoint muss das Event empfangen, „de“ erkennen und einen Entwurf auf Deutsch in den internen Notizen veröffentlichen.
  5. 05
    Schrittweise im Produktivbetrieb aktivieren
    Beginnen Sie mit einer einzigen Warteschlange (zum Beispiel der spanischsprachigen). Messen Sie eine Woche lang die Qualität. Erweitern Sie den Einsatz Warteschlange für Warteschlange.
!
Antworten Sie dem Kunden niemals direkt
Das LLM schreibt, der Mensch validiert. Das ist die Regel. Ein Qwen 3.8, der eine Bestellnummer halluziniert oder eine Erstattungsrichtlinie erfindet, endet als 1-Sterne-Bewertung auf Trustpilot. Solange Sie keine 6 Monate Qualitätsmessung pro Sprache haben, bleiben Sie im Entwurfsmodus.

#5. Die Qualität pro Sprache messen

Qwen 3.8 liefert in den sechs Sprachen nicht dieselbe Qualität. Französisch und Englisch sind hervorragend, Spanisch und Italienisch sehr gut, Deutsch ordentlich; bei Arabisch variiert die Qualität je nach Dialekt (Modernes Hocharabisch, MSA, funktioniert gut, maghrebinische Dialekte weniger gut). Für eine gezielte Steuerung muss die Qualität gemessen werden.

Drei Indikatoren zur Protokollierung pro Sprache ab dem ersten Tag:

Validierungsrate ohne Bearbeitung
Anteil der Entwürfe, die der Agent unverändert versendet. Dies ist der einfachste und aussagekräftigste Indikator. Ziel: 40–60 % nach 3 Monaten.
Bearbeitungsrate (geänderte Wörter / generierte Wörter)
Messen Sie den Anteil der Änderungen mit einem Diff zwischen der endgültigen Antwort und dem Entwurf. Wenn dieser Anteil in einer Sprache über 30 % liegt, muss der Prompt überarbeitet werden.
CSAT nach Sprache
Die Zufriedenheitsumfrage nach der Problemlösung, ausgewertet nach der Sprache des Tickets. Wenn die Bewertung für Deutsch auf 3,5/5 fällt, während sie für Französisch bei 4,5 bleibt, haben Sie ein Problem mit dem Tonfall.
i
Konkretes Beispiel für eine Anpassung
Bei einem realen Einsatz bei einem französischen E-Commerce-Unternehmen, das nach Deutschland expandiert hatte, stagnierte die Validierungsrate für Deutsch bei 18 %. Die ermittelte Ursache: Im wörtlich übersetzten Prompt stand „sei empathisch“. Im deutschen Geschäftskontext klingt „empathisch“ nach einem Therapeuten. Ersetzt durch „verbindlich und lösungsorientiert“ (entgegenkommend und auf Lösungen ausgerichtet) → 45 % innerhalb von zwei Wochen.

#Häufige Fallstricke

Der Bot antwortet in der falschen Sprache
Es handelt sich fast immer um eine gemischtsprachige Nachricht (englische Signatur unter einem französischen Ticket). Erkennen Sie die Sprache anhand des ersten Absatzes oder erzwingen Sie die Sprache des Entwurfs mit der ausdrücklichen Anweisung "Reply in {lang}" zusätzlich zum System-Prompt.
Latenz > 10 Sekunden
Prüfen Sie, ob OLLAMA_KEEP_ALIVE aktiv ist und das Modell im VRAM geladen bleibt. ollama ps muss 100 % GPU anzeigen. Falls nicht, senken Sie num_ctx für kurze Tickets auf 4096.
Fehlerhaft formatierte arabische Antworten (RTL)
Qwen3 erzeugt gute arabische Texte, aber einige Support-Oberflächen zeigen sie nicht automatisch von rechts nach links (RTL) an. Fügen Sie dem Antwortblock in Zendesk/Freshdesk dir="rtl" lang="ar" hinzu.
Halluzination nicht existierender Rabattaktionen
Senken Sie die Temperatur auf 0,2 und geben Sie im Prompt an: „Erwähne keine Werbeaktionen oder Rabattcodes, sofern sie nicht im Ticket enthalten sind.“ Das LLM bietet gern Geschenke an, die es gar nicht gibt.
Webhook, der mehrmals wiederholt wird
Zendesk kann den Vorgang bei einem Timeout erneut versuchen. Speichern Sie ticket_id in Redis mit einer TTL von 10 Minuten, um Idempotenz sicherzustellen – andernfalls erzeugen Sie 3 Entwürfe für dasselbe Ticket.

#Weiterführende Informationen

Sobald die Basis stabil ist, erhöhen zwei Erweiterungen die Validierungsquote deutlich: ein lokales RAG an Ihre Wissensbasis (FAQ, Rückgaberichtlinien, Garantiebedingungen) anbinden, um die Antworten auf Fakten zu stützen, und eine LoRA-Fine-Tuning-Schicht auf Basis einiger Tausend gelöster Tickets ergänzen, um den unternehmenseigenen Ton zu treffen. Für den Produktivbetrieb an mehreren Arbeitsplätzen deckt eine Bereitstellung im Intranet hinter Nginx die Netzwerk- und Authentifizierungsaspekte ab.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.