Chinesische LLMs lokal: Qwen, DeepSeek, GLM, Kimi
Wenn Sie 2026 ein Open-Weight-LLM herunterladen, um es bei sich zu Hause auszuführen, stammt es mit hoher Wahrscheinlichkeit aus China. Qwen, DeepSeek, GLM, Kimi: Diese Modellfamilien dominieren die Spitzenplätze der Ranglisten offener Modelle, häufig unter permissiveren Lizenzen als denen westlicher Labore. Dieser Überblick ordnet ein, was jede Familie leistet, was ihre Lizenzen tatsächlich besagen und warum die lokale Ausführung eines chinesischen LLM die Frage der Vertraulichkeit bereits im Vorfeld beantwortet.
#Warum chinesische LLMs den Open-Weight-Bereich dominieren
Die Landschaft der offenen Modelle hat sich grundlegend verändert. Während Meta (Llama) vor zwei Jahren an der Spitze lag, veröffentlichen heute chinesische Labore die leistungsfähigsten Modellgewichte und bringen am häufigsten neue heraus. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) und Moonshot (Kimi) veröffentlichen in hohem Tempo Modelle, vom kleinen 3B-Modell bis zu MoE-Modellen mit mehreren Hundert Milliarden Parametern.
Der Grund ist ebenso strategisch wie technisch: Die Veröffentlichung der Modellgewichte als Open Weights ermöglicht es ihnen, weltweit sichtbarer zu werden, die Community anzuziehen und sich als De-facto-Standards zu etablieren, auch gegenüber geschlossenen US-amerikanischen Modellen. Für Sie als Nutzer lokaler Modelle ist das Ergebnis einfach: eine riesige Auswahl kostenloser Modelle, die regelmäßig aktualisiert werden und beim Programmieren, beim logischen Schlussfolgern und bei der Mehrsprachigkeit oft mit Cloud-Modellen gleichauf liegen.
#Der lokale Betrieb löst die Frage der Vertraulichkeit
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Das ist der reflexartige Einwand: „Ein chinesisches LLM – meine Daten gehen nach China.“ Das trifft auf Cloud-APIs zu (chat.qwen.ai, die DeepSeek-App, die Zhipu-Plattform): Dort laufen Ihre Prompts tatsächlich über entfernte Server, die chinesischem Recht unterliegen. Dieser Leitfaden behandelt jedoch den lokalen Betrieb, und beim lokalen Betrieb ist diese Sorge schlicht gegenstandslos.
Wenn Sie das Modell mit Ollama oder LM Studio starten, laden Sie eine Datei mit unveränderlichen Modellgewichten herunter (zum Beispiel eine GGUF-Datei), und Ihre GPU berechnet die Antworten. Das Modell hat keinerlei Netzwerkfunktionen: Es ist keine Software, die „nach Hause telefoniert“, sondern eine große Matrix aus Zahlen. Nichts verlässt Ihren Rechner, unabhängig von der Herkunft des Modells.
- In der Cloud (API)
- Ihre Prompts werden an den Anbieter gesendet. Die Herkunft des Modells und die geltende Rechtsordnung sind wirklich wichtig.
- Lokal
- Das Modell läuft mit seinen Gewichten auf Ihrer Hardware, auf Wunsch auch offline. Keine Daten verlassen den Rechner.
- Das tatsächliche Restrisiko
- Eine Verzerrung oder Zensur in den Antworten des Modells (bei bestimmten sensiblen Themen), kein Datenleck. Es geht um die Qualität der Ausgabe, nicht um die Privatsphäre.
#Die tatsächlichen Lizenzen: Apache 2.0 und MIT
Ein weiteres Vorurteil: „Chinesische Lizenzen sind undurchsichtig oder voller Fallstricke.“ Die Realität im Jahr 2026 ist das Gegenteil – oft gehören sie zu den saubersten Lizenzen auf dem Markt. Die Mehrheit der Modelle in diesem Überblick wird unter Apache 2.0 oder MIT veröffentlicht, zwei international gebräuchlichen permissiven Lizenzen, die auch eine kommerzielle Nutzung erlauben.
- Qwen
- Die meisten neueren Varianten (u. a. Qwen3.8-27B) sind unter Apache 2.0 lizenziert — kommerzielle Nutzung erlaubt, Weiterverteilung zulässig.
- DeepSeek
- Die Modelle V3/V4 und R1 sind unter der MIT-Lizenz veröffentlicht, einer der freizügigsten Lizenzen überhaupt.
- GLM (Zhipu)
- Die neuesten Generationen, darunter GLM-5.2, sind zur MIT-Lizenz gewechselt.
- Kimi (Moonshot)
- Offene Gewichte unter einer permissiven Lizenz vom Typ MIT/Apache, je nach Version.
#Qwen (Alibaba) : das Allround-Tool
Qwen ist die umfassendste und vielseitigste Modellfamilie im Ökosystem. Alibaba bietet das Modell in allen Größen an, vom 3B-Modell, das auf eine Einsteiger-GPU passt, bis zu großen MoE-Modellen, und mit allen Spezialisierungen: Allzweckmodelle, Code (Qwen3-Coder), Vision (Qwen3-VL) sowie ein „thinking“-Modus für logisches Schlussfolgern.
- Stärken
- Sehr gut multilingual (einschließlich sehr korrekter Französisch), unvergleichbare Größenvielfalt, reif entwickeltes Tools-Ökosystem, Tag-0-Verfügbarkeit auf Ollama.
- Typische Größen
- Von 3B/7B-Modellen zum Testen über 27B (Qwen3.8) als optimalen Kompromiss zwischen Qualität und VRAM bis hin zu MoE-Modellen mit 35B-A3B für große GPUs.
- Für wen
- Die erste Wahl für den Einstieg, wenn Sie ein Modell möchten, das alles ordentlich erledigt.
#DeepSeek: Der Meister des logischen Denkens
DeepSeek wurde mit R1 bekannt, einem Reasoning-Modell mit Chain-of-Thought, das Anfang 2025 die Branche aufrüttelte. Die Modellfamilie bleibt die Referenz für logische und mathematische Aufgaben sowie komplexe Programmieraufgaben. Die destillierten Versionen von R1 (7B, 14B, 32B) machen dieses Schlussfolgern auf handelsüblicher Hardware zugänglich.
- Stärken
- Schlussfolgern und Mathematik auf sehr hohem Niveau, MIT-Lizenz, destillierte Versionen, die lokal laufen.
- Die Falle
- Die Spitzenmodelle (V3/V4, 671B und mehr als MoE) sind riesig: Sie lassen sich nicht auf einer einzelnen GPU betreiben. Für den lokalen Einsatz auf Hardware für Privatanwender sollten Sie auf R1-Destillationen setzen.
- Für wen
- Alle, die anspruchsvolle Programmier-, Mathematik- oder Logikaufgaben bearbeiten – oder sehen möchten, wie das Modell „nachdenkt“, bevor es antwortet.
#GLM (Zhipu): der vielseitige Außenseiter
GLM, entwickelt von Zhipu AI, ist ein ernstzunehmender Konkurrent zu Qwen. Es ist gut im Französischen und stark beim Programmieren und logischen Schlussfolgern. Es bietet überschaubare Modellgrößen (etwa 9B und 32B), die direkt auf den optimalen Einsatzbereich von GPUs mit 12–24 GB abzielen, sowie riesige MoE-Modelle wie GLM-5.2 (753B) für extreme Konfigurationen.
- Stärken
- Ausgezeichnetes Verhältnis zwischen Qualität und Größe bei den Varianten 9B–32B, gutes Französisch, MIT-Lizenz bei den neuesten Generationen.
- Typische Größen
- 9B für eine GPU mit 8–12 GB, 32B für 24 GB. Die Frontier-MoE-Versionen bleiben Macs mit viel gemeinsamem Arbeitsspeicher vorbehalten.
- Für wen
- Eine überzeugende Alternative zu Qwen, wenn Sie vergleichen möchten, oder ein Modell, das auf bescheidener Hardware gute Ergebnisse auf Französisch liefert.
#Kimi und MiniCPM: Die beiden Extremfälle
Diese beiden Familien veranschaulichen die Grenzen des Spektrums. Kimi (Moonshot) zielt auf sehr große Modelle ab: MoE mit 1 Billion Parametern und darüber, bekannt für ihren langen Kontext und ihre Leistung bei agentischen Aufgaben. MiniCPM (Team OpenBMB / ModelBest) zielt auf das Gegenteil ab: kompakte und effiziente Modelle, die für den Einsatz auf Mobilgeräten oder GPUs mit sehr wenig Speicher konzipiert sind.
- Kimi K2 / K3
- Riesige MoE-Modelle (1 bis 2,8 Billionen Parameter). Offen verfügbare Gewichte, aber „offen“ bedeutet nicht „auf Ihrem Rechner ausführbar“: Dafür sind Dutzende Beschleuniger nötig. Nur für Server, nicht für Arbeitsplatzrechner.
- MiniCPM
- Ultrakompakte Modelle, darunter einige multimodale, entwickelt für eingebettete Systeme und kleine Hardware-Konfigurationen. Ideal, wenn jedes Gigabyte VRAM zählt.
- Zusammenfassung
- Open-Weight-Modelle decken das gesamte Hardwarespektrum ab. Verwechseln Sie „das Modell ist frei“ nicht mit „mein Rechner kann es ausführen“.
#Welches Modell je nach VRAM auswählen?
Der eigentliche limitierende Faktor beim lokalen Einsatz ist nicht die Marke des Modells, sondern der VRAM Ihrer GPU. Für die Quantisierung Q4_K_M (der beste Kompromiss zwischen Qualität und Größe) folgen hier konkrete Anhaltspunkte, um diese Modellfamilien nach Hardwareklassen einzuordnen.
- 8 GB (RTX 3060 8G, 4060)
- Qwen 7B, GLM 9B, die destillierte 7B-Version von DeepSeek-R1 in Q4 (~5 GB). Gut nutzbar für Chats und leichte Programmieraufgaben.
- 12 GB (RTX 3060 12G, 4070)
- Der Sweet Spot. Qwen 14B, GLM 9B in Q8, DeepSeek-R1 14B (~9 GB). Spielraum für einen größeren Kontext.
- 16 GB (RTX 4080, 5070 Ti)
- Qwen ~24–27B, DeepSeek-R1 32B mit starker Quantisierung. Die „ernsthafte“ Leistungsklasse für Reasoning.
- 24 GB (RTX 3090/4090)
- Qwen 27-32B und GLM 32B vollständig im VRAM (~19 GB), MoE 35B-A3B. Das Beste für lokale KI auf Consumer-Hardware.
- Mac mit Unified Memory (48–128+ GB)
- Die einzige realistische Plattform für große MoE-Modelle (GLM-5.2, DeepSeek Flash) durch Offloading in den gemeinsamen Arbeitsspeicher (Unified Memory) — bei moderatem Durchsatz.
#Ein chinesisches Modell in der Praxis installieren
Der typische Stack ist unabhängig von der Herkunft des Modells derselbe: Ollama als Inferenz-Daemon (er lauscht auf http://localhost:11434), mit Open WebUI oder LM Studio als Benutzeroberfläche. So können Sie ein Modell aus jeder Familie herunterladen.
- 01Ollama installierenLaden Sie den Daemon von ollama.com herunter und starten Sie ihn. Er stellt eine lokale API auf Port 11434 bereit — für den Einstieg müssen Sie nichts weiter konfigurieren.
- 02Ein Modell passend zu Ihrem VRAM auswählenZiehen Sie die obige Tabelle erneut heran. Beginnen Sie im Zweifelsfall mit Qwen 14B oder GLM 9B in Q4_K_M: Sie passen auf die meisten aktuellen GPUs und decken 90 % der Anwendungsfälle ab.
- 03Herunterladen und startenEin einziger Befehl lädt die Gewichte herunter und öffnet anschließend den Chat. Beim ersten Start werden mehrere Gigabyte heruntergeladen; die folgenden Starts erfolgen sofort.
- 04Offline-Modus überprüfenSobald die Modellgewichte im Cache liegen, trennen Sie die Netzwerkverbindung und setzen Sie den Chat fort: Das ist der Beweis dafür, dass das Modell zu 100 % lokal läuft.
#Weiterführende Informationen
Dieser Überblick hilft Ihnen bei der Orientierung; diese Leitfäden behandeln die einzelnen Familien und die Einstellungen für den lokalen Betrieb im Detail:
- Der Sweet Spot bei Qwen
- „Qwen 3.8 27B lokal: Ollama-Installation, VRAM und Einstellungen“ erläutert den genauen Befehl, den VRAM-Bedarf je Quantisierung und den Thinking-Modus.
- DeepSeeks Reasoning
- „DeepSeek R1 mit Ollama installieren“ behandelt die destillierten Versionen 7B/14B/32B und die lokal ausgeführte Gedankenkette (Chain of Thought).
- Passend zu Ihrer Grafikkarte wählen
- Die Leitfäden „Welches LLM für 12 GB / 16 GB / 24 GB VRAM?“ übersetzen diese Speicherstufen in konkrete Empfehlungen je GPU.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.