Einsteiger 12 Min.Überblick

Chinesische LLMs lokal: Qwen, DeepSeek, GLM, Kimi

Wenn Sie 2026 ein Open-Weight-LLM herunterladen, um es bei sich zu Hause auszuführen, stammt es mit hoher Wahrscheinlichkeit aus China. Qwen, DeepSeek, GLM, Kimi: Diese Modellfamilien dominieren die Spitzenplätze der Ranglisten offener Modelle, häufig unter permissiveren Lizenzen als denen westlicher Labore. Dieser Überblick ordnet ein, was jede Familie leistet, was ihre Lizenzen tatsächlich besagen und warum die lokale Ausführung eines chinesischen LLM die Frage der Vertraulichkeit bereits im Vorfeld beantwortet.

Von Mohamed Meguedmi·Aktualisierung 2026-09-01·Unter Windows, macOS und Linux getestet

#Warum chinesische LLMs den Open-Weight-Bereich dominieren

Die Landschaft der offenen Modelle hat sich grundlegend verändert. Während Meta (Llama) vor zwei Jahren an der Spitze lag, veröffentlichen heute chinesische Labore die leistungsfähigsten Modellgewichte und bringen am häufigsten neue heraus. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) und Moonshot (Kimi) veröffentlichen in hohem Tempo Modelle, vom kleinen 3B-Modell bis zu MoE-Modellen mit mehreren Hundert Milliarden Parametern.

Der Grund ist ebenso strategisch wie technisch: Die Veröffentlichung der Modellgewichte als Open Weights ermöglicht es ihnen, weltweit sichtbarer zu werden, die Community anzuziehen und sich als De-facto-Standards zu etablieren, auch gegenüber geschlossenen US-amerikanischen Modellen. Für Sie als Nutzer lokaler Modelle ist das Ergebnis einfach: eine riesige Auswahl kostenloser Modelle, die regelmäßig aktualisiert werden und beim Programmieren, beim logischen Schlussfolgern und bei der Mehrsprachigkeit oft mit Cloud-Modellen gleichauf liegen.

i
Open-weight ≠ open-source
„Open-weight“ bedeutet, dass die Modellgewichte frei heruntergeladen und ausgeführt werden können. Das garantiert nicht, dass die Trainingsdaten oder der vollständige Code veröffentlicht sind. Das gilt für nahezu alle Modelle in diesem Leitfaden – Sie erhalten das Modell, nicht sein Rezept.

#Der lokale Betrieb löst die Frage der Vertraulichkeit

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Das ist der reflexartige Einwand: „Ein chinesisches LLM – meine Daten gehen nach China.“ Das trifft auf Cloud-APIs zu (chat.qwen.ai, die DeepSeek-App, die Zhipu-Plattform): Dort laufen Ihre Prompts tatsächlich über entfernte Server, die chinesischem Recht unterliegen. Dieser Leitfaden behandelt jedoch den lokalen Betrieb, und beim lokalen Betrieb ist diese Sorge schlicht gegenstandslos.

Wenn Sie das Modell mit Ollama oder LM Studio starten, laden Sie eine Datei mit unveränderlichen Modellgewichten herunter (zum Beispiel eine GGUF-Datei), und Ihre GPU berechnet die Antworten. Das Modell hat keinerlei Netzwerkfunktionen: Es ist keine Software, die „nach Hause telefoniert“, sondern eine große Matrix aus Zahlen. Nichts verlässt Ihren Rechner, unabhängig von der Herkunft des Modells.

In der Cloud (API)
Ihre Prompts werden an den Anbieter gesendet. Die Herkunft des Modells und die geltende Rechtsordnung sind wirklich wichtig.
Lokal
Das Modell läuft mit seinen Gewichten auf Ihrer Hardware, auf Wunsch auch offline. Keine Daten verlassen den Rechner.
Das tatsächliche Restrisiko
Eine Verzerrung oder Zensur in den Antworten des Modells (bei bestimmten sensiblen Themen), kein Datenleck. Es geht um die Qualität der Ausgabe, nicht um die Privatsphäre.
→
Überprüfen, dass keine Daten nach außen gelangen
Überzeugen Sie sich selbst: Starten Sie Ollama, schalten Sie das WLAN aus und chatten Sie mit dem Modell. Alles funktioniert weiterhin. Ein lokales LLM benötigt das Netzwerk nur für den erstmaligen Download der Modellgewichte.

#Die tatsächlichen Lizenzen: Apache 2.0 und MIT

Ein weiteres Vorurteil: „Chinesische Lizenzen sind undurchsichtig oder voller Fallstricke.“ Die Realität im Jahr 2026 ist das Gegenteil – oft gehören sie zu den saubersten Lizenzen auf dem Markt. Die Mehrheit der Modelle in diesem Überblick wird unter Apache 2.0 oder MIT veröffentlicht, zwei international gebräuchlichen permissiven Lizenzen, die auch eine kommerzielle Nutzung erlauben.

Qwen
Die meisten neueren Varianten (u. a. Qwen3.8-27B) sind unter Apache 2.0 lizenziert — kommerzielle Nutzung erlaubt, Weiterverteilung zulässig.
DeepSeek
Die Modelle V3/V4 und R1 sind unter der MIT-Lizenz veröffentlicht, einer der freizügigsten Lizenzen überhaupt.
GLM (Zhipu)
Die neuesten Generationen, darunter GLM-5.2, sind zur MIT-Lizenz gewechselt.
Kimi (Moonshot)
Offene Gewichte unter einer permissiven Lizenz vom Typ MIT/Apache, je nach Version.
!
Lesen Sie dennoch die Modellkarte
Einige ältere Modellfamilien oder bestimmte Varianten können unter einer eigenen Lizenz mit Nutzungsbedingungen stehen. Prüfen Sie vor einem kommerziellen Einsatz immer die Datei LICENSE auf der Hugging-Face-Seite genau des Modells, das Sie herunterladen – verlassen Sie sich nicht nur auf den Ruf der Modellfamilie.

#Qwen (Alibaba) : das Allround-Tool

Qwen ist die umfassendste und vielseitigste Modellfamilie im Ökosystem. Alibaba bietet das Modell in allen Größen an, vom 3B-Modell, das auf eine Einsteiger-GPU passt, bis zu großen MoE-Modellen, und mit allen Spezialisierungen: Allzweckmodelle, Code (Qwen3-Coder), Vision (Qwen3-VL) sowie ein „thinking“-Modus für logisches Schlussfolgern.

Stärken
Sehr gut multilingual (einschließlich sehr korrekter Französisch), unvergleichbare Größenvielfalt, reif entwickeltes Tools-Ökosystem, Tag-0-Verfügbarkeit auf Ollama.
Typische Größen
Von 3B/7B-Modellen zum Testen über 27B (Qwen3.8) als optimalen Kompromiss zwischen Qualität und VRAM bis hin zu MoE-Modellen mit 35B-A3B für große GPUs.
Für wen
Die erste Wahl für den Einstieg, wenn Sie ein Modell möchten, das alles ordentlich erledigt.

#DeepSeek: Der Meister des logischen Denkens

DeepSeek wurde mit R1 bekannt, einem Reasoning-Modell mit Chain-of-Thought, das Anfang 2025 die Branche aufrüttelte. Die Modellfamilie bleibt die Referenz für logische und mathematische Aufgaben sowie komplexe Programmieraufgaben. Die destillierten Versionen von R1 (7B, 14B, 32B) machen dieses Schlussfolgern auf handelsüblicher Hardware zugänglich.

Stärken
Schlussfolgern und Mathematik auf sehr hohem Niveau, MIT-Lizenz, destillierte Versionen, die lokal laufen.
Die Falle
Die Spitzenmodelle (V3/V4, 671B und mehr als MoE) sind riesig: Sie lassen sich nicht auf einer einzelnen GPU betreiben. Für den lokalen Einsatz auf Hardware für Privatanwender sollten Sie auf R1-Destillationen setzen.
Für wen
Alle, die anspruchsvolle Programmier-, Mathematik- oder Logikaufgaben bearbeiten – oder sehen möchten, wie das Modell „nachdenkt“, bevor es antwortet.

#GLM (Zhipu): der vielseitige Außenseiter

GLM, entwickelt von Zhipu AI, ist ein ernstzunehmender Konkurrent zu Qwen. Es ist gut im Französischen und stark beim Programmieren und logischen Schlussfolgern. Es bietet überschaubare Modellgrößen (etwa 9B und 32B), die direkt auf den optimalen Einsatzbereich von GPUs mit 12–24 GB abzielen, sowie riesige MoE-Modelle wie GLM-5.2 (753B) für extreme Konfigurationen.

Stärken
Ausgezeichnetes Verhältnis zwischen Qualität und Größe bei den Varianten 9B–32B, gutes Französisch, MIT-Lizenz bei den neuesten Generationen.
Typische Größen
9B für eine GPU mit 8–12 GB, 32B für 24 GB. Die Frontier-MoE-Versionen bleiben Macs mit viel gemeinsamem Arbeitsspeicher vorbehalten.
Für wen
Eine überzeugende Alternative zu Qwen, wenn Sie vergleichen möchten, oder ein Modell, das auf bescheidener Hardware gute Ergebnisse auf Französisch liefert.

#Kimi und MiniCPM: Die beiden Extremfälle

Diese beiden Familien veranschaulichen die Grenzen des Spektrums. Kimi (Moonshot) zielt auf sehr große Modelle ab: MoE mit 1 Billion Parametern und darüber, bekannt für ihren langen Kontext und ihre Leistung bei agentischen Aufgaben. MiniCPM (Team OpenBMB / ModelBest) zielt auf das Gegenteil ab: kompakte und effiziente Modelle, die für den Einsatz auf Mobilgeräten oder GPUs mit sehr wenig Speicher konzipiert sind.

Kimi K2 / K3
Riesige MoE-Modelle (1 bis 2,8 Billionen Parameter). Offen verfügbare Gewichte, aber „offen“ bedeutet nicht „auf Ihrem Rechner ausführbar“: Dafür sind Dutzende Beschleuniger nötig. Nur für Server, nicht für Arbeitsplatzrechner.
MiniCPM
Ultrakompakte Modelle, darunter einige multimodale, entwickelt für eingebettete Systeme und kleine Hardware-Konfigurationen. Ideal, wenn jedes Gigabyte VRAM zählt.
Zusammenfassung
Open-Weight-Modelle decken das gesamte Hardwarespektrum ab. Verwechseln Sie „das Modell ist frei“ nicht mit „mein Rechner kann es ausführen“.

#Welches Modell je nach VRAM auswählen?

Der eigentliche limitierende Faktor beim lokalen Einsatz ist nicht die Marke des Modells, sondern der VRAM Ihrer GPU. Für die Quantisierung Q4_K_M (der beste Kompromiss zwischen Qualität und Größe) folgen hier konkrete Anhaltspunkte, um diese Modellfamilien nach Hardwareklassen einzuordnen.

8 GB (RTX 3060 8G, 4060)
Qwen 7B, GLM 9B, die destillierte 7B-Version von DeepSeek-R1 in Q4 (~5 GB). Gut nutzbar für Chats und leichte Programmieraufgaben.
12 GB (RTX 3060 12G, 4070)
Der Sweet Spot. Qwen 14B, GLM 9B in Q8, DeepSeek-R1 14B (~9 GB). Spielraum für einen größeren Kontext.
16 GB (RTX 4080, 5070 Ti)
Qwen ~24–27B, DeepSeek-R1 32B mit starker Quantisierung. Die „ernsthafte“ Leistungsklasse für Reasoning.
24 GB (RTX 3090/4090)
Qwen 27-32B und GLM 32B vollständig im VRAM (~19 GB), MoE 35B-A3B. Das Beste für lokale KI auf Consumer-Hardware.
Mac mit Unified Memory (48–128+ GB)
Die einzige realistische Plattform für große MoE-Modelle (GLM-5.2, DeepSeek Flash) durch Offloading in den gemeinsamen Arbeitsspeicher (Unified Memory) — bei moderatem Durchsatz.
i
VRAM-Richtwert bei Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Rechnen Sie immer 1 bis 2 GB für den Kontext und das System hinzu. Ein Modell, das nicht vollständig in den VRAM passt, wird in den Arbeitsspeicher ausgelagert (CPU-Offloading), und sein Durchsatz bricht ein.

#Ein chinesisches Modell in der Praxis installieren

Der typische Stack ist unabhängig von der Herkunft des Modells derselbe: Ollama als Inferenz-Daemon (er lauscht auf http://localhost:11434), mit Open WebUI oder LM Studio als Benutzeroberfläche. So können Sie ein Modell aus jeder Familie herunterladen.

  1. 01
    Ollama installieren
    Laden Sie den Daemon von ollama.com herunter und starten Sie ihn. Er stellt eine lokale API auf Port 11434 bereit — für den Einstieg müssen Sie nichts weiter konfigurieren.
  2. 02
    Ein Modell passend zu Ihrem VRAM auswählen
    Ziehen Sie die obige Tabelle erneut heran. Beginnen Sie im Zweifelsfall mit Qwen 14B oder GLM 9B in Q4_K_M: Sie passen auf die meisten aktuellen GPUs und decken 90 % der Anwendungsfälle ab.
  3. 03
    Herunterladen und starten
    Ein einziger Befehl lädt die Gewichte herunter und öffnet anschließend den Chat. Beim ersten Start werden mehrere Gigabyte heruntergeladen; die folgenden Starts erfolgen sofort.
  4. 04
    Offline-Modus überprüfen
    Sobald die Modellgewichte im Cache liegen, trennen Sie die Netzwerkverbindung und setzen Sie den Chat fort: Das ist der Beweis dafür, dass das Modell zu 100 % lokal läuft.
Terminal
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
Die Tag-Namen variieren
Die genauen Tags (qwen3, deepseek-r1:14b usw.) und die verfügbaren Versionen ändern sich in der Ollama-Bibliothek schnell. Prüfen Sie vor dem Download auf ollama.com/library den genauen Namen und die Größe in GB jeder Variante.

#Weiterführende Informationen

Dieser Überblick hilft Ihnen bei der Orientierung; diese Leitfäden behandeln die einzelnen Familien und die Einstellungen für den lokalen Betrieb im Detail:

Der Sweet Spot bei Qwen
„Qwen 3.8 27B lokal: Ollama-Installation, VRAM und Einstellungen“ erläutert den genauen Befehl, den VRAM-Bedarf je Quantisierung und den Thinking-Modus.
DeepSeeks Reasoning
„DeepSeek R1 mit Ollama installieren“ behandelt die destillierten Versionen 7B/14B/32B und die lokal ausgeführte Gedankenkette (Chain of Thought).
Passend zu Ihrer Grafikkarte wählen
Die Leitfäden „Welches LLM für 12 GB / 16 GB / 24 GB VRAM?“ übersetzen diese Speicherstufen in konkrete Empfehlungen je GPU.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.