GLM 5.1 lokal: die open-weight Alternative zu kennen
GLM 5.1 ist die neueste Version der Open-Weight-Modellfamilie von Zhipu AI, einem der chinesischen Labore, die im Bereich Self-Hosting besonders aktiv sind. In der französischsprachigen Diskussion steht das Modell oft im Schatten von Qwen und Llama, zu Unrecht: Bei bestimmten Anwendungen — Programmieren, strukturiertes Schlussfolgern, Tool Calling — ist es ebenbürtig. Dieser Leitfaden zeigt Ihnen, wie Sie GLM 5.1 lokal mit Ollama oder llama.cpp installieren, wie viel VRAM es je nach Quantisierung benötigt, wie gut es mit Französisch und Code zurechtkommt und wie es sich gegenüber Qwen 3.5 und Gemma 4 einordnet.
#Warum GLM 5.1 lokal?
Drei konkrete Gründe sprechen dafür, GLM 5.1 statt eines vergleichbaren Qwen 3.5 oder Gemma 4 auszuprobieren. Erstens seine permissive Lizenz: Die Open-Weight-Version (verfügbar in 9B und 32B) erlaubt die kommerzielle Nutzung, was im Open-Source-Ökosystem keineswegs selbstverständlich ist. Zweitens das native Tool Calling: GLM 5.1 wurde von Anfang an darauf trainiert, Tools aufzurufen, und eignet sich dadurch besonders für lokale Agenten, ohne dass an Prompts herumgebastelt werden muss.
Schließlich das Verhältnis von Qualität zu Größe: Das 9B-Modell erreicht in mehreren Benchmarks für Code und Schlussfolgern das Niveau eines Gemma 4 12B und ist damit eine interessante Wahl, wenn Ihnen nur 12 GB VRAM zur Verfügung stehen. Das 32B-Modell zielt höher und spielt in der Liga der 24–35B-Modelle wie Qwen 3.8 27B oder Mistral Small 24B.
#Was GLM 5.1 auszeichnet
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
GLM 5.1 behält die dichte Transformer-Architektur der früheren Versionen bei – hier kommt kein Mixture-of-Experts zum Einsatz, anders als bei Qwen 3.6 35B-A3B oder DeepSeek V4. Diese Entscheidung vereinfacht die Inferenz und garantiert, dass der Durchsatz bei Fragen, die selten genutzte Experten beanspruchen, nicht einbricht.
- Größen
- 9B und 32B mit offenen Modellgewichten. Eine 100B+-Version existiert, ist aber ausschließlich über die Zhipu-API zugänglich und nicht herunterladbar.
- Kontext
- 128k Tokens bei beiden Modellgrößen, beim 32B-Modell per YaRN-Scaling auf 1M erweitert (mit Qualitätseinbußen oberhalb von 200k).
- Tokenizer
- Optimierter zweisprachiger Tokenizer für Chinesisch und Englisch mit ordentlicher Abdeckung des Französischen. Für einen gleichwertigen französischen Text mit ~5 % mehr Tokens als bei einem Mistral rechnen.
- Tool Calling
- Natives Format, kompatibel mit dem OpenAI-tools-Schema. Kein Prompt-Engineering nötig, um den Funktionsaufruf auszulösen; das Modell weiß, wann es eine Funktion aufrufen soll.
- Lizenz
- GLM License (Variante von Apache 2.0 mit einer Klausel zur Namensnennung). Kommerzielle Nutzung erlaubt, Weiterverbreitung unter denselben Bedingungen.
- Multimodal
- Die Open-Weight-Modelle mit 9B und 32B unterstützen nur Text. Die Vision-Version (GLM-V) ist ein separates Modell, das separat per Pull heruntergeladen werden muss.
#Voraussetzungen
- Ollama ≥ 0.5
- Für die Ollama-Version. Ältere Builds kennen das Chat-Template von GLM 5.1 nicht.
- Aktuelle Version von llama.cpp
- Build von 2026 oder neuer. Die Unterstützung für die GLM-Architektur wurde Ende 2025 stabilisiert.
- Festplattenspeicher
- 6 GB für 9B Q4, 19 GB für 32B Q4. Verdoppeln Sie diese Werte für Q8, vervierfachen Sie sie für FP16.
- Mindestbedarf an VRAM
- 8 GB für das 9B-Modell in Q4, 24 GB für das 32B-Modell in Q4. Bei weniger VRAM werden Teile des Modells in den Arbeitsspeicher ausgelagert und auf der CPU ausgeführt, und der Durchsatz fällt auf 3–5 Tokens/s.
- Aktueller GPU-Treiber
- CUDA 12.x für NVIDIA, ROCm 6.x für AMD, natives Metal für Apple Silicon.
#1. Installation mit Ollama
Ollama ist der kürzeste Weg. Das Modell wird in der offiziellen Modellbibliothek unter dem Namen glm5.1 bereitgestellt, mit den üblichen Tags für Größe und Quantisierung.
Für das 32B-Modell ist die Vorgehensweise dieselbe, aber rechnen Sie mit mehreren Minuten Downloadzeit und mindestens 24 GB VRAM oder vereinheitlichtem Speicher.
Sobald das Modell heruntergeladen ist, lauscht der OpenAI-kompatible Endpunkt von Ollama standardmäßig auf http://localhost:11434, und glm5.1 antwortet wie jedes andere über Ollama bereitgestellte Modell.
#2. Installation mit llama.cpp
Mit llama.cpp laden Sie eine GGUF-Datei von Hugging Face herunter und führen das Modell über die Kommandozeile oder den HTTP-Server aus. Diesen Weg sollten Sie bevorzugen, wenn Sie den KV-Cache oder das Draft-Modell für spekulative Decodierung fein abstimmen möchten oder mehrere GPUs verwenden.
- -c 16384
- Kontextfenster. 16k ist ein guter Standardwert für französische Texte und Code. Erhöhen Sie ihn auf 32k oder mehr, wenn Sie genügend VRAM haben.
- -ngl 99
- Alles auf der GPU. Stellen Sie einen niedrigeren Wert ein, um Schichten auf die CPU auszulagern, wenn der GPU-Speicher nicht ausreicht.
- -fa
- Flash Attention. Unverzichtbar bei mehr als 8k, damit der Speicherbedarf des KV-Caches nicht explodiert.
- --host 0.0.0.0
- Macht den Server im Netzwerk erreichbar. Setzen Sie 127.0.0.1, wenn Sie den Zugriff auf den lokalen Rechner beschränken möchten.
#3. VRAM pro Quantisierung
Die Zahlen unten berücksichtigen die Gewichte plus einen KV-Cache für 8k Kontext. Für 32k oder 128k rechnen Sie je nach Größe 2 bis 8 GB zusätzlich ein.
- GLM 5.1 9B — Q4_K_M
- ≈ 6 GB VRAM. Passt knapp auf eine GTX 1660 mit 6 GB, komfortabel auf eine RTX 3050/3060/4060 mit 8 GB.
- GLM 5.1 9B — Q5_K_M
- ≈ 7 GB VRAM. Sinnvoll ab 8 GB, mit etwas Spielraum.
- GLM 5.1 9B — Q8_0
- ≈ 10 GB VRAM. Ziel: RTX 3060 12 GB, 4070 12 GB oder Mac 16 GB+.
- GLM 5.1 32B — Q4_K_M
- ≈ 19 GB VRAM. Ideal: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
- GLM 5.1 32B — Q5_K_M
- ≈ 23 GB VRAM. Nahe an der Kapazitätsgrenze von 24 GB; für mehr Spielraum einen Mac mit mindestens 48 GB oder ein Multi-GPU-System anstreben.
- GLM 5.1 32B — Q8_0
- ≈ 34 GB VRAM. Nur für die RTX 5090 mit 32 GB, Mac Studio Ultra oder Multi-GPU-Konfigurationen (2× 3090, 2× 4090) geeignet.
#4. Qualität bei französischen Texten und Code
GLM 5.1 wurde hauptsächlich mit chinesischen und englischen Texten trainiert, kommt aber auch mit Französisch ordentlich zurecht – nicht auf dem Niveau eines Mistral mit muttersprachlicher Französischkompetenz, aber über dem eines Gemma 4 12B in derselben Größenklasse. Typische Fehler betreffen idiomatische Wendungen und einige seltene Fälle grammatischer Kongruenz; nichts, was die allgemeine Nutzung als Assistent oder für RAG beeinträchtigt.
- Französisch — 9B
- Gut geeignet für Zusammenfassungen, Übersetzungen und RAG mit französischsprachigen Dokumenten. Gelegentlich einzelne Anglizismen. Eine niedrige Temperatur (0,2–0,4) bevorzugen, um Abweichungen zu minimieren.
- Französisch — 32B
- Sehr sauber. Auf dem Niveau von Mistral Small 24B hinsichtlich Schreibqualität, leicht unter den proprietären Großmodellen.
- Code — 9B
- Für seine Größe ausgezeichnet. Generiert hochwertigen Code in Python, JS, Go und Rust. Schlägt das Allzweckmodell Granite 4.2 8B und kann bei Code mit Qwen 3.5 9B mithalten.
- Code — 32B
- Sehr leistungsfähig. Bei HumanEval, MBPP und MultiPL-E gehört es zur Spitzengruppe der Open-Weight-Modelle. Dank des 128k-Kontexts gut beim Refactoring über mehrere Dateien hinweg.
- Reasoning
- Explizites Chain-of-Thought auf Anfrage, ohne ein spezielles <think>-Token wie bei DeepSeek R1. Das 32B-Modell schlägt sich bei AIME, GPQA und MATH gut.
- Tool Calling
- Natives Format, das mit OpenAI tools kompatibel ist. Das Modell entscheidet selbstständig, eine Funktion aufzurufen, und formatiert die JSON-Argumente fehlerfrei.
#5. GLM 5.1 im Vergleich zu Qwen 3.5 und Gemma 4
Drei Open-Weight-Modellfamilien gehören 2026 derselben Größenklasse an: GLM 5.1, Qwen (3.5 9B / 3.8 27B) und Gemma 4 (12B / 26B-A4B). Eine ehrliche Vergleichstabelle:
- Pure Geschwindigkeit (tok/s)
- Bei gleicher Modellgröße und gleicher VRAM-Kapazität liegt GLM 5.1 im selben Bereich wie die dichten Modelle von Qwen 3.5 und Gemma 4. Es gibt keinen markanten Unterschied — der Durchsatz hängt vor allem vom Backend (Ollama vs. llama.cpp vs. vLLM) und von der GPU ab.
- Qualität auf Französisch
- Mistral Small 24B (nativ) > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 bei gleicher Größe. Wenn Französisch entscheidend ist, bleibt Mistral vorn; GLM 5.1 ist eine solide zweite Wahl unter den offenen Modellen.
- Code
- Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 als Allzweckmodell > Gemma 4 bei gleicher Größe. GLM 5.1 32B ist gegenüber Qwen 3.8 27B konkurrenzfähig, liegt aber leicht hinter den auf Code spezialisierten Modellen.
- Tool Calling
- GLM 5.1 ≈ Qwen 3.5 > Gemma 4. Die beiden ersten wurden explizit für Tools trainiert, Gemma erfordert etwas mehr Prompt-Engineering.
- Langer Kontext
- Qwen 3.5 256k nativ (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M über YaRN) > Gemma 4 128k. Für die Analyse einer kompletten Codebasis behält Qwen eine längere Vorwärtskette.
- Lizenz
- GLM (Apache-ähnlich) ≈ Qwen (Apache 2.0 bei den meisten Varianten) ≈ Gemma 4 (Apache 2.0 seit April 2026). Drei unkomplizierte Lizenzen für den Einsatz in Unternehmen, wobei Gemma seine eigene Lizenzklausel aufgegeben hat.
- Ökosystem
- Qwen > Gemma 4 > GLM 5.1. Qwen hat inzwischen die größte Anzahl an Community-Fine-Tunes, Gemma 4 folgt dicht dahinter, GLM 5.1 bleibt weniger verbreitet – weniger Varianten, weniger Tutorials auf Französisch.
#Tipps und Stolperfallen
- Kurzer Systemprompt
- GLM 5.1 befolgt Systemprompts gut, aber wird etwas überlastet, wenn man ihm 800 Wörter gibt. Wählen Sie 200–400 Wörter, klar und strukturiert.
- Niedrige Temperatur für FR
- 0,2 bis 0,4, um Anglizismen und Unstimmigkeiten bei der grammatischen Kongruenz zu minimieren. Oberhalb von 0,7 beginnt die Qualität französischer Texte zu schwanken.
- Stop-Tokens
- Das Modell verwendet <|endoftext|> und <|user|> als Trennzeichen. Wenn Sie Ihren eigenen Client schreiben, fügen Sie diese beiden Zeichenfolgen zu den Stop-Tokens hinzu, damit das Modell nicht von selbst weiterredet.
- Streaming über Ollama
- Die Endpunkte /api/chat und /v1/chat/completions unterstützen stream=true. Anders als bei manchen MoE-Modellen gibt es bei GLM 5.1 keine besonderen Eigenheiten.
- LoRA-Fine-Tuning
- LoRA-Fine-Tuning von GLM 5.1 9B ist mit Unsloth auf einer RTX 4090 mit 24 GB praktikabel. Das 32B-Modell erfordert mehrere GPUs oder einen Mac mit großzügig bemessenem gemeinsamem Speicher für CPU und GPU.
- Ollama-Modelfile
- Um einen Systemprompt und Parameter festzulegen, erstellen Sie ein Modelfile auf Basis von glm5.1:9b und führen anschließend ollama create monassistant -f Modelfile aus. Das abgeleitete Modell erscheint in ollama list wie jedes andere Modell.
#Weiterführende Informationen
GLM 5.1 läuft, und Sie haben Ihre ersten Ergebnisse. Einige Anregungen, um weiterzugehen:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um den genauen Kompromiss zwischen Qualität und VRAM für Ihre Anwendungsfälle zu bestimmen.
- Qwen3.6 35B-A3B lokal: Test und VRAM-Anforderungen
- Der direkte Konkurrent von Qwen mit MoE-Architektur. Ein hilfreicher Vergleich, wenn Sie unsicher sind.
- Open WebUI mit Ollama: der komplette Guide
- Eine ChatGPT-ähnliche Benutzeroberfläche auf Basis von GLM 5.1: Gespräche, RAG, Mehrbenutzerbetrieb.
- Lokalen KI-Agenten in Python mit LangChain und Ollama erstellen
- Um die native Tool-Call-Funktion von GLM 5.1 zu nutzen und damit Ihre eigenen Funktionen aufzurufen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.