Mittelstufe 10 Min.GLM

GLM 5.1 lokal: die open-weight Alternative zu kennen

GLM 5.1 ist die neueste Version der Open-Weight-Modellfamilie von Zhipu AI, einem der chinesischen Labore, die im Bereich Self-Hosting besonders aktiv sind. In der französischsprachigen Diskussion steht das Modell oft im Schatten von Qwen und Llama, zu Unrecht: Bei bestimmten Anwendungen — Programmieren, strukturiertes Schlussfolgern, Tool Calling — ist es ebenbürtig. Dieser Leitfaden zeigt Ihnen, wie Sie GLM 5.1 lokal mit Ollama oder llama.cpp installieren, wie viel VRAM es je nach Quantisierung benötigt, wie gut es mit Französisch und Code zurechtkommt und wie es sich gegenüber Qwen 3.5 und Gemma 4 einordnet.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum GLM 5.1 lokal?

Drei konkrete Gründe sprechen dafür, GLM 5.1 statt eines vergleichbaren Qwen 3.5 oder Gemma 4 auszuprobieren. Erstens seine permissive Lizenz: Die Open-Weight-Version (verfügbar in 9B und 32B) erlaubt die kommerzielle Nutzung, was im Open-Source-Ökosystem keineswegs selbstverständlich ist. Zweitens das native Tool Calling: GLM 5.1 wurde von Anfang an darauf trainiert, Tools aufzurufen, und eignet sich dadurch besonders für lokale Agenten, ohne dass an Prompts herumgebastelt werden muss.

Schließlich das Verhältnis von Qualität zu Größe: Das 9B-Modell erreicht in mehreren Benchmarks für Code und Schlussfolgern das Niveau eines Gemma 4 12B und ist damit eine interessante Wahl, wenn Ihnen nur 12 GB VRAM zur Verfügung stehen. Das 32B-Modell zielt höher und spielt in der Liga der 24–35B-Modelle wie Qwen 3.8 27B oder Mistral Small 24B.

i
Kurz gesagt
GLM 5.1 = ein ernstzunehmendes chinesisches Open-Weight-Modell, im französischsprachigen Raum unterschätzt, besonders stark beim Programmieren und beim Tool Calling. Mit Ollama lässt es sich mit einem einzigen Befehl nutzen; llama.cpp ist die Option, wenn Sie mehr Kontrolle wünschen.

#Was GLM 5.1 auszeichnet

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

GLM 5.1 behält die dichte Transformer-Architektur der früheren Versionen bei – hier kommt kein Mixture-of-Experts zum Einsatz, anders als bei Qwen 3.6 35B-A3B oder DeepSeek V4. Diese Entscheidung vereinfacht die Inferenz und garantiert, dass der Durchsatz bei Fragen, die selten genutzte Experten beanspruchen, nicht einbricht.

Größen
9B und 32B mit offenen Modellgewichten. Eine 100B+-Version existiert, ist aber ausschließlich über die Zhipu-API zugänglich und nicht herunterladbar.
Kontext
128k Tokens bei beiden Modellgrößen, beim 32B-Modell per YaRN-Scaling auf 1M erweitert (mit Qualitätseinbußen oberhalb von 200k).
Tokenizer
Optimierter zweisprachiger Tokenizer für Chinesisch und Englisch mit ordentlicher Abdeckung des Französischen. Für einen gleichwertigen französischen Text mit ~5 % mehr Tokens als bei einem Mistral rechnen.
Tool Calling
Natives Format, kompatibel mit dem OpenAI-tools-Schema. Kein Prompt-Engineering nötig, um den Funktionsaufruf auszulösen; das Modell weiß, wann es eine Funktion aufrufen soll.
Lizenz
GLM License (Variante von Apache 2.0 mit einer Klausel zur Namensnennung). Kommerzielle Nutzung erlaubt, Weiterverbreitung unter denselben Bedingungen.
Multimodal
Die Open-Weight-Modelle mit 9B und 32B unterstützen nur Text. Die Vision-Version (GLM-V) ist ein separates Modell, das separat per Pull heruntergeladen werden muss.
→
Warum hier kein MoE?
Ein dichtes 32B-Modell lässt sich einfacher bereitstellen als ein MoE-Modell mit 35B-A3B: keine Überraschungen beim VRAM-Bedarf durch das Routing, keine starken Schwankungen des Durchsatzes je nach Frage. Wenn Sie eine stabile und vorhersehbare Geschwindigkeit wünschen, ist GLM 5.1 32B komfortabler als ein vergleichbares MoE-Modell.

#Voraussetzungen

Ollama ≥ 0.5
Für die Ollama-Version. Ältere Builds kennen das Chat-Template von GLM 5.1 nicht.
Aktuelle Version von llama.cpp
Build von 2026 oder neuer. Die Unterstützung für die GLM-Architektur wurde Ende 2025 stabilisiert.
Festplattenspeicher
6 GB für 9B Q4, 19 GB für 32B Q4. Verdoppeln Sie diese Werte für Q8, vervierfachen Sie sie für FP16.
Mindestbedarf an VRAM
8 GB für das 9B-Modell in Q4, 24 GB für das 32B-Modell in Q4. Bei weniger VRAM werden Teile des Modells in den Arbeitsspeicher ausgelagert und auf der CPU ausgeführt, und der Durchsatz fällt auf 3–5 Tokens/s.
Aktueller GPU-Treiber
CUDA 12.x für NVIDIA, ROCm 6.x für AMD, natives Metal für Apple Silicon.

#1. Installation mit Ollama

Ollama ist der kürzeste Weg. Das Modell wird in der offiziellen Modellbibliothek unter dem Namen glm5.1 bereitgestellt, mit den üblichen Tags für Größe und Quantisierung.

Pull und direkter Start
ollama run glm5.1:9b

Für das 32B-Modell ist die Vorgehensweise dieselbe, aber rechnen Sie mit mehreren Minuten Downloadzeit und mindestens 24 GB VRAM oder vereinheitlichtem Speicher.

Nützliche Tags
ollama pull glm5.1:9b           # alias de 9b-instruct-q4_K_M
ollama pull glm5.1:9b-q8_0      # qualité supérieure, +60% VRAM
ollama pull glm5.1:32b          # 32B Q4 par défaut
ollama pull glm5.1:32b-q5_K_M   # le sweet spot 32B sur 24 Go

Sobald das Modell heruntergeladen ist, lauscht der OpenAI-kompatible Endpunkt von Ollama standardmäßig auf http://localhost:11434, und glm5.1 antwortet wie jedes andere über Ollama bereitgestellte Modell.

i
Prüfen, ob das Modell in den VRAM passt
Führen Sie nach dem ersten Prompt in einem anderen Terminal ollama ps aus. Die Spalte PROCESSOR muss 100% GPU anzeigen. Wenn dort 70% GPU / 30% CPU steht, passt das Modell nicht vollständig in den VRAM – wechseln Sie zu einer stärkeren Quantisierung oder zu einem kleineren Modell.

#2. Installation mit llama.cpp

Mit llama.cpp laden Sie eine GGUF-Datei von Hugging Face herunter und führen das Modell über die Kommandozeile oder den HTTP-Server aus. Diesen Weg sollten Sie bevorzugen, wenn Sie den KV-Cache oder das Draft-Modell für spekulative Decodierung fein abstimmen möchten oder mehrere GPUs verwenden.

GGUF-Download
# 9B en Q4_K_M (recommandé)
wget https://huggingface.co/zhipuai/glm-5.1-9b-chat-gguf/resolve/main/glm-5.1-9b-chat-Q4_K_M.gguf

# 32B en Q4_K_M
wget https://huggingface.co/zhipuai/glm-5.1-32b-chat-gguf/resolve/main/glm-5.1-32b-chat-Q4_K_M.gguf
Start im Servermodus
./llama-server \
  -m glm-5.1-9b-chat-Q4_K_M.gguf \
  -c 16384 \
  -ngl 99 \
  -fa \
  --host 0.0.0.0 --port 8080
-c 16384
Kontextfenster. 16k ist ein guter Standardwert für französische Texte und Code. Erhöhen Sie ihn auf 32k oder mehr, wenn Sie genügend VRAM haben.
-ngl 99
Alles auf der GPU. Stellen Sie einen niedrigeren Wert ein, um Schichten auf die CPU auszulagern, wenn der GPU-Speicher nicht ausreicht.
-fa
Flash Attention. Unverzichtbar bei mehr als 8k, damit der Speicherbedarf des KV-Caches nicht explodiert.
--host 0.0.0.0
Macht den Server im Netzwerk erreichbar. Setzen Sie 127.0.0.1, wenn Sie den Zugriff auf den lokalen Rechner beschränken möchten.
→
Quantisierung des KV-Cache
Bei GLM 5.1 mit --cache-type-k q8_0 --cache-type-v q8_0 wird die KV-Speicherung um den Faktor 2 reduziert mit einer Qualitätsverlust, der praktisch null ist. Erforderlich, wenn Sie einen Kontext von 64k+ auf einem 32B-Modell erreichen möchten.

#3. VRAM pro Quantisierung

Die Zahlen unten berücksichtigen die Gewichte plus einen KV-Cache für 8k Kontext. Für 32k oder 128k rechnen Sie je nach Größe 2 bis 8 GB zusätzlich ein.

GLM 5.1 9B — Q4_K_M
≈ 6 GB VRAM. Passt knapp auf eine GTX 1660 mit 6 GB, komfortabel auf eine RTX 3050/3060/4060 mit 8 GB.
GLM 5.1 9B — Q5_K_M
≈ 7 GB VRAM. Sinnvoll ab 8 GB, mit etwas Spielraum.
GLM 5.1 9B — Q8_0
≈ 10 GB VRAM. Ziel: RTX 3060 12 GB, 4070 12 GB oder Mac 16 GB+.
GLM 5.1 32B — Q4_K_M
≈ 19 GB VRAM. Ideal: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
GLM 5.1 32B — Q5_K_M
≈ 23 GB VRAM. Nahe an der Kapazitätsgrenze von 24 GB; für mehr Spielraum einen Mac mit mindestens 48 GB oder ein Multi-GPU-System anstreben.
GLM 5.1 32B — Q8_0
≈ 34 GB VRAM. Nur für die RTX 5090 mit 32 GB, Mac Studio Ultra oder Multi-GPU-Konfigurationen (2× 3090, 2× 4090) geeignet.
!
Die Falle beim 128k-Kontextfenster
Das Aktivieren des maximalen Kontextfensters vergrößert den KV-Cache je nach Größe um 5 bis 10 GB. Das 32B-Modell in Q5 passt bei 8k Kontext noch in 24 GB Speicher, bei 32k jedoch nicht mehr. Erhöhen Sie den Kontext schrittweise und behalten Sie ollama ps oder nvidia-smi im Blick.

#4. Qualität bei französischen Texten und Code

GLM 5.1 wurde hauptsächlich mit chinesischen und englischen Texten trainiert, kommt aber auch mit Französisch ordentlich zurecht – nicht auf dem Niveau eines Mistral mit muttersprachlicher Französischkompetenz, aber über dem eines Gemma 4 12B in derselben Größenklasse. Typische Fehler betreffen idiomatische Wendungen und einige seltene Fälle grammatischer Kongruenz; nichts, was die allgemeine Nutzung als Assistent oder für RAG beeinträchtigt.

Französisch — 9B
Gut geeignet für Zusammenfassungen, Übersetzungen und RAG mit französischsprachigen Dokumenten. Gelegentlich einzelne Anglizismen. Eine niedrige Temperatur (0,2–0,4) bevorzugen, um Abweichungen zu minimieren.
Französisch — 32B
Sehr sauber. Auf dem Niveau von Mistral Small 24B hinsichtlich Schreibqualität, leicht unter den proprietären Großmodellen.
Code — 9B
Für seine Größe ausgezeichnet. Generiert hochwertigen Code in Python, JS, Go und Rust. Schlägt das Allzweckmodell Granite 4.2 8B und kann bei Code mit Qwen 3.5 9B mithalten.
Code — 32B
Sehr leistungsfähig. Bei HumanEval, MBPP und MultiPL-E gehört es zur Spitzengruppe der Open-Weight-Modelle. Dank des 128k-Kontexts gut beim Refactoring über mehrere Dateien hinweg.
Reasoning
Explizites Chain-of-Thought auf Anfrage, ohne ein spezielles <think>-Token wie bei DeepSeek R1. Das 32B-Modell schlägt sich bei AIME, GPQA und MATH gut.
Tool Calling
Natives Format, das mit OpenAI tools kompatibel ist. Das Modell entscheidet selbstständig, eine Funktion aufzurufen, und formatiert die JSON-Argumente fehlerfrei.
→
Für das tägliche Programmieren
Wenn Ihr Hauptziel Unterstützung beim Programmieren ist, vergleichen Sie GLM 5.1 9B und Qwen 3.5 9B anhand Ihrer eigenen Aufgaben. Beide sind hervorragend, aber eines kann besser zu Ihrer Programmiersprache und Ihrem Stil passen. Kein öffentlicher Benchmark ersetzt einen 30-minütigen Test in Ihrem Repository.

#5. GLM 5.1 im Vergleich zu Qwen 3.5 und Gemma 4

Drei Open-Weight-Modellfamilien gehören 2026 derselben Größenklasse an: GLM 5.1, Qwen (3.5 9B / 3.8 27B) und Gemma 4 (12B / 26B-A4B). Eine ehrliche Vergleichstabelle:

Pure Geschwindigkeit (tok/s)
Bei gleicher Modellgröße und gleicher VRAM-Kapazität liegt GLM 5.1 im selben Bereich wie die dichten Modelle von Qwen 3.5 und Gemma 4. Es gibt keinen markanten Unterschied — der Durchsatz hängt vor allem vom Backend (Ollama vs. llama.cpp vs. vLLM) und von der GPU ab.
Qualität auf Französisch
Mistral Small 24B (nativ) > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 bei gleicher Größe. Wenn Französisch entscheidend ist, bleibt Mistral vorn; GLM 5.1 ist eine solide zweite Wahl unter den offenen Modellen.
Code
Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 als Allzweckmodell > Gemma 4 bei gleicher Größe. GLM 5.1 32B ist gegenüber Qwen 3.8 27B konkurrenzfähig, liegt aber leicht hinter den auf Code spezialisierten Modellen.
Tool Calling
GLM 5.1 ≈ Qwen 3.5 > Gemma 4. Die beiden ersten wurden explizit für Tools trainiert, Gemma erfordert etwas mehr Prompt-Engineering.
Langer Kontext
Qwen 3.5 256k nativ (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M über YaRN) > Gemma 4 128k. Für die Analyse einer kompletten Codebasis behält Qwen eine längere Vorwärtskette.
Lizenz
GLM (Apache-ähnlich) ≈ Qwen (Apache 2.0 bei den meisten Varianten) ≈ Gemma 4 (Apache 2.0 seit April 2026). Drei unkomplizierte Lizenzen für den Einsatz in Unternehmen, wobei Gemma seine eigene Lizenzklausel aufgegeben hat.
Ökosystem
Qwen > Gemma 4 > GLM 5.1. Qwen hat inzwischen die größte Anzahl an Community-Fine-Tunes, Gemma 4 folgt dicht dahinter, GLM 5.1 bleibt weniger verbreitet – weniger Varianten, weniger Tutorials auf Französisch.
i
Unsere ehrliche Empfehlung
Wenn Sie 12 GB VRAM haben und etwas abseits der üblichen Wege ausprobieren möchten: GLM 5.1 9B. Wenn Sie bei 24 GB das beste offene Allround-Modell suchen: Qwen 3.8 27B oder GLM 5.1 32B, je nachdem, welches mit Ihren Prompts besser funktioniert. Wenn Community und Fine-Tuning wichtig sind: Qwen 3.5 bleibt bei der Anzahl abgeleiteter Varianten unübertroffen.

#Tipps und Stolperfallen

Kurzer Systemprompt
GLM 5.1 befolgt Systemprompts gut, aber wird etwas überlastet, wenn man ihm 800 Wörter gibt. Wählen Sie 200–400 Wörter, klar und strukturiert.
Niedrige Temperatur für FR
0,2 bis 0,4, um Anglizismen und Unstimmigkeiten bei der grammatischen Kongruenz zu minimieren. Oberhalb von 0,7 beginnt die Qualität französischer Texte zu schwanken.
Stop-Tokens
Das Modell verwendet <|endoftext|> und <|user|> als Trennzeichen. Wenn Sie Ihren eigenen Client schreiben, fügen Sie diese beiden Zeichenfolgen zu den Stop-Tokens hinzu, damit das Modell nicht von selbst weiterredet.
Streaming über Ollama
Die Endpunkte /api/chat und /v1/chat/completions unterstützen stream=true. Anders als bei manchen MoE-Modellen gibt es bei GLM 5.1 keine besonderen Eigenheiten.
LoRA-Fine-Tuning
LoRA-Fine-Tuning von GLM 5.1 9B ist mit Unsloth auf einer RTX 4090 mit 24 GB praktikabel. Das 32B-Modell erfordert mehrere GPUs oder einen Mac mit großzügig bemessenem gemeinsamem Speicher für CPU und GPU.
Ollama-Modelfile
Um einen Systemprompt und Parameter festzulegen, erstellen Sie ein Modelfile auf Basis von glm5.1:9b und führen anschließend ollama create monassistant -f Modelfile aus. Das abgeleitete Modell erscheint in ollama list wie jedes andere Modell.
!
Verwechslung mit ChatGLM und GLM-4
Verwechseln Sie GLM 5.1 (moderne dichte Transformer-Architektur, 2026 erschienen) nicht mit ChatGLM (erste Generation, 2023) oder GLM-4 (2024). Die Ollama-Tags sind unterschiedlich (chatglm, glm4, glm5.1); prüfen Sie genau, was Sie herunterladen.

#Weiterführende Informationen

GLM 5.1 läuft, und Sie haben Ihre ersten Ergebnisse. Einige Anregungen, um weiterzugehen:

Quantisierung wählen (Q4, Q5, Q8, FP16)
Um den genauen Kompromiss zwischen Qualität und VRAM für Ihre Anwendungsfälle zu bestimmen.
Qwen3.6 35B-A3B lokal: Test und VRAM-Anforderungen
Der direkte Konkurrent von Qwen mit MoE-Architektur. Ein hilfreicher Vergleich, wenn Sie unsicher sind.
Open WebUI mit Ollama: der komplette Guide
Eine ChatGPT-ähnliche Benutzeroberfläche auf Basis von GLM 5.1: Gespräche, RAG, Mehrbenutzerbetrieb.
Lokalen KI-Agenten in Python mit LangChain und Ollama erstellen
Um die native Tool-Call-Funktion von GLM 5.1 zu nutzen und damit Ihre eigenen Funktionen aufzurufen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.