Mittelstufe 10 Min.Gemma

Gemma 4 lokal mit Ollama: Installation, VRAM, perfs

Gemma 4 ist die neue Generation von Open-Weight-Modellen von Google, erschienen 2026. Native Multimodalität, ein langes Kontextfenster, Apache-2.0-Lizenz und drei nützliche Modellgrößen in der Ollama-Bibliothek: E2B (kompakt), 12B und 26B-A4B (ein MoE). Dieser Leitfaden zeigt Ihnen, wie Sie Gemma 4 mit Ollama ausführen, welche Quantisierung Sie je nach verfügbarem VRAM wählen sollten, welche Größenordnungen bei Tokens pro Sekunde auf RTX und Apple Silicon zu erwarten sind und was sich gegenüber Gemma 3 konkret ändert.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Gemma 4 lokal ausführen?

Gemma 4 ist eines der besten open-weight-Modelle seiner Größe für Französisch. Der 12B Q4 passt problemlos in 8 bis 12 GB VRAM, was eine RTX 3060, eine 4070 oder einen Mac M-Serie-Mittelklasse abdeckt. Der 26B-A4B, ein MoE, der nur 4B Parameter aktiviert, nutzt Karten mit 24 GB (3090, 4090, 7900 XTX) sowie Macs mit ausreichender integrierter Speicher und bleibt dennoch schnell. Bei der Nutzung als Assistent im Französischen, RAG, allgemeinem Code ist dies ein hervorragendes Modell.

Der andere Grund, es lokal zu betreiben: Seit April 2026 wird Gemma 4 unter der Apache-2.0-Lizenz veröffentlicht. Damit entfallen die Einschränkungen der bisherigen Gemma Terms of Use (kommerzielle Nutzung, Weiterverbreitung und Fine-Tuning sind frei erlaubt), und Ollama übernimmt den Pull, die Quantisierung und die Inferenz, ohne dass Sie direkt mit Python, CUDA oder llama.cpp arbeiten müssen.

i
Kurz gesagt
Gemma 4 + Ollama bedeutet: ein Befehl zum Herunterladen, ein Befehl zum Chatten und ein OpenAI-kompatibler Endpunkt auf localhost:11434. Der Rest ist nur eine Frage der Einstellungen.

#Was sich im Vergleich zu Gemma 3 ändert

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Gemma 3 (März 2025) brachte Multimodalität und einen Kontext von 128k. Gemma 4 behält diese Errungenschaften bei und entwickelt sie in drei Bereichen weiter: Qualität (ein großer, in Benchmarks für logisches Schlussfolgern und Code gemessener Sprung), Effizienz (das 12B-Modell ersetzt das 27B-Modell von Gemma 3 bei vielen Aufgaben mit Vorteilen, und das MoE-Modell 26B-A4B führt das Äquivalent eines großen Modells mit der Geschwindigkeit eines kleinen aus) und Tokenizer (ein dichteres Vokabular, das bei gleichwertiger Textgenerierung die Anzahl der Tokens reduziert – also mehr nützliche Tokens pro Sekunde).

Größen
Gemma 3: 1B, 4B, 12B, 27B (dichte Modelle). Gemma 4: E2B (kompakt), 12B (dicht) und 26B-A4B (MoE, 4B aktive Parameter). Die Modellreihe wird effizienter, statt einfach größer zu werden.
Multimodal
Native Bildverarbeitung bei 12B und 26B-A4B (Text + Bilder). E2B bleibt die kompakte, textorientierte Variante.
Kontext
128k Tokens bei allen Modellen der Reihe. Dieselben Speicherbeschränkungen wie zuvor: Der KV-Cache benötigt schnell viel Speicher.
Tokenizer
SentencePiece, mit überarbeitetem Vokabular zur besseren Abdeckung von Französisch, Code und Sprachen mit nichtlateinischen Schriftsystemen. Bei einem gleichwertigen Prompt werden etwa 5 bis 15 % weniger Tokens verbraucht.
Lizenz
Apache 2.0 seit April 2026. Kommerzielle Nutzung, Weiterverbreitung und Fine-Tuning sind frei, ohne spezifische Klausel zur zulässigen Nutzung — eine echte Änderung gegenüber den Gemma Terms of Use von Gemma 3.
→
Wann Sie bei Gemma 3 bleiben sollten
Wenn Sie bereits eine bewährte RAG-Pipeline mit Gemma 3 12B betreiben und Ihnen die Qualität genügt, wechseln Sie nicht bloß aus Prinzip. Gemma 4 12B ist besser, aber der etwas höhere VRAM-Bedarf (~8 GB gegenüber ~7 GB in Q4) und die erneute Abstimmung der Prompts lohnen sich nur, wenn Sie an die Grenzen von Gemma 3 12B stoßen.

#Voraussetzungen

Ollama installiert
Aktuelle Version (≥ 0.5). Die Installationsanleitungen für Windows, macOS oder Linux ansehen, falls die Installation noch nicht erfolgt ist.
Festplattenspeicher
4,3 GB für E2B, 7,6 GB für 12B Q4 und 19 GB für 26B-A4B Q4 einplanen. Die Q5- und Q8-Varianten von 12B und 26B benötigen das 1,3- bis 2-Fache an Speicherplatz.
VRAM oder Unified Memory
Praktisches Minimum: 6 GB für E2B, 8 bis 12 GB für 12B in Q4, 24 GB für 26B-A4B in Q4. Bei weniger Speicher werden Teile des Modells auf die CPU ausgelagert, und die Geschwindigkeit bricht ein.
Aktuelle GPU-Treiber
CUDA 12.x für NVIDIA, ROCm 6.x für AMD, natives Metal für Apple Silicon. Ollama erkennt das Backend automatisch.

#1. Pull und Start mit einem Befehl

Der Ollama-Tag für Gemma 4 folgt der üblichen Konvention: gemma4 (latest verweist standardmäßig auf das 12B-Modell in Q4), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Um die Quantisierung ausdrücklich anzugeben, hängt man ein Suffix an: gemma4:12b-instruct-q4_K_M.

Pull und direkter Start
ollama run gemma4:12b

Bei der ersten Ausführung lädt Ollama das Modell herunter (~7,6 GB für den 12B Q4) und öffnet anschließend direkt einen interaktiven Prompt. Bei späteren Ausführungen startet es sofort, solange das Modell im Arbeitsspeicher-Cache bleibt.

Nur Pull (ohne Start)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
Die Quantisierung explizit wählen
Standardmäßig stellt Ollama Q4_K_M bereit, das in 95 % der Fälle den besten Kompromiss zwischen Qualität und Speicherbedarf bietet. Für mehr Qualität: gemma4:12b-instruct-q5_K_M (etwas bessere Qualität, +25 % VRAM), gemma4:12b-instruct-q8_0 (nahe an FP16, +100 % VRAM). E2B hingegen wird direkt in QAT int4 (gemma4:e2b-it-qat) bereitgestellt und hat keine sinnvolle Variante mit höherem Speicherbedarf. Unquantisiertes FP16 ist nur für Fine-tuning von Interesse.

Um in Echtzeit zu prüfen, was im VRAM geladen ist:

Status der geladenen Modelle
ollama ps

Die Spalte PROCESSOR muss 100 % GPU anzeigen. Wenn Sie 70 % / 30 % GPU / CPU sehen, passt das Modell nicht vollständig in den VRAM und wird teilweise in den System-RAM ausgelagert – wechseln Sie zu einer aggressiveren Quantisierung oder zu einer kleineren Modellgröße.

#2. VRAM je Größe und Quantisierung

Die folgenden Zahlen umfassen die Modellgewichte plus einen KV-Cache für ein Kontextfenster von 8k Tokens (die Standardeinstellung von Ollama). Für eine Erweiterung auf 32k oder 128k sollten Sie je nach Größe mit zusätzlichen 2 bis 8 GB rechnen.

Gemma 4 E2B — QAT int4
≈ 4,5 GB VRAM. Kompakte Variante (QAT, ~2 Milliarden aktive Parameter nach dem MatFormer-Prinzip). Passt auf jede GTX 1660 (6 GB), RTX 3050 (8 GB) oder einen Mac mit 8 GB gemeinsamem Speicher.
Gemma 4 12B — Q4_K_M
≈ 8 GB VRAM. Besonders geeignet für: RTX 3060 12 GB, 4070 12 GB, 5070 12 GB, Mac mit 16 GB oder mehr.
Gemma 4 12B — Q5_K_M
≈ 9,5 GB VRAM. Passt mit einem moderaten Kontext in 12 GB, komfortabler mit 16 GB (4070 Ti Super, 5080).
Gemma 4 12B — Q8_0
≈ 13 GB VRAM. Nur für Grafikkarten mit mindestens 16 GB oder Apple-Silicon-Systeme mit großzügiger Speicherausstattung.
Gemma 4 26B-A4B — Q4_K_M
≈ 19 GB VRAM. Sweet Spot: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE: Lädt nur 4B aktive Parameter und ist daher trotz des Speicherbedarfs schnell.
Gemma 4 26B-A4B — Q5_K_M
≈ 23 GB VRAM. An der oberen Grenze für 24 GB; andernfalls einen Mac mit mindestens 48 GB vereinheitlichtem Speicher oder ein Multi-GPU-System ins Auge fassen.
Gemma 4 26B-A4B — Q8_0
≈ 30 GB VRAM. Für Grafikkarten mit mindestens 32 GB (RTX 5090) oder Macs mit mindestens 48 GB vereinheitlichtem Speicher.
!
Die Falle des 128k-Kontextfensters
Das Aktivieren des maximalen Kontextfensters (num_ctx=131072) beim 12B-Modell kann den KV-Cache um 4 bis 6 GB vergrößern. Wenn das Modell in Q4 bei 8k gerade noch in den Speicher passt, wird es bei 32k die Kapazität überschreiten. Erhöhen Sie den Kontext schrittweise und behalten Sie ollama ps im Blick.

#3. Tokens/sec: RTX und Apple Silicon

Beobachtete Größenordnungen mit einer aktuellen Ollama-Version, 8k Kontext, kurzem Prompt und einer Generierung von 200 Tokens. Die Zahlen schwanken je nach generiertem Inhalt und Ollama-Version um ±15 %. Da der 26B-A4B ein MoE-Modell ist (4B aktive Parameter), läuft er deutlich schneller als ein dichtes 26B-Modell, sobald er im Speicher untergebracht ist.

RTX 3060 12 GB
Gemma 4 E2B: ~90 tok/s. Gemma 4 12B Q4: ~28 tok/s. 26B-A4B: passt nicht in den VRAM (19 GB), daher vermeiden.
RTX 4070 12 GB
E2B: ~130 tok/s. 12B Q4: ~46 tok/s. 26B-A4B: überschreitet die VRAM-Kapazität.
RTX 4080 Super 16 GB
12B Q4: ~66 Tok/s. 12B Q8: ~40 Tok/s. 26B-A4B: passt nicht in 16 GB.
RTX 4090 24 GB
12B Q4: ~100 Tok/s. 26B-A4B Q4: ~58 Tok/s. 26B-A4B Q5: ~50 Tok/s.
RTX 5090 32 GB
12B Q4: ~150 Tok/s. 26B-A4B Q4: ~88 Tok/s. 26B-A4B Q8: ~48 Tok/s.
Mac M3 Max 64 GB
12B Q4: ~38 Tok/s. 26B-A4B Q4: ~30 Tok/s. Schön gleichmäßige Leistung dank Unified Memory.
Mac M4 Pro 48 GB
12B Q4: ~34 tok/s. 26B-A4B Q4: ~24 tok/s. Das MoE-Modell passt problemlos in den Speicher und bleibt für seine Größe schnell.
Mac M4 Max 128 GB
26B-A4B Q4: ~36 tok/s. 26B-A4B Q8: ~20 tok/s. Der Mac, der am besten mit dem 26B im Alltag zurechtkommt.
→
Praktischer Hinweis
Über 30 tok/s ist die interaktive Nutzung flüssig. Zwischen 15 und 30 tok/s ist die Geschwindigkeit für Chats noch in Ordnung, bei längeren Ausgaben wird es aber zäh. Unter 10 tok/s sollten Sie sich auf Batch-Verarbeitung oder Aufgaben beschränken, bei denen Sie ohnehin bis zum Ende warten.

#4. Erster Prompt und nützliche Einstellungen

Gemma 4 antwortet gut auf Französisch ohne speziellen Systemprompt, aber einige Parameter sollten je nach Anwendung angepasst werden.

Schnelltest
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

Um die Parameter während des Betriebs über den interaktiven Prompt anzupassen:

Sitzungsparameter
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
0,7 standardmäßig. Senken Sie auf 0,2 bis 0,4 für faktenbasierte Inhalte, Code oder RAG. Erhöhen Sie auf 0,9 bis 1,1 für Brainstorming.
num_ctx
Kontextfenster. Je nach Build standardmäßig 4096 oder 8192. Erhöhen Sie den Wert entsprechend Ihrem Anwendungsfall und dem verfügbaren VRAM.
num_predict
Maximale Anzahl an generierten Tokens. -1 für unbegrenzt (bis zum Stop). Geeignet, um die Länge der Antworten zu begrenzen.
repeat_penalty
Standardmäßig 1,1. Wenn Gemma 4 in einer Schleife hängen bleibt, erhöhen Sie den Wert auf 1,15–1,2. Wenn die Antworten zu ausgefeilt wirken, senken Sie ihn auf 1,05.
i
Einstellungen dauerhaft speichern
Um einen Systemprompt und Parameter festzulegen, erstellen Sie ein Modelfile: FROM gemma4:12b, dann SYSTEM "...", PARAMETER temperature 0.3 usw. Führen Sie ollama create monassistant -f Modelfile aus und rufen Sie anschließend monassistant wie ein normales Modell auf.

#5. API und Integration in Ihren Code

Ollama stellt unter http://localhost:11434/v1 einen OpenAI-kompatiblen Endpunkt bereit. Jedes SDK, das die OpenAI-API unterstützt, funktioniert, wenn Sie einfach base_url auf Ihren lokalen Endpunkt setzen.

Python — OpenAI-SDK
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

Für die multimodale Version (12B und 26B-A4B) wird das Bild Base64-kodiert oder über eine lokale URL in der Nachricht übergeben – mit demselben Protokoll wie bei GPT-4o.

Bildverarbeitung mit curl
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#Fehlerbehebung

"Error: model gemma4 not found"
Der Tag existiert in Ihrer Ollama-Version noch nicht, oder es liegt ein Tippfehler vor. Prüfen Sie mit ollama list die installierten Modelle und sehen Sie in der Dokumentation der Ollama-Modellbibliothek nach den offiziellen Tags.
Modell, das teilweise auf die CPU ausgelagert wird
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
Geschwindigkeit geteilt durch 3 nach einigen Stunden
Der KV-Cache fragmentiert sich bei bestimmten Treibern. Starten Sie den Dienst Ollama neu (sudo systemctl restart ollama unter Linux, starten Sie die Anwendung unter Mac/Windows neu).
Abgebrochene Antworten nach ~400 Wörtern
num_predict ist zu niedrig. Setzen Sie num_predict auf 2048 oder auf -1 für eine unbegrenzte Ausgabe und erhöhen Sie num_ctx entsprechend.
Unbeholfenes Französisch bei E2B
Das ist zu erwarten: E2B ist für seine Größe leistungsfähig, bleibt aber eine kompakte Variante. Für anspruchsvolle Aufgaben auf Französisch wählen Sie das 12B-Modell.
OOM auf RTX 4060 8 GB bei 12B
Das 12B-Modell in Q4 passt gerade noch in 8 GB, ohne Spielraum für den Kontext. Nutzen Sie entweder gemma4:e2b-it-qat, akzeptieren Sie CPU-Offloading (~3–5 Tokens/s) oder wechseln Sie die Grafikkarte.

#Weiterführende Informationen

Gemma 4 läuft bei Ihnen. Hier sind einige Anregungen für die nächsten Schritte, je nachdem, was Sie damit machen möchten:

Was ist Ollama und wie funktioniert es
Wenn Sie Ollama gerade kennenlernen, behandelt dieser Einsteigerleitfaden die wichtigsten Befehle und vermittelt ein vollständiges Verständnis der Funktionsweise.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um genau zu verstehen, was Sie beim Wechsel von Q8 auf Q4 opfern und wann dies wirklich eine Rolle spielt.
Open WebUI mit Ollama
Für eine ChatGPT-ähnliche Oberfläche auf Basis von Gemma 4: Gesprächsverlauf, integriertes RAG, gemeinsame Nutzung durch mehrere Benutzer.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.