Von Gemma 2 zu Gemma 3 wechseln: Fallstricke und Prüfungen
Der Wechsel von Gemma 2 zu Gemma 3 verursacht selten Probleme beim Modellstart, führt aber häufig zu Problemen im Verhalten: Die Kontextgröße steigt von 8.192 Tokens auf 32.768 (1B) oder 131.072 Tokens (4B/12B/27B), das Chat-Template ändert sich und 4B/12B/27B werden multimodal, während Gemma 2 ausschließlich textbasiert war. Prüfen Sie erneut das von Ihrer Laufzeitumgebung angewendete Template und die tatsächlich konfigurierte Kontextgröße und führen Sie Ihre Testprompts vor jeder Umstellung im Produktivbetrieb erneut aus.
Gemma 2 (9B, 27B) und Gemma 3 (1B, 4B, 12B, 27B) sind nicht einfach dieselbe Modellfamilie mit einer höheren Versionsnummer: Architektur, Kontext und Eingabeformat ändern sich. Dieser Leitfaden führt die Punkte auf, die bei einer bereits auf Gemma 2 basierenden Anwendung tatsächlich zu Fehlfunktionen führen, und beschreibt die Prüfungen vor dem Austausch des Modells im Produktivbetrieb sowie alles, was Sie wissen müssen, um bei Bedarf zur bisherigen Version zurückzukehren.
#Was sich zwischen Gemma 2 und Gemma 3 wirklich ändert
Drei strukturelle Änderungen wirken sich auf eine bestehende Anwendung aus: die maximale Kontextlänge, die Struktur der an das Modell gesendeten Nachrichten und das Vorhandensein einer Bildeingabe. Einfach nur den Modellnamen in Ihrem Code zu ändern (von gemma2 zu gemma3), reicht nicht aus, um identisches Verhalten zu gewährleisten, selbst wenn das Ausgabeformat weiterhin Text ist.
Gemma 2 gab es nur mit 9 und 27 Milliarden Parametern. Gemma 3 ergänzt ein 1B- und ein 4B-Modell und definiert den Kontext jeder Modellgröße neu: Es ist nicht nur „größer“, sondern hat intern eine andere Architektur. Wenn Ihre Wahl der Modellgröße auf die Einschränkungen von Gemma 2 abgestimmt war, sollten Sie diese Wahl überdenken, statt sie unverändert zu übernehmen.
#Größen und Kontext: Der echte Sprung
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Gemma 2 hat einen festen Kontext von 8.192 Token, unabhängig von der Modellgröße. Gemma 3 erweitert diesen Kontext auf 32.768 Token für das 1B-Modell und auf 131.072 Token für die 4B-, 12B- und 27B-Modelle: ein Faktor 16 für mittlere und große Modelle. Das ist die nützlichste Angabe, um einen RAG-Einsatz oder einen langen Gesprächsverlauf zu dimensionieren. Der angegebene Kontext ist jedoch die Obergrenze des Modells und nicht der tatsächlich von Ihrer Laufzeitumgebung zugewiesene Speicher: Ollama und Inferenzserver begrenzen den Kontext standardmäßig oft auf einen deutlich niedrigeren Wert (häufig 4096 oder 8192 Token), solange er nicht ausdrücklich erhöht wird.
| Größe | Gemma 2: Kontext | Gemma 3 Kontext | Eingabebild |
|---|---|---|---|
| 1B | — | 32 768 Tokens | Nein (nur Text) |
| 4B | — | 131 072 Tokens | Ja |
| 9B / 12B | 8.192 Tokens (9B) | 131.072 Tokens (12B) | 9B: nein · 12B: ja |
| 27B | 8 192 Tokens | 131 072 Tokens | Ja |
#Chat-Template: der häufigste Stolperstein
Die häufigste Ursache für schlechtere Antworten nach einer Migration ist nicht die Qualität des Modells, sondern ein falsch angewendetes Chat-Template. Jede Modellfamilie erwartet eine bestimmte Formatierung der Gesprächsbeiträge (Markierungen für Anfang und Ende eines Beitrags, Position des Systemprompts). Wenn Ihre Anwendung den endgültigen Prompt selbst erstellt, statt die Laufzeitumgebung das Template des Modells anwenden zu lassen, erzeugt ein weiterhin auf Gemma 2 abgestimmtes Template Antworten, die abgeschnitten sind, am Thema vorbeigehen oder über das erwartete Ende hinaus weitergeneriert werden.
- 01Identifizieren, wer den Prompt erstelltPrüfen, ob Ihr Code den an das Modell gesendeten Text selbst zusammensetzt oder die Chat-API der Laufzeitumgebung (Ollama /api/chat, llama.cpp server) verwendet, die automatisch das richtige Template anwendet.
- 02Die Templates vergleichenDie im verwendeten Gemma-3-Modell (GGUF oder Hugging Face) eingebettete Template-Datei abrufen und mit der Template-Datei des bisher verwendeten Gemma-2-Modells vergleichen, statt anzunehmen, dass sie identisch sind.
- 03Einen Satz Referenzprompts erneut ausführenDieselben 10 bis 20 Testprompts zuerst mit Gemma 2 und anschließend mit Gemma 3 unter Verwendung des neuen Templates ausführen und die Länge, die Relevanz sowie das Vorhandensein eines sauberen Generierungsendes vergleichen.
Die Systemrolle veranschaulicht diese Falle gut. Google erklärt bei der Vorstellung von Gemma 4, dass diese neue Modellfamilie „im Gegensatz zu Gemma 3 die Standardrollen system, assistant und user verwendet“: eine offizielle Bestätigung dafür, dass Gemma 3 (wie Gemma 2) den Systemprompt nicht genau so behandelt wie Laufzeitumgebungen, die eine native Rolle system bereitstellen. Konkret muss Code, der sich auf die Konventionen anderer Modellfamilien stützt und eine separate Nachricht mit der Rolle system sendet, speziell bei Gemma 3 prüfen, wie seine Laufzeitumgebung diese Nachricht behandelt, statt davon auszugehen, dass sie isoliert verarbeitet wird.
#Multimodalität: Die Modelle 4B, 12B und 27B akzeptieren Bilder
Im Gegensatz zu Gemma 2, das ausschließlich textbasiert ist, verfügen die Modelle Gemma 3 4B, 12B und 27B über einen SigLIP-Bildencoder, der auf 896×896 Pixel skalierte Bilder verarbeitet; nur das 1B-Modell bleibt ausschließlich textbasiert. Konkret erhält Ihre Anwendung beim Wechsel auf ein 12B- oder 27B-Modell die Möglichkeit, Bilder als Eingabe zu verarbeiten, selbst wenn sie diese Fähigkeit nicht nutzt: Dadurch ändert sich das von manchen Runtimes erwartete API-Format (ein zusätzliches Bildfeld neben dem Text), und der beim Laden benötigte Speicher kann leicht zunehmen, selbst wenn kein Bild übermittelt wird.
Diese Umstellung auf Multimodalität hat eine praktische Folge, die bei Migrationen oft übersehen wird: Eine Pipeline, die das Format eingehender Nachrichten streng validiert hat (JSON-Schema, strikte Typisierung), kann ein fehlendes oder leeres Bildfeld ablehnen oder falsch interpretieren, wenn der API-Client des neuen Modells es standardmäßig hinzufügt. Umgekehrt muss an einer Pipeline, die nichttextuelle Eingaben bereits vor dem Modellaufruf herausgefiltert hat, nichts geändert werden: Die Bildverarbeitungsfähigkeit von Gemma 3 bleibt inaktiv, solange kein Bild übermittelt wird; ihre Nutzung wird niemals erzwungen.
#QAT-Quantisierung: Speicherbedarf um den Faktor 3 bis 4 reduziert
Google veröffentlicht Gemma-3-Checkpoints, die unter Berücksichtigung der Quantisierung trainiert wurden (QAT), zusätzlich zu den klassischen Q4_0-Versionen für Ollama, llama.cpp und MLX. Der Vorteil: deutlich geringere Qualitätsverluste als bei einer nachträglichen Quantisierung eines Modells, das darauf nicht vorbereitet wurde.
| Größe | BF16 | QAT int4 |
|---|---|---|
| 27B | 54 GB | 14,1 GB |
| 12B | 24 GB | 6,6 GB |
| 4B | 8 GB | 2,6 GB |
| 1B | 2 GB | 0,5 GB |
Diese Zahlen wurden von Google bei der Veröffentlichung der QAT-Checkpoints publiziert; sie geben den zum Laden der Gewichte benötigten Speicher an, nicht den gesamten Speicherverbrauch bei der Generierung (Kontext und KV-Cache kommen hinzu). Eine Messung auf Ihrem eigenen Gerät bleibt die einzige Möglichkeit, eine Zahl für Ihren Anwendungsfall zu bestätigen.
Die von Google verwendete Methode bezieht sich auf etwa 5.000 Schritte des Quantization-Aware-Training, wobei die Wahrscheinlichkeiten des nicht quantisierten Modells als Ziel verwendet werden, was eine Verringerung der Perplexität um 54 % gegenüber einer nachträglichen Quantisierung eines nicht darauf vorbereiteten Modells erzielt. Für eine Migration von Gemma 2 bedeutet das, dass ein gleiches Quantisierungslevel (z. B. Q4) auf Gemma 3 in der Regel ein Ergebnis liefert, das näher an dem vollständig präzisen Modell liegt als das, was von Gemma 2 bei klassischer Quantisierung erzielt wurde — ein Vorteil, der durch die Modellvorbereitung entsteht und nicht durch eine Einstellung des Benutzers resultiert.
#Zu Gemma 3 wechseln oder auf Gemma 4 warten?
Gemma 4 ist zum Zeitpunkt der Erstellung dieses Leitfadens bereits auf Ollama verfügbar. Das wirft für alle, die noch von Gemma 2 migrieren, eine wichtige Frage auf: Sollte man bei Gemma 3 bleiben oder direkt auf die nächste Generation setzen? Die Modellseite von Gemma 4 auf Ollama nennt andere Größen als bei Gemma 3 (E2B- und E4B-Varianten mit reduzierter effektiver Parameterzahl, ein 12B-Modell, eine 26B-MoE-Variante mit 3,8 Milliarden aktiven Parametern und ein dichtes 31B-Modell). Diese Varianten sind auf Reasoning, agentische Workflows und Code ausgerichtet – ein breiteres Einsatzspektrum als der reine Ersatz von Gemma 2.
Für eine Anwendung, die bereits mit Gemma 2 im Produktivbetrieb läuft, konzentriert sich dieser Leitfaden weiterhin auf die Migration zu Gemma 3: Die hier beschriebenen Prüfungen von Kontext, Template und Regressionen gelten unverändert auch dann, wenn das endgültige Ziel Gemma 4 ist. Die direkte Umstellung verändert jedoch mehr Dinge (Standard-Chat-Rollen, neue Größen, MoE-Architektur bei der 26B-Variante) als eine Migration Gemma 2 → Gemma 3. Ein eigener Leitfaden beschreibt ausführlich die lokale Installation und die Leistung von Gemma 4.
#Checkliste vor dem Wechsel in den Produktivbetrieb
- Runtime-Version
- Prüfen, ob Ollama, llama.cpp oder MLX die gewünschte Version von Gemma 3 unterstützen (die Unterstützung wurde nach der Veröffentlichung des Modells hinzugefügt und ist bei einer älteren Runtime-Version nicht immer sofort verfügbar).
- Tatsächlich konfigurierter Kontext
- Die Kontextgröße des Servers nicht dem Zufall überlassen: Sie ausdrücklich nach Ihren tatsächlichen Anforderungen einstellen, nicht nach der maximalen Kontextgröße des Modells.
- Bild-Eingabeformat
- Bei einem Wechsel zu 4B, 12B oder 27B überprüfen, dass Ihr API-Client kein Bildformat sendet, das mit dem neuen Endpunkt inkompatibel ist.
- Wahl der Quantisierung
- Einen klassischen GGUF Q4_K_M und einen offiziellen QAT-Checkpoint mit Ihren eigenen Prompts vergleichen, bevor Sie sich endgültig entscheiden; beide sind für Gemma 3 verfügbar.
- Rollback-Zeitfenster
- Das Modell Gemma 2 und seine Konfiguration während der Umstellung verfügbar halten, bis bestätigt ist, dass keine Regressionen auftreten.
#Eine Regression bei Ihren Prompts erkennen
Eine Modellmigration lässt sich nicht anhand eines Gefühls nach zwei oder drei Fragen validieren. Ein Satz von Referenzprompts, der die tatsächliche Nutzung der Anwendung repräsentiert und unverändert mit dem alten und dem neuen Modell ausgeführt wird, ist die einzige Möglichkeit, eine unbemerkte Regression zu erkennen: eine längere, aber weniger präzise Antwort, den Verlust eines erwarteten Ausgabeformats (JSON, Liste) oder eine Veränderung des Tons. Diese Referenzausgaben aufzubewahren, ermöglicht es außerdem, die Migrationsentscheidung zu dokumentieren, statt sich auf einen Eindruck zu stützen.
#Einen Rollback einplanen
Die sicherste Vorgehensweise für eine Anwendung im Produktivbetrieb besteht darin, Gemma 3 parallel zu Gemma 2 bereitzustellen (mit einem eigenen Modellnamen in der Laufzeitumgebung), einen Teil des Datenverkehrs an die neue Version weiterzuleiten und die alte erst dann abzuschalten, wenn die Qualitätsmessungen mit Ihren Referenz-Prompts mindestens gleichwertige Ergebnisse liefern. Das beansprucht während der Übergangsphase etwas zusätzlichen Festplattenspeicher und RAM, verhindert aber einen Dienstausfall, falls das neue Chat-Template oder der neue Kontext unter realen Bedingungen zu unerwartetem Verhalten führt.
- Gemma 3 Schritt für Schritt lokal installieren
- Die Formate GGUF und safetensors verstehen
- Vergleichen Sie lokale KI mit ChatGPT
- Gemma 4 lokal: Installation, VRAM und Leistung
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Den KV-Cache quantisieren, um bei langen Kontexten VRAM zu sparen
- Quelle: offizielle Präsentation von Gemma 3 (Hugging Face)
- Quelle: QAT-Checkpoints für Gemma 3 (Google Developers Blog)
- Quelle: offizielle Präsentation von Gemma 2 (Hugging Face)
- Quelle: Gemma-4-Modellseite auf Ollama
Kann man Gemma 2 durch Gemma 3 ersetzen, ohne den Code zu ändern?+
Ist Gemma 3 aufwendiger zu betreiben als Gemma 2?+
Sollte die QAT-Version oder eine klassische GGUF-Q4_K_M-Version verwendet werden?+
Ist das Kontextfenster von Gemma 3 mit 131.072 Tokens standardmäßig aktiv?+
Soll man direkt auf Gemma 4 wechseln, anstatt auf Gemma 3?+
Kann ein Modell Gemma 3 27B auf einer Allgemeinverfügbarkeitskarte laufen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.