Einsteiger 9 Min.Ollama

Gemma 3 (Google) lokal: vollständiger Leitfaden 2026

Gemma 3 ist Googles Familie von Open-Weight-Modellen, die im März 2025 veröffentlicht wurde. Vier Größen (1B, 4B, 12B, 27B), integrierte Bildverarbeitung ab 4B, eine Kontextlänge von 128k und solide mehrsprachige Unterstützung mit ordentlichem Französisch. Dieser Leitfaden behandelt Schritt für Schritt die lokale Installation von Gemma 3 mit Ollama, die Google-Lizenz, die Sie kennen sollten, und die Bereiche, in denen das Modell wirklich glänzt.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Gemma 3?

Gemma 3 ist die dritte Generation der Open-Weight-Modelle von Google DeepMind, die aus derselben Forschung wie Gemini hervorgegangen sind. Die Familie umfasst vier deutlich unterschiedliche Größen – von 1B bis 27B. So können Sie genau die passende Größe für Ihre vorhandene Hardware wählen, vom Laptop ohne GPU bis zur Workstation mit 24 GB.

Drei Eigenschaften heben Gemma 3 von anderen Modellen dieser Kategorie ab: ein standardmäßig verfügbarer Kontext von 128k (nur 32k bei der 1B-Version), integrierte multimodale Bildverarbeitung ab der 4B-Version, ohne ein separates Modell laden zu müssen, und gezielte Arbeit an der Mehrsprachigkeit (laut Google-Dokumentation werden bei den Größen ab 4B mehr als 140 Sprachen abgedeckt).

i
Kurz gesagt
Gemma 3 = Googles „vielseitige“ Modellfamilie. Bei keinem bestimmten Benchmark die stärkste, aber eine der umfassendsten: 4 Größen, Bildverarbeitung, langer Kontext, Mehrsprachigkeit. Ideal als Standardmodell auf einem bestimmten Rechner.

#Die 4 Größen von Gemma 3

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Wahl der richtigen Größe ist die wichtigste Entscheidung. Hier ist die Zuordnung von Einsatzzweck und Hardware:

gemma3:1b
Nur Text, Kontext 32k. Für reinen CPU-Betrieb, Raspberry Pi 5 oder einen Mac M1 mit 8 GB. Begrenzte Qualität, aber sofortige Antworten. Gut für Klassifikation und kurze Umformulierungen.
gemma3:4b
Multimodal (Text + Bild), Kontextgröße 128k. Die „Laptop“-Stufe: passt problemlos in 6 GB VRAM oder auf einen Mac M2/M3 mit 16 GB Arbeitsspeicher. Angemessene Qualität für allgemeine Aufgaben.
gemma3:12b
Multimodal, Kontextfenster mit 128k Tokens. Die Stufe „Mittelklasse-PC“: RTX 3060 mit 12 GB, 4070, M3 Pro mit 18 GB. Die Qualität ist im Alltag wirklich brauchbar.
gemma3:27b
Multimodal, Kontext 128k. Die „Workstation“-Stufe: RTX 3090/4090, M3 Max. Das beste Gemma-3-Modell, bei vielen Aufgaben mit Modellen einer höheren Kategorie vergleichbar.
→
Wenn Sie unsicher sind
Beginnen Sie mit der 4B-Variante. Sie ist das kleinste Modell mit Bildverarbeitung und einem 128k-Kontext und läuft praktisch überall. Auf 12B oder 27B können Sie umsteigen, sobald Sie wissen, ob Ihnen die Qualität ausreicht.

#VRAM-Voraussetzungen (Quantisierung Q4_K_M)

gemma3:1b
≈ 1 GB VRAM oder RAM. Läuft auf jedem Rechner, auch auf einem Raspberry Pi 5.
gemma3:4b
≈ 3 GB VRAM. RTX 3050 6 GB, GTX 1660 6 GB, MacBook Air M2 8 GB reichen aus.
gemma3:12b
≈ 8 GB VRAM. RTX 3060 mit 12 GB, RTX 4070 mit 12 GB, Mac M3 Pro mit 18 GB gemeinsamem Speicher.
gemma3:27b
≈ 17 GB VRAM in Q4. RTX 3090/4090 mit 24 GB oder Mac M3/M4 Max mit mindestens 36 GB. In Q3 (verringerte Qualität) passt das Modell auch in 16 GB.

Rechnen Sie je nach tatsächlich verwendeter Kontextlänge etwa 1 bis 4 GB für den KV-Cache hinzu. Das Laden des vollständigen 128k-Kontexts eines 27B-Modells benötigt mehr VRAM als die Modellgewichte allein.

#1. Lokale Installation von Gemma 3 mit Ollama

Falls Ollama noch nicht installiert ist, folgen Sie zuerst dem Leitfaden zur Installation von Ollama für Ihr Betriebssystem. Sobald Ollama läuft, lässt sich Gemma 3 mit einem einzigen Befehl herunterladen.

Terminal
ollama run gemma3:4b

Ollama lädt das Modell herunter (etwa 3,3 GB für die 4B-Version in Q4) und startet es anschließend direkt im interaktiven Modus. Sobald der Prompt >>> erscheint, können Sie es testen.

Pull ohne Start
ollama pull gemma3:1b
ollama pull gemma3:4b
ollama pull gemma3:12b
ollama pull gemma3:27b

Der Ollama-Daemon lauscht auf http://localhost:11434 — Sie können Open WebUI, LM Studio als Client, Continue.dev oder jeden anderen OpenAI-kompatiblen Client damit verbinden.

→
Die richtige Quantisierung wählen
Der Standard-Tag (z. B. gemma3:12b) verweist auf Q4_K_M, den besten Kompromiss zwischen Qualität und Speicherbedarf für die meisten Anwendungen. Für höhere Qualität auf Kosten eines höheren VRAM-Bedarfs verwenden Sie gemma3:12b-it-q5_K_M oder q8_0.

#2. Mehrsprachigkeit und Qualität im Französischen

Googles Arbeit an der Mehrsprachigkeit bleibt eine echte Stärke von Gemma 3 gegenüber kleinen, auf Englisch ausgerichteten Modellen. Französisch ist im Trainingskorpus gut vertreten — Sie werden praktisch nie erleben, dass das Modell mitten in einer Antwort ins Englische wechselt, was bei kleineren Modellen weiterhin ein wiederkehrender Schwachpunkt ist. Die Modellgenerationen von 2026 (Qwen 3.5, Granite 4.2) haben bei Französisch deutlich aufgeholt, aber Gemma 3 kann auf diesem Gebiet weiterhin mithalten.

Gemma 3 4B
Brauchbares Französisch für einfache Aufgaben (Zusammenfassung, Umformulierung, Klassifikation). Beim Verfassen längerer Texte bleiben die Formulierungen manchmal unbeholfen.
Gemma 3 12B
Niveau eines „brauchbaren französischsprachigen Assistenten“. Gute Beherrschung der Grammatik, vielfältiger Wortschatz, wenige störende Anglizismen. In diesem Punkt mit Qwen 3.5 9B vergleichbar.
Gemma 3 27B
Sehr gutes Französisch. Beim Verfassen von Texten auf dem Niveau von Mistral Small 24B, beim formalen Schlussfolgern etwas darunter, aber bei Nuancen und Stil oft besser.
Schnelltest auf Französisch
>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne.

1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains...
2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE...
3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...

#3. Integrierte multimodale Vision

Ab der 4B-Variante akzeptiert Gemma 3 Bilder als Eingabe — ein separates Vision-Modell muss nicht geladen werden. Dieselbe ausführbare Datei verarbeitet Text und Bilder mit einem integrierten SigLIP-Encoder. Praktisch für OCR, Bildbeschreibungen oder die Analyse von Screenshots.

Ollama-CLI mit Bild
ollama run gemma3:12b
>>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png

In der Python-API wird das Bild im Format base64 oder über einen lokalen Pfad übergeben:

Ollamas Python-API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{
        'role': 'user',
        'content': 'Extrais le texte visible sur cette facture.',
        'images': ['/chemin/vers/facture.jpg'],
    }]
)
print(response['message']['content'])
i
Realistische Einschätzung der Vision-Qualität
Gemma 3 Vision liefert ordentliche Ergebnisse bei allgemeinen Beschreibungen, bei der OCR sauberer Dokumente und beim Lesen von Benutzeroberflächen. Für die OCR unscharfer Fotos oder handschriftlicher Inhalte bleibt ein neueres und größeres Vision-Modell wie Qwen 3.8 27B (Vision) besser. Bei komplexem räumlichem Schlussfolgern (Objekte zählen, eine technische Zeichnung verstehen) bleibt noch Verbesserungspotenzial — das gilt für alle Open-Weight-LLMs.

#4. 128k-Kontext in der Praxis

Das Kontextfenster von Gemma 3 mit 128k (außer bei der 1B-Variante, die auf 32k begrenzt ist) reicht aus, um ein kurzes Buch, einen vollständigen Dokumentationsordner oder Transkripte mehrerer Stunden zu verarbeiten. Standardmäßig lädt Ollama einen deutlich kürzeren Kontext (typischerweise 4k oder 8k), um VRAM zu sparen – Sie müssen ihn ausdrücklich erweitern.

Den Kontext über die CLI erweitern
ollama run gemma3:12b
>>> /set parameter num_ctx 32768

Oder über die API, indem Sie die Option num_ctx bei der Anfrage übergeben:

Erweiterter Kontext über die API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{'role': 'user', 'content': 'Résume ce document : ...'}],
    options={'num_ctx': 32768},
)
!
Der Kontext kostet VRAM
Jedes Kontexttoken benötigt Speicher für den KV-Cache. Der Wechsel von 8k auf 128k bei einem 12B-Modell kann den VRAM-Verbrauch um 4–6 GB erhöhen. Wenn der VRAM voll ist, wechselt das Modell zum CPU-Offloading und die Geschwindigkeit bricht ein. Erweitern Sie schrittweise: 16k → 32k → 64k entsprechend Ihrem tatsächlichen Bedarf.

#Gemma-Lizenz: Was Sie wissen müssen

Gemma 3 steht NICHT wie Mistral, Qwen oder DeepSeek unter einer Apache-2.0- oder MIT-Lizenz. Google verwendet eine eigene Lizenz: die „Gemma Terms of Use“. Sie erlaubt die kommerzielle Nutzung einschließlich der Weitergabe abgeleiteter Modelle, schreibt aber zwei Einschränkungen vor, die wirklich freie Lizenzen nicht haben.

Richtlinie zu verbotenen Nutzungen
Sie müssen die Gemma Prohibited Use Policy einhalten (keine Generierung von CSAM, keine eklatanten Rechtsverletzungen usw.). Google kann die Liste einseitig ändern.
Weitergabe der Lizenzbedingungen
Wenn Sie das Modell (oder ein davon abgeleitetes Modell) weiterverbreiten, müssen Sie Ihren Nutzern die Gemma-Lizenz weitergeben und sie zur Zustimmung zu denselben Einschränkungen verpflichten.
Kein "Copyleft"
Die Lizenz überträgt sich NICHT auf Ihre Anwendungen, die Gemma 3 aufrufen. Sie betrifft nur die weiterverteilten Modellgewichte.
!
Für professionellen Einsatz
Für eine einfache Nutzung als internes SaaS-Angebot oder in einem Produkt (der Endnutzer sieht die Gewichte nie) ist Gemma 3 problemlos einsetzbar. Wenn Sie ein feinabgestimmtes Modell veröffentlichen oder Gemma 3 in ein Open-Source-Produkt integrieren möchten, das mit den Gewichten verbreitet wird, lesen Sie vorher die Lizenz — der Unterschied zu einer wirklich permissiven Lizenz wird dann spürbar. Hinweis: Google hat die nächste Generation, Gemma 4, unter die Apache-2.0-Lizenz gestellt (April 2026) — wenn die Weiterverbreitung der Gewichte für Sie wichtig ist, hebt diese Lizenz genau diese Einschränkung auf.

#Gemma 3 27B vs Llama 4 Scout

Beide Modelle positionieren sich im Segment „lokal nutzbare Spitzenmodelle“. Für die Auswahl müssen Sie vergleichen, was sie wirklich voneinander unterscheidet:

Architektur
Gemma 3 27B ist ein dichtes Modell (27 Milliarden Parameter, alle aktiv). Llama 4 Scout ist ein MoE (17 Milliarden aktive Parameter, insgesamt 109 Milliarden) — bei gleicher VRAM-Kapazität deutlich leistungsfähiger, sofern es in den Speicher passt, setzt aber voraus, dass sämtliche Experten geladen werden können.
Mindestbedarf an VRAM
Gemma 3 27B Q4: ≈ 17 GB. Llama 4 Scout Q4: ≈ 60 GB (alle Experten geladen). Auf einer einzelnen RTX 4090 passt nur Gemma 3 27B mit genügend Spielraum in den Speicher.
Kontext
Gemma 3 : 128k. Llama 4 Scout : 10M (theoretisch, in der Praxis geringer). Wenn Sie tatsächlich mehr als 128k Tokens verarbeiten, hat Scout den Vorsprung.
Vision
Beide sind von Haus aus multimodal. Vergleichbare Qualität bei allgemeinen Aufgaben.
FR
Gemma 3 ist bei alltäglichem Französisch etwas besser. Llama 4 Scout ist beim formalen Schlussfolgern und bei Code stärker.
Lizenz
Gemma Terms of Use vs. Llama 4 Community License. Beide sind nicht OSI-konform und erlauben eine kommerzielle Nutzung unter jeweils spezifischen Einschränkungen.
→
Fazit
Auf einer einzelnen GPU mit 24 GB: Gemma 3 27B. Auf einem Mac Studio Ultra oder mit mehreren GPUs wird Llama 4 Scout wegen der Vorteile der MoE-Architektur interessant. Viele Nutzer lassen beide Modelle installiert und wechseln je nach Aufgabe.

#Fehlerbehebung

"Out of memory" beim Laden
Der VRAM reicht für die gewählte Größe nicht aus. Wechseln Sie zur nächstkleineren Größe (gemma3:12b → gemma3:4b) oder zu einer aggressiveren Quantisierung (Q4 → Q3). Erzwingen Sie bei einem 27B-Modell keinen CPU-Offload: Damit wird es unbrauchbar.
Abgelehnte Bilder
Sie verwenden wahrscheinlich gemma3:1b, das ausschließlich Text verarbeitet. Wechseln Sie mindestens zu gemma3:4b, um Bilder verarbeiten zu können.
Kontext jenseits von 4k wird ignoriert
Ollama verwendet standardmäßig einen sehr kleinen Wert für num_ctx. Erhöhen Sie ihn ausdrücklich mit /set parameter num_ctx 32768 oder über die API-Option options={'num_ctx': 32768}.
Langsame Generierung bei 12B/27B mit GPU
Prüfen Sie mit ollama ps, ob die Spalte PROCESSOR tatsächlich 100% GPU anzeigt. Wenn Sie einen CPU-Prozentanteil sehen, passen Modell und Kontext nicht vollständig in den VRAM — reduzieren Sie num_ctx.
Abgeschnittene Antworten
Erhöhen Sie num_predict (Standardwert 128 in einigen Clients). Für Ollama CLI: /set parameter num_predict 2048.

#Weiterführende Informationen

Gemma 3 eignet sich hervorragend als vielseitiger Einstieg. Hier sind einige naheliegende Möglichkeiten, je nachdem, wofür Sie es nutzen möchten:

Vergleich mit Gemma 4
Die Anleitung „Gemma 4 lokal mit Ollama“ zeigt die Entwicklung der Familie und wo ein Upgrade lohnend ist.
Optimale Wahl der Quantisierung
Die Anleitung „Quantisierung wählen (Q4, Q5, Q8, FP16)“ erläutert die Abwägungen, die besonders für die 4 Größen Gemma 3 gelten.
Bildverarbeitung in einer Pipeline nutzen
Der Leitfaden „Multimodale LLMs mit Bildverarbeitung lokal nutzen“ bietet konkrete Python-Anleitungen (OCR, Beschreibung, Analyse), die sich direkt auf Gemma 3 4B/12B/27B anwenden lassen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.