Mittelstufe 10 Min.IBM

Granite 4 von IBM lokal: Installation und Anwendungsfälle d'usage

IBM entwickelt eher unauffällig eine der interessantesten Open-Weight-LLM-Familien für Unternehmen: Granite. Dieser Leitfaden zeigt, wie Sie Granite 4 mit Ollama lokal installieren, erklärt die hybride Mamba-Architektur, die den benötigten Speicher reduziert, erläutert die Apache-2.0-Lizenz ohne versteckte Fallstricke und konzentriert sich auf die Einsatzbereiche — RAG, Function Calling und betriebliche Aufgaben —, in denen sich Granite wirklich von Modellen für die breite Öffentlichkeit abhebt.

Von Clara M.·Aktualisierung 2026-07-30·Unter Windows, macOS und Linux getestet

#Warum Granite 4 anstatt eines anderen Modells?

Granite ist nicht darauf ausgelegt, Chatbot-Ranglisten anzuführen. IBM verfolgt ein anderes Ziel: zuverlässige, speichersparende und rechtlich saubere Modelle, die für die Integration in Unternehmensanwendungen entwickelt wurden. Man entscheidet sich nicht für Granite, um über Philosophie zu diskutieren, sondern um ein Modell an eine Dokumentenbasis anzubinden, es Tools aufrufen zu lassen oder es kostengünstig auf einfacher Hardware auszuführen.

Drei Dinge unterscheiden Granite 4 von anderen Open-Weight-Modellen. Erstens eine hybride Mamba-Architektur, die den Speicherverbrauch stark reduziert, besonders bei langen Kontexten. Zweitens eine strikte Apache-2.0-Lizenz ohne die Nutzungseinschränkungen, die Llama oder Gemma vorgeben. Drittens die Arbeit an Nachvollziehbarkeit und Governance — signierte Modelle, dokumentierte Trainingsdaten, ISO-42001-Zertifizierung —, die IT-Leitungen und Rechtsabteilungen zu schätzen wissen. Dieses Modell ist darauf ausgelegt, eine Compliance-Prüfung zu bestehen, nicht nur einen Benchmark.

i
Granite zielt auf die Integration ab, nicht auf die Konversation
Wenn Sie den besten Allround-Assistenten auf Französisch suchen, werden Qwen3 oder Mistral oft weiterhin vorn liegen. Granite spielt seine Stärken aus, wenn es als Komponente eingesetzt wird: als RAG-Engine, zur Orchestrierung von Tools oder zur Extraktion strukturierter Daten in einer Pipeline.

#Die hybride Mamba-Architektur und ihre Speicherersparnis

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Das eigentliche technische Argument für Granite 4 ist seine Architektur. Ein klassischer Transformer basiert vollständig auf Attention: Bei jedem neuen Token liest das Modell den gesamten Kontext erneut und speichert einen „KV-Cache“, der linear mit der Gesprächslänge wächst. Je länger der Kontext, desto stärker steigt der VRAM-Bedarf und desto langsamer wird die Inferenz. Das ist die bekannte Grenze bei langen Kontexten im lokalen Betrieb.

Mamba gehört zu einer anderen Familie: den Zustandsraummodellen (state space models). Statt alles erneut zu lesen, hält eine Mamba-Schicht einen rekurrenten Zustand fester Größe vor, der die Vergangenheit zusammenfasst. Die Folge: Der Speicherbedarf wächst nicht mit der Kontextlänge, und der Durchsatz bleibt auch bei sehr langen Dokumenten stabil. Der Nachteil von Mamba allein ist, dass weiter zurückliegende Details weniger präzise abgerufen werden.

Granite 4 kombiniert beides. Die meisten Blöcke sind Mamba-2-Schichten (sparsam), durchsetzt mit einer Minderheit von Aufmerksamkeitsblöcken (präzise) — im Verhältnis von etwa neun Mamba-Schichten zu einer Aufmerksamkeitsschicht. So bleibt der Großteil des Speichervorteils erhalten, ebenso wie die Fähigkeit der Aufmerksamkeit, ein bestimmtes Detail exakt wiederzufinden. In der Praxis benötigt Granite 4 deutlich weniger RAM/VRAM als ein Transformer vergleichbarer Größe, insbesondere sobald der Kontext einige Tausend Tokens überschreitet.

→
Der Vorteil ist maximal bei langem Kontext
Bei einem kurzen Prompt ist der Unterschied zu einem klassischen Transformer gering. Laden Sie jedoch ein großes Dokument oder einen langen Gesprächsverlauf, wird der Abstand größer: Während ein klassisches Modell den Speicher Ihrer Grafikkarte voll auslastet, bleibt der Speicherbedarf von Granite nahezu konstant.

#Micro, Tiny und Small: welche Variante wählen

Granite 4 ist in mehreren Größen erhältlich, mit Suffixen, die die Zielhardware angeben. Die mit „H“ gekennzeichneten Versionen verwenden die hybride Architektur; für Umgebungen, die Mamba noch nicht unterstützen, wird eine nicht hybride Version bereitgestellt.

Granite 4 Micro (~3B, dicht)
Das kleinste Modell, mit dichter und hybrider Architektur. Ideal für den Betrieb auf einer CPU, mit wenig VRAM oder auf Edge-Geräten. Passt in Q4 in ~2 GB. Perfekt für Extraktion, Klassifikation und leichtgewichtiges RAG.
Granite 4 Tiny-H (~7B, MoE)
Hybrides Mixture-of-Experts-Modell: viele Parameter insgesamt, aber nur wenige sind bei jedem Token aktiv, daher schnell. Guter Kompromiss zwischen Qualität und Geschwindigkeit auf einer Einsteiger-Grafikkarte.
Granite 4 Small-H (~32B, MoE)
Die erschwingliche Spitzenklasse: bei beruflichen Aufgaben eine Qualität nahe der großer Modelle, bei weiterhin geringem Speicherbedarf der Hybridarchitektur. Für Workstations oder Server gedacht.
Nicht hybride Variante
Für Laufzeitumgebungen, die Mamba noch nicht unterstützen, gibt es eine klassische Transformer-Version. Nur für Fälle verwenden, in denen die Kompatibilität dies erfordert – der Speichervorteil geht dabei verloren.

Für den Einstieg reicht Micro aus, um die Anwendungsfälle zu validieren, und läuft überall. Wechseln Sie zu Tiny-H oder Small-H, sobald Sie wissen, was Sie in den produktiven Regelbetrieb überführen möchten, und ein Qualitätsdefizit messen.

#Voraussetzungen und VRAM

Die einzige Softwarevoraussetzung ist eine installierte und aktuelle Version von Ollama – der Daemon lauscht standardmäßig auf http://localhost:11434. Stellen Sie sicher, dass Sie eine aktuelle Version verwenden: Die Unterstützung der Mamba-Schichten von Granite 4 erfordert eine hinreichend neue Ollama-Version, andernfalls lässt sich das Modell nicht laden.

Micro (3B) in Q4
≈ 2 GB VRAM. Läuft auch auf einer CPU mit 8 GB RAM, langsam, aber zuverlässig. Eine RTX 3060 12GB bietet reichlich Spielraum.
Tiny-H (7B MoE) in Q4
Etwa 5 GB VRAM für die Gewichte, aber die nur teilweise Aktivierung beim MoE hält den Rechenaufwand für die Inferenz gering. Eine Karte mit 8–12 GB reicht völlig aus.
Small-H (32B MoE) in Q4
≈ 19 GB VRAM. RTX 4090 mit 24 GB oder Mac mit 32–48 GB gemeinsamem Speicher. Der hybride Ansatz begrenzt den starken Anstieg des Speicherbedarfs bei langen Kontexten.
Puffer für den Kontext
Dank Mamba benötigt der KV-Cache deutlich weniger Speicher als bei einem vergleichbaren Transformer: Sie können große Kontextlängen anstreben, ohne den VRAM-Bedarf zu verdoppeln.
i
Orientierung zur Quantisierung
Q4_K_M bleibt die empfohlene Standardeinstellung (bestes Verhältnis von Qualität zu Größe). Wechseln Sie zu Q5_K_M oder Q8_0, wenn Sie genügend VRAM-Spielraum haben und bei sensiblen Extraktionsaufgaben maximale Genauigkeit anstreben.

#Granite 4 über Ollama installieren

Die Installation folgt dem üblichen Ollama-Ablauf. Das Modell ist in der offiziellen Bibliothek unter dem Namen granite4 veröffentlicht; die Varianten werden über Tags ausgewählt. Prüfen Sie die genauen Namen der Tags auf ollama.com/library, bevor Sie eine bestimmte Modellgröße herunterladen, da sich die Tags von Release zu Release ändern.

  1. 01
    Ollama überprüfen
    Vergewissern Sie sich, dass der Daemon läuft und auf dem neuesten Stand ist. Eine ältere Version kennt die Mamba-Schichten von Granite 4 nicht.
  2. 02
    Das Modell herunterladen
    Laden Sie die gewählte Variante mit ollama pull herunter. Beginnen Sie mit Micro, um schnell zu testen, ohne Ihr Laufwerk oder Ihre Grafikkarte zu überlasten.
  3. 03
    Ersten Chat starten
    ollama run öffnet eine interaktive Sitzung. Stellen Sie eine fachliche Frage — Zusammenfassung eines Textes, Extraktion von Feldern — statt eines allgemeinen Rätsels.
  4. 04
    Eine Oberfläche anbinden
    Richten Sie Open WebUI oder LM Studio auf den lokalen Endpoint aus, um einen komfortablen Einsatz zu ermöglichen, oder rufen Sie die HTTP-API direkt aus Ihrer Anwendung auf.
Terminal — Granite 4 installieren und starten
# Vérifier la version d'Ollama (doit être récente)
ollama --version

# Tirer la variante Micro (la plus légère)
ollama pull granite4:micro

# Lancer une session interactive
ollama run granite4:micro

# Vérifier ce qui tourne et la répartition GPU/CPU
ollama ps

Für eine anwendungsbezogene Nutzung bietet Ollama eine OpenAI-kompatible API auf dem gleichen Port. Sie können daher alle bestehenden Clients einfach durch die Änderung der Basis-URL und des Modellnamens wiederverwenden.

Terminal — lokaler API-Aufruf
curl http://localhost:11434/api/chat -d '{
  "model": "granite4:micro",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "stream": false
}'

#Apache 2.0, die Lizenz ohne Fallstricke für Unternehmen

Das ist ein Punkt, den Rechtsabteilungen vor den Benchmarks prüfen. Granite 4 ist unter der Apache-2.0-Lizenz veröffentlicht, einer permissiven und bewährten Open-Source-Lizenz. Sie können es kommerziell nutzen, verändern, weiterverbreiten und in ein geschlossenes Produkt integrieren, ohne Nutzerzahlgrenzen oder Klauseln zur zulässigen Nutzung im Blick behalten zu müssen.

Dieser Unterschied ist im Vergleich zu den beliebten Alternativen wichtig. Metas „Llama Community License“ ist keine echte Open-Source-Lizenz: Sie legt bei mehr als 700 Millionen monatlichen Nutzern Einschränkungen fest und verbietet bestimmte Nutzungsarten. Auch die Bedingungen von Gemma (Google) regeln die Nutzung durch eine Richtlinie zu verbotenen Nutzungsarten. Apache 2.0 enthält nichts dergleichen: Es ist eine Standardlizenz, die Rechtsabteilungen bereits kennen und ohne Verhandlungen genehmigen.

Kommerzieller Einsatz
Erlaubt, ohne Bedingungen hinsichtlich Größe oder Branche. Keine Nutzerschwelle, die überwacht werden muss.
Änderung und Fine-tuning
Sie können das Modell anpassen und Ihre Modellgewichte privat halten, ohne sie veröffentlichen zu müssen.
Weiterverteilung
Eine Integration in ein proprietäres Produkt ist möglich, sofern der Lizenzhinweis erhalten bleibt.
IBM-Governance
Kryptografisch signierte Modelle, dokumentierte Daten und Zertifizierung nach ISO 42001 — konkrete Argumente für eine Konformitätsprüfung.
!
Prüfen Sie immer die Lizenz der Variante
Apache 2.0 gilt für die Hauptfamilie Granite 4, aber ein von Dritten feinabgestimmtes Modell, das über Ollama weiterverbreitet wird, kann anderen Lizenzbedingungen unterliegen. Prüfen Sie die Modellkarte vor einem Einsatz in der Produktion.

#RAG und Function Calling: die Stärken von Granite

Hier zeigt sich, warum Granite seine Daseinsberechtigung hat. IBM hat diese Modelle gezielt für zwei Einsatzbereiche in Unternehmen trainiert: RAG (Antworten auf Grundlage bereitgestellter Dokumente) und Function Calling (Tools zuverlässig aufrufen). Genau diese Bausteine braucht man, um einen nützlichen Assistenten für betriebliche Aufgaben zu entwickeln und nicht nur einen einfachen Chatbot.

Bei RAG hält sich Granite eng an den bereitgestellten Kontext und begrenzt Halluzinationen: Es stützt sich eher auf die eingefügten Passagen, als Inhalte hinzuzuerfinden. Zusammen mit der hybriden Architektur, die lange Dokumente verarbeitet, ohne den VRAM-Bedarf explodieren zu lassen, macht das Granite zu einem guten Modell für lokale Abfragen einer Dokumentensammlung. Häufig reicht die Micro-Version aus, wodurch RAG auch auf bescheidener Hardware möglich wird.

Bei der Nutzung von Tools erzeugt Granite korrekt strukturierte Funktionsaufrufe und hält die erwarteten JSON-Schemata ein. Das ist die Grundlage eines Agenten: Das Modell entscheidet, eine Funktion aufzurufen, liest das Ergebnis und fährt mit dem nächsten Schritt fort. In Kombination mit einem kostengünstigen langen Kontext lassen sich zuverlässige Geschäftsprozesse automatisieren, ohne von der Cloud abhängig zu sein.

Dokumentbasiertes RAG
Klare Stärke: gute Berücksichtigung des Kontexts, geringe Halluzinationsrate, langer Kontext bei geringem Speicherverbrauch. Ideal für eine interne Wissensdatenbank.
Function calling
Zuverlässige Tool-Aufrufe und konformes JSON – der Baustein für lokale Agenten und Integrationen in ein bestehendes System.
Strukturierte Extraktion
Freitext in saubere Datenfelder (Datumsangaben, Beträge, Entitäten) umwandeln. Die Micro-Version erledigt das bereits sehr gut.
Allgemeine Konversation
Ordentlich, ohne außergewöhnlich zu sein. Hier will Granite nicht punkten.
Beispiel — Definition eines Tools für function calling
{
  "type": "function",
  "function": {
    "name": "chercher_facture",
    "description": "Récupère une facture par son numéro",
    "parameters": {
      "type": "object",
      "properties": {
        "numero": { "type": "string", "description": "Numéro de facture" }
      },
      "required": ["numero"]
    }
  }
}

#Fehlerbehebung

Das Modell lässt sich nicht laden (Architekturfehler)
Ihr Ollama ist zu alt, um die Mamba-Schichten von Granite 4 zu unterstützen. Aktualisieren Sie Ollama auf eine aktuelle Version und starten Sie dann den Pull erneut.
„model not found“ beim Pull
Der Tag existiert nicht unter diesem Namen. Überprüfen Sie die exakte Schreibweise auf ollama.com/library – die Variantentags wechseln von einer Release zur nächsten.
Unpassende Antworten in RAG
Der Kontext ist falsch formatiert oder enthält zu viele Störinformationen. Strukturieren Sie die eingefügten Passagen, reduzieren Sie ihre Anzahl und verlangen Sie ausdrücklich, dass ausschließlich auf Grundlage der bereitgestellten Dokumente geantwortet wird.
Falsch formatierte Tool-Aufrufe
Das JSON-Schema ist mehrdeutig. Vereinfachen Sie die Definition, kennzeichnen Sie die erforderlichen Felder ausdrücklich und testen Sie zunächst mit einem einzigen Tool, bevor Sie mehrere kombinieren.
Starker Geschwindigkeitseinbruch bei Small-H
Das Modell wird wegen unzureichender VRAM teilweise in den Arbeitsspeicher ausgelagert. „ollama ps“ zeigt die Aufteilung zwischen GPU und CPU. Wechseln Sie zu Tiny-H oder Micro oder wählen Sie eine Quantisierungsstufe mit geringerer Bitbreite.
„Connection refused“
Der Ollama-Daemon läuft nicht. Prüfen Sie mit „ollama ps“, ob er unter http://localhost:11434 erreichbar ist.

#Weiterführende Informationen

Granite baut auf Bausteinen auf, die auf dieser Website bereits behandelt werden. Diese Leitfäden führen den vorliegenden Leitfaden weiter:

Ollama unter Linux installieren
Voraussetzung, wenn der Daemon noch nicht eingerichtet ist: Installations-Skript, systemd-Service und GPU-Konfiguration NVIDIA/AMD.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um bei Granite Small-H zwischen Qualität und VRAM abzuwägen, da jede Quantisierungsstufe verändert, was auf Ihre Karte passt.
Lokale KI im Unternehmen: DSGVO, Souveränität und Deployment
Die passende Ergänzung zur Apache-2.0-Lizenz: Wie Sie Granite in einer Organisation regelkonform bereitstellen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.