Alles über Granite Guardian von IBM für Compliance IA
Granite Guardian ist der Sicherheitsklassifikator von IBM: ein kleines Modell, dessen einzige Aufgabe darin besteht, eine Eingabe oder Ausgabe eines LLM zu lesen und mit „riskant“ oder „sicher“ zu antworten. Version 4.1 (April 2026, Apache-2.0-Lizenz) läuft über Ollama vollständig lokal und deckt agentenspezifische Risiken ab – Jailbreaks, halluzinierte Tool-Aufrufe und unbelegte RAG-Antworten. Dieser Leitfaden zeigt, wie Sie das Modell installieren, aufrufen und Ihren lokalen Agenten vorschalten, ohne jemals einen Prompt an die Cloud zu senden.
#Warum ein lokaler Schutzmechanismus für Ihre Agenten?
Ein LLM, das in einem Chat antwortet, ist leicht zu überwachen: Sie lesen die Antwort. Ein Agent hingegen reiht Tool-Aufrufe aneinander, liest RAG-Dokumente und trifft Entscheidungen, ohne dass jemand jeden Schritt überprüft. Genau dort kommt es zu Vorfällen: Ein in ein Dokument eingeschleuster Prompt löst eine unerwünschte Aktion aus, ein Tool-Aufruf ist vollständig erfunden, eine „faktische“ Antwort ist in Wirklichkeit halluziniert. Sie brauchen eine Komponente, die diesen Ablauf kontinuierlich prüft.
Der übliche Reflex ist, eine Cloud-Moderations-API (OpenAI Moderation, Azure Content Safety) aufzurufen. Das Problem: Sie haben sich gerade deshalb für den lokalen Betrieb entschieden, damit Ihre Prompts und Daten Ihren Rechner nicht verlassen. Jede Nachricht an einen entfernten Moderationsdienst zu senden, macht den gesamten Vertraulichkeitsvorteil zunichte. Granite Guardian löst dieses Paradox – es ist ein Schutzmechanismus, der neben Ihren Modellen auf demselben Rechner läuft.
#Was genau ist Granite Guardian?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Granite Guardian gehört zur Granite-Familie von IBM. Es ist ein Sicherheitsklassifikator, der darauf trainiert wurde, problematische Inhalte in den Eingaben und Ausgaben von LLMs zu erkennen. Version 4.1 (April 2026) wurde unter der Apache-2.0-Lizenz veröffentlicht, die die kommerzielle Nutzung und Änderungen ohne Lizenzgebühren erlaubt — ein entscheidender Punkt für den Einsatz in Unternehmen.
- Rolle
- Detektor, kein Generator. Er erhält einen Text und gibt ein Risikosignal (yes/no + Wahrscheinlichkeitswert) zurück.
- Größen
- Eine kompakte Variante (~2B) für geringe Latenz, eine größere Variante (~8B) für feinere Differenzierung. Die 2B-Variante genügt für die meisten Schutzmechanismen im laufenden Betrieb.
- Lizenz
- Apache 2.0 — kommerzielle Nutzung, Weiterverbreitung und Fine-Tuning erlaubt.
- Schwerpunkt von Version 4.1
- Agentische Risiken: Erkennung halluzinierter Tool-Aufrufe und Überprüfung, ob die RAG-Antworten tatsächlich auf dem bereitgestellten Kontext beruhen.
- Format
- Ein strukturierter Prompt gibt den zu bewertenden Risikotyp an; das Modell antwortet mit einem Urteil, das Sie parsen.
#Die Risiken, die von Granite Guardian erkannt werden
Das Modell deckt zwei große Kategorien ab. Zunächst die „klassischen“ Inhaltsrisiken, dann die spezifischen Risiken agentischer Systeme und RAG – hier hebt sich Version 4.1 ab.
- Jailbreak / Injektion
- Versuche, die Systemanweisungen zu umgehen, einschließlich versteckter Injektionen in einem Dokument oder einer Webseite, die der Agent liest.
- Schädlicher Inhalt
- Gewalt, sexuelle Inhalte, Aufforderungen zu gefährlichen Handlungen, Hassrede – sowohl bei der Eingabe als auch bei der Ausgabe.
- Groundedness (RAG)
- Ist die Antwort tatsächlich durch die abgerufenen Dokumente gestützt, oder hat das Modell sie erfunden? Erkennt RAG-Halluzinationen.
- Relevanz des Kontexts
- Sind die abgerufenen Passagen wirklich für die Frage relevant? Ein Kontext, der am Thema vorbeigeht, ist ein Anzeichen dafür, dass der Retriever vom Thema abweicht.
- Function calling hallucination
- Ruft der Agent ein nicht existierendes Tool auf oder überträgt Argumente, die nicht mit der Benutzeranfrage übereinstimmen?
#Voraussetzungen
Granite Guardian läuft neben Ihrem Hauptmodell. Sie müssen daher seinen VRAM-Bedarf zusätzlich zu dem des Agenten einplanen. Die gute Nachricht: Die 2B-Variante ist leichtgewichtig.
- Ollama installiert
- Der Daemon lauscht standardmäßig auf http://localhost:11434. Falls die Installation noch nicht erfolgt ist, die Installationsanleitung für Ollama konsultieren.
- VRAM (Guardian 2B, Q4_K_M)
- ≈ 2 GB. Es wird zu Ihrem Agentenmodell hinzugefügt. Eine RTX 3060 12GB kann einen 7B plus Guardian problemlos verarbeiten.
- VRAM (Guardian 8B, Q4_K_M)
- ≈ 5 GB, wenn Sie die differenzierteste Variante möchten und genügend Speicherreserve haben (RTX 4080 16GB, M4 Pro).
- Quantization
- Q4_K_M wird für ein ausgewogenes Verhältnis zwischen Latenz und Qualität empfohlen. Q8_0, wenn Sie Spielraum haben und den Qualitätsverlust bei der Risikobewertung begrenzen möchten.
#Modell installieren
- 01Prüfen, ob Ollama läuftDer Befehl `ollama list` muss ohne Fehler ausgeführt werden können. Andernfalls starten Sie den Daemon (`ollama serve` unter Linux oder die Anwendung unter Windows/macOS).
- 02Den offiziellen Tag ermittelnSuchen Sie auf ollama.com/library nach „granite-guardian“ und notieren Sie den genauen Tag der 2B-Variante. Die Tag-Namen ändern sich von Version zu Version – raten Sie sie nicht.
- 03Modell herunterladenEin einfacher `ollama pull` lädt die quantisierten Modellgewichte im GGUF-Format herunter. Rechnen Sie bei der 2B-Version mit einem Download von 1 bis 2 GB.
- 04BestätigenFühren Sie `ollama list` erneut aus: Das Modell muss mit seiner Größe angezeigt werden. Sie können ihm nun Fragen stellen.
#Erster Guardrail-Aufruf
Das Prinzip: Sie übermitteln Guardian den zu bewertenden Text und geben dabei die Art des Risikos an. Das Modell gibt eine Bewertung zurück, die Sie interpretieren. Am einfachsten ist es, die OpenAI-kompatible API von Ollama über denselben lokalen Endpunkt zu nutzen.
#Einen Agenten schützen: Tool-Aufrufe und RAG
Der eigentliche Nutzen von Version 4.1 zeigt sich, wenn Sie einen Agenten überwachen. Der Guardian wird an drei Stellen eingesetzt: bevor der Agent die Eingabe erhält (Jailbreak/Injection), nach einem RAG-Retrieval (Groundedness) und vor der Ausführung eines Tool-Calls (Funktionshalluzination).
- 01Eingabe filternJede Nutzernachricht — und jedes externe Dokument, das der Agent liest — durchläuft zunächst Guardian im Jailbreak-/Injection-Modus. Ein manipuliertes Webdokument wird abgefangen, bevor es das Hauptmodell erreicht.
- 02Das RAG-Grounding prüfenÜbergeben Sie Guardian nach dem Abruf der Textpassagen die Frage, die Passagen und den Antwortentwurf im Modus groundedness. Wenn Guardian die Antwort als nicht durch die Passagen gestützt einstuft, lehnen Sie sie ab oder starten einen erneuten Abruf.
- 03Tool-Call validierenLassen Sie vor der Ausführung eines Tool-Aufrufs prüfen, ob die Benutzeranfrage und das aufgerufene Tool zusammenpassen. Ein halluzinierter Aufruf (nicht existierendes Tool, unpassende Argumente) wird blockiert, bevor Nebenwirkungen auftreten.
#Anwendungsfälle für DSGVO und Compliance
Die Moderation lokal auszuführen, ist nicht nur technisch bequem: Es ist auch ein Argument für die Einhaltung gesetzlicher Vorgaben. Nach DSGVO und AI Act muss jede Übermittlung personenbezogener Daten an einen Drittanbieterdienst begründet, geregelt und dokumentiert werden. Ein cloudbasierter Schutzmechanismus würde Sie dazu zwingen, Prompts – möglicherweise voller personenbezogener Daten – an einen zusätzlichen Auftragsverarbeiter zu übermitteln.
- Kein Datentransfer
- Der bewertete Text verlässt Ihre Infrastruktur nie. Es gibt keinen Auftragsverarbeiter für die Moderation, der im Verzeichnis der Verarbeitungstätigkeiten aufgeführt oder durch einen Auftragsverarbeitungsvertrag (DPA) eingebunden werden müsste.
- Nachvollziehbarkeit
- Sie protokollieren jede Bewertung lokal (erkanntes Risiko, Typ, Score). Das ist hilfreich, um eine wirksame Aufsicht über risikobehaftete Systeme gemäß dem AI Act nachzuweisen.
- Minimierung
- Der Guardian blockiert im Vorfeld manipulierte Eingaben, die über den Agenten Daten exfiltrieren könnten, und verringert damit die Angriffsfläche für solche Vorfälle.
- Souveränität
- Ein Modell unter der Apache-2.0-Lizenz, das auf Hardware ausgeführt wird, über die Sie die Kontrolle haben: keine Abhängigkeit von der Verfügbarkeit oder den Bedingungen eines externen Anbieters.
#Fehlerbehebung & Tipps
- Immer dasselbe Urteil
- Wenn alle Antworten „no“ lauten, überprüfen Sie, ob der Risikotyp korrekt übergeben wurde (Rolle system) und ob der Modelltag stimmt. Ein generisches Modell wird die Arbeit eines Guardian nicht übernehmen.
- Zu hohe Latenz
- Wechseln Sie von der 8B- zur 2B-Version, quantisieren Sie in Q4_K_M und lassen Sie das Modell geladen (Ollama-Keep-Alive), um ein erneutes Laden bei jedem Aufruf zu vermeiden.
- Fehleranfälliges Parsing
- Setzen Sie kein bestimmtes Format voraus. Protokollieren Sie die Rohausgabe einige Tage lang in der Vorproduktionsumgebung und schreiben Sie anschließend einen toleranten Parser (Kleinschreibung, Entfernen von Leerzeichen am Anfang und Ende, Präfix).
- Zwei Modelle in VRAM
- Guardian und Agent müssen zusammen in den Speicher passen. Bleiben Sie bei einer Grafikkarte mit 12 GB bei einem 7B-Q4-Agenten + Guardian 2B Q4 (~7 GB insgesamt).
- Problematische Falschpositive
- Passen Sie die Art des bewerteten Risikos an Ihre tatsächliche Nutzung an, statt alle Detektoren zu aktivieren. Eine zu restriktive Schutzmaßnahme wird letztlich von den Teams deaktiviert.
#Weiterführende Informationen
Granite Guardian ist Teil eines umfassenderen Ansatzes für Datenschutz und Compliance im lokalen Betrieb. Drei Leitfäden ergänzen das Bild: die Datenschutz-Checkliste, um zu prüfen, dass keine Daten Ihren Rechner verlassen, der Leitfaden zu lokalen LLMs und der DSGVO für den vollständigen rechtlichen Rahmen sowie der Leitfaden zu lokaler KI im Unternehmen für die Organisation einer regelkonformen Bereitstellung.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.