Mittelstufe 10 Min.Anpassung

Abliterated-Modelle (unzensiert) lokal nutzen: Anleitung pratique

Open-Weight-Modelle wie Qwen, Gemma oder Mistral wurden darauf ausgerichtet, bestimmte Anfragen abzulehnen. Ein abliterated-Modell ist eine Variante, bei der dieses Ablehnungsverhalten durch einen gezielten Eingriff in die Modellgewichte entfernt wurde – nicht durch einen Prompt-Jailbreak, sondern durch Änderungen am Netzwerk. Dieser Leitfaden erklärt, was diese Technik tatsächlich bewirkt, wo diese Modelle zu finden sind, wie sie lokal mit Ollama oder im GGUF-Format ausgeführt werden können und wo die tatsächlichen Grenzen liegen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-01·Unter Windows, macOS und Linux getestet

#Was ist ein abliteriertes Modell?

Ein als „abliterated“ (manchmal auch „decensored“ oder „uncensored“) bezeichnetes Modell ist ein Open-Weight-LLM, dem die Fähigkeit zur Ablehnung von Anfragen entfernt wurde. Wenn Sie etwas anfragen, das ein standardmäßiges Qwen 3.5 mit „I cannot help with that“ ablehnen würde, antwortet die abliterated-Version direkt, ohne Alignment-Hinweis, ohne moralisierende Einleitung und ohne der Frage auszuweichen.

Wichtig: Es handelt sich nicht um einen Prompt-Jailbreak. Das Modell wurde auf der Ebene seiner Gewichte verändert. Eine Ablehnung ist mechanisch unmöglich geworden – oder zumindest äußerst selten –, weil die interne Richtung entfernt wurde, die sie auslöste.

i
Abliteriert, feingetunt, per Jailbreak manipuliert: drei verschiedene Dinge
Ein Modell mit Jailbreak ist das Original plus ein cleverer Prompt, der es dazu bringt, seine Schutzmechanismen zu umgehen (fragil). Ein unzensiertes, feinabgestimmtes Modell wurde auf einem Datensatz ohne Antwortverweigerungen erneut trainiert (teuer). Bei einem abliterierten Modell wurde lediglich die Ablehnungsrichtung durch eine Operation der linearen Algebra entfernt (schnell, erhält die Qualität besser).

#Wie funktioniert die Ablation?

Das KI-Set ohne Filter

Sie wissen jetzt, was ein „abliterated“-Modell ist. Das Kit IA Ohne Filter beginnt mit dem rechtlichen Rahmen in Frankreich und Europa (Kap. 4), zeigt Ihnen dann, wie Sie eine Variante vor dem Herunterladen beurteilen (Kap. 5 und 6), und wie Sie diejenige auswählen, die in Ihren Videospeicher passt (Kap. 7).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Ablation stützt sich auf ein 2024 von Arditi et al. veröffentlichtes Ergebnis („Refusal in Language Models Is Mediated by a Single Direction“). Die Autoren zeigen, dass bei den meisten alignierten LLMs die Verweigerung durch eine einzige Richtung im Raum der internen Aktivierungen gesteuert wird – einen Vektor, den man isolieren kann, indem man die Aktivierungen bei harmlosen Prompts mit denen bei Prompts vergleicht, die eine Verweigerung auslösen.

Bei der Ablation wird diese Richtung Schicht für Schicht aus den Modellgewichten herausprojiziert. Konkret werden die Projektionsmatrizen so verändert, dass sie die mit der Ablehnung verbundene Komponente nicht mehr erzeugen können. Das Modell funktioniert weiterhin normal, aber das „interne Signal“, das es in den Modus „ich lehne ab“ versetzte, wurde abgeschaltet.

Schritt 1 — Abfragen
Man lässt das Modell mehrere Dutzend Prompt-Paare verarbeiten: neutrale Prompts und Prompts, die das Modell zur Verweigerung veranlassen. Dabei werden die Aktivierungen in jeder Schicht aufgezeichnet.
Schritt 2 — Isolieren
Man berechnet die mittlere Differenz der Aktivierungen zwischen den beiden Gruppen. Dieser Vektor ist nach der Normalisierung die Ablehnungsrichtung.
Schritt 3 — Projizieren
Die Gewichte jeder Schicht werden verändert, um diese Richtung unzugänglich zu machen. Dabei wird lediglich eine orthogonale Projektion subtrahiert; es findet kein erneutes Training statt.
Schritt 4 — Testen
Es wird geprüft, ob das Modell Anfragen nicht mehr ablehnt und ob seine allgemeinen Fähigkeiten (Schlussfolgern, Programmieren, Französisch) nicht eingebrochen sind.
→
Warum es so schnell geht
Für eine Ablation brauchen Sie weder eine besonders leistungsstarke GPU noch stundenlanges Training. Selbst bei 70B-Modellen genügen wenige Minuten bis einige Stunden, denn dabei wird lediglich lineare Algebra mit bereits vorhandenen Matrizen ausgeführt.

#Wo Sie abliterated Modelle finden

Der Großteil des Ökosystems ist auf Hugging Face zu finden. Einige Herausgeber genießen in der Community hohes Ansehen für die Qualität ihrer Ablationen:

mlabonne
Maxime Labonne, einer der Ersten, die diese Technik populär gemacht haben. Abliterierte Varianten von Qwen 3.5, Gemma 4 und Mistral Small – alle auf huggingface.co/mlabonne dokumentiert.
huihui-ai
Deckt ein sehr breites Spektrum ab: Qwen 3.5 (2B bis 27B), Granite 4.2, Gemma 4, GLM 4.7. Varianten mit der Kennzeichnung „-abliterated“ oder „-abliterate“.
failspy
Autor mehrerer prominenter Varianten (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). Hinsichtlich der Qualität viel diskutiert.
Orenguteng / Lexi
Die Serie „Lexi-Uncensored“ kombiniert Ablation mit leichtem Fine-Tuning. Sie ist für ihren Gesprächston bekannt.
!
Prüfen Sie die Modellbeschreibung
Nicht alle Modelle mit den Tags „uncensored“ oder „abliterated“ sind gleich gut. Lesen Sie die Model Card: Manche Herausgeber stellen die verwendeten Skripte und die Evaluationen nach der Ablation bereit, andere begnügen sich mit einem reißerischen Titel. Bevorzugen Sie im Zweifelsfall einen Herausgeber mit einer überprüfbaren Veröffentlichungshistorie.

Für die Nutzung mit Ollama bietet auch die offizielle Registry zahlreiche Varianten an — suchen Sie auf ollama.com/library nach Tags, die abliterated oder uncensored enthalten, oder verwenden Sie die von huihui_ai und mlabonne veröffentlichten Community-Varianten, die sich direkt per Pull herunterladen lassen.

#Installation in Ollama

Der einfachste Weg, ein abliterated LLM lokal zu betreiben, führt über Ollama. Der Daemon lauscht standardmäßig auf http://localhost:11434 und akzeptiert Community-Varianten ohne besondere Konfiguration.

  1. 01
    Prüfen, ob Ollama läuft
    ollama --version in einem Terminal ausführen. Falls der Befehl fehlschlägt, vor dem Fortfahren die Ollama-Installationsanleitung befolgen.
  2. 02
    Ein Modell wählen, das zu Ihrem VRAM passt
    Orientieren Sie sich an diesen Größenordnungen: Ein 7–8B-Modell in Q4 benötigt etwa 5 GB, ein 14B-Modell etwa 9 GB, ein 32B-Modell etwa 19 GB und ein 70B-Modell etwa 40 GB. Eine RTX 3060 mit 12 GB reicht aus, um ein 8B-Modell komfortabel zu betreiben; eine RTX 4090 mit 24 GB ermöglicht den Betrieb von 32B-Modellen.
  3. 03
    Pullen und Starten
    Verwenden Sie ollama run mit dem vollständigen Namen der Variante. Das Modell wird heruntergeladen und anschließend in den VRAM geladen, und das Gespräch beginnt.
  4. 04
    Eine typische Antwortverweigerung testen
    Stellen Sie eine Frage, die das Basismodell ablehnen würde. Wenn die Variante korrekt abliterated ist, erhalten Sie eine direkte Antwort ohne Vorrede.
Beispiel — Abliterated-Variante von Qwen 3.5 9B
ollama run huihui_ai/qwen3.5-abliterated:9b
Beispiel — abliterated-Variante von Gemma 4 12B
ollama run huihui_ai/gemma4-abliterated:12b
# ou, depuis Hugging Face directement :
# ollama run hf.co/mlabonne/gemma-4-12b-it-abliterated-GGUF
→
Direkter Pull von Hugging Face
Seit Ollama 0.4 können Sie ollama run hf.co/<publisher>/<modele>-GGUF ausführen, ohne die Ollama-Registry zu verwenden. Praktisch, um schnell eine von mlabonne oder failspy veröffentlichte Ablation zu testen, die (noch) keinen offiziellen Tag hat.

Sobald das Modell geladen ist, lässt es sich wie jedes andere LLM in Ollama nutzen: ein OpenAI-kompatibler Endpunkt auf :11434, integrierbar in Open WebUI, Continue.dev, LiteLLM und Ihre Python-Skripte. Es ist keine spezielle Option erforderlich, damit ein „abliterated“-Modell „funktioniert“ – das Ausbleiben von Antwortverweigerungen steckt in den Gewichten, nicht in der Konfiguration.

#Mit GGUF (LM Studio, llama.cpp)

Wenn Sie lieber LM Studio oder llama.cpp direkt verwenden, arbeiten Sie mit GGUF-Dateien. Die meisten ablatierten Modelle sind auf Hugging Face bereits in mehreren Quantisierungen verfügbar — Q4_K_M bleibt der empfohlene Kompromiss (Qualität bleibt erhalten, minimaler VRAM-Bedarf), Q5_K_M, wenn Sie noch Spielraum haben, Q8_0, wenn Sie maximale Originaltreue wünschen.

  1. 01
    Das GGUF-Repository identifizieren
    Suchen Sie auf Hugging Face nach Repositories mit der Kennzeichnung -GGUF. Zum Beispiel: mlabonne/Qwen3.5-9B-abliterated-GGUF oder bartowski/<modele>-abliterated-GGUF.
  2. 02
    Die richtige Quantisierung herunterladen
    In LM Studio können Sie über die Benutzeroberfläche nach Größe und Herausgeber filtern. Bevorzugen Sie für die meisten Fälle Q4_K_M. Bei sehr kleinen Modellen (1–3B) lässt sich mit Q5_K_M oder Q6_K ein spürbarer Qualitätsverlust vermeiden.
  3. 03
    Laden und testen
    LM Studio lädt die Schichten automatisch auf die GPU, wenn genügend VRAM vorhanden ist. Achten Sie auf die Offload-Anzeige – wenn Teile des Modells in den Arbeitsspeicher ausgelagert werden, sinkt die Geschwindigkeit.
  4. 04
    Durch die API verfügbar machen
    Aktivieren Sie den lokal laufenden OpenAI-kompatiblen Server, wenn Sie ihn in Ihre Anwendungen integrieren möchten. Der Standardport für LM Studio ist 1234 (gegenüber 11434 für Ollama).
i
Quantisierung und Ablation
Die Ablation erfolgt am nicht quantisierten Modell, anschließend wird das Ergebnis quantisiert. Sie erhalten also direkt die GGUF-Datei einer bereits abliterierten Variante – bei der Quantisierung gibt es nichts zu „aktivieren“.

#Grenzen und Qualitätsverlust

Die Ablation hat ihren Preis. Das Entfernen einer Richtung im Residualstrom verändert alles, was über diese Richtung lief, einschließlich nützlicher Komponenten. In der Praxis beobachtete Nebenwirkungen:

Leichter Leistungsrückgang bei Reasoning-Benchmarks
Typischerweise sieht man bei MMLU oder GSM8K einen Rückgang um 1 bis 3 Punkte. Das ist messbar, steht der praktischen Nutzung aber selten im Weg.
Manchmal mechanischere Antworten
Das Modell verliert einen Teil der Nuancen des Alignments: weniger Anfragen zur Klarstellung, weniger Warnungen, selbst wenn diese nützlich wären.
Nur geringfügig häufigere Halluzinationen
Bei Fragen, auf die das Modell normalerweise mit „Ich bin mir dessen nicht sicher“ geantwortet hätte, neigt es dazu, eine selbstsicher formulierte Antwort zu erfinden.
Verbleibende Verhaltensweisen
Einige Antwortverweigerungen kommen dennoch vor, besonders bei nur näherungsweise durchgeführten Ablationen. Umgekehrt antworten manche Modelle, bei denen die Abliteration sehr gut gelungen ist, auf alles – auch auf Dinge, bei denen Sie lieber hätten, dass sie schweigen.
→
Vor dem Einsatz vergleichen
Bevor Sie Ihr Basismodell durch seine abliterated-Version ersetzen, testen Sie beide Versionen mit einer kleinen Reihe von 10 bis 20 Prompts, die für Ihre tatsächliche Nutzung repräsentativ sind. So wissen Sie sofort, ob der Verlust für Sie akzeptabel ist.

#Risiken und verantwortungsvolle Nutzung

Ein Modell, das nichts mehr ablehnt, ist kein Spielzeug. Einige einfache Grundsätze, bevor Sie es in der Praxis einsetzen:

Sie bleiben für die Ausgaben verantwortlich
Ob Sie ein aligniertes Modell, ein abliterated-Modell oder ein Cloud-Modell verwenden: Sie entscheiden selbst, wie Sie die Antworten nutzen. Die DSGVO, das Strafrecht und das Urheberrecht ändern sich nicht mit der Modellversion.
Stellen Sie es nicht ohne Filter zur freien Nutzung bereit
Wenn Sie einen Endpoint für ein Team einrichten, sehen Sie mindestens eine Filterung auf Anwendungsebene vor (Schlüsselwörter, Moderation der Ausgabe). Ein unverändertes abliterated-Modell in einem internen Chat ist grundsätzlich eine schlechte Idee.
Seien Sie gegenüber den Benutzern transparent
Wenn eine App, die mit einem abliterierten Modell verbunden ist, möglicherweise überraschende Inhalte erzeugt, weisen Sie Ihre Nutzer darauf hin. Keine Überraschungen, keine Klagen.
Legitimer Einsatz, tatsächlicher Einsatz
Forschung zur KI-Sicherheit, Red-Teaming, Verarbeitung sensibler Korpora (Medizin, Recht, Sicherheit), bei denen die Antwortverweigerungen eines alignierten Modells das Werkzeug unbrauchbar machen: In diesen Fällen hat die Ablation einen echten Nutzen. Wer nach dem Motto „Ich habe die Zensur zum Spaß entfernt“ handelt, riskiert sehr unerwünschte Ausgaben, ohne einen Nutzen daraus zu ziehen.
!
Das, was die Ablation nicht verändert
Die Ablation entfernt die Verweigerung, nicht das Wissen. Wenn das Basismodell im Training nie mit einem gefährlichen Thema in Berührung gekommen ist, weiß die abliterierte Variante darüber auch nicht mehr. Umgekehrt wird ein Modell, das etwas „wusste“, sich aber weigerte, es mitzuteilen, es jetzt mitteilen — genau deshalb ist Vorsicht geboten.

#Tipps und Fehlerbehebung

Das Modell verweigert die Antwort trotzdem
Bei manchen Ablationsvarianten bleiben Ablehnungen bei bestimmten Themen bestehen (Politik, Medizin, Minderjährige). Probieren Sie eine andere Ablation desselben Modells oder einen anderen Herausgeber aus – die Qualität der Ablation variiert stark.
Das Modell ist inkohärent geworden
Symptom einer zu aggressiven Ablation (zu viele Richtungen entfernt oder eine Richtung falsch isoliert). Bevorzugen Sie eine Variante eines anerkannten Herausgebers gegenüber einer selbst durchgeführten, nicht dokumentierten Ablation.
Schlechte Leistung im Französischen
Wie bei jedem Open-Weight-Modell hängt die Leistung auf Französisch vom Basismodell ab. Qwen 3.5, Mistral Small, Gemma 4 und Granite 4.2 sind solide; ältere Modelle (Llama 3, Phi-3, Gemma 2) sind schwächer. Die Ablation ändert daran nichts.
Verbliebene Einleitungen wie „As an AI, I cannot...“
Fügen Sie statt eines Jailbreaks einen kurzen Systemprompt hinzu, der an die Rolle und das erwartete Format erinnert. Das reicht oft aus, um die Überreste des Alignments zu beseitigen.
VRAM voll
Bei 8 GB bleiben Sie bei einem 7–8B-Modell in Q4_K_M. Bei 12 GB können Sie auf Q5_K_M wechseln oder ein 14B-Modell in Q4 ausprobieren. Bei 24 GB passt ein 32B-Modell in Q4 bequem in den Speicher.

#Weiterführende Informationen

Die Ablation ist ein Einstieg in die Anpassung von Open-Weight-Modellen. Um noch weiter zu gehen:

Ein Modell mit Ollama Modelfile anpassen
Wenn Sie eine abliterated-Variante um einen Systemprompt, Parameter und ein Template ergänzen möchten, sollten Sie das Modelfile kennen.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um zu verstehen, welches GGUF-Modell Sie abhängig von Ihrem VRAM und der angestrebten Qualität laden sollten – die Ablation ändert nichts an den Abwägungen.
Lokales LLM-Fine-Tuning: LoRA und QLoRA
Wenn Ihnen die Ablation allein nicht ausreicht und Sie den Ton oder das Fachgebiet anpassen möchten, ist ein leichtes LoRA auf einer abliterated-Variante oft der beste Kompromiss.
Häufig gestellte Fragen
Gibt es eine KI ohne Grenzen und ohne Zensur?+
Ja, aber nicht in der Cloud: Alle Online-Dienste „ohne Grenzen“ setzen tatsächlich serverseitige Filter und Nutzungsbedingungen ein. Wirklich unzensierte KI ist ein lokal laufendes abliterated-Modell – das Verweigerungsverhalten wurde aus den Gewichten selbst entfernt, und nichts läuft über einen Server eines Drittanbieters. Genau das behandelt dieser Leitfaden.
Ist eine lokal laufende, nicht zensierte KI rechtlich zulässig?+
Ein abliterated Modell zu Hause auszuführen, ist legal: Es handelt sich um veränderte Open-Weight-Modellgewichte, die öffentlich verbreitet werden. Was Sie damit erzeugen, unterliegt jedoch weiterhin dem allgemeinen Recht – die Ablation entfernt die Antwortverweigerungen des Modells, nicht Ihre Verantwortung. Prüfen Sie auch die Lizenz der verwendeten Variante (sie entspricht in der Regel der Lizenz des ursprünglichen Modells).
Ist eine lokale KI ohne Einschränkungen weniger intelligent?+
Etwas, ja: Die Ablation verschlechtert die allgemeine Qualität leicht (siehe Abschnitt „Einschränkungen und Qualitätsverlust“). Im Alltag ist der Unterschied marginal; für Code oder anspruchsvolles Schlussfolgern behalten Sie die ursprüngliche Variante parallel bei – beide lassen sich problemlos nebeneinander in Ollama nutzen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.