Abliterated-Modelle (unzensiert) lokal nutzen: Anleitung pratique
Open-Weight-Modelle wie Qwen, Gemma oder Mistral wurden darauf ausgerichtet, bestimmte Anfragen abzulehnen. Ein abliterated-Modell ist eine Variante, bei der dieses Ablehnungsverhalten durch einen gezielten Eingriff in die Modellgewichte entfernt wurde – nicht durch einen Prompt-Jailbreak, sondern durch Änderungen am Netzwerk. Dieser Leitfaden erklärt, was diese Technik tatsächlich bewirkt, wo diese Modelle zu finden sind, wie sie lokal mit Ollama oder im GGUF-Format ausgeführt werden können und wo die tatsächlichen Grenzen liegen.
#Was ist ein abliteriertes Modell?
Ein als „abliterated“ (manchmal auch „decensored“ oder „uncensored“) bezeichnetes Modell ist ein Open-Weight-LLM, dem die Fähigkeit zur Ablehnung von Anfragen entfernt wurde. Wenn Sie etwas anfragen, das ein standardmäßiges Qwen 3.5 mit „I cannot help with that“ ablehnen würde, antwortet die abliterated-Version direkt, ohne Alignment-Hinweis, ohne moralisierende Einleitung und ohne der Frage auszuweichen.
Wichtig: Es handelt sich nicht um einen Prompt-Jailbreak. Das Modell wurde auf der Ebene seiner Gewichte verändert. Eine Ablehnung ist mechanisch unmöglich geworden – oder zumindest äußerst selten –, weil die interne Richtung entfernt wurde, die sie auslöste.
#Wie funktioniert die Ablation?
Sie wissen jetzt, was ein „abliterated“-Modell ist. Das Kit IA Ohne Filter beginnt mit dem rechtlichen Rahmen in Frankreich und Europa (Kap. 4), zeigt Ihnen dann, wie Sie eine Variante vor dem Herunterladen beurteilen (Kap. 5 und 6), und wie Sie diejenige auswählen, die in Ihren Videospeicher passt (Kap. 7).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Die Ablation stützt sich auf ein 2024 von Arditi et al. veröffentlichtes Ergebnis („Refusal in Language Models Is Mediated by a Single Direction“). Die Autoren zeigen, dass bei den meisten alignierten LLMs die Verweigerung durch eine einzige Richtung im Raum der internen Aktivierungen gesteuert wird – einen Vektor, den man isolieren kann, indem man die Aktivierungen bei harmlosen Prompts mit denen bei Prompts vergleicht, die eine Verweigerung auslösen.
Bei der Ablation wird diese Richtung Schicht für Schicht aus den Modellgewichten herausprojiziert. Konkret werden die Projektionsmatrizen so verändert, dass sie die mit der Ablehnung verbundene Komponente nicht mehr erzeugen können. Das Modell funktioniert weiterhin normal, aber das „interne Signal“, das es in den Modus „ich lehne ab“ versetzte, wurde abgeschaltet.
- Schritt 1 — Abfragen
- Man lässt das Modell mehrere Dutzend Prompt-Paare verarbeiten: neutrale Prompts und Prompts, die das Modell zur Verweigerung veranlassen. Dabei werden die Aktivierungen in jeder Schicht aufgezeichnet.
- Schritt 2 — Isolieren
- Man berechnet die mittlere Differenz der Aktivierungen zwischen den beiden Gruppen. Dieser Vektor ist nach der Normalisierung die Ablehnungsrichtung.
- Schritt 3 — Projizieren
- Die Gewichte jeder Schicht werden verändert, um diese Richtung unzugänglich zu machen. Dabei wird lediglich eine orthogonale Projektion subtrahiert; es findet kein erneutes Training statt.
- Schritt 4 — Testen
- Es wird geprüft, ob das Modell Anfragen nicht mehr ablehnt und ob seine allgemeinen Fähigkeiten (Schlussfolgern, Programmieren, Französisch) nicht eingebrochen sind.
#Wo Sie abliterated Modelle finden
Der Großteil des Ökosystems ist auf Hugging Face zu finden. Einige Herausgeber genießen in der Community hohes Ansehen für die Qualität ihrer Ablationen:
- mlabonne
- Maxime Labonne, einer der Ersten, die diese Technik populär gemacht haben. Abliterierte Varianten von Qwen 3.5, Gemma 4 und Mistral Small – alle auf huggingface.co/mlabonne dokumentiert.
- huihui-ai
- Deckt ein sehr breites Spektrum ab: Qwen 3.5 (2B bis 27B), Granite 4.2, Gemma 4, GLM 4.7. Varianten mit der Kennzeichnung „-abliterated“ oder „-abliterate“.
- failspy
- Autor mehrerer prominenter Varianten (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). Hinsichtlich der Qualität viel diskutiert.
- Orenguteng / Lexi
- Die Serie „Lexi-Uncensored“ kombiniert Ablation mit leichtem Fine-Tuning. Sie ist für ihren Gesprächston bekannt.
Für die Nutzung mit Ollama bietet auch die offizielle Registry zahlreiche Varianten an — suchen Sie auf ollama.com/library nach Tags, die abliterated oder uncensored enthalten, oder verwenden Sie die von huihui_ai und mlabonne veröffentlichten Community-Varianten, die sich direkt per Pull herunterladen lassen.
#Installation in Ollama
Der einfachste Weg, ein abliterated LLM lokal zu betreiben, führt über Ollama. Der Daemon lauscht standardmäßig auf http://localhost:11434 und akzeptiert Community-Varianten ohne besondere Konfiguration.
- 01Prüfen, ob Ollama läuftollama --version in einem Terminal ausführen. Falls der Befehl fehlschlägt, vor dem Fortfahren die Ollama-Installationsanleitung befolgen.
- 02Ein Modell wählen, das zu Ihrem VRAM passtOrientieren Sie sich an diesen Größenordnungen: Ein 7–8B-Modell in Q4 benötigt etwa 5 GB, ein 14B-Modell etwa 9 GB, ein 32B-Modell etwa 19 GB und ein 70B-Modell etwa 40 GB. Eine RTX 3060 mit 12 GB reicht aus, um ein 8B-Modell komfortabel zu betreiben; eine RTX 4090 mit 24 GB ermöglicht den Betrieb von 32B-Modellen.
- 03Pullen und StartenVerwenden Sie ollama run mit dem vollständigen Namen der Variante. Das Modell wird heruntergeladen und anschließend in den VRAM geladen, und das Gespräch beginnt.
- 04Eine typische Antwortverweigerung testenStellen Sie eine Frage, die das Basismodell ablehnen würde. Wenn die Variante korrekt abliterated ist, erhalten Sie eine direkte Antwort ohne Vorrede.
Sobald das Modell geladen ist, lässt es sich wie jedes andere LLM in Ollama nutzen: ein OpenAI-kompatibler Endpunkt auf :11434, integrierbar in Open WebUI, Continue.dev, LiteLLM und Ihre Python-Skripte. Es ist keine spezielle Option erforderlich, damit ein „abliterated“-Modell „funktioniert“ – das Ausbleiben von Antwortverweigerungen steckt in den Gewichten, nicht in der Konfiguration.
#Mit GGUF (LM Studio, llama.cpp)
Wenn Sie lieber LM Studio oder llama.cpp direkt verwenden, arbeiten Sie mit GGUF-Dateien. Die meisten ablatierten Modelle sind auf Hugging Face bereits in mehreren Quantisierungen verfügbar — Q4_K_M bleibt der empfohlene Kompromiss (Qualität bleibt erhalten, minimaler VRAM-Bedarf), Q5_K_M, wenn Sie noch Spielraum haben, Q8_0, wenn Sie maximale Originaltreue wünschen.
- 01Das GGUF-Repository identifizierenSuchen Sie auf Hugging Face nach Repositories mit der Kennzeichnung -GGUF. Zum Beispiel: mlabonne/Qwen3.5-9B-abliterated-GGUF oder bartowski/<modele>-abliterated-GGUF.
- 02Die richtige Quantisierung herunterladenIn LM Studio können Sie über die Benutzeroberfläche nach Größe und Herausgeber filtern. Bevorzugen Sie für die meisten Fälle Q4_K_M. Bei sehr kleinen Modellen (1–3B) lässt sich mit Q5_K_M oder Q6_K ein spürbarer Qualitätsverlust vermeiden.
- 03Laden und testenLM Studio lädt die Schichten automatisch auf die GPU, wenn genügend VRAM vorhanden ist. Achten Sie auf die Offload-Anzeige – wenn Teile des Modells in den Arbeitsspeicher ausgelagert werden, sinkt die Geschwindigkeit.
- 04Durch die API verfügbar machenAktivieren Sie den lokal laufenden OpenAI-kompatiblen Server, wenn Sie ihn in Ihre Anwendungen integrieren möchten. Der Standardport für LM Studio ist 1234 (gegenüber 11434 für Ollama).
#Grenzen und Qualitätsverlust
Die Ablation hat ihren Preis. Das Entfernen einer Richtung im Residualstrom verändert alles, was über diese Richtung lief, einschließlich nützlicher Komponenten. In der Praxis beobachtete Nebenwirkungen:
- Leichter Leistungsrückgang bei Reasoning-Benchmarks
- Typischerweise sieht man bei MMLU oder GSM8K einen Rückgang um 1 bis 3 Punkte. Das ist messbar, steht der praktischen Nutzung aber selten im Weg.
- Manchmal mechanischere Antworten
- Das Modell verliert einen Teil der Nuancen des Alignments: weniger Anfragen zur Klarstellung, weniger Warnungen, selbst wenn diese nützlich wären.
- Nur geringfügig häufigere Halluzinationen
- Bei Fragen, auf die das Modell normalerweise mit „Ich bin mir dessen nicht sicher“ geantwortet hätte, neigt es dazu, eine selbstsicher formulierte Antwort zu erfinden.
- Verbleibende Verhaltensweisen
- Einige Antwortverweigerungen kommen dennoch vor, besonders bei nur näherungsweise durchgeführten Ablationen. Umgekehrt antworten manche Modelle, bei denen die Abliteration sehr gut gelungen ist, auf alles – auch auf Dinge, bei denen Sie lieber hätten, dass sie schweigen.
#Risiken und verantwortungsvolle Nutzung
Ein Modell, das nichts mehr ablehnt, ist kein Spielzeug. Einige einfache Grundsätze, bevor Sie es in der Praxis einsetzen:
- Sie bleiben für die Ausgaben verantwortlich
- Ob Sie ein aligniertes Modell, ein abliterated-Modell oder ein Cloud-Modell verwenden: Sie entscheiden selbst, wie Sie die Antworten nutzen. Die DSGVO, das Strafrecht und das Urheberrecht ändern sich nicht mit der Modellversion.
- Stellen Sie es nicht ohne Filter zur freien Nutzung bereit
- Wenn Sie einen Endpoint für ein Team einrichten, sehen Sie mindestens eine Filterung auf Anwendungsebene vor (Schlüsselwörter, Moderation der Ausgabe). Ein unverändertes abliterated-Modell in einem internen Chat ist grundsätzlich eine schlechte Idee.
- Seien Sie gegenüber den Benutzern transparent
- Wenn eine App, die mit einem abliterierten Modell verbunden ist, möglicherweise überraschende Inhalte erzeugt, weisen Sie Ihre Nutzer darauf hin. Keine Überraschungen, keine Klagen.
- Legitimer Einsatz, tatsächlicher Einsatz
- Forschung zur KI-Sicherheit, Red-Teaming, Verarbeitung sensibler Korpora (Medizin, Recht, Sicherheit), bei denen die Antwortverweigerungen eines alignierten Modells das Werkzeug unbrauchbar machen: In diesen Fällen hat die Ablation einen echten Nutzen. Wer nach dem Motto „Ich habe die Zensur zum Spaß entfernt“ handelt, riskiert sehr unerwünschte Ausgaben, ohne einen Nutzen daraus zu ziehen.
#Tipps und Fehlerbehebung
- Das Modell verweigert die Antwort trotzdem
- Bei manchen Ablationsvarianten bleiben Ablehnungen bei bestimmten Themen bestehen (Politik, Medizin, Minderjährige). Probieren Sie eine andere Ablation desselben Modells oder einen anderen Herausgeber aus – die Qualität der Ablation variiert stark.
- Das Modell ist inkohärent geworden
- Symptom einer zu aggressiven Ablation (zu viele Richtungen entfernt oder eine Richtung falsch isoliert). Bevorzugen Sie eine Variante eines anerkannten Herausgebers gegenüber einer selbst durchgeführten, nicht dokumentierten Ablation.
- Schlechte Leistung im Französischen
- Wie bei jedem Open-Weight-Modell hängt die Leistung auf Französisch vom Basismodell ab. Qwen 3.5, Mistral Small, Gemma 4 und Granite 4.2 sind solide; ältere Modelle (Llama 3, Phi-3, Gemma 2) sind schwächer. Die Ablation ändert daran nichts.
- Verbliebene Einleitungen wie „As an AI, I cannot...“
- Fügen Sie statt eines Jailbreaks einen kurzen Systemprompt hinzu, der an die Rolle und das erwartete Format erinnert. Das reicht oft aus, um die Überreste des Alignments zu beseitigen.
- VRAM voll
- Bei 8 GB bleiben Sie bei einem 7–8B-Modell in Q4_K_M. Bei 12 GB können Sie auf Q5_K_M wechseln oder ein 14B-Modell in Q4 ausprobieren. Bei 24 GB passt ein 32B-Modell in Q4 bequem in den Speicher.
#Weiterführende Informationen
Die Ablation ist ein Einstieg in die Anpassung von Open-Weight-Modellen. Um noch weiter zu gehen:
- Ein Modell mit Ollama Modelfile anpassen
- Wenn Sie eine abliterated-Variante um einen Systemprompt, Parameter und ein Template ergänzen möchten, sollten Sie das Modelfile kennen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um zu verstehen, welches GGUF-Modell Sie abhängig von Ihrem VRAM und der angestrebten Qualität laden sollten – die Ablation ändert nichts an den Abwägungen.
- Lokales LLM-Fine-Tuning: LoRA und QLoRA
- Wenn Ihnen die Ablation allein nicht ausreicht und Sie den Ton oder das Fachgebiet anpassen möchten, ist ein leichtes LoRA auf einer abliterated-Variante oft der beste Kompromiss.
Gibt es eine KI ohne Grenzen und ohne Zensur?+
Ist eine lokal laufende, nicht zensierte KI rechtlich zulässig?+
Ist eine lokale KI ohne Einschränkungen weniger intelligent?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.