Mittelstufe 13 minBild

ControlNet: Kontrolle über die Komposition Ihrer images

Direkte Antwort

ControlNet fügt einem Diffusionsmodell eine visuelle Bedingung (Konturen, Tiefe, Haltung) hinzu, die die Komposition während der Erzeugung festlegt, während der Prompt den Stil bestimmt. Die Methode erhielt den Preis für den besten Artikel bei ICCV 2023. ControlNet existiert in ComfyUI, Forge oder AUTOMATIC1111 und ist für SD 1.5, SDXL, SD 3.5 Large, Flux.1 und Z-Image Turbo verfügbar. Achtung: Ein Kontrollmodul funktioniert nur mit der Modellfamilie, für die es trainiert wurde.

Ein Prompt beschreibt einen Inhalt; er beschreibt keine Position. ControlNet konditioniert die Bildgenerierung auf eine Referenzstruktur, eine Pose, eine Kontur oder eine Tiefenkarte, sodass das Ergebnis einer Komposition folgt, die Sie selbst bestimmen. Dieser Leitfaden mit Stand vom 28. September 2026 erklärt, welchen Kontrolltyp Sie wählen sollten, wie Sie die Stärke und das Anwendungsintervall einstellen, wie groß die Dateien je nach Modellfamilie sind und wie es um das offizielle Angebot steht, das sich seit SD 1.5 stark verändert hat.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Das Problem, das gelöst wird

Text eignet sich schlecht, um Geometrie zu beschreiben. In einem Prompt beschreibt man ein Motiv, einen Stil und eine Atmosphäre, doch die Position einer Hand, der Winkel eines Gebäudes oder die genaue Silhouette eines Produkts lassen sich nicht mit Worten festlegen. Startet man die Generierung mit einem anderen Seed erneut, verändert sich die Komposition vollständig. ControlNet verändert die Eingabe, nicht den Prompt: Sie stellen ein Bild bereit, das die gewünschte Struktur kodiert. Das Modell wird bei jedem Schritt der Rauschunterdrückung anhand dieses Bildes konditioniert, und der Prompt steuert alles Übrige.

Die Methode stammt aus einem Forschungsartikel: „Adding Conditional Control to Text-to-Image Diffusion Models“ von Lvmin Zhang, Anyi Rao und Maneesh Agrawala, der im Tagungsband der ICCV 2023 veröffentlicht und mit dem Marr-Preis für den besten Artikel der Konferenz ausgezeichnet wurde. Der Abstract beschreibt das Prinzip: ControlNet friert das Diffusionsmodell ein, verwendet dessen vortrainierte Encoder-Schichten als Grundlage und bindet die trainierbare Kopie über „zero convolutions“ an — mit null initialisierte Faltungsschichten, die die Parameter schrittweise wachsen lassen und verhindern, dass schädliches Rauschen das Training stört. Die Autoren zeigen außerdem, dass das Training sowohl mit kleinen Datensätzen von weniger als 50.000 Bildern als auch mit großen von mehr als einer Million Bildern robust bleibt.

Was dies für Sie bedeutet: Ein Kontrollmechanismus wird einem bestehenden Modell hinzugefügt, ohne das Modell neu trainieren zu müssen, und jeder Kontrolltyp ist eine getrennte Datei. Deshalb ist es wichtig, die richtige Datei für die richtige Modellfamilie zu verwenden.

#Die Art der Steuerung auswählen

Das KI-Bild-Kit

KI-Bilder und -Videos lokal erstellen, ohne Begrenzung: ComfyUI, Flux, Z-Image und Wan 2.2 auf Ihrer GPU oder Ihrem Mac – mit Workflows zum direkten Laden und Informationen zum rechtlichen Rahmen.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Was die einzelnen Steuerungsarten mit den SD-1.5-Modellen von ControlNet 1.1 erfassen
KontrolleWas es erfasstWofürControlNet-Modell 1.1 für SD 1.5
Konturen (canny, softedge, lineart)Linien und KonturenEine exakte Form beibehalten: ein Produkt, ein Logo, eine Zeichnung zum Ausmalencontrol_v11p_sd15_canny, _softedge, _lineart, _lineart_anime
TiefeAbstand zur KameraDas Volumen und die Perspektive beibehalten, wenn Materialien und Details geändert werdencontrol_v11f1p_sd15_depth
PoseEin Skelett aus GelenkpunktenDie Charaktere: Die Haltung ist festgelegt, der Rest ist freicontrol_v11p_sd15_openpose
SegmentierungRegionen pro KategorieDie Szenenkonfiguration: Himmel hier, Gebäude dortcontrol_v11p_sd15_seg
Skizze (scribble)Eine grobe SkizzeEine handgezeichnete Zeichnung in ein gerendertes Bild umwandelncontrol_v11p_sd15_scribble
NormalenDie Orientierung der FlächenRelief und beleuchtungsabhängige Detailscontrol_v11p_sd15_normalbae
Kachel (tile)Der Inhalt eines BildbereichsBeim Vergrößern Details hinzufügencontrol_v11f1e_sd15_tile

Das offizielle Repository von ControlNet 1.1 kündigt 14 Modelle an, davon 11 produktionsreife und 3 experimentelle, die alle nach einer einheitlichen Regel benannt sind. Für Tiefenkarten führt es drei unterstützte Präprozessoren auf: Depth_Midas, Depth_Leres und Depth_Zoe. Ein Präprozessor ist ein Werkzeug, das Ihr Referenzbild in eine Kontrollkarte umwandelt, beispielsweise ein Foto in eine Tiefenkarte.

Die Faustregel: Wählen Sie die lockerste Steuerung, die noch das erfasst, worauf es Ihnen ankommt. Eine konturbasierte Konditionierung anhand eines Fotos reproduziert das Foto: Wenn genau das gewünscht ist, war die Generierung überflüssig. Tiefe oder Pose bieten im Allgemeinen ein besseres Gleichgewicht zwischen Vorgabentreue und Kreativität.

#Die wichtigsten Einstellungen

Die Namen variieren je nach Tool, aber drei Einstellungen tauchen überall auf. Die Tabelle zeigt deren Namen in den drei am häufigsten verwendeten Umgebungen gemäß ihren Dokumentationen.

ControlNet-Einstellungen je nach Tool
EinstellungComfyUI (Knoten Apply ControlNet)diffusers-BibliothekAUTOMATIC1111-Erweiterung
Stärke der Steuerungstrength: Je höher der Wert, desto stärker beeinflusst die Steuerung das Bild.controlnet_conditioning_scale: die Gewichtung der SteuerungControl Weight: die Gewichtung des Kontrolleinflusses, vergleichbar mit der Betonung eines Wortes im Prompt
Zeitpunkt der Anwendungstart_percent und end_percent: 0,2 bedeutet, dass die Steuerung bei 20 % des Entrauschungsprozesses beginnt, 0,8, dass sie bei 80 % endetcontrol_guidance_start und control_guidance_end, als Anteil der Schritte (0 bis 1)Start und End: die relativen Positionen im Generierungsverlauf, an denen die Steuerung beginnt und endet
Genauigkeit der KarteAuflösung des Vorverarbeiters, im Vorverarbeitungsknoten einstellenGröße des KontrollbildsDer Pixel-Perfect-Modus berechnet automatisch die optimale Auflösung des Präprozessors

Die Stärke ist der wirksamste Hebel: Nahe dem Maximum wirkt das Ergebnis starr, und eine geringere Stärke korrigiert die meisten starr wirkenden Bilder. Die Steuerung vor dem Ende des Entrauschens zu beenden, legt die Komposition fest und lässt dem Modell zugleich Freiheit bei der Darstellung von Materialien und Licht. Die AUTOMATIC1111-Erweiterung ergänzt einen Control Mode mit drei Einstellungen: Balanced, My prompt is more important und ControlNet is more important, um zwischen Prompt und Steuerung abzuwägen.

#Anfangswerte, die von den Modellautoren veröffentlicht wurden

Statt eigene Zahlen zu erfinden, beginnen Sie mit den Werten, die die Hersteller angeben. Sie variieren erheblich von Familie zu Familie, was daran erinnert, dass eine Einstellung, die für SD 1.5 gültig ist, nicht auf andere übertragen werden kann.

Empfohlene Werte gemäß den Modellbeschreibungen und der Dokumentation von diffusers
ModellEmpfohlene EinstellungQuelle
Flux.1 dev, Union Pro 2.0 (Shakker Labs), canny oder soft edgeStärke 0,7; Ende bei 0,8Modellbeschreibung
Flux.1 dev, Union Pro 2.0, TiefeStärke 0,8; Ende bei 0,8Modellbeschreibung
Flux.1 dev, Union Pro 2.0, PoseStärke 0,9; Ende bei 0,65Modellbeschreibung
Flux.1 dev, Union Pro 2.0, GraustufenStärke 0,9; Ende bei 0,8Modellbeschreibung
Z-Image Turbo, Fun ControlNet Unioncontrol_context_scale zwischen 0,65 und 0,80Modellbeschreibung
Flux.1 dev, ControlNet canny von InstantXStärke von 0,5 im offiziellen BeispielDokumentation von diffusers
SDXL, zwei kombinierte Steuerungen (Canny und Tiefe)0,5 für jeden im offiziellen BeispielDokumentation von diffusers
!
Das Kontrollmodell muss zum Basismodell passen
Ein ControlNet wird für eine bestimmte Architektur trainiert. Eine für SD 1.5 vorgesehene Datei funktioniert weder mit SDXL noch mit Flux. Das typische Symptom ist eine Ausgabe, die die Steuerung völlig ignoriert oder zu Rauschen zerfällt. Prüfen Sie vor dem Herunterladen immer, welche Modellfamilie in der Beschreibung der Datei angegeben ist.

#Welches ControlNet für welche Familie?

Das Angebot hat sich seit SD 1.5 erheblich verändert, und viele Anleitungen sind veraltet. Die Tabelle unterscheidet, was das Modell-Team veröffentlicht, von dem, was die Community veröffentlicht, da dies die Wartung und die Lizenzbedingungen beeinflusst.

Angebot je Modellfamilie, zum Zeitpunkt der Erstellung
FamilieVom Modellanbieter veröffentlichte KontrollenSteuerungsmöglichkeiten aus der Community oder von Drittanbietern
SD 1.5ControlNet 1.1 von lllyasviel: 14 Modelle (canny, Tiefe, Pose, Segmentierung, Skizze, Kacheln …)Viele abgeleitete Modelle
SDXLControl-LoRA von Stability AI: canny, Tiefe, Recolor und SketchControlNet Canny und Depth vom diffusers-Team; ControlNet Union von xinsir (eine Datei, mehrere Modi)
SD 3.5 LargeDrei ControlNets von Stability AI, veröffentlicht am 26. November 2024: Blur, Canny und DepthWenige vergleichbare Referenzen
Flux.1 devFLUX.1 Canny und Depth von Black Forest Labs, als vollständige Modelle und als LoRA, veröffentlicht im November 2024ControlNet Union von InstantX (Beta-Version) und Union Pro 2.0 von Shakker Labs
Z-Image TurboKeine auf der Hugging-Face-Seite des Herausgebers (Tongyi-MAI) zum Zeitpunkt unserer PrüfungFun ControlNet Union von Alibaba PAI: canny, HED, Tiefe, Pose und MLSD

Zwei Punkte sollten ausdrücklich erwähnt werden. Erstens hat Black Forest Labs FLUX.1 Depth und FLUX.1 Canny für seine API als veraltet gekennzeichnet, einschließlich der LoRA-Versionen: Die offenen Gewichte bleiben auf Hugging Face verfügbar, werden vom Anbieter aber nicht mehr gepflegt. Zweitens vereinen die „Union“-Modelle mehrere Modi in einer einzigen Datei. Das spart Speicherplatz auf dem Datenträger, geht aber mit einem unterschiedlichen Reifegrad einher: Die Modellbeschreibung von InstantXs ControlNet Union für Flux stellt es als erste Betaversion vor, die möglicherweise noch nicht vollständig trainiert ist.

Die Lizenz entspricht nicht automatisch der des Basismodells: Jede Kontrolldatei hat ihre eigene Lizenz, und diese unterscheidet sich von Datei zu Datei.

Lizenzen der Kontrollmodelle laut den Metadaten der Hugging-Face-Repositories und den angeführten Lizenzen
KontrolleLizenzZusammenfassung
ControlNet 1.1 für SD 1.5OpenRAILLizenz vom Typ RAIL mit Nutzungseinschränkungen
ControlNet canny SDXL vom diffusers-TeamOpenRAIL++Wie SDXL: Nutzungseinschränkungen in der Anlage aufgelistet
ControlNet Union SDXL von xinsirApache 2.0Permissiv
Control-LoRA von Stability AIStability AI Control-LoRA Community LicenseBei mehr als 1 Million aktiven Nutzern pro Monat ist für die kommerzielle Nutzung eine Lizenz von Stability AI erforderlich
ControlNets SD 3.5 LargeStability AI Community LicenseKostenlos für kommerziellen Gebrauch bei jährlichen Umsätzen unter 1 Million US-Dollar
FLUX.1 Canny und Depth [dev]Nicht kommerzielle FluxDev-LizenzDie Beschreibung stellt klar, dass die erzeugten Bilder zu privaten, wissenschaftlichen und kommerziellen Zwecken gemäß der Lizenz verwendet werden können
Union von InstantX und Union Pro 2.0 von Shakker Labs, für FluxNicht kommerzielle FluxDev-LizenzVor jedem kommerziellen Einsatz zu lesen
Fun ControlNet Union für Z-Image TurboApache 2.0Permissiv

#Was dafür an Dateien und Speicher benötigt wird

Ein ControlNet ist ein zusätzliches Netzwerk, das neben dem Basismodell läuft: Es erhöht den VRAM-Bedarf und die Rechenzeit pro Bild. Die auf Hugging Face veröffentlichten Dateigrößen liefern eine erste Größenordnung: Sie kommen zu den Gewichten des Basismodells und seines Textencoders hinzu.

Größe der Kontrolldateien, gemäß Hugging Face und Stability AI
KontrolleDateigröße
ControlNet 1.1 für SD 1.5, ursprüngliche Version (.pth)1,45 GB jeweils
SDXL, ControlNet canny vom diffusers-Team5 GB bei voller Präzision, 2,5 GB bei halber Präzision
SDXL, ControlNet Union von xinsir2,51 GB
SDXL, Control-LoRA von Stability AIEtwa 738 MB gegenüber 4,7 GB für das ursprüngliche ControlNet
SD 3.5 Large, ControlNet canny8,61 GB
Flux.1 dev, ControlNet Union von InstantX6,6 GB
Flux.1 dev, Union Pro 2.0 von Shakker Labs4,28 GB
Flux.1 dev, FLUX.1 Depth als LoRA (Black Forest Labs)1,24 GB gegenüber 23,8 GB für das vollständige Canny-Modell
Z-Image Turbo, Fun ControlNet Union3,1 GB

Zwei Erkenntnisse. Erstens benötigt eine Steuerung in Form einer LoRA nur einen Bruchteil des Speicherplatzes eines vollständigen Modells: Stability AI stellt seine Control-LoRA als Möglichkeit vor, die Steuerung auf einem breiteren Spektrum handelsüblicher Grafikkarten verfügbar zu machen. Zweitens ist beim Format Vorsicht geboten: Die .pth-Dateien von ControlNet 1.1 sind Python-Pickles, auf die Hugging Face mit einer Warnung vor Pickle-Imports hinweist. Bevorzugen Sie die .safetensors-Versionen, die keinen Code ausführen können.

Wie viel zusätzlicher VRAM wird benötigt? Die Anbieter nennen keine allgemeingültige Zahl, und der gemessene Wert hängt vom Modell und der Auflösung ab. Wenn der Speicher voll ist, helfen folgende Maßnahmen in dieser Reihenfolge: die Auflösung senken, die Anzahl gleichzeitig eingesetzter Steuerungen reduzieren und anschließend zu einer weniger speicherintensiven Steuerung wechseln, etwa einem Control-LoRA oder einer Version mit halber Präzision. Zum grundlegenden Speicherbedarf siehe den VRAM-Leitfaden.

#Wo Sie es einsetzen können

ControlNet ist keine eigenständige Anwendung: Es läuft innerhalb einer Oberfläche zur Bilderzeugung. In ComfyUI übernehmen zwei Knoten die Arbeit: Load ControlNet liest die Dateien aus dem Ordner models/controlnet, und Apply ControlNet erhält das Kontrollbild und die Einstellungen aus der obigen Tabelle. Die ComfyUI-Dokumentation weist darauf hin, dass der Softwarekern nicht alle Präprozessoren enthält: Häufig ist eine Erweiterung wie ComfyUI ControlNet aux nötig. Denken Sie daran, dass eine Erweiterung Code ist, der mit Ihren Berechtigungen ausgeführt wird: Installieren Sie nur bekannte Erweiterungen. Für Z-Image Turbo gehört die Kontrolldatei in einen anderen Ordner, models/model_patches.

In der klassischen Weboberfläche fügt die Erweiterung sd-webui-controlnet von AUTOMATIC1111 ein Bedienfeld unter dem Prompt hinzu. Ihr letzter Eintrag im Abschnitt mit Neuigkeiten, Version 1.1.454, stammt aus Juli 2024, ebenso wie ihr letzter Commit: Sie funktioniert weiterhin mit SD 1.5 und SDXL, wird neuere Modelle aber nicht mehr unterstützen. Forge integriert ControlNet laut seinem README direkt, ohne diese Erweiterung zu verwenden.

#Mehrere Steuerungen gleichzeitig kombinieren

Sie können problemlos zwei Steuerungen kombinieren, zum Beispiel eine Posensteuerung für die Körperhaltung der Figur und eine Tiefensteuerung für die Umgebung. Die Dokumentation von diffusers nennt die Regel: Maskieren Sie die Konditionierungen für gute Ergebnisse so, dass sie sich nicht überlappen, und experimentieren Sie mit unterschiedlichen Stärken, um die Gewichtung jeder Steuerung anzupassen. Ihr SDXL-Beispiel kombiniert Canny und Tiefe mit jeweils 0,5. In ComfyUI werden die Apply ControlNet-Knoten hintereinander geschaltet. Für beide gelten dieselben Prinzipien: Nur Steuerungen kombinieren, die unterschiedliche Aspekte des Bildes betreffen, und die Stärke jeder Steuerung reduzieren, da sich die Effekte addieren.

#Wenn der Kontrollmechanismus ignoriert wird

Das ControlNet-Modell erscheint nicht in der Liste
Die Datei befindet sich im falschen Ordner oder ihre Konfigurationsdatei trägt nicht den gleichen Namen. In ComfyUI ist der Ordner models/controlnet.
Die Ausgabe ignoriert die Referenz
Inkompatibilität zwischen der Basismodellfamilie und der Kontrollmodellfamilie, ein Präprozessor, der eine leere Kontrollkarte erzeugt hat, oder eine zu niedrig eingestellte Stärke. Zeigen Sie die Kontrollkarte selbst an, bevor Sie andere Ursachen vermuten.
Die Bilder wirken starr und leblos
Zu hohe Stärke oder Steuerung während des gesamten Entrauschungsprozesses. Verringern Sie die Stärke und beenden Sie die Steuerung vor dem Ende.
Enttäuschendes Ergebnis mit einem Union-Modell
Die Autoren des Union-Modells von InstantX schreiben, dass selbst ein vollständig trainiertes Union-Modell schlechter sein kann als spezialisierte Modelle, etwa das Modell für Posen. Probieren Sie ein dediziertes ControlNet aus und schreiben Sie einen detaillierten Prompt, wie es die Modellkarte von Shakker Labs empfiehlt.
Speicher voll
Reduzieren Sie die Auflösung, entfernen Sie ein ControlNet-Modul oder verwenden Sie eine leichtere Version des Moduls.

#FAQ

FAQ
Wozu dient ControlNet?+
Dazu, die Bildgenerierung anhand einer strukturellen Referenz wie Konturen, Tiefe oder eines Poseskeletts zu steuern, damit das Bild dieser Struktur folgt, während der Prompt Motiv und Stil bestimmt. Die in den Tagungsbänden der ICCV 2023 veröffentlichte Methode friert das Diffusionsmodell ein und trainiert eine Kopie, die über mit null initialisierte Faltungen angebunden ist: Das ursprüngliche Modell wird nicht erneut trainiert.
Ist eine leistungsstarke Grafikkarte für ControlNet erforderlich?+
Es fügt dem Basismodell ein zweites Netzwerk hinzu und benötigt dadurch zusätzlichen Speicher und zusätzliche Zeit. Die Anbieter veröffentlichen keine allgemeine Angabe zum zusätzlichen VRAM-Bedarf. Bei SD 1.5 benötigt ein Kontrollmodul in der Originalversion 1,45 GB; bei SDXL benötigt ein Control-LoRA von Stability AI etwa 738 MB gegenüber 4,7 GB. Beginnen Sie mit einem einzigen leichten Kontrollmodul und steigern Sie den Umfang anschließend.
Warum ignoriert meine Ausgabe das Kontrollbild?+
Meistens passt das Kontrollmodell nicht zur Familie des Basismodells (SD 1.5, SDXL, Flux), der Präprozessor hat eine leere Kontrollkarte erzeugt oder die Stärke ist zu niedrig eingestellt. Zeigen Sie zuerst die Kontrollkarte selbst an. Bei neueren Modellen spielt auch der Zeitraum, in dem die Kontrolle angewendet wird, eine Rolle: Wird sie zu früh beendet, hat sie danach keine Wirkung mehr.
Welche Steuerung eignet sich für die Pose einer Figur?+
Die Konditionierung anhand der Pose, die das Gelenkskelett festlegt und Kleidung, Aussehen und Hintergrund offenlässt. Bei Flux mit dem Modell Union Pro 2.0 von Shakker Labs empfiehlt die Modellbeschreibung für die Pose eine Stärke von 0,9 und einen Stopp bei 0,65 im Entrauschungsprozess. Konturen würden die gesamte Silhouette festlegen, was bei einer Figur selten das Ziel ist.
Gibt es ControlNet für SDXL, Flux und Z-Image?+
Ja, aber die Herkunft variiert. SDXL: Control-LoRA von Stability AI und Drittanbietermodelle. SD 3.5 Large: drei ControlNets von Stability AI. Flux.1: FLUX.1 Canny und Depth von Black Forest Labs, für die API als veraltet eingestuft, sowie Union-Modelle aus der Community. Z-Image Turbo: Fun ControlNet Union von Alibaba PAI, mit einem empfohlenen Wert von 0,65 bis 0,80.
Kann man mehrere ControlNets gleichzeitig verwenden?+
Ja. Die Dokumentation von diffusers empfiehlt, die Konditionierungen mit Masken zu versehen, damit sie sich nicht überlappen, und ihre jeweilige Stärke abzustimmen; ihr SDXL-Beispiel verwendet 0,5 für Canny und 0,5 für die Tiefe. In ComfyUI werden die Knoten Apply ControlNet hintereinander verbunden. Kombinieren Sie nur Steuerungen, die sich ergänzen, etwa Pose und Hintergrund.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.