ControlNet: Kontrolle über die Komposition Ihrer images
ControlNet fügt einem Diffusionsmodell eine visuelle Bedingung (Konturen, Tiefe, Haltung) hinzu, die die Komposition während der Erzeugung festlegt, während der Prompt den Stil bestimmt. Die Methode erhielt den Preis für den besten Artikel bei ICCV 2023. ControlNet existiert in ComfyUI, Forge oder AUTOMATIC1111 und ist für SD 1.5, SDXL, SD 3.5 Large, Flux.1 und Z-Image Turbo verfügbar. Achtung: Ein Kontrollmodul funktioniert nur mit der Modellfamilie, für die es trainiert wurde.
Ein Prompt beschreibt einen Inhalt; er beschreibt keine Position. ControlNet konditioniert die Bildgenerierung auf eine Referenzstruktur, eine Pose, eine Kontur oder eine Tiefenkarte, sodass das Ergebnis einer Komposition folgt, die Sie selbst bestimmen. Dieser Leitfaden mit Stand vom 28. September 2026 erklärt, welchen Kontrolltyp Sie wählen sollten, wie Sie die Stärke und das Anwendungsintervall einstellen, wie groß die Dateien je nach Modellfamilie sind und wie es um das offizielle Angebot steht, das sich seit SD 1.5 stark verändert hat.
#Das Problem, das gelöst wird
Text eignet sich schlecht, um Geometrie zu beschreiben. In einem Prompt beschreibt man ein Motiv, einen Stil und eine Atmosphäre, doch die Position einer Hand, der Winkel eines Gebäudes oder die genaue Silhouette eines Produkts lassen sich nicht mit Worten festlegen. Startet man die Generierung mit einem anderen Seed erneut, verändert sich die Komposition vollständig. ControlNet verändert die Eingabe, nicht den Prompt: Sie stellen ein Bild bereit, das die gewünschte Struktur kodiert. Das Modell wird bei jedem Schritt der Rauschunterdrückung anhand dieses Bildes konditioniert, und der Prompt steuert alles Übrige.
Die Methode stammt aus einem Forschungsartikel: „Adding Conditional Control to Text-to-Image Diffusion Models“ von Lvmin Zhang, Anyi Rao und Maneesh Agrawala, der im Tagungsband der ICCV 2023 veröffentlicht und mit dem Marr-Preis für den besten Artikel der Konferenz ausgezeichnet wurde. Der Abstract beschreibt das Prinzip: ControlNet friert das Diffusionsmodell ein, verwendet dessen vortrainierte Encoder-Schichten als Grundlage und bindet die trainierbare Kopie über „zero convolutions“ an — mit null initialisierte Faltungsschichten, die die Parameter schrittweise wachsen lassen und verhindern, dass schädliches Rauschen das Training stört. Die Autoren zeigen außerdem, dass das Training sowohl mit kleinen Datensätzen von weniger als 50.000 Bildern als auch mit großen von mehr als einer Million Bildern robust bleibt.
Was dies für Sie bedeutet: Ein Kontrollmechanismus wird einem bestehenden Modell hinzugefügt, ohne das Modell neu trainieren zu müssen, und jeder Kontrolltyp ist eine getrennte Datei. Deshalb ist es wichtig, die richtige Datei für die richtige Modellfamilie zu verwenden.
#Die Art der Steuerung auswählen
KI-Bilder und -Videos lokal erstellen, ohne Begrenzung: ComfyUI, Flux, Z-Image und Wan 2.2 auf Ihrer GPU oder Ihrem Mac – mit Workflows zum direkten Laden und Informationen zum rechtlichen Rahmen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
| Kontrolle | Was es erfasst | Wofür | ControlNet-Modell 1.1 für SD 1.5 |
|---|---|---|---|
| Konturen (canny, softedge, lineart) | Linien und Konturen | Eine exakte Form beibehalten: ein Produkt, ein Logo, eine Zeichnung zum Ausmalen | control_v11p_sd15_canny, _softedge, _lineart, _lineart_anime |
| Tiefe | Abstand zur Kamera | Das Volumen und die Perspektive beibehalten, wenn Materialien und Details geändert werden | control_v11f1p_sd15_depth |
| Pose | Ein Skelett aus Gelenkpunkten | Die Charaktere: Die Haltung ist festgelegt, der Rest ist frei | control_v11p_sd15_openpose |
| Segmentierung | Regionen pro Kategorie | Die Szenenkonfiguration: Himmel hier, Gebäude dort | control_v11p_sd15_seg |
| Skizze (scribble) | Eine grobe Skizze | Eine handgezeichnete Zeichnung in ein gerendertes Bild umwandeln | control_v11p_sd15_scribble |
| Normalen | Die Orientierung der Flächen | Relief und beleuchtungsabhängige Details | control_v11p_sd15_normalbae |
| Kachel (tile) | Der Inhalt eines Bildbereichs | Beim Vergrößern Details hinzufügen | control_v11f1e_sd15_tile |
Das offizielle Repository von ControlNet 1.1 kündigt 14 Modelle an, davon 11 produktionsreife und 3 experimentelle, die alle nach einer einheitlichen Regel benannt sind. Für Tiefenkarten führt es drei unterstützte Präprozessoren auf: Depth_Midas, Depth_Leres und Depth_Zoe. Ein Präprozessor ist ein Werkzeug, das Ihr Referenzbild in eine Kontrollkarte umwandelt, beispielsweise ein Foto in eine Tiefenkarte.
Die Faustregel: Wählen Sie die lockerste Steuerung, die noch das erfasst, worauf es Ihnen ankommt. Eine konturbasierte Konditionierung anhand eines Fotos reproduziert das Foto: Wenn genau das gewünscht ist, war die Generierung überflüssig. Tiefe oder Pose bieten im Allgemeinen ein besseres Gleichgewicht zwischen Vorgabentreue und Kreativität.
#Die wichtigsten Einstellungen
Die Namen variieren je nach Tool, aber drei Einstellungen tauchen überall auf. Die Tabelle zeigt deren Namen in den drei am häufigsten verwendeten Umgebungen gemäß ihren Dokumentationen.
| Einstellung | ComfyUI (Knoten Apply ControlNet) | diffusers-Bibliothek | AUTOMATIC1111-Erweiterung |
|---|---|---|---|
| Stärke der Steuerung | strength: Je höher der Wert, desto stärker beeinflusst die Steuerung das Bild. | controlnet_conditioning_scale: die Gewichtung der Steuerung | Control Weight: die Gewichtung des Kontrolleinflusses, vergleichbar mit der Betonung eines Wortes im Prompt |
| Zeitpunkt der Anwendung | start_percent und end_percent: 0,2 bedeutet, dass die Steuerung bei 20 % des Entrauschungsprozesses beginnt, 0,8, dass sie bei 80 % endet | control_guidance_start und control_guidance_end, als Anteil der Schritte (0 bis 1) | Start und End: die relativen Positionen im Generierungsverlauf, an denen die Steuerung beginnt und endet |
| Genauigkeit der Karte | Auflösung des Vorverarbeiters, im Vorverarbeitungsknoten einstellen | Größe des Kontrollbilds | Der Pixel-Perfect-Modus berechnet automatisch die optimale Auflösung des Präprozessors |
Die Stärke ist der wirksamste Hebel: Nahe dem Maximum wirkt das Ergebnis starr, und eine geringere Stärke korrigiert die meisten starr wirkenden Bilder. Die Steuerung vor dem Ende des Entrauschens zu beenden, legt die Komposition fest und lässt dem Modell zugleich Freiheit bei der Darstellung von Materialien und Licht. Die AUTOMATIC1111-Erweiterung ergänzt einen Control Mode mit drei Einstellungen: Balanced, My prompt is more important und ControlNet is more important, um zwischen Prompt und Steuerung abzuwägen.
#Anfangswerte, die von den Modellautoren veröffentlicht wurden
Statt eigene Zahlen zu erfinden, beginnen Sie mit den Werten, die die Hersteller angeben. Sie variieren erheblich von Familie zu Familie, was daran erinnert, dass eine Einstellung, die für SD 1.5 gültig ist, nicht auf andere übertragen werden kann.
| Modell | Empfohlene Einstellung | Quelle |
|---|---|---|
| Flux.1 dev, Union Pro 2.0 (Shakker Labs), canny oder soft edge | Stärke 0,7; Ende bei 0,8 | Modellbeschreibung |
| Flux.1 dev, Union Pro 2.0, Tiefe | Stärke 0,8; Ende bei 0,8 | Modellbeschreibung |
| Flux.1 dev, Union Pro 2.0, Pose | Stärke 0,9; Ende bei 0,65 | Modellbeschreibung |
| Flux.1 dev, Union Pro 2.0, Graustufen | Stärke 0,9; Ende bei 0,8 | Modellbeschreibung |
| Z-Image Turbo, Fun ControlNet Union | control_context_scale zwischen 0,65 und 0,80 | Modellbeschreibung |
| Flux.1 dev, ControlNet canny von InstantX | Stärke von 0,5 im offiziellen Beispiel | Dokumentation von diffusers |
| SDXL, zwei kombinierte Steuerungen (Canny und Tiefe) | 0,5 für jeden im offiziellen Beispiel | Dokumentation von diffusers |
#Welches ControlNet für welche Familie?
Das Angebot hat sich seit SD 1.5 erheblich verändert, und viele Anleitungen sind veraltet. Die Tabelle unterscheidet, was das Modell-Team veröffentlicht, von dem, was die Community veröffentlicht, da dies die Wartung und die Lizenzbedingungen beeinflusst.
| Familie | Vom Modellanbieter veröffentlichte Kontrollen | Steuerungsmöglichkeiten aus der Community oder von Drittanbietern |
|---|---|---|
| SD 1.5 | ControlNet 1.1 von lllyasviel: 14 Modelle (canny, Tiefe, Pose, Segmentierung, Skizze, Kacheln …) | Viele abgeleitete Modelle |
| SDXL | Control-LoRA von Stability AI: canny, Tiefe, Recolor und Sketch | ControlNet Canny und Depth vom diffusers-Team; ControlNet Union von xinsir (eine Datei, mehrere Modi) |
| SD 3.5 Large | Drei ControlNets von Stability AI, veröffentlicht am 26. November 2024: Blur, Canny und Depth | Wenige vergleichbare Referenzen |
| Flux.1 dev | FLUX.1 Canny und Depth von Black Forest Labs, als vollständige Modelle und als LoRA, veröffentlicht im November 2024 | ControlNet Union von InstantX (Beta-Version) und Union Pro 2.0 von Shakker Labs |
| Z-Image Turbo | Keine auf der Hugging-Face-Seite des Herausgebers (Tongyi-MAI) zum Zeitpunkt unserer Prüfung | Fun ControlNet Union von Alibaba PAI: canny, HED, Tiefe, Pose und MLSD |
Zwei Punkte sollten ausdrücklich erwähnt werden. Erstens hat Black Forest Labs FLUX.1 Depth und FLUX.1 Canny für seine API als veraltet gekennzeichnet, einschließlich der LoRA-Versionen: Die offenen Gewichte bleiben auf Hugging Face verfügbar, werden vom Anbieter aber nicht mehr gepflegt. Zweitens vereinen die „Union“-Modelle mehrere Modi in einer einzigen Datei. Das spart Speicherplatz auf dem Datenträger, geht aber mit einem unterschiedlichen Reifegrad einher: Die Modellbeschreibung von InstantXs ControlNet Union für Flux stellt es als erste Betaversion vor, die möglicherweise noch nicht vollständig trainiert ist.
Die Lizenz entspricht nicht automatisch der des Basismodells: Jede Kontrolldatei hat ihre eigene Lizenz, und diese unterscheidet sich von Datei zu Datei.
| Kontrolle | Lizenz | Zusammenfassung |
|---|---|---|
| ControlNet 1.1 für SD 1.5 | OpenRAIL | Lizenz vom Typ RAIL mit Nutzungseinschränkungen |
| ControlNet canny SDXL vom diffusers-Team | OpenRAIL++ | Wie SDXL: Nutzungseinschränkungen in der Anlage aufgelistet |
| ControlNet Union SDXL von xinsir | Apache 2.0 | Permissiv |
| Control-LoRA von Stability AI | Stability AI Control-LoRA Community License | Bei mehr als 1 Million aktiven Nutzern pro Monat ist für die kommerzielle Nutzung eine Lizenz von Stability AI erforderlich |
| ControlNets SD 3.5 Large | Stability AI Community License | Kostenlos für kommerziellen Gebrauch bei jährlichen Umsätzen unter 1 Million US-Dollar |
| FLUX.1 Canny und Depth [dev] | Nicht kommerzielle FluxDev-Lizenz | Die Beschreibung stellt klar, dass die erzeugten Bilder zu privaten, wissenschaftlichen und kommerziellen Zwecken gemäß der Lizenz verwendet werden können |
| Union von InstantX und Union Pro 2.0 von Shakker Labs, für Flux | Nicht kommerzielle FluxDev-Lizenz | Vor jedem kommerziellen Einsatz zu lesen |
| Fun ControlNet Union für Z-Image Turbo | Apache 2.0 | Permissiv |
#Was dafür an Dateien und Speicher benötigt wird
Ein ControlNet ist ein zusätzliches Netzwerk, das neben dem Basismodell läuft: Es erhöht den VRAM-Bedarf und die Rechenzeit pro Bild. Die auf Hugging Face veröffentlichten Dateigrößen liefern eine erste Größenordnung: Sie kommen zu den Gewichten des Basismodells und seines Textencoders hinzu.
| Kontrolle | Dateigröße |
|---|---|
| ControlNet 1.1 für SD 1.5, ursprüngliche Version (.pth) | 1,45 GB jeweils |
| SDXL, ControlNet canny vom diffusers-Team | 5 GB bei voller Präzision, 2,5 GB bei halber Präzision |
| SDXL, ControlNet Union von xinsir | 2,51 GB |
| SDXL, Control-LoRA von Stability AI | Etwa 738 MB gegenüber 4,7 GB für das ursprüngliche ControlNet |
| SD 3.5 Large, ControlNet canny | 8,61 GB |
| Flux.1 dev, ControlNet Union von InstantX | 6,6 GB |
| Flux.1 dev, Union Pro 2.0 von Shakker Labs | 4,28 GB |
| Flux.1 dev, FLUX.1 Depth als LoRA (Black Forest Labs) | 1,24 GB gegenüber 23,8 GB für das vollständige Canny-Modell |
| Z-Image Turbo, Fun ControlNet Union | 3,1 GB |
Zwei Erkenntnisse. Erstens benötigt eine Steuerung in Form einer LoRA nur einen Bruchteil des Speicherplatzes eines vollständigen Modells: Stability AI stellt seine Control-LoRA als Möglichkeit vor, die Steuerung auf einem breiteren Spektrum handelsüblicher Grafikkarten verfügbar zu machen. Zweitens ist beim Format Vorsicht geboten: Die .pth-Dateien von ControlNet 1.1 sind Python-Pickles, auf die Hugging Face mit einer Warnung vor Pickle-Imports hinweist. Bevorzugen Sie die .safetensors-Versionen, die keinen Code ausführen können.
Wie viel zusätzlicher VRAM wird benötigt? Die Anbieter nennen keine allgemeingültige Zahl, und der gemessene Wert hängt vom Modell und der Auflösung ab. Wenn der Speicher voll ist, helfen folgende Maßnahmen in dieser Reihenfolge: die Auflösung senken, die Anzahl gleichzeitig eingesetzter Steuerungen reduzieren und anschließend zu einer weniger speicherintensiven Steuerung wechseln, etwa einem Control-LoRA oder einer Version mit halber Präzision. Zum grundlegenden Speicherbedarf siehe den VRAM-Leitfaden.
#Wo Sie es einsetzen können
ControlNet ist keine eigenständige Anwendung: Es läuft innerhalb einer Oberfläche zur Bilderzeugung. In ComfyUI übernehmen zwei Knoten die Arbeit: Load ControlNet liest die Dateien aus dem Ordner models/controlnet, und Apply ControlNet erhält das Kontrollbild und die Einstellungen aus der obigen Tabelle. Die ComfyUI-Dokumentation weist darauf hin, dass der Softwarekern nicht alle Präprozessoren enthält: Häufig ist eine Erweiterung wie ComfyUI ControlNet aux nötig. Denken Sie daran, dass eine Erweiterung Code ist, der mit Ihren Berechtigungen ausgeführt wird: Installieren Sie nur bekannte Erweiterungen. Für Z-Image Turbo gehört die Kontrolldatei in einen anderen Ordner, models/model_patches.
In der klassischen Weboberfläche fügt die Erweiterung sd-webui-controlnet von AUTOMATIC1111 ein Bedienfeld unter dem Prompt hinzu. Ihr letzter Eintrag im Abschnitt mit Neuigkeiten, Version 1.1.454, stammt aus Juli 2024, ebenso wie ihr letzter Commit: Sie funktioniert weiterhin mit SD 1.5 und SDXL, wird neuere Modelle aber nicht mehr unterstützen. Forge integriert ControlNet laut seinem README direkt, ohne diese Erweiterung zu verwenden.
#Mehrere Steuerungen gleichzeitig kombinieren
Sie können problemlos zwei Steuerungen kombinieren, zum Beispiel eine Posensteuerung für die Körperhaltung der Figur und eine Tiefensteuerung für die Umgebung. Die Dokumentation von diffusers nennt die Regel: Maskieren Sie die Konditionierungen für gute Ergebnisse so, dass sie sich nicht überlappen, und experimentieren Sie mit unterschiedlichen Stärken, um die Gewichtung jeder Steuerung anzupassen. Ihr SDXL-Beispiel kombiniert Canny und Tiefe mit jeweils 0,5. In ComfyUI werden die Apply ControlNet-Knoten hintereinander geschaltet. Für beide gelten dieselben Prinzipien: Nur Steuerungen kombinieren, die unterschiedliche Aspekte des Bildes betreffen, und die Stärke jeder Steuerung reduzieren, da sich die Effekte addieren.
#Wenn der Kontrollmechanismus ignoriert wird
- Das ControlNet-Modell erscheint nicht in der Liste
- Die Datei befindet sich im falschen Ordner oder ihre Konfigurationsdatei trägt nicht den gleichen Namen. In ComfyUI ist der Ordner models/controlnet.
- Die Ausgabe ignoriert die Referenz
- Inkompatibilität zwischen der Basismodellfamilie und der Kontrollmodellfamilie, ein Präprozessor, der eine leere Kontrollkarte erzeugt hat, oder eine zu niedrig eingestellte Stärke. Zeigen Sie die Kontrollkarte selbst an, bevor Sie andere Ursachen vermuten.
- Die Bilder wirken starr und leblos
- Zu hohe Stärke oder Steuerung während des gesamten Entrauschungsprozesses. Verringern Sie die Stärke und beenden Sie die Steuerung vor dem Ende.
- Enttäuschendes Ergebnis mit einem Union-Modell
- Die Autoren des Union-Modells von InstantX schreiben, dass selbst ein vollständig trainiertes Union-Modell schlechter sein kann als spezialisierte Modelle, etwa das Modell für Posen. Probieren Sie ein dediziertes ControlNet aus und schreiben Sie einen detaillierten Prompt, wie es die Modellkarte von Shakker Labs empfiehlt.
- Speicher voll
- Reduzieren Sie die Auflösung, entfernen Sie ein ControlNet-Modul oder verwenden Sie eine leichtere Version des Moduls.
- ComfyUI: die graphbasierte Oberfläche installieren
- AUTOMATIC1111: die klassische Weboberfläche
- Übersicht zur lokalen Bildgenerierung
- Das KI-Bilder-Kit: ControlNet-Workflows und -Einstellungen je nach Grafikkarte
- Quelle: das offizielle ControlNet-Repository
- Quelle : der ursprüngliche Forschungsartikel, ICCV 2023
- Quelle: die Control-LoRA von Stability AI für SDXL
- Quelle: FLUX.1 Tools und die Abkündigung von Depth und Canny
#FAQ
Wozu dient ControlNet?+
Ist eine leistungsstarke Grafikkarte für ControlNet erforderlich?+
Warum ignoriert meine Ausgabe das Kontrollbild?+
Welche Steuerung eignet sich für die Pose einer Figur?+
Gibt es ControlNet für SDXL, Flux und Z-Image?+
Kann man mehrere ControlNets gleichzeitig verwenden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.