Real-ESRGAN: Bilder vergrößern in lokal
Real-ESRGAN ist ein freies Modell (BSD-3-Clause), das ein Bild um den Faktor 4 vergrößert und dabei plausible Details rekonstruiert. Am einfachsten ist die portable ausführbare Datei ncnn-vulkan, die ohne CUDA und PyTorch auf Intel-, AMD- oder NVIDIA-Grafikkarten läuft. Wählen Sie das Modell passend zum Bild: realesrgan-x4plus für Fotos, die Anime-Variante für Illustrationen. Seit September 2022 hat das Projekt keine neue Version veröffentlicht, und die hinzugefügten Details sind erfunden: niemals für Text oder als Beweismittel verwenden.
Real-ESRGAN vergrößert ein Bild, indem es plausible Details rekonstruiert, statt Pixel zu strecken. Es ist ein freies, kleines und schnelles Modell, das sich als Baustein am Ende einer lokalen Bildgenerierungskette etabliert hat oder zur Restaurierung alter Fotos eingesetzt wird. Dieser Leitfaden mit Stand vom 28. September 2026 erklärt, welches Modell Sie wählen sollten, wie Sie es ohne Installation von PyTorch starten, was es erfindet, welche Fehler zu erwarten sind und wo das Projekt im Vergleich zu neueren Alternativen steht.
#Was ein KI-basiertes Vergrößerungstool tut
Eine klassische Bildvergrößerung arbeitet mit Interpolation: Sie berechnet Zwischenpixel aus den benachbarten Pixeln, wodurch ein größeres und unschärferes Bild entsteht. Ein lernbasierter Bildvergrößerer arbeitet anders. Er wurde darauf trainiert, aus einer qualitativ verschlechterten Version ein scharfes Bild wiederherzustellen, und rekonstruiert das, was dem Original am ähnlichsten ist: Texturen, Kanten, Körnung. Der Unterschied lässt sich in einem Satz zusammenfassen: Interpolation erzeugt keine Informationen, das Modell erfindet sie. Genau das verlangen wir von ihm, und deshalb muss man wissen, wo man es nicht einsetzen sollte.
Real-ESRGAN geht auf einen Artikel von Xintao Wang, Liangbin Xie, Chao Dong und Ying Shan (Tencent ARC Lab) zurück, der im Juli 2021 auf arXiv veröffentlicht und bei den ICCV Workshops vorgestellt wurde: „Training Real-World Blind Super-Resolution with Pure Synthetic Data“. Die Zusammenfassung beschreibt die Idee: ein ausschließlich mit synthetischen Daten trainiertes Modell mit einer Modellierung von Bildverschlechterungen „höherer Ordnung“, die reale Bildfehler (Unschärfe, Rauschen, Kompression) besser simuliert, und einem U-Net-Diskriminator. „Blind“ bedeutet, dass das Modell nicht wissen muss, welche Bildverschlechterung das Bild erfahren hat. Das Repository hat mehr als 36.000 Sterne.
#Die Modelle: Welches sollten Sie wählen?
KI-Bilder und -Videos lokal erstellen, ohne Begrenzung: ComfyUI, Flux, Z-Image und Wan 2.2 auf Ihrer GPU oder Ihrem Mac – mit Workflows zum direkten Laden und Informationen zum rechtlichen Rahmen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
| Modell | Skalierung | Projektbeschreibung | Geeignet für |
|---|---|---|---|
| RealESRGAN_x4plus | ×4 | ×4-Modell für allgemeine Bilder | Fotos, generierte Bilder: die Standardwahl |
| RealESRGAN_x2plus | ×2 | ×2-Modell für allgemeine Bilder | Wenn ×4 zu viel ist, ohne anschließend erneut die Bildgröße anzupassen |
| RealESRNet_x4plus | ×4 | Modell ×4 mit MSE-Verlust und übermäßigem Smoothing-Effekt | Selten: Das Ergebnis ist glatt und ausdruckslos |
| realesr-general-x4v3 | ×4, auch mit den Faktoren ×1, ×2 und ×3 nutzbar | Kleines Modell, benötigt deutlich weniger GPU-Speicher und Zeit, geringere Leistung bei der Rauschunterdrückung | Rechner mit geringer Leistung, Bildstapel; die Option -dn steuert die Rauschreduzierung |
| RealESRGAN_x4plus_anime_6B | ×4 | Optimiert für Anime-Bilder, kleineres Netzwerk (6 RRDB-Blöcke) | Illustrationen, Bildtafeln, 2D-Zeichnungen |
| realesr-animevideov3 | ×4, auch mit den Faktoren ×1, ×2 und ×3 nutzbar | Modell in Größe XS für animierte Videos | Animationssequenzen |
Der Katalog des Projekts unterscheidet zwischen Modellen für Fotos und Modellen für Illustrationen, und diese Wahl hat den größten Einfluss auf das Ergebnis. Die Anime-Variante wird als für diesen Bildtyp optimiert beschrieben, mit einem kleineren Netzwerk, und das Projekt vergleicht sie mit waifu2x. Probieren Sie sie bei einer Zeichnung zuerst aus: Ein Fotomodell kann gleichmäßigen Farbflächen, die glatt bleiben sollten, eine Textur verleihen. Prüfen Sie das an Ihrem Bild.
#Drei Möglichkeiten zum Starten
Das README beschreibt drei Möglichkeiten: eine Online-Demo, die portable ncnn-Programmdatei und das Python-Skript. Für den regelmäßigen lokalen Einsatz kommen nur die letzten beiden infrage.
| Weg | Was man braucht | Vorteile | Grenzen |
|---|---|---|---|
| Portable ausführbare Datei (ncnn-vulkan) | Eine GPU von Intel, AMD oder NVIDIA mit Vulkan-Unterstützung. Archive für Windows, Linux und macOS. Kein CUDA, kein PyTorch. | Keine Installation erforderlich, die Modelle sind enthalten | Unterstützt nicht alle Funktionen des Python-Skripts, etwa --outscale, und kann Inkonsistenzen zwischen den Blöcken erzeugen |
| Python-Skript (inference_realesrgan.py) | Python 3.7 oder höher, PyTorch 1.7 oder höher, basicsr, facexlib und gfpgan für Gesichter | Beliebige Skalierung, Gesichter, Tiling, Bilder mit Alphakanal, Graustufenbilder oder 16-Bit-Bilder | Fehleranfällige Abhängigkeiten, siehe Fehlerbehebung |
#Die genauen Befehle
Die portable ausführbare Datei wird über die Kommandozeile verwendet. Der Hilfetext nennt die Optionen: -i für die Eingabe (Datei oder Ordner), -o für die Ausgabe, -s für den Skalierungsfaktor (2, 3 oder 4), -n für das Modell, -t für die Kachelgröße, -g zur Auswahl der GPU, -f für das Ausgabeformat.
Das Python-Skript bietet die Option --outscale: Das Modell vergrößert das Bild immer um den Faktor 4, anschließend skaliert das Programm das Ergebnis mit geringem Rechenaufwand auf den gewünschten Maßstab. Außerdem gibt es --tile, um das Bild in Kacheln aufzuteilen und Arbeitsspeicher zu sparen, sowie --fp32 für volle Präzision. Diese ist beim Betrieb auf der CPU zwingend erforderlich (siehe unten).
In ComfyUI werden Upscaling-Modelle in ComfyUI/models/upscale_models abgelegt. Angewendet werden sie mit einem Ladeknoten und anschließend einem Knoten für modellbasiertes Upscaling. Für eine Desktop-Oberfläche nennt die README mehrere Projekte, die Real-ESRGAN integrieren, darunter Upscayl, eine freie Software für Linux, macOS und Windows, die rund 50.000 Sterne hat und in den letzten Tagen aktualisiert wurde.
#Gut nutzen
- 01Das Modell entsprechend dem Bildtyp auswählenFoto oder Illustration: Diese Einstellung beeinflusst das Ergebnis am stärksten, weit stärker als der Vergrößerungsfaktor. Fügen Sie dem Befehl immer -n hinzu.
- 02Nicht mehrere Durchgänge hintereinander ausführenZweimal hintereinander um den Faktor ×4 zu vergrößern, erzeugt eine Plastikoptik statt Details. Ein Durchlauf mit dem richtigen Faktor genügt; wenn ×4 zu viel ist, nehmen Sie das ×2-Modell oder die Skalierungsoption.
- 03Vor dem Vergrößern bereinigenEine leichte Rauschreduzierung im Vorfeld verhindert, dass das Modell Rauschen als zu rekonstruierende Details behandelt. Bei realesr-general-x4v3 steuert die Option -dn die Stärke der Rauschreduzierung, um ein zu glattes Ergebnis zu vermeiden.
- 04face_enhance nur für echte Gesichter verwendenDie Option face_enhance basiert auf GFPGAN und ist nur für echte Gesichter gedacht: Die FAQ des Projekts rät davon ab, sie bei Animationen zu verwenden, da sie dort unnötig GPU-Speicher verbraucht.
- 05Bei 100 % vergleichenEine Vergrößerung beurteilt man auf Pixelebene, nicht anhand eines Vorschaubilds. Viele Ergebnisse, die in kleiner Darstellung spektakulär wirken, sehen aus der Nähe glatt und künstlich aus.
#Welche Größe anstreben: eine Berechnung vor dem Start
Ein Vergrößerungsfaktor von ×4 ist nur dann nützlich, wenn die endgültige Größe für eine spezifische Anwendung geeignet ist. Der erforderliche Faktor nach dem Ziel basiert auf einem einfachen Berechnungsverfahren: Pixel = Zentimeter ÷ 2,54 × Auflösung in Punkten pro Zoll, dann Faktor = gewünschter großer Seitenwert ÷ ursprünglicher großer Seitenwert.
| Nutzung | Angestrebte Länge der längeren Bildseite | Notwendiger Faktor |
|---|---|---|
| 4K-Bildschirm, Vollbild | 3 840 px | ×3,75: Ein Durchlauf mit Faktor ×4 genügt |
| A4-Druck mit 300 dpi | 3 508 Pixel | ×3,4: ein Durchlauf mit ×4 oder --outscale 3,4 |
| A3-Ausdruck mit 300 dpi | 4 961 px | ×4,8: Übersteigt die Vergrößerung eines einzelnen ×4-Durchlaufs; akzeptieren Sie einen etwas kleineren Ausdruck, statt zwei Durchläufe hintereinander auszuführen. |
| Webseite oder Vorschaubild | 1.600 bis 2.000 Pixel | ×1,6 bis ×2: Das ×2-Modell oder --outscale reicht aus |
Merken Sie sich den Grundsatz: die sinnvoll nutzbare Größe anstreben, nicht die maximale. Ein Bild mit 1.024 × 1.024 Pixeln, das um den Faktor 4 vergrößert wird, hat anschließend 4.096 × 4.096 Pixel, also etwa 16,8 Millionen Pixel, sechzehnmal so viele wie am Anfang: entsprechend mehr Dateidaten zum Speichern, Laden und Nachbearbeiten, für einen Zugewinn, der auf dem Bildschirm oft unsichtbar bleibt. Mit der Option --outscale des Python-Skripts lässt sich der genaue Skalierungsfaktor wählen, statt erst zu stark zu vergrößern und anschließend wieder zu verkleinern.
#In einer Kette zur Bildgenerierung
Bei der lokalen Bildgenerierung ist der Upscaler der letzte Schritt: Man erzeugt ein Bild in einer Auflösung, die die Grafikkarte unterstützt, und vergrößert es anschließend. Das benötigt weniger Speicher, als direkt ein großes Bild zu generieren. Die nativen Auflösungen der Bildmodelle, beispielsweise 512 × 512 für SD 1.5 oder 1024 × 1024 für SDXL, werden im Leitfaden zu Stable Diffusion ausführlich beschrieben. Eine anschließende Vergrößerung um den Faktor 2 macht aus einem SDXL-Bild mit 1024 × 1024 ein Bild mit 2048 × 2048, ohne es erneut durch das Diffusionsmodell laufen zu lassen.
- Stable Diffusion: Versionen, native Auflösungen und Lizenzbedingungen
- Bilder lokal generieren: der Überblick
#Was es erfindet
- Der Text
- Beim Vergrößern werden kleine Schriftzeichen zu plausibel aussehenden, aber falschen Zeichen. Für ein Dokument braucht es optische Zeichenerkennung, kein Vergrößerungstool.
- Gesichter
- Ein unscharfes Gesicht wird beim Vergrößern zu einem scharfen Gesicht, das nicht genau dieselbe Person zeigt. Eine Verwendung zur Identifizierung ist in keinem Fall akzeptabel.
- Feine Details
- Stoffmuster, Laub, Haare: Das Modell erzeugt eine glaubhafte Textur, nicht die ursprüngliche Textur.
- Fehler
- Ein deutlich sichtbares Kompressionsartefakt wird manchmal geradezu sorgfältig vergrößert, statt entfernt zu werden.
#Troubleshooting: Häufige Fehler
| Symptom | Ursache | Korrekturmaßnahme |
|---|---|---|
| Fehler „slow_conv2d_cpu not implemented for Half“ | Real-ESRGAN verwendet standardmäßig halbe Genauigkeit (fp16), die einige Operatoren auf der CPU nicht unterstützen | Die Option --fp32 zum Befehl hinzufügen |
| ModuleNotFoundError : torchvision.transforms.functional_tensor | basicsr importiert ein Modul, das torchvision ab Version 0.17 entfernt hat (Bericht vom 28. August 2024; ein Fix wird in einem Pull Request im BasicSR-Repository vorgeschlagen) | Eine kompatible Version von torchvision installieren oder die portable ausführbare ncnn-Datei verwenden, die nicht davon abhängt |
| Sichtbare Blöcke oder Nahtstellen im Bild | Das ausführbare Programm zerlegt das Bild in Kacheln und setzt diese anschließend wieder zusammen, was laut README zu Inkonsistenzen führen kann | Die Kachelgröße mit -t einstellen (0 für automatisch): Größere Kacheln reduzieren sichtbare Übergänge, sofern der Speicher es zulässt |
| Schwarzes Bild als Ausgabe | Die TODO-Liste des ncnn-Repositories weist darauf hin, dass einige PCs schwarze Bilder erzeugen | Den anderen Ansatz (Python oder ncnn) oder eine andere Karte mit -g testen |
| Verzerrte Gesichter auf einer Illustration | Option face_enhance bei nicht fotografischen Inhalten aktiviert | Entfernen Sie sie: Sie ist für echte Gesichter konzipiert |
#Wo steht das Projekt im Jahr 2026?
Man muss ehrlich sein, was das Alter angeht. Die letzte veröffentlichte Version, v0.3.0, stammt vom 20. September 2022, und der letzte Commit im Hauptrepository vom 2. April 2024 entfernt eine Konfigurationsdatei für die kontinuierliche Integration. Die ncnn-Implementierung, deren README eine MIT-Lizenz angibt, hat seit Mai 2024 kein Update erhalten. Das macht das Modell nicht schlecht: Es erfüllt seine Aufgabe, ist klein und läuft auch auf weniger leistungsstarken Grafikkarten. Allerdings kann man nicht mit Fehlerbehebungen für neuere Inkompatibilitäten wie die mit torchvision rechnen.
Als Alternativen führt das README von ComfyUI SeedVR2 und SUPIR unter den unterstützten Modellen auf. SeedVR2 stellt sich als Verfahren zur Videorestaurierung in einem Schritt durch adversariales Nachtraining eines Diffusionsmodells vor, und SUPIR zielt auf die fotorealistische Restaurierung von Bildern „in the wild“ ab. Diese Ansätze basieren auf Diffusion: Wir haben keinen zuverlässigen zahlenbasierten Vergleich mit Real-ESRGAN, und das Risiko erfundener Details ist dort mindestens ebenso hoch. Lesen Sie vor einer kommerziellen Nutzung die Lizenz von SUPIR, die GitHub als „Other“ einstuft. Für die meisten alltäglichen Fotos und Illustrationen bietet Real-ESRGAN weiterhin ein gutes Verhältnis zwischen Einfachheit, Geschwindigkeit und benötigter Hardware.
- ControlNet: Die Komposition vorab beherrschen
- Das Kit KI-Bilder
- Quelle: das offizielle Repository von Real-ESRGAN
- Quelle: Forschungsartikel auf arXiv
- Quelle: die Implementierung ncnn-vulkan
#FAQ
Ist Real-ESRGAN kostenlos?+
Braucht man eine Grafikkarte?+
Kann man gescannten Text vergrößern?+
Warum ist meine Illustration nach der Vergrößerung körnig?+
Kann man es für Videos verwenden?+
Wird Real-ESRGAN noch gepflegt?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.