Einsteiger 11 Min.Bild

Real-ESRGAN: Bilder vergrößern in lokal

Direkte Antwort

Real-ESRGAN ist ein freies Modell (BSD-3-Clause), das ein Bild um den Faktor 4 vergrößert und dabei plausible Details rekonstruiert. Am einfachsten ist die portable ausführbare Datei ncnn-vulkan, die ohne CUDA und PyTorch auf Intel-, AMD- oder NVIDIA-Grafikkarten läuft. Wählen Sie das Modell passend zum Bild: realesrgan-x4plus für Fotos, die Anime-Variante für Illustrationen. Seit September 2022 hat das Projekt keine neue Version veröffentlicht, und die hinzugefügten Details sind erfunden: niemals für Text oder als Beweismittel verwenden.

Real-ESRGAN vergrößert ein Bild, indem es plausible Details rekonstruiert, statt Pixel zu strecken. Es ist ein freies, kleines und schnelles Modell, das sich als Baustein am Ende einer lokalen Bildgenerierungskette etabliert hat oder zur Restaurierung alter Fotos eingesetzt wird. Dieser Leitfaden mit Stand vom 28. September 2026 erklärt, welches Modell Sie wählen sollten, wie Sie es ohne Installation von PyTorch starten, was es erfindet, welche Fehler zu erwarten sind und wo das Projekt im Vergleich zu neueren Alternativen steht.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Was ein KI-basiertes Vergrößerungstool tut

Eine klassische Bildvergrößerung arbeitet mit Interpolation: Sie berechnet Zwischenpixel aus den benachbarten Pixeln, wodurch ein größeres und unschärferes Bild entsteht. Ein lernbasierter Bildvergrößerer arbeitet anders. Er wurde darauf trainiert, aus einer qualitativ verschlechterten Version ein scharfes Bild wiederherzustellen, und rekonstruiert das, was dem Original am ähnlichsten ist: Texturen, Kanten, Körnung. Der Unterschied lässt sich in einem Satz zusammenfassen: Interpolation erzeugt keine Informationen, das Modell erfindet sie. Genau das verlangen wir von ihm, und deshalb muss man wissen, wo man es nicht einsetzen sollte.

Real-ESRGAN geht auf einen Artikel von Xintao Wang, Liangbin Xie, Chao Dong und Ying Shan (Tencent ARC Lab) zurück, der im Juli 2021 auf arXiv veröffentlicht und bei den ICCV Workshops vorgestellt wurde: „Training Real-World Blind Super-Resolution with Pure Synthetic Data“. Die Zusammenfassung beschreibt die Idee: ein ausschließlich mit synthetischen Daten trainiertes Modell mit einer Modellierung von Bildverschlechterungen „höherer Ordnung“, die reale Bildfehler (Unschärfe, Rauschen, Kompression) besser simuliert, und einem U-Net-Diskriminator. „Blind“ bedeutet, dass das Modell nicht wissen muss, welche Bildverschlechterung das Bild erfahren hat. Das Repository hat mehr als 36.000 Sterne.

#Die Modelle: Welches sollten Sie wählen?

Das Kit KI-Bilder

KI-Bilder und -Videos lokal erstellen, ohne Begrenzung: ComfyUI, Flux, Z-Image und Wan 2.2 auf Ihrer GPU oder Ihrem Mac – mit Workflows zum direkten Laden und Informationen zum rechtlichen Rahmen.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
Modelle aus dem offiziellen Repository, laut dessen Model Zoo
ModellSkalierungProjektbeschreibungGeeignet für
RealESRGAN_x4plus×4×4-Modell für allgemeine BilderFotos, generierte Bilder: die Standardwahl
RealESRGAN_x2plus×2×2-Modell für allgemeine BilderWenn ×4 zu viel ist, ohne anschließend erneut die Bildgröße anzupassen
RealESRNet_x4plus×4Modell ×4 mit MSE-Verlust und übermäßigem Smoothing-EffektSelten: Das Ergebnis ist glatt und ausdruckslos
realesr-general-x4v3×4, auch mit den Faktoren ×1, ×2 und ×3 nutzbarKleines Modell, benötigt deutlich weniger GPU-Speicher und Zeit, geringere Leistung bei der RauschunterdrückungRechner mit geringer Leistung, Bildstapel; die Option -dn steuert die Rauschreduzierung
RealESRGAN_x4plus_anime_6B×4Optimiert für Anime-Bilder, kleineres Netzwerk (6 RRDB-Blöcke)Illustrationen, Bildtafeln, 2D-Zeichnungen
realesr-animevideov3×4, auch mit den Faktoren ×1, ×2 und ×3 nutzbarModell in Größe XS für animierte VideosAnimationssequenzen

Der Katalog des Projekts unterscheidet zwischen Modellen für Fotos und Modellen für Illustrationen, und diese Wahl hat den größten Einfluss auf das Ergebnis. Die Anime-Variante wird als für diesen Bildtyp optimiert beschrieben, mit einem kleineren Netzwerk, und das Projekt vergleicht sie mit waifu2x. Probieren Sie sie bei einer Zeichnung zuerst aus: Ein Fotomodell kann gleichmäßigen Farbflächen, die glatt bleiben sollten, eine Textur verleihen. Prüfen Sie das an Ihrem Bild.

!
Das Standardmodell des portablen Programms ist nicht das, was man vermutet
Die zentrale README nennt realesrgan-x4plus als Standardmodell der portablen ausführbaren Datei, doch der Hilfetext des Programms nennt realesr-animevideov3, das Animationsmodell, als Standard. Bei einem Foto liefert dieses Modell ein ungeeignetes Ergebnis. Geben Sie das Modell immer mit der Option -n an, statt sich auf die Standardeinstellung zu verlassen.

#Drei Möglichkeiten zum Starten

Das README beschreibt drei Möglichkeiten: eine Online-Demo, die portable ncnn-Programmdatei und das Python-Skript. Für den regelmäßigen lokalen Einsatz kommen nur die letzten beiden infrage.

Die beiden lokalen Wege gemäß dem README
WegWas man brauchtVorteileGrenzen
Portable ausführbare Datei (ncnn-vulkan)Eine GPU von Intel, AMD oder NVIDIA mit Vulkan-Unterstützung. Archive für Windows, Linux und macOS. Kein CUDA, kein PyTorch.Keine Installation erforderlich, die Modelle sind enthaltenUnterstützt nicht alle Funktionen des Python-Skripts, etwa --outscale, und kann Inkonsistenzen zwischen den Blöcken erzeugen
Python-Skript (inference_realesrgan.py)Python 3.7 oder höher, PyTorch 1.7 oder höher, basicsr, facexlib und gfpgan für GesichterBeliebige Skalierung, Gesichter, Tiling, Bilder mit Alphakanal, Graustufenbilder oder 16-Bit-BilderFehleranfällige Abhängigkeiten, siehe Fehlerbehebung

#Die genauen Befehle

Die portable ausführbare Datei wird über die Kommandozeile verwendet. Der Hilfetext nennt die Optionen: -i für die Eingabe (Datei oder Ordner), -o für die Ausgabe, -s für den Skalierungsfaktor (2, 3 oder 4), -n für das Modell, -t für die Kachelgröße, -g zur Auswahl der GPU, -f für das Ausgabeformat.

Terminal
# Exécutable portable : photo agrandie ×4 avec le modèle généraliste
./realesrgan-ncnn-vulkan.exe -i input.jpg -o output.png -n realesrgan-x4plus

# Script Python : échelle arbitraire (ici ×3,5) avec amélioration des visages
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs --outscale 3.5 --face_enhance

Das Python-Skript bietet die Option --outscale: Das Modell vergrößert das Bild immer um den Faktor 4, anschließend skaliert das Programm das Ergebnis mit geringem Rechenaufwand auf den gewünschten Maßstab. Außerdem gibt es --tile, um das Bild in Kacheln aufzuteilen und Arbeitsspeicher zu sparen, sowie --fp32 für volle Präzision. Diese ist beim Betrieb auf der CPU zwingend erforderlich (siehe unten).

In ComfyUI werden Upscaling-Modelle in ComfyUI/models/upscale_models abgelegt. Angewendet werden sie mit einem Ladeknoten und anschließend einem Knoten für modellbasiertes Upscaling. Für eine Desktop-Oberfläche nennt die README mehrere Projekte, die Real-ESRGAN integrieren, darunter Upscayl, eine freie Software für Linux, macOS und Windows, die rund 50.000 Sterne hat und in den letzten Tagen aktualisiert wurde.

#Gut nutzen

  1. 01
    Das Modell entsprechend dem Bildtyp auswählen
    Foto oder Illustration: Diese Einstellung beeinflusst das Ergebnis am stärksten, weit stärker als der Vergrößerungsfaktor. Fügen Sie dem Befehl immer -n hinzu.
  2. 02
    Nicht mehrere Durchgänge hintereinander ausführen
    Zweimal hintereinander um den Faktor ×4 zu vergrößern, erzeugt eine Plastikoptik statt Details. Ein Durchlauf mit dem richtigen Faktor genügt; wenn ×4 zu viel ist, nehmen Sie das ×2-Modell oder die Skalierungsoption.
  3. 03
    Vor dem Vergrößern bereinigen
    Eine leichte Rauschreduzierung im Vorfeld verhindert, dass das Modell Rauschen als zu rekonstruierende Details behandelt. Bei realesr-general-x4v3 steuert die Option -dn die Stärke der Rauschreduzierung, um ein zu glattes Ergebnis zu vermeiden.
  4. 04
    face_enhance nur für echte Gesichter verwenden
    Die Option face_enhance basiert auf GFPGAN und ist nur für echte Gesichter gedacht: Die FAQ des Projekts rät davon ab, sie bei Animationen zu verwenden, da sie dort unnötig GPU-Speicher verbraucht.
  5. 05
    Bei 100 % vergleichen
    Eine Vergrößerung beurteilt man auf Pixelebene, nicht anhand eines Vorschaubilds. Viele Ergebnisse, die in kleiner Darstellung spektakulär wirken, sehen aus der Nähe glatt und künstlich aus.

#Welche Größe anstreben: eine Berechnung vor dem Start

Ein Vergrößerungsfaktor von ×4 ist nur dann nützlich, wenn die endgültige Größe für eine spezifische Anwendung geeignet ist. Der erforderliche Faktor nach dem Ziel basiert auf einem einfachen Berechnungsverfahren: Pixel = Zentimeter ÷ 2,54 × Auflösung in Punkten pro Zoll, dann Faktor = gewünschter großer Seitenwert ÷ ursprünglicher großer Seitenwert.

Erforderlicher Faktor ausgehend von einem Bild mit 1.024 Pixeln an der längeren Seite (Berechnung, Druck mit 300 dpi)
NutzungAngestrebte Länge der längeren BildseiteNotwendiger Faktor
4K-Bildschirm, Vollbild3 840 px×3,75: Ein Durchlauf mit Faktor ×4 genügt
A4-Druck mit 300 dpi3 508 Pixel×3,4: ein Durchlauf mit ×4 oder --outscale 3,4
A3-Ausdruck mit 300 dpi4 961 px×4,8: Übersteigt die Vergrößerung eines einzelnen ×4-Durchlaufs; akzeptieren Sie einen etwas kleineren Ausdruck, statt zwei Durchläufe hintereinander auszuführen.
Webseite oder Vorschaubild1.600 bis 2.000 Pixel×1,6 bis ×2: Das ×2-Modell oder --outscale reicht aus

Merken Sie sich den Grundsatz: die sinnvoll nutzbare Größe anstreben, nicht die maximale. Ein Bild mit 1.024 × 1.024 Pixeln, das um den Faktor 4 vergrößert wird, hat anschließend 4.096 × 4.096 Pixel, also etwa 16,8 Millionen Pixel, sechzehnmal so viele wie am Anfang: entsprechend mehr Dateidaten zum Speichern, Laden und Nachbearbeiten, für einen Zugewinn, der auf dem Bildschirm oft unsichtbar bleibt. Mit der Option --outscale des Python-Skripts lässt sich der genaue Skalierungsfaktor wählen, statt erst zu stark zu vergrößern und anschließend wieder zu verkleinern.

#In einer Kette zur Bildgenerierung

Bei der lokalen Bildgenerierung ist der Upscaler der letzte Schritt: Man erzeugt ein Bild in einer Auflösung, die die Grafikkarte unterstützt, und vergrößert es anschließend. Das benötigt weniger Speicher, als direkt ein großes Bild zu generieren. Die nativen Auflösungen der Bildmodelle, beispielsweise 512 × 512 für SD 1.5 oder 1024 × 1024 für SDXL, werden im Leitfaden zu Stable Diffusion ausführlich beschrieben. Eine anschließende Vergrößerung um den Faktor 2 macht aus einem SDXL-Bild mit 1024 × 1024 ein Bild mit 2048 × 2048, ohne es erneut durch das Diffusionsmodell laufen zu lassen.

#Was es erfindet

Der Text
Beim Vergrößern werden kleine Schriftzeichen zu plausibel aussehenden, aber falschen Zeichen. Für ein Dokument braucht es optische Zeichenerkennung, kein Vergrößerungstool.
Gesichter
Ein unscharfes Gesicht wird beim Vergrößern zu einem scharfen Gesicht, das nicht genau dieselbe Person zeigt. Eine Verwendung zur Identifizierung ist in keinem Fall akzeptabel.
Feine Details
Stoffmuster, Laub, Haare: Das Modell erzeugt eine glaubhafte Textur, nicht die ursprüngliche Textur.
Fehler
Ein deutlich sichtbares Kompressionsartefakt wird manchmal geradezu sorgfältig vergrößert, statt entfernt zu werden.
!
Ein vergrößertes Bild ist kein Beweis
In juristischen oder medizinischen Zusammenhängen oder bei der Identifizierung ist ein vom Modell hinzugefügtes Detail im Original nicht vorhanden. Die Vergrößerung erleichtert das Lesen; sie fügt keine Informationen hinzu, die als Beweismittel verwertbar wären.

#Troubleshooting: Häufige Fehler

Bekannte Fehler, gemäß der FAQ und den Bugberichten des Projekts
SymptomUrsacheKorrekturmaßnahme
Fehler „slow_conv2d_cpu not implemented for Half“Real-ESRGAN verwendet standardmäßig halbe Genauigkeit (fp16), die einige Operatoren auf der CPU nicht unterstützenDie Option --fp32 zum Befehl hinzufügen
ModuleNotFoundError : torchvision.transforms.functional_tensorbasicsr importiert ein Modul, das torchvision ab Version 0.17 entfernt hat (Bericht vom 28. August 2024; ein Fix wird in einem Pull Request im BasicSR-Repository vorgeschlagen)Eine kompatible Version von torchvision installieren oder die portable ausführbare ncnn-Datei verwenden, die nicht davon abhängt
Sichtbare Blöcke oder Nahtstellen im BildDas ausführbare Programm zerlegt das Bild in Kacheln und setzt diese anschließend wieder zusammen, was laut README zu Inkonsistenzen führen kannDie Kachelgröße mit -t einstellen (0 für automatisch): Größere Kacheln reduzieren sichtbare Übergänge, sofern der Speicher es zulässt
Schwarzes Bild als AusgabeDie TODO-Liste des ncnn-Repositories weist darauf hin, dass einige PCs schwarze Bilder erzeugenDen anderen Ansatz (Python oder ncnn) oder eine andere Karte mit -g testen
Verzerrte Gesichter auf einer IllustrationOption face_enhance bei nicht fotografischen Inhalten aktiviertEntfernen Sie sie: Sie ist für echte Gesichter konzipiert

#Wo steht das Projekt im Jahr 2026?

Man muss ehrlich sein, was das Alter angeht. Die letzte veröffentlichte Version, v0.3.0, stammt vom 20. September 2022, und der letzte Commit im Hauptrepository vom 2. April 2024 entfernt eine Konfigurationsdatei für die kontinuierliche Integration. Die ncnn-Implementierung, deren README eine MIT-Lizenz angibt, hat seit Mai 2024 kein Update erhalten. Das macht das Modell nicht schlecht: Es erfüllt seine Aufgabe, ist klein und läuft auch auf weniger leistungsstarken Grafikkarten. Allerdings kann man nicht mit Fehlerbehebungen für neuere Inkompatibilitäten wie die mit torchvision rechnen.

Als Alternativen führt das README von ComfyUI SeedVR2 und SUPIR unter den unterstützten Modellen auf. SeedVR2 stellt sich als Verfahren zur Videorestaurierung in einem Schritt durch adversariales Nachtraining eines Diffusionsmodells vor, und SUPIR zielt auf die fotorealistische Restaurierung von Bildern „in the wild“ ab. Diese Ansätze basieren auf Diffusion: Wir haben keinen zuverlässigen zahlenbasierten Vergleich mit Real-ESRGAN, und das Risiko erfundener Details ist dort mindestens ebenso hoch. Lesen Sie vor einer kommerziellen Nutzung die Lizenz von SUPIR, die GitHub als „Other“ einstuft. Für die meisten alltäglichen Fotos und Illustrationen bietet Real-ESRGAN weiterhin ein gutes Verhältnis zwischen Einfachheit, Geschwindigkeit und benötigter Hardware.

#FAQ

FAQ
Ist Real-ESRGAN kostenlos?+
Ja. Das Repository ist unter der Lizenz BSD-3-Clause lizenziert, die ncnn-vulkan-Implementierung unter MIT-Lizenz, und die Ausführung ist lokal, ohne Nutzungskosten oder Konto. Prüfen Sie jedoch die Rechte an den vergrößerten Bildern sowie die Lizenz jedes externen Modells oder Desktop-Programms, das Real-ESRGAN enthält, wie Upscayl, das unter AGPL-3.0 lizenziert ist.
Braucht man eine Grafikkarte?+
Nicht unbedingt. Das Python-Skript läuft mit der Option --fp32 auf der CPU, allerdings deutlich langsamer. Die ausführbare ncnn-Datei benötigt eine Vulkan-kompatible GPU von Intel, AMD oder NVIDIA und erfordert weder CUDA noch PyTorch. Das kleine Modell realesr-general-x4v3 ist darauf ausgelegt, deutlich weniger GPU-Speicher und Zeit zu benötigen, wodurch es sich für weniger leistungsfähige Rechner eignet.
Kann man gescannten Text vergrößern?+
Technisch ja, aber das ist nicht der richtige Ansatz: Die rekonstruierten Zeichen sind plausibel und manchmal falsch. Verwenden Sie für ein gescanntes Dokument die optische Zeichenerkennung, die den Text liest, statt ihn neu zu zeichnen. Der Upscaler darf vor der OCR ausschließlich zur besseren visuellen Lesbarkeit eingesetzt werden, niemals zur Überprüfung der Richtigkeit des erkannten Textes.
Warum ist meine Illustration nach der Vergrößerung körnig?+
Sie haben wahrscheinlich das für Fotos vorgesehene Modell verwendet. Verwenden Sie für eine Zeichnung RealESRGAN_x4plus_anime_6B, das mit einem kleineren Netzwerk für Anime-Bilder optimiert ist. Achten Sie bei der portablen ausführbaren Datei auch auf das Standardmodell: Geben Sie es mit -n ausdrücklich an, denn der Hilfetext nennt realesr-animevideov3 als Standard.
Kann man es für Videos verwenden?+
Ja, Bild für Bild. Für Animationen stellt das Projekt das Modell realesr-animevideov3 und ein Videoskript bereit. Bei Verwendung der ausführbaren ncnn-Datei besteht die dokumentierte Methode darin, die Einzelbilder mit ffmpeg zu extrahieren, sie zu verarbeiten und anschließend wieder zusammenzusetzen. Da die aufeinanderfolgenden Bilder unabhängig voneinander verarbeitet werden, können sie flackern: Prüfen Sie das Ergebnis während der Wiedergabe, nicht nur im Standbild.
Wird Real-ESRGAN noch gepflegt?+
Nur noch sehr wenig. Die letzte Version, v0.3.0, stammt vom September 2022, und der letzte Commit vom April 2024 betrifft nur die kontinuierliche Integration. Das Modell bleibt nutzbar, aber Inkompatibilitäten bei Abhängigkeiten wie torchvision werden vom Projekt nicht behoben. Um diese Probleme zu vermeiden, ist die portable ausführbare ncnn-Datei die stabilste Lösung.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.