Mittelstufe 11 Min.Andere Tools

Text Generation WebUI (oobabooga)

Direkte Antwort

oobabooga ist das Pseudonym des Entwicklers von Text Generation WebUI, inzwischen in TextGen umbenannt: eine Open-Source-Oberfläche (AGPL-3.0, etwa 47.000 GitHub-Sterne), mit der sich Sprachmodelle lokal und ohne Telemetrie ausführen lassen. Für GGUF-Modelle lässt sie sich als portable Version herunterladen, wie eine Desktop-Anwendung; die vollständige Installation ergänzt weitere Engines, das Training von LoRA und Erweiterungen. Offizielle Quelle: das GitHub-Repository oobabooga/textgen.

Viele Tutorials zu Text Generation WebUI beschreiben eine Version von vor zwei Jahren: inzwischen weggefallene Engines, ersetzte Erweiterungen, geänderte Befehle. Dieser Leitfaden behandelt das Thema anhand des aktuellen Repositorys: den neuen Namen, die drei Installationswege, die tatsächlich unterstützten Engines, die Erweiterungen, die API und die Sicherheitseinstellungen, die Sie kennen sollten, bevor Sie die Oberfläche anderen zugänglich machen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#oobabooga, Text Generation WebUI, TextGen: Worum geht es?

oobabooga ist das GitHub-Pseudonym des Entwicklers des Projekts. Das Tool, das lange Text Generation WebUI hieß, wird inzwischen unter dem Namen TextGen vorgestellt: Die alte Repository-Adresse leitet auf github.com/oobabooga/textgen weiter. Es handelt sich um eine Open-Source-Anwendung unter der Lizenz AGPL-3.0, die Chat, freie Generierung, Bildverarbeitung, Tool-Aufrufe, eine OpenAI-kompatible API und LoRA-Training vereint. Das Repository beschreibt die Anwendung als vollständig offline und privat, ohne Telemetrie, externe Ressourcen oder Anfragen an entfernte Server zur Prüfung auf Updates.

Das Projekt ist aktiv: Die neueste von uns erfasste Version, 4.9, stammt vom Mai 2026. Unseres Wissens gibt es außer diesem GitHub-Repository keine offizielle Website. Seien Sie vorsichtig bei Downloadseiten von Drittanbietern und Forks, die behaupten, das Projekt zu ersetzen, denn eine manipulierte ausführbare Datei wird mit Ihren Berechtigungen ausgeführt.

i
Warum alte Tutorials Sie in die Irre führen
Die aktuelle README-Datei listet fünf Engines auf: llama.cpp, ik_llama.cpp, Transformers, ExLlamaV3 und TensorRT-LLM. ExLlamaV2, die Formate AWQ und GPTQ sowie vLLM, die oft in älteren Anleitungen (einschließlich der ersten Version dieser Anleitung) genannt werden, sind dort nicht mehr aufgeführt. Prüfen Sie immer das Datum eines Tutorials.

#1. Installation: portabel, mit einem Klick oder manuell

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Das Repository bietet drei Möglichkeiten. Die portable Version ist die einfachste: Sie enthält alle Abhängigkeiten, lässt sich per Doppelklick starten und lädt nur GGUF-Modelle (mit llama.cpp als Engine). Sie ist für Linux, Windows und macOS mit Varianten für CUDA, Vulkan, ROCm und reinen CPU-Betrieb verfügbar. Die vollständige Installation, die für die anderen Engines, das Training, die Bildgenerierung und die Erweiterungen erforderlich ist, lädt PyTorch herunter und benötigt etwa 10 GB Speicherplatz.

Die Installationsmethode wählen
ModusWas Sie erhaltenWas Sie wissen müssen
Portable-Version (Desktop-Anwendung)GGUF über llama.cpp, alles inklusiveAm einfachsten; keine Erweiterungen und keine anderen Engines
Ein-Klick-Installer (start_-Skripte)Vollständige Installation: ExLlamaV3, Transformers, Training, ErweiterungenEtwa 10 GB; Auswahl des GPU-Herstellers bei der Installation
Manuell mit venv oder CondaVollständige Kontrolle über die Python-UmgebungFür Entwickler; nur für besondere Fälle
  1. 01
    Die portable Version herunterladen
    Wählen Sie auf der Release-Seite des Repositorys das Archiv für Ihr System und Ihre GPU. Für NVIDIA nehmen Sie den Build cuda13.1, wenn nvidia-smi eine CUDA-Version von mindestens 13.1 anzeigt, andernfalls cuda12.4. AMD und Intel verwenden Vulkan, AMD kann auch ROCm verwenden, und es gibt eine reine CPU-Version.
  2. 02
    Extrahieren und starten
    Entpacken Sie das Archiv und doppelklicken Sie anschließend auf textgen: Ein Fenster öffnet sich.
  3. 03
    Unter macOS die Quarantäne aufheben
    Führen Sie vor dem ersten Start xattr -cr gefolgt vom Pfad des entpackten Ordners aus, wie in den Versionshinweisen angegeben.
  4. 04
    Ein Modell hinzufügen
    Platzieren Sie eine GGUF-Datei im Ordner user_data/models; die Benutzeroberfläche erkennt sie automatisch.
  5. 05
    Laden und chatten
    Wählen Sie das Modell im Tab für Modelle aus und öffnen Sie anschließend den Chat.

Das Aktualisieren eines portablen Builds erfolgt ohne Verlust Ihrer Modelle oder Einstellungen: Laden Sie das neue Archiv herunter, entpacken Sie es und ersetzen Sie den Ordner user_data durch den Ihrer alten Installation. Seit Version 4.0 können Sie user_data auch eine Ebene über den Installationsordnern ablegen; er wird dann automatisch erkannt.

Für die vollständige Installation klonen Sie das Repository und starten Sie das Skript für Ihr Betriebssystem. Das Skript fragt nach dem Hersteller Ihrer GPU und installiert die Abhängigkeiten in einem lokalen Ordner. Anschließend öffnen Sie http://127.0.0.1:7860 im Browser.

Vollständige Installation mit dem One-Click-Installer (Linux; macOS und Windows: start_macos.sh, start_windows.bat)
git clone https://github.com/oobabooga/textgen
cd textgen
./start_linux.sh

Alles wird in einem lokalen Ordner namens installer_files abgelegt. Um von Grund auf neu zu installieren, löschen Sie diesen Ordner und starten Sie das Skript erneut. Um Optionen dauerhaft anzuwenden, tragen Sie sie in user_data/CMD_FLAGS.txt ein, zum Beispiel --api zum Aktivieren der API. Keines dieser Skripte benötigt Administratorrechte.

#2. Ein Modell herunterladen und auswählen

Die Anleitung im Repository lässt sich in drei Sätzen zusammenfassen: Laden Sie eine GGUF-Datei von Hugging Face herunter, legen Sie sie in user_data/models ab, und die Benutzeroberfläche erkennt sie. Modelle, die aus mehreren Dateien bestehen (Transformers in 16 Bit, EXL3), gehören in einen Unterordner desselben Verzeichnisses und erfordern die vollständige Installation, nicht die portable Version.

Das einzige praktische Kriterium ist der Speicher. Richtwerte dieser Website bei Q4-Quantisierung, nur für die Modellgewichte: 3B etwa 2 GB, 7 bis 8B etwa 5 GB, 14B etwa 9 GB, 32B etwa 19 bis 20 GB, 70B etwa 40 GB. Rechnen Sie den Kontextcache und eine Reserve für das System hinzu. Der VRAM-Rechner dieser Website liefert Ihnen den genauen Gesamtbedarf für Ihren Kontext.

#Kontext und Cache: die beiden Optionen, die Speicher sparen

Zwei Startoptionen wirken sich direkt auf den Speicherbedarf aus. --ctx-size legt die Kontextgröße in Tokens fest: Der Wert 0 bedeutet bei llama.cpp eine automatische Einstellung, sofern alle Schichten auf der GPU liegen (--gpu-layers=-1); bei den anderen Engines beträgt der Standardwert 8.192. --cache-type bestimmt das Format des Kontextcaches; bei llama.cpp sind fp16, q8_0 und q4_0 gültige Werte. Ein quantisierter Cache benötigt weniger Speicher als ein fp16-Cache, allerdings auf Kosten einer leicht geringeren Genauigkeit: Probieren Sie bei knappem Speicher zuerst q8_0 aus, bevor Sie die Modellgröße reduzieren.

Das Repository verweist außerdem auf zwei Community-Tools als Orientierung für diese Wahl: einen Speicherrechner für GGUF-Modelle und eine Liste empfohlener Quantisierungen. Überprüfen Sie deren Ergebnisse mit dem Rechner dieser Website und beobachten Sie anschließend während eines langen Gesprächs die tatsächliche Speicherbelegung der Grafikkarte.

#3. Eine Engine (Loader) auswählen

TextGen lädt ein Modell mit einer Engine, die als Loader bezeichnet wird. Standardmäßig erkennt TextGen sie automatisch; Sie können sie mit der Option --loader vorgeben. Die aktuell zulässigen Werte sind Transformers, llama.cpp, ExLlamav3_HF, ExLlamav3 und TensorRT-LLM, und Sie können Engine und Modell ohne Neustart wechseln.

Die Engines im aktuellen README
EngineModellformatNutzung
llama.cppGGUFDie Standardwahl: Prozessor und GPU, einzige Engine der portablen Version
ik_llama.cppGGUFVariante von llama.cpp, als zusätzliches Backend aufgeführt
ExLlamaV3EXL3Quantisierung für GPU, bei vollständiger Installation
Transformers16-Bit-Modelle, safetensorsVielseitig und speicherhungrig; wird auch für das Training verwendet
TensorRT-LLMFür NVIDIA kompilierte ModelleFür NVIDIA-GPUs, vollständige Installation

Wenn Sie gerade anfangen, bleiben Sie bei llama.cpp und dem GGUF-Format: Das ist der kürzeste Weg, der auch bei der portablen Version zum Einsatz kommt und den andere Tools (Ollama, LM Studio) ebenfalls nutzen. Andere Inferenz-Engines sind bei einem konkreten Bedarf gerechtfertigt: einem bestimmten Format, Fine-Tuning oder der maximalen Ausnutzung einer NVIDIA-Karte.

#4. Chat, instruct, notebook, vision

Instruct
Der Modus zum Befolgen von Anweisungen, wie bei ChatGPT. Die Prompts werden automatisch mithilfe von Jinja2-Vorlagen formatiert.
Chat-instruct und Chat
Um mit personalisierten Charakteren zu sprechen.
Notebook
Ein Tab für freie Textgenerierung außerhalb der abwechselnden Chatbeiträge: Sie schreiben, das Modell setzt den Text fort.
Vision und Dateien
Sie können Bilder zu Ihren Nachrichten hinzufügen sowie Textdateien, PDF- und .docx-Dateien, um deren Inhalt zu diskutieren.
Bearbeitung und Verzweigungen
Eine Nachricht bearbeiten, zwischen ihren Versionen wechseln und an jeder beliebigen Stelle der Unterhaltung eine Verzweigung öffnen.

Die Modelle können während des Gesprächs auch Tools aufrufen: Websuche, Abrufen von Webseiten, Berechnungen. Jedes Tool ist eine einfache Python-Datei, und MCP-Server werden unterstützt. Diese Funktion hängt mit dem Kontext zusammen: Ein Agent, der Tools aufruft, füllt ein kleines Kontextfenster schnell. Denken Sie daran, die Kontextgröße mit der Option --ctx-size zu erhöhen.

#5. Erweiterungen: Was es wirklich gibt

Die Erweiterungen funktionieren nur mit der vollständigen Installation. Das Erweiterungsverzeichnis des Repositorys enthält unter anderem coqui_tts, silero_tts (Sprachsynthese), whisper_stt (Spracheingabe), sd_api_pictures und send_pictures (Bilder), google_translate, superbooga und superboogav2, ngrok, gallery und perplexity_colors. Das README ergänzt, dass es außerdem Erweiterungen aus der Community gibt.

→
Keine Erweiterung „openai“ mehr erforderlich
Die mit OpenAI und Anthropic kompatible API ist jetzt integriert: Es genügt, --api hinzuzufügen. Tutorials, die zum Aktivieren einer Erweiterung namens openai auffordern, beschreiben die frühere Funktionsweise.

#6. API-Modus

Fügen Sie --api zu Ihren Optionen hinzu, um die API zu starten. Laut dem Wiki des Repositorys ist der Standardport 5000, lässt sich mit --api-port ändern, und die API bleibt lokal, solange Sie nicht ausdrücklich anfordern, sie nach außen zu öffnen. Das Wiki stellt klar, dass sie offline arbeitet, sich nicht mit OpenAI verbindet und keine Protokolle anlegt. Die Endpunkte decken Chats, Completions und Nachrichten im Anthropic-Format ab und unterstützen Tool-Aufrufe.

Anfrage an die lokale API (Beispiel aus der offiziellen Wiki-Dokumentation)
curl http://127.0.0.1:5000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.6
  }'

Sie können jeden OpenAI-Client (ein Chat-Frontend, einen Code-Agenten, LangChain) anbinden, indem Sie ihn auf diese Adresse verweisen lassen. Die interaktive Dokumentation aller Endpunkte wird unter derselben Adresse im Pfad /docs bereitgestellt.

#Die Benutzeroberfläche für andere zugänglich machen: Diese Optionen sollten Sie kennen

Standardmäßig ist die Benutzeroberfläche nur von Ihrem Rechner aus erreichbar. Drei Optionen ändern das. --listen macht die Benutzeroberfläche über Ihr lokales Netzwerk zugänglich. --share erstellt eine öffentliche Adresse; vermeiden Sie diese Option außer für einen kurzen Test. Und --multi-user speichert keine Chatverläufe: Im Repository wird diese Option als geeignet für kleine Teams beschrieben, deren Mitglieder einander vertrauen, nicht als Unternehmenslösung.

Fügen Sie für die API --api-key mit einem Schlüssel Ihrer Wahl hinzu, sobald der Server auf Verbindungen aus dem Netzwerk lauscht: Ohne Schlüssel kann jedes Gerät, das den Port erreicht, Ihr Modell abfragen. Für eine tatsächliche Nutzung im Team (Konten, Rollen, Protokollierung) sollten Sie stattdessen ein dediziertes Frontend vor die Inferenz-Engine schalten.

#TextGen gegenüber Ollama und LM Studio

Welches Tool für welchen Bedarf
BedarfTextGenOllama oder LM Studio
Schnell starten mit einem GGUFPortable Version, ebenfalls einfach zu bedienenOllama: ein Befehl; LM Studio: geführte Benutzeroberfläche
Mehrere Engines und Formate testenJa: Das ist seine StärkeFokussiert auf GGUF
Ein LoRA im Interface finetunenJa, mit der vollständigen InstallationNein
Ein Team bedienenWenig geeignet (eingeschränkter Mehrbenutzerbetrieb)Ollama hinter Open WebUI oder LibreChat
Flüssiger AlltagseinsatzMehr Einstellungen, mehr manuelle SchritteEinfacher zu warten

Zusammengefasst: TextGen ist das Werkzeug zum Experimentieren und für die Feinabstimmung, nicht für den täglichen Gebrauch durch Anfänger. Wenn Sie zunächst mit einem Modell chatten möchten, beginnen Sie mit Ollama oder LM Studio; kehren Sie zu TextGen zurück, wenn Sie eine Engine, ein Format oder ein Training benötigen, das die anderen nicht anbieten.

Häufig gestellte Fragen
oobabooga und Text Generation WebUI, ist das dasselbe?+
Ja. oobabooga ist das Pseudonym des Entwicklers, und Text Generation WebUI ist der ursprüngliche Name des Projekts, das heute als TextGen vorgestellt wird. Die alte GitHub-Adresse leitet zu github.com/oobabooga/textgen weiter. Das ist die einzige offizielle Quelle, die wir kennen: Meiden Sie Download-Websites von Drittanbietern und überprüfen Sie die Adresse, bevor Sie irgendetwas ausführen.
Wie installiert man Text Generation WebUI im Jahr 2026?+
Am einfachsten ist die portable Version, die über die Releases des Repositorys heruntergeladen werden kann: Sie ist sofort einsatzbereit, unterstützt aber nur GGUF-Modelle. Für andere Backends, Training oder Erweiterungen klonen Sie das Repository und führen Sie start_windows.bat, start_linux.sh oder start_macos.sh aus. Planen Sie dafür etwa 10 GB Festplattenspeicher ein.
Welche Engines und Formate werden unterstützt?+
Die aktuelle README-Datei listet llama.cpp, ik_llama.cpp, Transformers, ExLlamaV3 und TensorRT-LLM auf. Das GGUF-Format wird über llama.cpp verarbeitet, das einzige Backend der portablen Version. ExLlamaV2, AWQ, GPTQ und vLLM, die in älteren Tutorials genannt werden, sind dort nicht mehr aufgeführt: Prüfen Sie die Dokumentation, bevor Sie einer Anleitung folgen, die sie erwähnt.
Ist es wirklich offline und ohne Telemetrie?+
Laut Repository ist der Betrieb zu 100 % offline und privat, ohne Telemetrie, externe Ressourcen oder Update-Anfragen. Das Wiki stellt klar, dass die API keine Verbindung zu OpenAI herstellt und kein Protokoll anlegt. Die Websuchfunktionen greifen hingegen naturgemäß auf das Internet zu: Deaktivieren Sie diese für eine strikt lokale Nutzung.
Wie aktiviert man die API, um ein anderes Tool anzuschließen?+
Fügen Sie --api zur Befehlszeile hinzu oder tragen Sie es in user_data/CMD_FLAGS.txt ein. Der Standardport ist 5000 und lässt sich mit --api-port ändern; die Adresse lautet http://127.0.0.1:5000/v1. Wenn die API auf Anfragen aus dem Netzwerk lauscht, fügen Sie --api-key hinzu, damit ein Schlüssel erforderlich ist. Andernfalls kann jedes Gerät, das den Port erreicht, die API nutzen.
Sollte man TextGen Ollama vorziehen?+
Nicht für den Einstieg: Ollama und LM Studio sind im Alltag einfacher, da Sie sich mit weniger Optionen vertraut machen müssen. TextGen lohnt sich, wenn Sie mehrere Engines und Formate testen, ein LoRA in der Benutzeroberfläche trainieren oder die Generierung fein abstimmen möchten. Häufig wird Ollama für den Alltag und TextGen zum Experimentieren genutzt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.