Text Generation WebUI (oobabooga)
oobabooga ist das Pseudonym des Entwicklers von Text Generation WebUI, inzwischen in TextGen umbenannt: eine Open-Source-Oberfläche (AGPL-3.0, etwa 47.000 GitHub-Sterne), mit der sich Sprachmodelle lokal und ohne Telemetrie ausführen lassen. Für GGUF-Modelle lässt sie sich als portable Version herunterladen, wie eine Desktop-Anwendung; die vollständige Installation ergänzt weitere Engines, das Training von LoRA und Erweiterungen. Offizielle Quelle: das GitHub-Repository oobabooga/textgen.
Viele Tutorials zu Text Generation WebUI beschreiben eine Version von vor zwei Jahren: inzwischen weggefallene Engines, ersetzte Erweiterungen, geänderte Befehle. Dieser Leitfaden behandelt das Thema anhand des aktuellen Repositorys: den neuen Namen, die drei Installationswege, die tatsächlich unterstützten Engines, die Erweiterungen, die API und die Sicherheitseinstellungen, die Sie kennen sollten, bevor Sie die Oberfläche anderen zugänglich machen.
#oobabooga, Text Generation WebUI, TextGen: Worum geht es?
oobabooga ist das GitHub-Pseudonym des Entwicklers des Projekts. Das Tool, das lange Text Generation WebUI hieß, wird inzwischen unter dem Namen TextGen vorgestellt: Die alte Repository-Adresse leitet auf github.com/oobabooga/textgen weiter. Es handelt sich um eine Open-Source-Anwendung unter der Lizenz AGPL-3.0, die Chat, freie Generierung, Bildverarbeitung, Tool-Aufrufe, eine OpenAI-kompatible API und LoRA-Training vereint. Das Repository beschreibt die Anwendung als vollständig offline und privat, ohne Telemetrie, externe Ressourcen oder Anfragen an entfernte Server zur Prüfung auf Updates.
Das Projekt ist aktiv: Die neueste von uns erfasste Version, 4.9, stammt vom Mai 2026. Unseres Wissens gibt es außer diesem GitHub-Repository keine offizielle Website. Seien Sie vorsichtig bei Downloadseiten von Drittanbietern und Forks, die behaupten, das Projekt zu ersetzen, denn eine manipulierte ausführbare Datei wird mit Ihren Berechtigungen ausgeführt.
#1. Installation: portabel, mit einem Klick oder manuell
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Das Repository bietet drei Möglichkeiten. Die portable Version ist die einfachste: Sie enthält alle Abhängigkeiten, lässt sich per Doppelklick starten und lädt nur GGUF-Modelle (mit llama.cpp als Engine). Sie ist für Linux, Windows und macOS mit Varianten für CUDA, Vulkan, ROCm und reinen CPU-Betrieb verfügbar. Die vollständige Installation, die für die anderen Engines, das Training, die Bildgenerierung und die Erweiterungen erforderlich ist, lädt PyTorch herunter und benötigt etwa 10 GB Speicherplatz.
| Modus | Was Sie erhalten | Was Sie wissen müssen |
|---|---|---|
| Portable-Version (Desktop-Anwendung) | GGUF über llama.cpp, alles inklusive | Am einfachsten; keine Erweiterungen und keine anderen Engines |
| Ein-Klick-Installer (start_-Skripte) | Vollständige Installation: ExLlamaV3, Transformers, Training, Erweiterungen | Etwa 10 GB; Auswahl des GPU-Herstellers bei der Installation |
| Manuell mit venv oder Conda | Vollständige Kontrolle über die Python-Umgebung | Für Entwickler; nur für besondere Fälle |
- 01Die portable Version herunterladenWählen Sie auf der Release-Seite des Repositorys das Archiv für Ihr System und Ihre GPU. Für NVIDIA nehmen Sie den Build cuda13.1, wenn nvidia-smi eine CUDA-Version von mindestens 13.1 anzeigt, andernfalls cuda12.4. AMD und Intel verwenden Vulkan, AMD kann auch ROCm verwenden, und es gibt eine reine CPU-Version.
- 02Extrahieren und startenEntpacken Sie das Archiv und doppelklicken Sie anschließend auf textgen: Ein Fenster öffnet sich.
- 03Unter macOS die Quarantäne aufhebenFühren Sie vor dem ersten Start xattr -cr gefolgt vom Pfad des entpackten Ordners aus, wie in den Versionshinweisen angegeben.
- 04Ein Modell hinzufügenPlatzieren Sie eine GGUF-Datei im Ordner user_data/models; die Benutzeroberfläche erkennt sie automatisch.
- 05Laden und chattenWählen Sie das Modell im Tab für Modelle aus und öffnen Sie anschließend den Chat.
Das Aktualisieren eines portablen Builds erfolgt ohne Verlust Ihrer Modelle oder Einstellungen: Laden Sie das neue Archiv herunter, entpacken Sie es und ersetzen Sie den Ordner user_data durch den Ihrer alten Installation. Seit Version 4.0 können Sie user_data auch eine Ebene über den Installationsordnern ablegen; er wird dann automatisch erkannt.
Für die vollständige Installation klonen Sie das Repository und starten Sie das Skript für Ihr Betriebssystem. Das Skript fragt nach dem Hersteller Ihrer GPU und installiert die Abhängigkeiten in einem lokalen Ordner. Anschließend öffnen Sie http://127.0.0.1:7860 im Browser.
Alles wird in einem lokalen Ordner namens installer_files abgelegt. Um von Grund auf neu zu installieren, löschen Sie diesen Ordner und starten Sie das Skript erneut. Um Optionen dauerhaft anzuwenden, tragen Sie sie in user_data/CMD_FLAGS.txt ein, zum Beispiel --api zum Aktivieren der API. Keines dieser Skripte benötigt Administratorrechte.
#2. Ein Modell herunterladen und auswählen
Die Anleitung im Repository lässt sich in drei Sätzen zusammenfassen: Laden Sie eine GGUF-Datei von Hugging Face herunter, legen Sie sie in user_data/models ab, und die Benutzeroberfläche erkennt sie. Modelle, die aus mehreren Dateien bestehen (Transformers in 16 Bit, EXL3), gehören in einen Unterordner desselben Verzeichnisses und erfordern die vollständige Installation, nicht die portable Version.
Das einzige praktische Kriterium ist der Speicher. Richtwerte dieser Website bei Q4-Quantisierung, nur für die Modellgewichte: 3B etwa 2 GB, 7 bis 8B etwa 5 GB, 14B etwa 9 GB, 32B etwa 19 bis 20 GB, 70B etwa 40 GB. Rechnen Sie den Kontextcache und eine Reserve für das System hinzu. Der VRAM-Rechner dieser Website liefert Ihnen den genauen Gesamtbedarf für Ihren Kontext.
#Kontext und Cache: die beiden Optionen, die Speicher sparen
Zwei Startoptionen wirken sich direkt auf den Speicherbedarf aus. --ctx-size legt die Kontextgröße in Tokens fest: Der Wert 0 bedeutet bei llama.cpp eine automatische Einstellung, sofern alle Schichten auf der GPU liegen (--gpu-layers=-1); bei den anderen Engines beträgt der Standardwert 8.192. --cache-type bestimmt das Format des Kontextcaches; bei llama.cpp sind fp16, q8_0 und q4_0 gültige Werte. Ein quantisierter Cache benötigt weniger Speicher als ein fp16-Cache, allerdings auf Kosten einer leicht geringeren Genauigkeit: Probieren Sie bei knappem Speicher zuerst q8_0 aus, bevor Sie die Modellgröße reduzieren.
Das Repository verweist außerdem auf zwei Community-Tools als Orientierung für diese Wahl: einen Speicherrechner für GGUF-Modelle und eine Liste empfohlener Quantisierungen. Überprüfen Sie deren Ergebnisse mit dem Rechner dieser Website und beobachten Sie anschließend während eines langen Gesprächs die tatsächliche Speicherbelegung der Grafikkarte.
#3. Eine Engine (Loader) auswählen
TextGen lädt ein Modell mit einer Engine, die als Loader bezeichnet wird. Standardmäßig erkennt TextGen sie automatisch; Sie können sie mit der Option --loader vorgeben. Die aktuell zulässigen Werte sind Transformers, llama.cpp, ExLlamav3_HF, ExLlamav3 und TensorRT-LLM, und Sie können Engine und Modell ohne Neustart wechseln.
| Engine | Modellformat | Nutzung |
|---|---|---|
| llama.cpp | GGUF | Die Standardwahl: Prozessor und GPU, einzige Engine der portablen Version |
| ik_llama.cpp | GGUF | Variante von llama.cpp, als zusätzliches Backend aufgeführt |
| ExLlamaV3 | EXL3 | Quantisierung für GPU, bei vollständiger Installation |
| Transformers | 16-Bit-Modelle, safetensors | Vielseitig und speicherhungrig; wird auch für das Training verwendet |
| TensorRT-LLM | Für NVIDIA kompilierte Modelle | Für NVIDIA-GPUs, vollständige Installation |
Wenn Sie gerade anfangen, bleiben Sie bei llama.cpp und dem GGUF-Format: Das ist der kürzeste Weg, der auch bei der portablen Version zum Einsatz kommt und den andere Tools (Ollama, LM Studio) ebenfalls nutzen. Andere Inferenz-Engines sind bei einem konkreten Bedarf gerechtfertigt: einem bestimmten Format, Fine-Tuning oder der maximalen Ausnutzung einer NVIDIA-Karte.
#4. Chat, instruct, notebook, vision
- Instruct
- Der Modus zum Befolgen von Anweisungen, wie bei ChatGPT. Die Prompts werden automatisch mithilfe von Jinja2-Vorlagen formatiert.
- Chat-instruct und Chat
- Um mit personalisierten Charakteren zu sprechen.
- Notebook
- Ein Tab für freie Textgenerierung außerhalb der abwechselnden Chatbeiträge: Sie schreiben, das Modell setzt den Text fort.
- Vision und Dateien
- Sie können Bilder zu Ihren Nachrichten hinzufügen sowie Textdateien, PDF- und .docx-Dateien, um deren Inhalt zu diskutieren.
- Bearbeitung und Verzweigungen
- Eine Nachricht bearbeiten, zwischen ihren Versionen wechseln und an jeder beliebigen Stelle der Unterhaltung eine Verzweigung öffnen.
Die Modelle können während des Gesprächs auch Tools aufrufen: Websuche, Abrufen von Webseiten, Berechnungen. Jedes Tool ist eine einfache Python-Datei, und MCP-Server werden unterstützt. Diese Funktion hängt mit dem Kontext zusammen: Ein Agent, der Tools aufruft, füllt ein kleines Kontextfenster schnell. Denken Sie daran, die Kontextgröße mit der Option --ctx-size zu erhöhen.
#5. Erweiterungen: Was es wirklich gibt
Die Erweiterungen funktionieren nur mit der vollständigen Installation. Das Erweiterungsverzeichnis des Repositorys enthält unter anderem coqui_tts, silero_tts (Sprachsynthese), whisper_stt (Spracheingabe), sd_api_pictures und send_pictures (Bilder), google_translate, superbooga und superboogav2, ngrok, gallery und perplexity_colors. Das README ergänzt, dass es außerdem Erweiterungen aus der Community gibt.
#6. API-Modus
Fügen Sie --api zu Ihren Optionen hinzu, um die API zu starten. Laut dem Wiki des Repositorys ist der Standardport 5000, lässt sich mit --api-port ändern, und die API bleibt lokal, solange Sie nicht ausdrücklich anfordern, sie nach außen zu öffnen. Das Wiki stellt klar, dass sie offline arbeitet, sich nicht mit OpenAI verbindet und keine Protokolle anlegt. Die Endpunkte decken Chats, Completions und Nachrichten im Anthropic-Format ab und unterstützen Tool-Aufrufe.
Sie können jeden OpenAI-Client (ein Chat-Frontend, einen Code-Agenten, LangChain) anbinden, indem Sie ihn auf diese Adresse verweisen lassen. Die interaktive Dokumentation aller Endpunkte wird unter derselben Adresse im Pfad /docs bereitgestellt.
#Die Benutzeroberfläche für andere zugänglich machen: Diese Optionen sollten Sie kennen
Standardmäßig ist die Benutzeroberfläche nur von Ihrem Rechner aus erreichbar. Drei Optionen ändern das. --listen macht die Benutzeroberfläche über Ihr lokales Netzwerk zugänglich. --share erstellt eine öffentliche Adresse; vermeiden Sie diese Option außer für einen kurzen Test. Und --multi-user speichert keine Chatverläufe: Im Repository wird diese Option als geeignet für kleine Teams beschrieben, deren Mitglieder einander vertrauen, nicht als Unternehmenslösung.
Fügen Sie für die API --api-key mit einem Schlüssel Ihrer Wahl hinzu, sobald der Server auf Verbindungen aus dem Netzwerk lauscht: Ohne Schlüssel kann jedes Gerät, das den Port erreicht, Ihr Modell abfragen. Für eine tatsächliche Nutzung im Team (Konten, Rollen, Protokollierung) sollten Sie stattdessen ein dediziertes Frontend vor die Inferenz-Engine schalten.
#TextGen gegenüber Ollama und LM Studio
| Bedarf | TextGen | Ollama oder LM Studio |
|---|---|---|
| Schnell starten mit einem GGUF | Portable Version, ebenfalls einfach zu bedienen | Ollama: ein Befehl; LM Studio: geführte Benutzeroberfläche |
| Mehrere Engines und Formate testen | Ja: Das ist seine Stärke | Fokussiert auf GGUF |
| Ein LoRA im Interface finetunen | Ja, mit der vollständigen Installation | Nein |
| Ein Team bedienen | Wenig geeignet (eingeschränkter Mehrbenutzerbetrieb) | Ollama hinter Open WebUI oder LibreChat |
| Flüssiger Alltagseinsatz | Mehr Einstellungen, mehr manuelle Schritte | Einfacher zu warten |
Zusammengefasst: TextGen ist das Werkzeug zum Experimentieren und für die Feinabstimmung, nicht für den täglichen Gebrauch durch Anfänger. Wenn Sie zunächst mit einem Modell chatten möchten, beginnen Sie mit Ollama oder LM Studio; kehren Sie zu TextGen zurück, wenn Sie eine Engine, ein Format oder ein Training benötigen, das die anderen nicht anbieten.
- Ollama vs LM Studio vs Jan vs GPT4All
- Quelle: TextGen-Repository (oobabooga)
- Quelle: Versionshinweise zu Version 4.9
- Quelle: Wiki, OpenAI-kompatible API
oobabooga und Text Generation WebUI, ist das dasselbe?+
Wie installiert man Text Generation WebUI im Jahr 2026?+
Welche Engines und Formate werden unterstützt?+
Ist es wirklich offline und ohne Telemetrie?+
Wie aktiviert man die API, um ein anderes Tool anzuschließen?+
Sollte man TextGen Ollama vorziehen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.