Open WebUI: ChatGPT-ähnliche Oberfläche für Ollama
Open WebUI Ollama ist heute die praktischste Kombination, um auf dem eigenen Rechner eine Oberfläche im Stil von ChatGPT ohne Cloud-Abhängigkeit zu nutzen. Diese vollständig selbst gehostete Lösung verwandelt Ihren Ollama-Server in eine Webanwendung für mehrere Benutzer mit Gesprächsverlauf, Modellverwaltung und dokumentenbasiertem RAG. Dieser Leitfaden beschreibt die Installation von Open WebUI Ollama über Docker, die Netzwerkkonfiguration, die je nach verfügbarem VRAM kompatiblen Modelle, die erweiterten Funktionen (RAG, Mehrbenutzerbetrieb, MCP) und die Einschränkungen, die Sie vor einem internen Produktiveinsatz kennen sollten.
Was ist Open WebUI und warum sollte es mit Ollama kombiniert werden?
Open WebUI (ehemals Ollama WebUI) ist ein mit SvelteKit + FastAPI geschriebenes Open-Source-Frontend, veröffentlicht unter der BSD-3-Lizenz auf github.com/open-webui/open-webui. Es bietet eine Chat-Oberfläche, die der von ChatGPT entspricht, aber an ein lokales Inferenz-Backend angebunden ist. Ollama übernimmt diese Backend-Rolle: ein Daemon, der quantisierte GGUF-Modelle lädt und eine OpenAI-kompatible HTTP-API auf Port 11434 bereitstellt.
Die Kombination der beiden ergibt eine Benutzeroberfläche für lokale LLMs vollständig:
- Frontend : Open WebUI auf dem Port 8080 (Chat, Historie, Systemprompts, Python-Funktionen)
- Backend : Ollama auf Port 11434 (GPU-Speicherverwaltung, Quantisierung, Streaming)
- Speicher : SQLite oder PostgreSQL für Gespräche und Embeddings
Im Gegensatz zu LM Studio, das nur für einen einzelnen Benutzer ausgelegt und ausschließlich als Desktop-Anwendung verfügbar ist, verwaltet Open WebUI Konten, Gruppen und Berechtigungen pro Modell und bietet einen RAG-Modus mit integrierter ChromaDB-Vektordatenbank. Es ist die bevorzugte Option, um einen Inferenzserver mit mehreren Mitarbeitenden zu teilen.
Installation über Docker: die empfohlene Methode
L'installation WebUI Docker ist der von der Entwicklungsteam Open WebUI unterstützte Weg. Er vermeidet Python-Abhängigkeitskonflikte und ermöglicht atomare Updates.
Voraussetzungen :
- Docker 24+ und Docker Compose v2
- Ollama installiert auf dem Host oder im Container (siehe ollama.com/download)
- NVIDIA-GPU mit Treibern ≥ 535 und nvidia-container-toolkit oder CPU für kleine Modelle
Minimaler Befehl (Ollama bereits auf dem Host installiert) :
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
Die Benutzeroberfläche erreichen Sie anschließend unter http://localhost:3000. Das zuerst erstellte Konto erhält automatisch Administratorrechte.
All-in-one-Stack mit docker-compose (Ollama + WebUI + NVIDIA-GPU) : siehe die Referenzdatei auf docs.openwebui.com/getting-started/quick-start. Der Dienst ollama muss ein persistentes Volume einbinden /root/.ollama um die heruntergeladenen Modelle über Neustarts hinweg zu behalten; andernfalls müssen Sie mehrere Hundert Gigabyte erneut herunterladen, und zwar bei jedem docker compose down.
Für AMD ROCm verwenden Sie das Image ghcr.io/open-webui/open-webui:main verbunden mit ollama/ollama:rocm. Die Leistung der RX 7900 XTX liegt mit Q4_K_M bei etwa 70–80 % der Leistung einer RTX 4090 (Schätzwert, abhängig vom Modell).
Das passende Modell für Ihr Hardware-Setup auswählen
Open WebUI zeigt alle Modelle an, die im lokalen Ollama-Register vorhanden sind. Der begrenzende Faktor bleibt der VRAM. Hier sind drei Stufen, die zu Hardware für Privatnutzer und Profis passen.
Eine RTX 4090 (24 GB VRAM) eignet sich für 30–70B-Modelle in Q4 mit teilweisem CPU-Offloading:
- Qwen 2.5 72B Instruct (72B, Qwen License) — VRAM Q4 ~42 GB, ctx 131072. Erfordert CPU-Offload oder eine zweite Karte.
- Llama 3.3 70B Instruct (70B, Llama 3.3 Community) — VRAM Q4 ~40 GB. Auch hier ist Offloading erforderlich.
- DeepSeek R1 Distill Llama 70B — gute Leistungen beim logischen Schlussfolgern, MMLU-Score auf Augenhöhe mit den besten 70B-Modellen (je nach Version noch zu bestätigen).
Eine Workstation mit 2× RTX 6000 Ada (96 GB insgesamt) ermöglicht den Einsatz kompakter MoE-Modelle:
- gpt-oss 120B (117B, Apache 2.0, OpenAI) — VRAM Q4 ~70 GB, ctx 128000. Offenes Modell von OpenAI, native Ollama-Integration.
- Mistral Small 4 (119B, Apache 2.0) — ctx 256000, hervorragender Kompromiss für französischsprachige Anwendungen.
- Qwen 3.5 122B-A10B — MoE mit 10B aktiven Parametern, sehr geringe Latenz für diese Größe.
Ein Server mit 8× H100 (640 GB) oder ein Cluster öffnet die Tür zu den Grenzen des Machbaren:
- DeepSeek V3.2 (685B, MIT) — VRAM Q4 ~410 GB
- Kimi K2.6 (1000B, Modified MIT) — VRAM Q4 ~600 GB, Kontext 256000
- DeepSeek V4 Pro 1.6T — MoE-Modell der Spitzenklasse, Kontext von 1 Million Tokens
Für eine präzise Dimensionierung passend zu Ihrer Grafikkarte verwenden Sie den Konfigurations-Tool von quelllm.fr der den verfügbaren VRAM, die gewünschte Quantisierung und die angestrebte Kontextlänge zusammen berücksichtigt.
Erweiterte Funktionen: RAG, Funktionen, MCP
Open WebUI bietet mehr als nur einen Chat. Drei Funktionen sollten bereits bei der Installation konfiguriert werden.
Integrierter RAG : Legen Sie PDF-, DOCX- oder TXT-Dateien oder URLs in einer „Collection“ ab. Open WebUI zerlegt sie in Chunks (Standard-Chunkgröße 1500, Überlappung 100) und erzeugt Embeddings über sentence-transformers/all-MiniLM-L6-v2 lokal oder über Ollama (nomic-embed-text) und speichert sie in ChromaDB. Bei der Inferenz werden die relevanten Chunks in den Kontext eingefügt. Bei umfangreichen Datenbanken wechseln Sie über die Variable zu PostgreSQL + pgvector VECTOR_DB=pgvector.
Python-Funktionen (Pipelines) : Open WebUI ermöglicht die Ausführung beliebigen Codes in der Vor- oder Nachverarbeitung. Beispiel: Prompts, die „code“ enthalten, automatisch weiterleiten an Qwen3-Coder-Next 80B-A3B, und die übrigen an Mistral Medium 3.5 128B. Die Pipelines laufen in einem separaten Container über den Port 9099, eine nützliche Isolierung für die Sicherheit.
Der Support für MCP (Model Context Protocol) : seit Version 0.6 kann Open WebUI MCP-Server nutzen. Siehe die offizielle Spezifikation für die verfügbaren Server (Dateisystem, GitHub, Postgres usw.).
Detaillierter Vergleich der Frontends unter quelllm.fr/compare/open-webui-vs-lm-studio.
Beobachtete Leistung und Tokens pro Sekunde
Die Durchsatzraten hängen von der Kombination aus Modell und GPU ab. Einige Referenzmessungen mit Ollama 0.5+ und Open WebUI 0.6+ in Q4_K_M:
- Llama 3.1 70B auf 2× RTX 4090 (experimenteller Tensorparallelismus in Ollama): ca. 18–22 Tokens/s bei der Generierung (geschätzt)
- gpt-oss 120B auf H100 80GB: 60–80 Tokens/s (je nach Offload zu bestätigen)
- Qwen 3 235B-A22B auf 4× A100 80GB: 45–55 Tokens/s dank der MoE-Architektur, die nur 22B aktiviert
Das WebSocket-Streaming von Open WebUI verursacht eine nicht wahrnehmbare zusätzliche Latenz (<10 ms). Der Engpass bleibt die Inferenz selbst. Zur Optimierung aktivieren Sie OLLAMA_FLASH_ATTENTION=1 et OLLAMA_KV_CACHE_TYPE=q8_0 in der Umgebung des Ollama-Containers: 30–40 % Speicherersparnis beim Kontext (siehe github.com/ollama/ollama/blob/main/docs/faq.md).
Für Reasoning-Modelle wie DeepSeek R1 671B, rechnen Sie mit der 3- bis 10-fachen Anzahl generierter Tokens pro Anfrage (interne Chain-of-Thought) und daher mit Antwortzeiten von mehreren Minuten, selbst auf leistungsstarker Infrastruktur.
Sicherheit und Bereitstellung für mehrere Benutzer
Im Unternehmen sind drei Vorsichtsmaßnahmen erforderlich:
- Reverse-Proxy mit TLS : Schalten Sie Traefik oder Caddy vor Open WebUI. Der Standardport 8080 bietet keine Verschlüsselung.
- SSO-Authentifizierung : Open WebUI unterstützt OIDC (Keycloak, Authentik) über Variablen
OAUTH_*. Deaktivieren Sie die offene Kontoerstellung mitENABLE_SIGNUP=false. - RBAC pro Modell : beschränken Sie über die Admin-Oberfläche den Zugriff auf große Modelle (>40 GB VRAM) auf Senior-Gruppen, damit kein einzelner Nutzer die Warteschlange überlastet.
Prüfen Sie die Protokolle regelmäßig /app/backend/data/audit.log die Prompts und Uploads protokollieren.
FAQ
F: Funktioniert Open WebUI ohne Ollama?
Ja. Open WebUI unterstützt jede OpenAI-kompatible API: vLLM, llama.cpp server, LiteLLM, TGI. Konfigurieren Sie die URL unter Einstellungen → Verbindungen. Ollama bleibt der einfachste Einstieg, da seine CLI Downloads, GGUF-Quantisierung und Speicher automatisch verwaltet. Für eine Bereitstellung mit hoher Leistung und ausgereiftem Tensor-Parallelismus sind vLLM oder SGLang vorzuziehen.
F: Welche minimale VRAM-Größe ist notwendig, um zu starten?
Mit 8 GB VRAM (RTX 3060, 4060) können Sie 7–8B-Modelle wie leichte destillierte Varianten problemlos betreiben. Bei 12–16 GB sollten Sie 13–14B-Modelle anstreben. Die Faustregel: VRAM ≈ Parameter × 0,6 bei Q4_K_M, plus 1–2 GB für den 8K-Kontext. Siehe quelllm.fr/guide/vram-quantification für Details zu den einzelnen Quantisierungen (Q4, Q5, Q8, FP16).
F: Wie installiert man Open WebUI ohne Docker?
Via pip install open-webui puis open-webui serve. Diese Methode ist dokumentiert, aber weniger isoliert: Konflikte mit anderen Python-Umgebungen sind möglich, Aktualisierungen sind schwieriger. Beschränken Sie ihren Einsatz auf Entwicklungsrechner. Für einen Arbeitsplatzrechner mit nur einem Nutzer können LM Studio oder Jan einfacher sein; vergleichen Sie die beiden unter quelllm.fr/compare/lm-studio-vs-jan.
F: Kann man Open WebUI mit mehreren Ollama-Servern verbinden?
Ja. Fügen Sie unter Einstellungen → Verbindungen mehrere Ollama-URLs hinzu (z. B. http://gpu-01:11434, http://gpu-02:11434). Open WebUI aggregiert die verfügbaren Modelle. Der Routing ist manuell (der Benutzer wählt das Modell); für ein automatisches Lastverteilung können Sie LiteLLM als Proxy einsetzen. Nützlich, um zu verteilen Mixtral 8x22B Instruct auf einem Knoten und Llama 3.1 405B Instruct auf einem anderen.
F: Sind die Gespräche im Ruhezustand verschlüsselt?
Standardmäßig nicht. Die SQLite-Datenbank /app/backend/data/webui.db speichert die Nachrichten im Klartext. Für die Verschlüsselung im Ruhezustand verwenden Sie ein Docker-Volume auf einem verschlüsselten Dateisystem (LUKS, native ZFS-Verschlüsselung) oder wechseln Sie zu PostgreSQL mit Transparent Data Encryption. Der Netzwerkverkehr kann hingegen über den oben genannten Reverse-Proxy mit TLS verschlüsselt werden.
F: Unterstützt Open WebUI Vision und Bilder?
Ja, mit multimodalen Modellen. Laden Sie ein Bild in den Chat hoch: Open WebUI kodiert es in Base64 und übermittelt es an Ollama, sofern das Modell die Bildmodalität unterstützt. Kompatible Modelle im Katalog: Qwen 2.5 VL 72B, Qwen 3 VL 235B-A22B, LLaVA-OneVision 72B et Molmo 72B.
Fazit
Open WebUI Ollama bildet den Referenz-Stack für die Bereitstellung einer selbst gehosteten, ChatGPT-ähnlichen Benutzeroberfläche, vom Laptop bis zum GPU-Cluster. Die Docker-Installation dauert fünfzehn Minuten, die zusätzliche Konfiguration von RBAC und RAG einige Stunden. Die Modellwahl bleibt der entscheidende Faktor: Stimmen Sie Parameter, Quantisierung und verfügbaren VRAM genau aufeinander ab. Um die 249 indexierten Modelle entsprechend Ihren Hardwarebeschränkungen zu erkunden, durchsuchen Sie den kompletter Katalog von quelllm.fr oder lassen Sie den Konfigurator die optimale Kombination aus Modell und Quantisierung für Ihre GPU empfehlen.