Einsteiger 11 Min.Oberflächen

Die Frontends von chat

Direkte Antwort

Für ein lokales LLM ist Open WebUI die Standardwahl: eine Oberfläche ähnlich wie bei ChatGPT, Ollama mit einem einzigen Docker-Befehl angebunden, Konten und Rollen inklusive. LibreChat eignet sich, wenn ein Team lokale Anbieter und Cloud-Anbieter kombiniert, AnythingLLM, wenn Dokumente abgefragt werden sollen, und SillyTavern für Rollenspiele. Achtung: Die Lizenz von Open WebUI ist keine einfache MIT-Lizenz mehr, und bei mehr als 50 Nutzern gilt eine Markenklausel.

Ollama, LM Studio oder llama.cpp führen das Modell aus, aber keines dieser Programme bietet das Erlebnis eines echten Mehrbenutzer-Chats mit Gesprächsverlauf, Dokumenten und Konten. Das ist die Aufgabe eines Frontends. Dieser Leitfaden vergleicht fünf Open-Source-Oberflächen anhand überprüfbarer Kriterien: Lizenz, Authentifizierung, Dokumentverwaltung, unterstützte Anbieter und Einrichtungsaufwand.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Was genau ist ein Frontend?

Ein Frontend ist eine Web- oder Desktop-Oberfläche, die mit einem Inferenzserver kommuniziert: Ollama, LM Studio, llama-server, vLLM oder einer Cloud-API. Es verwaltet den Gesprächsverlauf, die Markdown-Anzeige, die Benutzerkonten, das Hochladen von Dateien und manchmal auch die Suche in Ihren Dokumenten sowie Agenten. Es führt das Modell nicht selbst aus: Wenn der dahinterliegende Server gestoppt oder überlastet ist, kann die Oberfläche nichts daran ändern.

Die Verbindung erfolgt fast immer über eine OpenAI-kompatible API. Ollama stellt seine eigene unter http://localhost:11434/v1/ bereit und akzeptiert jeden beliebigen Dummy-Schlüssel. Dadurch lassen sich nahezu alle Frontends ohne spezielle Konfiguration anbinden. Merken Sie sich: Mit der Wahl eines Frontends legen Sie sich nicht auf eine Inferenz-Engine fest, und Sie können eines von beiden wechseln, ohne das andere neu einzurichten.

#Der Vergleich in einer Tabelle

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die folgenden Kriterien entscheiden tatsächlich über eine Bereitstellung: Lizenz (sie bestimmt, ob eine kommerzielle Nutzung möglich ist), Authentifizierung (sie bestimmt, ob eine gemeinsame Nutzung möglich ist), Dokumente (sie bestimmen die Nutzung im Unternehmen) und Installationsaufwand. Die GitHub-Sternzahlen, erhoben am 30. September 2026, messen nur die Beliebtheit, nicht die Qualität.

Fünf Open-Source-Chat-Frontends, Stand 30. September 2026
FrontendLizenzGitHub-SterneKonten und RollenStärkenInstallationsaufwand
Open WebUIModifizierte BSD-Lizenz mit Markenklausel (siehe unten)etwa 154.000Rollen, Gruppen, LDAP, SSO, SCIMNative Ollama-Unterstützung, RAG, Plugins, Offline-ModusDocker, ein Befehl
LibreChatMITetwa 45.000OAuth2, LDAP, E-Mail, Admin-PanelMehrere Anbieter, Presets, AgentenDocker Compose
AnythingLLMMITetwa 66.000Multi-utilisateursDokumente, Arbeitsbereiche, Agenten, Desktop-AnwendungDesktop-Anwendung oder Docker
SillyTavernAGPL-3.0etwa 34.000Hauptsächlich für den privaten GebrauchCharaktere, Lorebooks, FeinabstimmungNode.js oder Docker
Big-AGIMITetwa 7.000Wenig auf Teams ausgerichtetPersonas, Beam mit mehreren Modellen, Bilder, StimmeWebanwendung, die bereitgestellt werden muss

#Die Lizenz von Open WebUI: das Detail, das viele falsch wiedergeben

Viele Vergleiche, darunter die frühere Version dieses Leitfadens, stellen Open WebUI als Projekt unter der MIT-Lizenz dar. Das ist nicht mehr korrekt. Die Datei LICENSE im Repository enthält eine BSD-artige Lizenz mit drei Klauseln, ergänzt um eine vierte Klausel: Diese verbietet es, die Marke „Open WebUI“ (Name, Logo, visuelle Erkennungsmerkmale) zu ändern, zu entfernen oder zu ersetzen, es sei denn, die Bereitstellung überschreitet in einem gleitenden Zeitraum von dreißig Tagen nicht fünfzig Benutzer, Sie haben eine schriftliche Genehmigung des Rechteinhabers oder Sie verfügen über eine Unternehmenslizenz.

Was das in der Praxis ändert. Persönliche Nutzung, Familie, kleines Team: nichts. Bei einem Einsatz für mehr als fünfzig Nutzer mit eigenem Erscheinungsbild (Firmenlogo, Produktname) benötigen Sie eine Genehmigung oder eine Unternehmenslizenz, oder Sie müssen die Marke beibehalten. Die Benutzeroberfläche unverändert und mit sichtbarer Marke zu nutzen, bleibt möglich. Wenn Sie einen Einsatz in großem Maßstab planen, lesen Sie die Datei LICENSE und deren Änderungshistorie im Repository und lassen Sie beides von der für Lizenzen zuständigen Person prüfen.

!
Verlassen Sie sich nicht auf die MIT-Lizenzangabe, die Sie anderswo finden
Einige Vergleichsseiten und sogar manche automatisch erzeugten Zusammenfassungen schreiben weiterhin, dass die drei großen Frontends unter der MIT-Lizenz stehen. Maßgeblich ist allein die Datei LICENSE im Repository, und sie hat sich geändert. Prüfen Sie sie zum Zeitpunkt Ihrer Bereitstellung.

#Open WebUI : Standardwahl mit Ollama

Open WebUI beschreibt sich als eine selbst gehostete, erweiterbare KI-Plattform, die vollständig offline funktionieren kann und Ollama sowie OpenAI-kompatible APIs unterstützt. Der Hauptvorteil für Anfänger ist der einfache Einstieg: ein einziger Docker-Befehl, dann ein Browser. Open WebUI bietet lokales RAG auf Basis mehrerer Vektordatenbanken, eine differenzierte Verwaltung von Rollen und Gruppen sowie Authentifizierung für Unternehmen (LDAP, Active Directory, SSO, SCIM).

Open WebUI mit Ollama auf demselben Rechner starten
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Öffnen Sie anschließend http://localhost:3000 und erstellen Sie das erste Konto, das zum Administratorkonto wird. Wenn Ollama auf einem anderen Server läuft, gibt die README an, dass die Variable OLLAMA_BASE_URL gesetzt werden muss. Das Volume open-webui bewahrt Ihre Daten: Ohne dieses Volume werden bei jeder Neuerstellung des Containers der Verlauf und die Konten gelöscht.

Diese Einschränkungen sollten Sie kennen: Die Oberfläche bietet viele Funktionen und wirkt manchmal überladen, jede zusätzliche Funktion bringt einen weiteren Bereich mit sich, der konfiguriert und aktualisiert werden muss, und die oben beschriebene Klausel zur Markenverwendung betrifft größere Bereitstellungen.

#LibreChat: mehrere Anbieter in einer einzigen Benutzeroberfläche

LibreChat richtet sich an Teams, die eine einzige Oberfläche für mehrere Anbieter wünschen: Sein Repository nennt Anthropic, OpenAI, Azure, Groq, Mistral, OpenRouter, Vertex AI und Gemini, mit Voreinstellungen, einem Administrationsbereich und einer Authentifizierung für mehrere Benutzer über OAuth2, LDAP oder E-Mail. Das Projekt steht unter der MIT-Lizenz, ohne Bedingungen zur Markenverwendung.

Typischer Fall: Ein Team möchte Ollama intern einsetzen, behält aber für bestimmte Anfragen den Zugang zu einem Cloud-Anbieter – mit einer einzigen Oberfläche und überwachten Kontingenten. Der Nachteil: Die Bereitstellung erfolgt über Docker Compose mit mehreren Diensten, und die Ausrichtung „lokal zuerst“ ist weniger ausgeprägt als bei Open WebUI.

#AnythingLLM: Wenn das Ziel darin besteht, mit Ihren Dokumenten zu sprechen

AnythingLLM präsentiert sich als All-in-One-Anwendung, mit der man mit eigenen Dokumenten chatten und Agenten nutzen kann – auch im Mehrbenutzermodus und ohne aufwendige Konfiguration. Seine Stärke liegt in der Organisation in Arbeitsbereichen (einer pro Projekt, Kunde oder Thema) und in der Verfügbarkeit einer Desktop-Anwendung für Mac, Windows und Linux: Man installiert sie wie ein gewöhnliches Programm, ohne Docker. Die Lizenz ist MIT.

Zu beachten: Die README weist darauf hin, dass die Anwendung eine Telemetriefunktion enthält, die anonyme Nutzungsinformationen erfasst. Wenn Sie einen strikt offline betriebenen Einsatz oder die Vertraulichkeit einer sensiblen Umgebung gewährleisten müssen, deaktivieren Sie diese Datenerfassung in den Einstellungen, bevor Sie irgendwelche Daten anbinden, und prüfen Sie, welche Daten tatsächlich das Netzwerk verlassen.

#SillyTavern: Rollenspiel und Fiktion

SillyTavern ist für Rollenspiele und interaktive Fiktion konzipiert. Im Repository wird es als einheitliche Oberfläche für zahlreiche LLM-APIs beschrieben (KoboldAI/CPP, Horde, NovelAI, Ooba, Tabby, OpenAI, OpenRouter, Claude, Mistral und andere), mit Visual-Novel-Modus, Lorebooks (WorldInfo), Bildgenerierung, Sprachsynthese und Erweiterungen von Drittanbietern. Es steht unter der Lizenz AGPL-3.0, die bei der Nutzung als Dienst strengere Anforderungen stellt.

Es ist nicht als Ersatz für einen professionellen Chat gedacht: Die Benutzeroberfläche ist dicht mit Funktionen bestückt und auf Charaktere ausgerichtet, nicht auf Unternehmenskonten. Für den beruflichen Einsatz sollten Sie es ausschließen. Für kreatives Schreiben mit fein abgestimmten Sampling-Einstellungen ist es die umfassendste Lösung.

#Big-AGI: Produktivität mit mehreren Modellen

Big-AGI ist eine KI-Suite zum Selbsthosten unter der MIT-Lizenz. Das Repository hebt Personas, Beam-Unterhaltungen mit mehreren Modellen, Bildgenerierung, Sprachfunktionen, PDF-Import und die Bereitstellung vor Ort hervor. Mit etwa 7.000 GitHub-Sternen ist die Community deutlich kleiner als die von Open WebUI oder AnythingLLM: Rechnen Sie mit weniger Tutorials, weniger fertigen Antworten bei Problemen und einer stärkeren Abhängigkeit von einer kleinen Anzahl von Maintainerinnen und Maintainern.

#Was kein Frontend löst: die gleichzeitige Nutzung durch mehrere Benutzer

Wenn Sie fünf Kollegen Zugriff auf die Oberfläche geben, wird der Rechner dadurch nicht fünfmal leistungsfähiger. Jedes Frontend sendet seine Anfragen an dieselbe Engine, die sie verarbeitet. Laut der FAQ von Ollama verarbeitet ein Modell standardmäßig jeweils nur eine Anfrage (OLLAMA_NUM_PARALLEL hat den Wert 1); weitere Anfragen werden in eine Warteschlange aufgenommen, standardmäßig bis zu 512. Ist diese Grenze erreicht, werden weitere Anfragen abgewiesen.

Parallele Verarbeitung zuzulassen erhöht unmittelbar den Speicherbedarf. Laut Dokumentation wächst der benötigte Speicher proportional zum Produkt aus der Anzahl paralleler Anfragen und der Kontextlänge: Bei einem Kontext von 2.000 Tokens und 4 parallelen Anfragen wird Speicher für das Äquivalent von 8.000 Tokens reserviert. Bei einem Modell mit 27 Milliarden Parametern, das bereits nahe an der Speichergrenze der Grafikkarte liegt, kann die parallele Verarbeitung diese Grenze überschreiten und einen Teil des Modells auf die CPU verlagern, wodurch es für alle langsamer wird.

Auswirkung der Parallelität auf den Speicherbedarf (Regel aus der Ollama-Dokumentation)
Kontext pro AnfrageParallelanfragenZugewiesener GesamtkontextWas das bedeutet
4 000 Tokens14 000Standardkonfiguration mit dem geringsten Speicherbedarf
4 000 Tokens416 000Viermal so viel Kontextspeicher
32 000 Tokens4128 000Nur für Rechner mit viel Speicher

Die Faustregel: Legen Sie die Kapazität der Inferenz-Engine fest, bevor Sie sich um die Benutzeroberfläche kümmern. Bei mehr als nur wenigen gleichzeitig aktiven Nutzern ist ein auf Durchsatz ausgelegter Server wie vLLM oder SGLang ein sinnvoller Ersatz für Ollama hinter demselben Frontend, da alle dieselbe OpenAI-kompatible API verwenden.

#Welches Frontend für welches Nutzerprofil

Das Frontend für Ihre Situation
Ihre SituationEmpfohlene WahlWarumWas zu überprüfen ist
Sie steigen gerade ein, Ollama ist bereits installiertOpen WebUIEin Docker-Befehl, vertraute OberflächeMarkenbedingung, wenn Sie mehr als 50 Benutzer haben
Team, das lokale und cloudbasierte Lösungen kombiniertLibreChatUnterstützung mehrerer Anbieter, MIT, AdministrationDie Bereitstellungszeit von Docker Compose
Chat auf Grundlage einer DokumentensammlungAnythingLLMArbeitsbereiche, DesktopanwendungDie zu deaktivierende Telemetrie
Rollenspiel und kreatives SchreibenSillyTavernCharaktere, Lorebücher, SamplingDie AGPL-3.0-Lizenz, wenn Sie die Software als Dienst anbieten
Persönlicher Gebrauch mit mehreren Modellen nebeneinanderBig-AGIBeam mit mehreren Modellen, PersonasDie Größe der Community

#Bevor Sie den Zugang für andere Personen öffnen

Ein Frontend, das auf Ihrem Rechner funktioniert, ist noch nicht für die Nutzung durch ein Team bereit. Drei Prüfungen sind erforderlich, bevor Sie die Adresse weitergeben. Erstens: Aktivieren Sie die Authentifizierung und deaktivieren Sie die offene Registrierung, sonst kann jeder im Netzwerk ein Konto erstellen. Zweitens: Platzieren Sie den Dienst hinter einem Reverse-Proxy mit HTTPS, insbesondere wenn der Datenverkehr das lokale Netzwerk verlässt. Drittens: Machen Sie den Port der Inferenz-Engine (11434 bei Ollama) niemals direkt zugänglich, da die Engine keine native Authentifizierung bietet.

Diese Punkte werden in den Leitfäden zur Sicherheit und zur Freigabe im Netzwerk ausführlich erläutert. Wenn Sie einen Rechner allein nutzen, benötigt das Frontend all das nicht. Es lohnt sich aber, sich von Anfang an anzugewöhnen, zu prüfen, welche Dienste auf Netzwerkverbindungen lauschen.

#Ein Frontend in dreißig Minuten testen

  1. 01
    Die Engine anbinden
    Starten Sie das Frontend und verbinden Sie es über die OpenAI-kompatible URL mit Ihrer Inferenz-Engine. Prüfen Sie, ob eine einfache Unterhaltung funktioniert, bevor Sie weitere Einstellungen vornehmen.
  2. 02
    Ein echtes Dokument senden
    Laden Sie ein PDF aus Ihrem Tätigkeitsbereich hoch, kein Demo-Beispiel, und stellen Sie drei Fragen, deren Antworten Sie kennen.
  3. 03
    Ein zweites Konto erstellen
    Testen Sie die Registrierung, die Rollen und den Zugriff auf die Chats eines anderen Benutzers: Dort unterscheiden sich die Frontends am meisten.
  4. 04
    Das Netzwerk beobachten
    Prüfen Sie während eines Gesprächs die ausgehenden Verbindungen der Anwendung. Es darf nichts an einen Dienst gesendet werden, den Sie nicht ausgewählt haben.
  5. 05
    Entscheiden
    Behalten Sie das Frontend, dessen Ergebnis zuverlässig ist, dessen Lizenz zu Ihrer Nutzung passt und das Sie auch in sechs Monaten noch aktualisieren können.
Häufig gestellte Fragen
Welches ist das beste Frontend für Ollama?+
Open WebUI lässt sich am einfachsten anbinden: ein Docker-Befehl, eine Oberfläche ähnlich wie bei ChatGPT sowie integriertes RAG und integrierte Kontenverwaltung. Alternativen sind bei einem konkreten Bedarf sinnvoll: LibreChat zum Kombinieren mehrerer Anbieter, AnythingLLM für Dokumente, SillyTavern für fiktionale Texte. Wenn Sie keinen besonderen Bedarf haben, beginnen Sie mit Open WebUI.
Ist Open WebUI wirklich kostenlos und open source?+
Der Code ist öffentlich zugänglich und kostenlos nutzbar, aber seine Lizenz ist keine reine MIT-Lizenz mehr: Sie enthält eine Klausel, die bei mehr als fünfzig Nutzern innerhalb von dreißig Tagen das Entfernen oder Ersetzen der Marke Open WebUI untersagt, sofern keine Genehmigung oder Enterprise-Lizenz vorliegt. Für die persönliche Nutzung oder die Nutzung in einem kleinen Team ändert sich nichts.
Ist Docker erforderlich, um ein Chat-Frontend zu installieren?+
Nicht immer. AnythingLLM bietet eine Desktop-Anwendung an, die wie ein gewöhnliches Programm installiert wird. Open WebUI und LibreChat werden meist über Docker installiert, was die Installation isoliert und Updates vereinfacht. Ohne Docker müssen Sie die Abhängigkeiten selbst verwalten, was mehr Zeit kostet und leichter zu Problemen führt.
Wie verbinde ich mein Frontend mit Ollama?+
Ollama stellt unter http://localhost:11434/v1/ eine OpenAI-kompatible API bereit und akzeptiert einen Dummy-Schlüssel. In einem Docker-Container bezeichnet localhost den Container: Verwenden Sie host.docker.internal wie im offiziellen Befehl von Open WebUI oder die IP-Adresse des Rechners und prüfen Sie, dass der Port nicht öffentlich erreichbar ist.
Kann ich ein Frontend mit meinem Team teilen?+
Ja, aber aktivieren Sie die Authentifizierung, bevor Sie die Adresse weitergeben, deaktivieren Sie die offene Registrierung und verwenden Sie HTTPS hinter einem Reverse Proxy. Open WebUI und LibreChat bieten Konten, Rollen und eine Anmeldung über LDAP oder OAuth. Prüfen Sie außerdem, ob der Server genug Speicher für gleichzeitige Anfragen hat, bevor Sie alle einladen.
Senden die Frontends meine Daten nach außen?+
Sie senden Ihre Anfragen an die konfigurierte API: Bei lokal betriebenem Ollama verlassen keine Daten Ihren Rechner. Einige erfassen jedoch zusätzlich selbst Daten: AnythingLLM gibt an, anonyme Nutzungstelemetrie zu erfassen. Lesen Sie die Dokumentation, deaktivieren Sie alles, was nicht erforderlich ist, und kontrollieren Sie in einer sensiblen Umgebung den ausgehenden Datenverkehr mit einer Firewall.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.