Die Frontends von chat
Für ein lokales LLM ist Open WebUI die Standardwahl: eine Oberfläche ähnlich wie bei ChatGPT, Ollama mit einem einzigen Docker-Befehl angebunden, Konten und Rollen inklusive. LibreChat eignet sich, wenn ein Team lokale Anbieter und Cloud-Anbieter kombiniert, AnythingLLM, wenn Dokumente abgefragt werden sollen, und SillyTavern für Rollenspiele. Achtung: Die Lizenz von Open WebUI ist keine einfache MIT-Lizenz mehr, und bei mehr als 50 Nutzern gilt eine Markenklausel.
Ollama, LM Studio oder llama.cpp führen das Modell aus, aber keines dieser Programme bietet das Erlebnis eines echten Mehrbenutzer-Chats mit Gesprächsverlauf, Dokumenten und Konten. Das ist die Aufgabe eines Frontends. Dieser Leitfaden vergleicht fünf Open-Source-Oberflächen anhand überprüfbarer Kriterien: Lizenz, Authentifizierung, Dokumentverwaltung, unterstützte Anbieter und Einrichtungsaufwand.
#Was genau ist ein Frontend?
Ein Frontend ist eine Web- oder Desktop-Oberfläche, die mit einem Inferenzserver kommuniziert: Ollama, LM Studio, llama-server, vLLM oder einer Cloud-API. Es verwaltet den Gesprächsverlauf, die Markdown-Anzeige, die Benutzerkonten, das Hochladen von Dateien und manchmal auch die Suche in Ihren Dokumenten sowie Agenten. Es führt das Modell nicht selbst aus: Wenn der dahinterliegende Server gestoppt oder überlastet ist, kann die Oberfläche nichts daran ändern.
Die Verbindung erfolgt fast immer über eine OpenAI-kompatible API. Ollama stellt seine eigene unter http://localhost:11434/v1/ bereit und akzeptiert jeden beliebigen Dummy-Schlüssel. Dadurch lassen sich nahezu alle Frontends ohne spezielle Konfiguration anbinden. Merken Sie sich: Mit der Wahl eines Frontends legen Sie sich nicht auf eine Inferenz-Engine fest, und Sie können eines von beiden wechseln, ohne das andere neu einzurichten.
#Der Vergleich in einer Tabelle
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Die folgenden Kriterien entscheiden tatsächlich über eine Bereitstellung: Lizenz (sie bestimmt, ob eine kommerzielle Nutzung möglich ist), Authentifizierung (sie bestimmt, ob eine gemeinsame Nutzung möglich ist), Dokumente (sie bestimmen die Nutzung im Unternehmen) und Installationsaufwand. Die GitHub-Sternzahlen, erhoben am 30. September 2026, messen nur die Beliebtheit, nicht die Qualität.
| Frontend | Lizenz | GitHub-Sterne | Konten und Rollen | Stärken | Installationsaufwand |
|---|---|---|---|---|---|
| Open WebUI | Modifizierte BSD-Lizenz mit Markenklausel (siehe unten) | etwa 154.000 | Rollen, Gruppen, LDAP, SSO, SCIM | Native Ollama-Unterstützung, RAG, Plugins, Offline-Modus | Docker, ein Befehl |
| LibreChat | MIT | etwa 45.000 | OAuth2, LDAP, E-Mail, Admin-Panel | Mehrere Anbieter, Presets, Agenten | Docker Compose |
| AnythingLLM | MIT | etwa 66.000 | Multi-utilisateurs | Dokumente, Arbeitsbereiche, Agenten, Desktop-Anwendung | Desktop-Anwendung oder Docker |
| SillyTavern | AGPL-3.0 | etwa 34.000 | Hauptsächlich für den privaten Gebrauch | Charaktere, Lorebooks, Feinabstimmung | Node.js oder Docker |
| Big-AGI | MIT | etwa 7.000 | Wenig auf Teams ausgerichtet | Personas, Beam mit mehreren Modellen, Bilder, Stimme | Webanwendung, die bereitgestellt werden muss |
#Die Lizenz von Open WebUI: das Detail, das viele falsch wiedergeben
Viele Vergleiche, darunter die frühere Version dieses Leitfadens, stellen Open WebUI als Projekt unter der MIT-Lizenz dar. Das ist nicht mehr korrekt. Die Datei LICENSE im Repository enthält eine BSD-artige Lizenz mit drei Klauseln, ergänzt um eine vierte Klausel: Diese verbietet es, die Marke „Open WebUI“ (Name, Logo, visuelle Erkennungsmerkmale) zu ändern, zu entfernen oder zu ersetzen, es sei denn, die Bereitstellung überschreitet in einem gleitenden Zeitraum von dreißig Tagen nicht fünfzig Benutzer, Sie haben eine schriftliche Genehmigung des Rechteinhabers oder Sie verfügen über eine Unternehmenslizenz.
Was das in der Praxis ändert. Persönliche Nutzung, Familie, kleines Team: nichts. Bei einem Einsatz für mehr als fünfzig Nutzer mit eigenem Erscheinungsbild (Firmenlogo, Produktname) benötigen Sie eine Genehmigung oder eine Unternehmenslizenz, oder Sie müssen die Marke beibehalten. Die Benutzeroberfläche unverändert und mit sichtbarer Marke zu nutzen, bleibt möglich. Wenn Sie einen Einsatz in großem Maßstab planen, lesen Sie die Datei LICENSE und deren Änderungshistorie im Repository und lassen Sie beides von der für Lizenzen zuständigen Person prüfen.
#Open WebUI : Standardwahl mit Ollama
Open WebUI beschreibt sich als eine selbst gehostete, erweiterbare KI-Plattform, die vollständig offline funktionieren kann und Ollama sowie OpenAI-kompatible APIs unterstützt. Der Hauptvorteil für Anfänger ist der einfache Einstieg: ein einziger Docker-Befehl, dann ein Browser. Open WebUI bietet lokales RAG auf Basis mehrerer Vektordatenbanken, eine differenzierte Verwaltung von Rollen und Gruppen sowie Authentifizierung für Unternehmen (LDAP, Active Directory, SSO, SCIM).
Öffnen Sie anschließend http://localhost:3000 und erstellen Sie das erste Konto, das zum Administratorkonto wird. Wenn Ollama auf einem anderen Server läuft, gibt die README an, dass die Variable OLLAMA_BASE_URL gesetzt werden muss. Das Volume open-webui bewahrt Ihre Daten: Ohne dieses Volume werden bei jeder Neuerstellung des Containers der Verlauf und die Konten gelöscht.
Diese Einschränkungen sollten Sie kennen: Die Oberfläche bietet viele Funktionen und wirkt manchmal überladen, jede zusätzliche Funktion bringt einen weiteren Bereich mit sich, der konfiguriert und aktualisiert werden muss, und die oben beschriebene Klausel zur Markenverwendung betrifft größere Bereitstellungen.
#LibreChat: mehrere Anbieter in einer einzigen Benutzeroberfläche
LibreChat richtet sich an Teams, die eine einzige Oberfläche für mehrere Anbieter wünschen: Sein Repository nennt Anthropic, OpenAI, Azure, Groq, Mistral, OpenRouter, Vertex AI und Gemini, mit Voreinstellungen, einem Administrationsbereich und einer Authentifizierung für mehrere Benutzer über OAuth2, LDAP oder E-Mail. Das Projekt steht unter der MIT-Lizenz, ohne Bedingungen zur Markenverwendung.
Typischer Fall: Ein Team möchte Ollama intern einsetzen, behält aber für bestimmte Anfragen den Zugang zu einem Cloud-Anbieter – mit einer einzigen Oberfläche und überwachten Kontingenten. Der Nachteil: Die Bereitstellung erfolgt über Docker Compose mit mehreren Diensten, und die Ausrichtung „lokal zuerst“ ist weniger ausgeprägt als bei Open WebUI.
#AnythingLLM: Wenn das Ziel darin besteht, mit Ihren Dokumenten zu sprechen
AnythingLLM präsentiert sich als All-in-One-Anwendung, mit der man mit eigenen Dokumenten chatten und Agenten nutzen kann – auch im Mehrbenutzermodus und ohne aufwendige Konfiguration. Seine Stärke liegt in der Organisation in Arbeitsbereichen (einer pro Projekt, Kunde oder Thema) und in der Verfügbarkeit einer Desktop-Anwendung für Mac, Windows und Linux: Man installiert sie wie ein gewöhnliches Programm, ohne Docker. Die Lizenz ist MIT.
Zu beachten: Die README weist darauf hin, dass die Anwendung eine Telemetriefunktion enthält, die anonyme Nutzungsinformationen erfasst. Wenn Sie einen strikt offline betriebenen Einsatz oder die Vertraulichkeit einer sensiblen Umgebung gewährleisten müssen, deaktivieren Sie diese Datenerfassung in den Einstellungen, bevor Sie irgendwelche Daten anbinden, und prüfen Sie, welche Daten tatsächlich das Netzwerk verlassen.
#SillyTavern: Rollenspiel und Fiktion
SillyTavern ist für Rollenspiele und interaktive Fiktion konzipiert. Im Repository wird es als einheitliche Oberfläche für zahlreiche LLM-APIs beschrieben (KoboldAI/CPP, Horde, NovelAI, Ooba, Tabby, OpenAI, OpenRouter, Claude, Mistral und andere), mit Visual-Novel-Modus, Lorebooks (WorldInfo), Bildgenerierung, Sprachsynthese und Erweiterungen von Drittanbietern. Es steht unter der Lizenz AGPL-3.0, die bei der Nutzung als Dienst strengere Anforderungen stellt.
Es ist nicht als Ersatz für einen professionellen Chat gedacht: Die Benutzeroberfläche ist dicht mit Funktionen bestückt und auf Charaktere ausgerichtet, nicht auf Unternehmenskonten. Für den beruflichen Einsatz sollten Sie es ausschließen. Für kreatives Schreiben mit fein abgestimmten Sampling-Einstellungen ist es die umfassendste Lösung.
#Big-AGI: Produktivität mit mehreren Modellen
Big-AGI ist eine KI-Suite zum Selbsthosten unter der MIT-Lizenz. Das Repository hebt Personas, Beam-Unterhaltungen mit mehreren Modellen, Bildgenerierung, Sprachfunktionen, PDF-Import und die Bereitstellung vor Ort hervor. Mit etwa 7.000 GitHub-Sternen ist die Community deutlich kleiner als die von Open WebUI oder AnythingLLM: Rechnen Sie mit weniger Tutorials, weniger fertigen Antworten bei Problemen und einer stärkeren Abhängigkeit von einer kleinen Anzahl von Maintainerinnen und Maintainern.
#Was kein Frontend löst: die gleichzeitige Nutzung durch mehrere Benutzer
Wenn Sie fünf Kollegen Zugriff auf die Oberfläche geben, wird der Rechner dadurch nicht fünfmal leistungsfähiger. Jedes Frontend sendet seine Anfragen an dieselbe Engine, die sie verarbeitet. Laut der FAQ von Ollama verarbeitet ein Modell standardmäßig jeweils nur eine Anfrage (OLLAMA_NUM_PARALLEL hat den Wert 1); weitere Anfragen werden in eine Warteschlange aufgenommen, standardmäßig bis zu 512. Ist diese Grenze erreicht, werden weitere Anfragen abgewiesen.
Parallele Verarbeitung zuzulassen erhöht unmittelbar den Speicherbedarf. Laut Dokumentation wächst der benötigte Speicher proportional zum Produkt aus der Anzahl paralleler Anfragen und der Kontextlänge: Bei einem Kontext von 2.000 Tokens und 4 parallelen Anfragen wird Speicher für das Äquivalent von 8.000 Tokens reserviert. Bei einem Modell mit 27 Milliarden Parametern, das bereits nahe an der Speichergrenze der Grafikkarte liegt, kann die parallele Verarbeitung diese Grenze überschreiten und einen Teil des Modells auf die CPU verlagern, wodurch es für alle langsamer wird.
| Kontext pro Anfrage | Parallelanfragen | Zugewiesener Gesamtkontext | Was das bedeutet |
|---|---|---|---|
| 4 000 Tokens | 1 | 4 000 | Standardkonfiguration mit dem geringsten Speicherbedarf |
| 4 000 Tokens | 4 | 16 000 | Viermal so viel Kontextspeicher |
| 32 000 Tokens | 4 | 128 000 | Nur für Rechner mit viel Speicher |
Die Faustregel: Legen Sie die Kapazität der Inferenz-Engine fest, bevor Sie sich um die Benutzeroberfläche kümmern. Bei mehr als nur wenigen gleichzeitig aktiven Nutzern ist ein auf Durchsatz ausgelegter Server wie vLLM oder SGLang ein sinnvoller Ersatz für Ollama hinter demselben Frontend, da alle dieselbe OpenAI-kompatible API verwenden.
#Welches Frontend für welches Nutzerprofil
| Ihre Situation | Empfohlene Wahl | Warum | Was zu überprüfen ist |
|---|---|---|---|
| Sie steigen gerade ein, Ollama ist bereits installiert | Open WebUI | Ein Docker-Befehl, vertraute Oberfläche | Markenbedingung, wenn Sie mehr als 50 Benutzer haben |
| Team, das lokale und cloudbasierte Lösungen kombiniert | LibreChat | Unterstützung mehrerer Anbieter, MIT, Administration | Die Bereitstellungszeit von Docker Compose |
| Chat auf Grundlage einer Dokumentensammlung | AnythingLLM | Arbeitsbereiche, Desktopanwendung | Die zu deaktivierende Telemetrie |
| Rollenspiel und kreatives Schreiben | SillyTavern | Charaktere, Lorebücher, Sampling | Die AGPL-3.0-Lizenz, wenn Sie die Software als Dienst anbieten |
| Persönlicher Gebrauch mit mehreren Modellen nebeneinander | Big-AGI | Beam mit mehreren Modellen, Personas | Die Größe der Community |
#Bevor Sie den Zugang für andere Personen öffnen
Ein Frontend, das auf Ihrem Rechner funktioniert, ist noch nicht für die Nutzung durch ein Team bereit. Drei Prüfungen sind erforderlich, bevor Sie die Adresse weitergeben. Erstens: Aktivieren Sie die Authentifizierung und deaktivieren Sie die offene Registrierung, sonst kann jeder im Netzwerk ein Konto erstellen. Zweitens: Platzieren Sie den Dienst hinter einem Reverse-Proxy mit HTTPS, insbesondere wenn der Datenverkehr das lokale Netzwerk verlässt. Drittens: Machen Sie den Port der Inferenz-Engine (11434 bei Ollama) niemals direkt zugänglich, da die Engine keine native Authentifizierung bietet.
Diese Punkte werden in den Leitfäden zur Sicherheit und zur Freigabe im Netzwerk ausführlich erläutert. Wenn Sie einen Rechner allein nutzen, benötigt das Frontend all das nicht. Es lohnt sich aber, sich von Anfang an anzugewöhnen, zu prüfen, welche Dienste auf Netzwerkverbindungen lauschen.
#Ein Frontend in dreißig Minuten testen
- 01Die Engine anbindenStarten Sie das Frontend und verbinden Sie es über die OpenAI-kompatible URL mit Ihrer Inferenz-Engine. Prüfen Sie, ob eine einfache Unterhaltung funktioniert, bevor Sie weitere Einstellungen vornehmen.
- 02Ein echtes Dokument sendenLaden Sie ein PDF aus Ihrem Tätigkeitsbereich hoch, kein Demo-Beispiel, und stellen Sie drei Fragen, deren Antworten Sie kennen.
- 03Ein zweites Konto erstellenTesten Sie die Registrierung, die Rollen und den Zugriff auf die Chats eines anderen Benutzers: Dort unterscheiden sich die Frontends am meisten.
- 04Das Netzwerk beobachtenPrüfen Sie während eines Gesprächs die ausgehenden Verbindungen der Anwendung. Es darf nichts an einen Dienst gesendet werden, den Sie nicht ausgewählt haben.
- 05EntscheidenBehalten Sie das Frontend, dessen Ergebnis zuverlässig ist, dessen Lizenz zu Ihrer Nutzung passt und das Sie auch in sechs Monaten noch aktualisieren können.
- Den eigenen Ollama-Server absichern
- Open WebUI mit Ollama: der komplette Guide
- LibreChat: webbasierte, mehrbenutzerfähige Schnittstelle
- Quelle: Repository Open WebUI
- Quelle: LibreChat-Repository
- Quelle: AnythingLLM-Repository
- Quelle: Ollama-Dokumentation, OpenAI-Kompatibilität
Welches ist das beste Frontend für Ollama?+
Ist Open WebUI wirklich kostenlos und open source?+
Ist Docker erforderlich, um ein Chat-Frontend zu installieren?+
Wie verbinde ich mein Frontend mit Ollama?+
Kann ich ein Frontend mit meinem Team teilen?+
Senden die Frontends meine Daten nach außen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.