Perplexica: ein selbst gehostetes Perplexity mit Ihrem LLM lokal
Perplexity hat eine Nutzungsweise populär gemacht: eine Frage in natürlicher Sprache stellen und eine zusammenfassende Antwort mit Quellenangaben erhalten statt einer Liste blauer Links. Perplexica bildet genau diese Funktionsweise nach, aber bei Ihnen zu Hause: eine Open-Source-Websuchmaschine, die das Web über SearXNG durchsucht und anschließend die Antwort von Ihrem lokalen LLM unter Ollama verfassen lässt. Dieser Leitfaden zeigt, wie Sie den vollständigen Stack in Docker aufsetzen, erklärt die Suchmodi (die bekannten „focus“) und benennt ohne Beschönigung, was Sie gegenüber dem Original gewinnen und verlieren.
#Warum Perplexica anstatt Perplexity?
Perplexity ist ein hervorragendes Produkt, aber es ist ein Cloud-Dienst: Ihre Anfragen werden an den Anbieter gesendet, die kostenlose Version ist begrenzt, und Sie haben keine Kontrolle über das Modell, das die Texte verfasst. Perplexica kehrt dieses Prinzip um. Es ist ein Open-Source-Projekt (MIT-Lizenz, auf GitHub verfügbar), das drei Komponenten orchestriert, die Sie selbst hosten. Keine Anfrage verlässt Ihr Netzwerk, Sie müssen nichts bezahlen, und Sie wählen das Modell, das antwortet.
Der Nutzen ist nicht nur ideologischer Natur. Eine lokale Antwortmaschine kann Quellen abfragen, ohne durch Kontingente eingeschränkt zu werden, im Hintergrund in einem Homelab laufen und über ihre Schnittstelle anderen Tools als Recherchebaustein dienen. Dafür hängt die Qualität unmittelbar von Ihrem lokalen Modell und dem Zustand Ihrer SearXNG-Instanz ab – zwei Punkte, auf die dieser Leitfaden besonderen Wert legt.
#Der Stack Perplexica + SearXNG + Ollama
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Drei Bausteine, jeder mit einer klaren Aufgabe. Zu verstehen, welcher Baustein was übernimmt, erleichtert die Fehlersuche erheblich, wenn eine Antwort schlecht ist: Sie wissen dann, welchen der drei Sie überprüfen müssen.
- SearXNG
- Eine freie Metasuchmaschine, die Ergebnisse aus Dutzenden von Suchmaschinen (Google, Bing, DuckDuckGo, Wikipedia…) ohne Tracking zusammenführt. Sie übernimmt die eigentliche Suche im Web. Ohne sie funktioniert Perplexica nicht.
- Ollama
- Der Daemon, der Ihr lokales LLM unter http://localhost:11434 bereitstellt. Er verfasst die endgültige Antwort auf Grundlage der Quellen. Er stellt außerdem ein Embedding-Modell bereit, um die Textauszüge nach ihrer Relevanz zu ordnen.
- Perplexica
- Die zentrale Steuerung und die Weboberfläche. Perplexica formuliert die Frage um, steuert SearXNG, extrahiert die Inhalte der Seiten, verwaltet die Neusortierung anhand von Embeddings und stellt den endgültigen Prompt zusammen, der an Ollama gesendet wird.
#Voraussetzungen
Nichts Exotisches, aber bei Hardware und Versionen gibt es einige Punkte zu beachten.
- Docker + Docker Compose
- Der gesamte Stack wird in Containern bereitgestellt. Docker Desktop (Windows/Mac) oder Docker Engine mit dem Compose-Plugin (Linux) reichen aus. Dies ist die offiziell empfohlene Installationsmethode.
- Ollama installiert und gestartet
- Der Daemon muss laufen und erreichbar sein. Überprüfen Sie dies mit ollama list. Wenn Ollama auf dem Host-Rechner läuft und Perplexica in Docker, verwenden Sie die Adresse http://host.docker.internal:11434, nicht localhost.
- Ein Chatmodell
- Ein 7–8B-Modell in Q4_K_M (~5 GB VRAM) ist ein brauchbares Minimum; ein 14B-Modell (~9 GB) verfasst deutlich zuverlässigere Zusammenfassungen. Die Qualität der endgültigen Antwort hängt direkt von dieser Wahl ab.
- Ein Embeddings-Modell
- Leicht und schnell, beispielsweise nomic-embed-text. Es dient ausschließlich der internen Neusortierung, nicht der Texterstellung.
- ~5 GB Festplattenspeicher und etwas RAM
- Für Docker-Images (Perplexica + SearXNG) und den Cache. Die Modelle hingegen werden separat von Ollama verwaltet.
#Docker-Installation in 10 Minuten
Die offizielle Installation erfolgt über das Git-Repository des Projekts. Es enthält eine docker-compose.yaml, die sowohl Perplexica als auch eine dedizierte SearXNG-Instanz vorkonfiguriert. Sie müssen SearXNG nicht separat installieren: Docker Compose übernimmt das.
- 01Repository klonenLaden Sie das Projekt Perplexica von GitHub herunter und wechseln Sie in den Projektordner. Alle folgenden Schritte werden dort ausgeführt.
- 02Konfigurationsdatei erstellenDas Repository enthält die Vorlagendatei sample.config.toml. Kopieren Sie sie nach config.toml: Diese Datei liest Perplexica beim Start, um Ihre Backends zu ermitteln.
- 03Die Compose-Datei prüfenDie Datei docker-compose.yaml definiert drei Dienste: perplexica (die App), searxng und die erforderlichen Netzwerkkomponenten. Standardmäßig ist die Weboberfläche über Port 3000 erreichbar.
- 04Stack startendocker compose up erstellt beim ersten Start die Images und startet anschließend alles. Planen Sie beim ersten Mal einige Minuten für das Herunterladen und Erstellen der Images ein.
- 05Oberfläche öffnenÖffnen Sie http://localhost:3000. Wenn die Chatseite angezeigt wird, ist die Hälfte der Arbeit erledigt; jetzt müssen noch die Modelle angebunden werden.
#Ollama mit Perplexica verbinden
Es gibt zwei Möglichkeiten, die Modelle zu konfigurieren: über die Datei config.toml vor dem Start oder über den Einstellungsbildschirm der Weboberfläche danach. Für den Einstieg ist die Oberfläche einfacher; die Datei ist praktisch für eine reproduzierbare Bereitstellung.
Der kritische Punkt ist die Adresse von Ollama. Perplexica läuft in einem Container; für ihn bedeutet localhost den Container selbst, nicht Ihre Maschine. Wenn Ollama auf dem Host installiert ist, verwenden Sie host.docker.internal (Windows/Mac und Linux mit der richtigen Host-Option) anstelle von localhost.
- 01Einstellungen öffnenIn der Weboberfläche gelangen Sie über das Einstellungssymbol zur Auswahl der Modellanbieter. Wählen Sie Ollama als Anbieter.
- 02Ollama-URL eingebenGeben Sie die API-Adresse ein (host.docker.internal:11434 beim Zugriff aus Docker). Perplexica fragt dann Ollama ab und listet automatisch Ihre verfügbaren Modelle auf.
- 03Chat-Modell auswählenSelect the model that will draft the responses (e.g. qwen3.5:9b). This is the number 1 lever for quality.
- 04Modell für Embeddings auswählenWählen Sie nomic-embed-text (oder ein gleichwertiges Modell) für die erneute Rangordnung der Auszüge. Ohne gültige Embeddings ist die Sortierung der Quellen beeinträchtigt.
- 05Eine erste Frage stellenTesten Sie mit einer Frage zu einem aktuellen Sachverhalt. Wenn unter der Antwort nummerierte Quellen erscheinen, funktioniert die gesamte Verarbeitungskette.
#Fokus-Modi: akademisch, Videos, Reddit…
Das ist die charakteristische Funktion von Perplexica. Statt überall auf dieselbe Weise zu suchen, wählen Sie einen „focus mode“, der SearXNG auf einen bestimmten Quellentyp ausrichtet und die Art der Textgestaltung anpasst. Der richtige Modus verändert die Relevanz grundlegend.
- All Mode
- Standardmodus: allgemeine Suche im gesamten Web. Für offene Fragen ohne spezifischen Bereich geeignet.
- Academic Search
- Richtet die Suche auf wissenschaftliche Quellen und Forschungsartikel aus. Ideal für eine Literaturübersicht oder eine anspruchsvolle technische Frage.
- Writing Assistant
- Ein Modus ohne Webrecherche: Perplexica nutzt ausschließlich den LLM für die Erstellung oder Umformulierung von Inhalten. Geeignet, wenn externe Quellen nicht benötigt werden.
- YouTube Search
- Konzentriert sich auf Videos: Die Antwort stützt sich auf relevante YouTube-Inhalte und enthält die zugehörigen Links. Nützlich für Tutorials und Demonstrationen.
- Wolfram Alpha Search
- Für Fragen zu Berechnungen, Wissenschaft und Fakten: Die Antwort stützt sich auf Wolfram Alpha.
- Reddit Search
- Durchsucht Reddit-Diskussionen: Bewertungen, Erfahrungsberichte und Community-Debatten. Besonders hilfreich bei Meinungsfragen oder Fragen zu Produkten.
#Die tatsächliche Qualität der Antworten
Seien wir ehrlich: Mit einem kleinen lokalen Modell ist die Zusammenfassung weniger flüssig und weniger nuanciert als mit den Spitzenmodellen, auf denen Perplexity basiert. Aber die Pipeline zählt genauso viel wie das Modell. Drei Stellschrauben bestimmen das Endergebnis.
- Die Größe des Chatmodells
- Das ist der entscheidende Faktor. Ein 7–8B-Modell verfasst korrekte, aber manchmal oberflächliche Antworten; ein 14B-Modell befolgt Anweisungen zu Quellenangaben besser und fasst Inhalte sauberer zusammen. Bei noch größeren Modellen kommt ein 32B-Modell (~19 GB VRAM) einem überzeugenden Nutzungserlebnis nahe.
- Der Betriebszustand von SearXNG
- Wenn Suchmaschinen blockiert sind oder ihr Anfragelimit erreicht haben, liefert SearXNG nur wenige Ergebnisse, und die Antwort verliert entsprechend an Substanz. Eine inhaltsarme Antwort liegt häufig an fehlenden Quellen, nicht am LLM.
- Verfügbares Kontextvolumen
- Perplexica fügt Auszüge aus mehreren Seiten in den Prompt ein. Ein Modell mit kurzem Kontextfenster schneidet die Quellen ab und verliert Informationen. Bevorzugen Sie ein Modell mit ausreichend großem Kontextfenster (mindestens 8k, wenn möglich mehr).
#Im Vergleich zu Perplexity: Was man verliert, was man gewinnt
Perplexica ist kein perfekter Klon, und das zu behaupten wäre unehrlich. Hier folgt eine realistische Abwägung, damit Sie entscheiden können, ob sich der Aufwand in Ihrem Fall lohnt.
- Vorteil — Datenschutz
- Keine Anfrage verlässt Ihr Netzwerk. Weder das Thema Ihrer Recherchen noch die Antworten werden über Dritte geleitet. Für die Beobachtung sensibler Themen ist das entscheidend.
- Vorteile — Kosten und Kontingente
- Nichts zu bezahlen, keine Begrenzung der Anfragen. Sie können so viele Suchanfragen starten, wie Ihre Hardware bewältigt, und das Tool ohne API-Rechnung in andere Tools integrieren.
- Man gewinnt — Kontrolle
- Sie wählen das Modell und die über SearXNG abgefragten Suchmaschinen und können das gesamte System dauerhaft in einem Homelab selbst hosten.
- Was verloren geht — sprachliche Feinheit
- Die Cloud-Modelle von Perplexity sind größer und leistungsfähiger. Mit bescheidener Hardware fallen lokale Zusammenfassungen blasser aus und enthalten mehr Ungenauigkeiten.
- Was verloren geht – die Zuverlässigkeit einer sofort einsatzbereiten Lösung
- Perplexity kümmert sich für Sie um die Infrastruktur. Bei Ihrer eigenen Installation müssen Sie selbst die Ursache finden und das Problem beheben, wenn SearXNG an ein Rate-Limit stößt oder Ollama den VRAM vollständig belegt.
- Man verliert — einige Funktionen
- Keine ausgereifte mobile App, keine ebenso ausgereifte mehrstufige Pro Search, keine proprietären Integrationen. Perplexica deckt das Wesentliche ab, bietet aber nicht den gesamten Komfort des kommerziellen Produkts.
#Behebung häufiger Probleme
- Perplexica erkennt Ollama nicht
- Fast immer liegt es an der Adresse. Wenn Sie aus einem Docker-Container zugreifen, ersetzen Sie localhost durch host.docker.internal (und fügen Sie unter Linux extra_hosts mit host-gateway hinzu). Prüfen Sie, ob Ollama auf Verbindungen lauscht, und lassen Sie bei Bedarf Verbindungen von außerhalb von localhost zu.
- Keine Quellen in den Antworten
- SearXNG liefert nichts zurück. Öffnen Sie direkt die SearXNG-Oberfläche, um eine Suche zu testen: Wenn sie fehlschlägt, sind einige Suchmaschinen blockiert oder ihre Anfragelimits sind erreicht. Verringern Sie die Anzahl der aktiven Suchmaschinen oder warten Sie.
- Die Liste der Modelle ist leer
- Perplexica fragt Ollama beim Laden der Einstellungen ab. Wenn die Liste leer ist, ist die API-URL falsch oder Ollama verfügt über kein Modell. Prüfen Sie das mit ollama list auf dem Host.
- Sehr langsame Antworten
- Das Chatmodell ist wahrscheinlich zu groß für Ihren VRAM und wird teilweise auf der CPU ausgeführt. Wechseln Sie zu einer leichteren Quantisierung (Q4_K_M) oder zu einem kleineren Modell; prüfen Sie, ob die GPU tatsächlich genutzt wird.
- Fehler bei den Embeddings
- Das Embedding-Modell ist nicht ausgewählt oder wurde nicht heruntergeladen. Führen Sie ollama pull nomic-embed-text aus und wählen Sie es ausdrücklich in den Einstellungen aus.
- Der Port 3000 ist bereits belegt
- Ein anderer Dienst belegt den Port. Ändern Sie die Portzuordnung in docker-compose (z. B. 3001:3000) und laden Sie den Stack neu.
#Weiterführende Informationen
Perplexica ist nur so gut wie das Modell und die Infrastruktur, die es tragen. Diese Anleitungen stärken die Grundlagen, auf denen es basiert.
- Ollama, was ist das und wie funktioniert es?
- Der Daemon, der Ihr Chatmodell und Ihre Embeddings über Port 11434 bereitstellt – der Baustein, von dem die gesamte Qualität der Texterstellung abhängt.
- Quantisierung wählen
- Q4_K_M, Q5_K_M, Q8_0: den Kompromiss zwischen VRAM-Bedarf und Qualität verstehen, um das passende Modell zur Zusammenfassung für Ihre Grafikkarte auszuwählen.
- AnythingLLM: Produktionsreifes RAG lokal
- Um über die Websuche hinauszugehen und ein RAG-System auf Basis Ihrer eigenen Dokumente aufzubauen, mit demselben Ollama-Backend.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.