Mittelstufe 11 Min.Web-Suche

Perplexica: ein selbst gehostetes Perplexity mit Ihrem LLM lokal

Perplexity hat eine Nutzungsweise populär gemacht: eine Frage in natürlicher Sprache stellen und eine zusammenfassende Antwort mit Quellenangaben erhalten statt einer Liste blauer Links. Perplexica bildet genau diese Funktionsweise nach, aber bei Ihnen zu Hause: eine Open-Source-Websuchmaschine, die das Web über SearXNG durchsucht und anschließend die Antwort von Ihrem lokalen LLM unter Ollama verfassen lässt. Dieser Leitfaden zeigt, wie Sie den vollständigen Stack in Docker aufsetzen, erklärt die Suchmodi (die bekannten „focus“) und benennt ohne Beschönigung, was Sie gegenüber dem Original gewinnen und verlieren.

Von Thomas P.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
i
Kurz gesagt
Perplexica bildet Perplexity lokal nach: Es durchsucht das Web über SearXNG und lässt anschließend Ihr Ollama-LLM die Antwort mit Quellenangaben verfassen. · Der Stack besteht aus drei Bausteinen (SearXNG, Ollama, Perplexica) und lässt sich mit Docker in etwa zehn Minuten installieren. · Sie benötigen zwei Ollama-Modelle: ein Chat-Modell (7–14B) zum Verfassen der Antworten und ein Embedding-Modell wie nomic-embed-text zum Einordnen der Quellen. · Open-Source-Projekt (MIT-Lizenz), keine Anfrage verlässt Ihr Netzwerk.

#Warum Perplexica anstatt Perplexity?

Perplexity ist ein hervorragendes Produkt, aber es ist ein Cloud-Dienst: Ihre Anfragen werden an den Anbieter gesendet, die kostenlose Version ist begrenzt, und Sie haben keine Kontrolle über das Modell, das die Texte verfasst. Perplexica kehrt dieses Prinzip um. Es ist ein Open-Source-Projekt (MIT-Lizenz, auf GitHub verfügbar), das drei Komponenten orchestriert, die Sie selbst hosten. Keine Anfrage verlässt Ihr Netzwerk, Sie müssen nichts bezahlen, und Sie wählen das Modell, das antwortet.

Der Nutzen ist nicht nur ideologischer Natur. Eine lokale Antwortmaschine kann Quellen abfragen, ohne durch Kontingente eingeschränkt zu werden, im Hintergrund in einem Homelab laufen und über ihre Schnittstelle anderen Tools als Recherchebaustein dienen. Dafür hängt die Qualität unmittelbar von Ihrem lokalen Modell und dem Zustand Ihrer SearXNG-Instanz ab – zwei Punkte, auf die dieser Leitfaden besonderen Wert legt.

i
Was Perplexica tatsächlich tut
Sie stellen eine Frage. Perplexica formuliert Ihre Anfrage um, führt sie über SearXNG aus, ruft die besten Ergebnisse ab, extrahiert daraus die relevanten Inhalte und bittet anschließend Ihr LLM, eine Zusammenfassung mit Verweisen auf die nummerierten Quellen zu verfassen. Das ist eine RAG-Pipeline, die in Echtzeit auf das Web angewendet wird.

#Der Stack Perplexica + SearXNG + Ollama

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Drei Bausteine, jeder mit einer klaren Aufgabe. Zu verstehen, welcher Baustein was übernimmt, erleichtert die Fehlersuche erheblich, wenn eine Antwort schlecht ist: Sie wissen dann, welchen der drei Sie überprüfen müssen.

SearXNG
Eine freie Metasuchmaschine, die Ergebnisse aus Dutzenden von Suchmaschinen (Google, Bing, DuckDuckGo, Wikipedia…) ohne Tracking zusammenführt. Sie übernimmt die eigentliche Suche im Web. Ohne sie funktioniert Perplexica nicht.
Ollama
Der Daemon, der Ihr lokales LLM unter http://localhost:11434 bereitstellt. Er verfasst die endgültige Antwort auf Grundlage der Quellen. Er stellt außerdem ein Embedding-Modell bereit, um die Textauszüge nach ihrer Relevanz zu ordnen.
Perplexica
Die zentrale Steuerung und die Weboberfläche. Perplexica formuliert die Frage um, steuert SearXNG, extrahiert die Inhalte der Seiten, verwaltet die Neusortierung anhand von Embeddings und stellt den endgültigen Prompt zusammen, der an Ollama gesendet wird.
→
Zwei Modelle, nicht eines
Perplexica benötigt zwei unterschiedliche Modelle: ein Chat-Modell (das Texte verfasst) und ein Embedding-Modell (das die Ähnlichkeit misst, um die Textauszüge zu sortieren). Planen Sie ein, beide in Ollama herunterzuladen, bevor Sie die Anwendung konfigurieren.

#Voraussetzungen

Nichts Exotisches, aber bei Hardware und Versionen gibt es einige Punkte zu beachten.

Docker + Docker Compose
Der gesamte Stack wird in Containern bereitgestellt. Docker Desktop (Windows/Mac) oder Docker Engine mit dem Compose-Plugin (Linux) reichen aus. Dies ist die offiziell empfohlene Installationsmethode.
Ollama installiert und gestartet
Der Daemon muss laufen und erreichbar sein. Überprüfen Sie dies mit ollama list. Wenn Ollama auf dem Host-Rechner läuft und Perplexica in Docker, verwenden Sie die Adresse http://host.docker.internal:11434, nicht localhost.
Ein Chatmodell
Ein 7–8B-Modell in Q4_K_M (~5 GB VRAM) ist ein brauchbares Minimum; ein 14B-Modell (~9 GB) verfasst deutlich zuverlässigere Zusammenfassungen. Die Qualität der endgültigen Antwort hängt direkt von dieser Wahl ab.
Ein Embeddings-Modell
Leicht und schnell, beispielsweise nomic-embed-text. Es dient ausschließlich der internen Neusortierung, nicht der Texterstellung.
~5 GB Festplattenspeicher und etwas RAM
Für Docker-Images (Perplexica + SearXNG) und den Cache. Die Modelle hingegen werden separat von Ollama verwaltet.
Terminal
# Récupérer les deux modèles nécessaires côté Ollama
ollama pull qwen3.5:9b         # modèle de chat (rédaction)
ollama pull nomic-embed-text   # modèle d'embeddings (reclassement)

# Vérifier qu'ils sont bien là et qu'Ollama répond
ollama list

#Docker-Installation in 10 Minuten

Die offizielle Installation erfolgt über das Git-Repository des Projekts. Es enthält eine docker-compose.yaml, die sowohl Perplexica als auch eine dedizierte SearXNG-Instanz vorkonfiguriert. Sie müssen SearXNG nicht separat installieren: Docker Compose übernimmt das.

  1. 01
    Repository klonen
    Laden Sie das Projekt Perplexica von GitHub herunter und wechseln Sie in den Projektordner. Alle folgenden Schritte werden dort ausgeführt.
  2. 02
    Konfigurationsdatei erstellen
    Das Repository enthält die Vorlagendatei sample.config.toml. Kopieren Sie sie nach config.toml: Diese Datei liest Perplexica beim Start, um Ihre Backends zu ermitteln.
  3. 03
    Die Compose-Datei prüfen
    Die Datei docker-compose.yaml definiert drei Dienste: perplexica (die App), searxng und die erforderlichen Netzwerkkomponenten. Standardmäßig ist die Weboberfläche über Port 3000 erreichbar.
  4. 04
    Stack starten
    docker compose up erstellt beim ersten Start die Images und startet anschließend alles. Planen Sie beim ersten Mal einige Minuten für das Herunterladen und Erstellen der Images ein.
  5. 05
    Oberfläche öffnen
    Öffnen Sie http://localhost:3000. Wenn die Chatseite angezeigt wird, ist die Hälfte der Arbeit erledigt; jetzt müssen noch die Modelle angebunden werden.
Terminal
# 1. Cloner le projet officiel
git clone https://github.com/ItzCrazyKns/Perplexica.git
cd Perplexica

# 2. Préparer la config à partir du modèle fourni
cp sample.config.toml config.toml

# 3. Construire et démarrer toute la stack (Perplexica + SearXNG)
docker compose up -d

# 4. Suivre les logs si besoin
docker compose logs -f perplexica
!
Prüfen Sie den genauen Namen der Compose-Datei
Je nach Version des Repositorys kann die Datei docker-compose.yaml oder docker-compose.yml heißen und der nach außen zugängliche Dienst einen leicht anderen Namen haben. Verlassen Sie sich auf die README-Datei des geklonten Repositorys, nicht auf einen auswendig gelernten Befehl: Das Projekt entwickelt sich schnell.

#Ollama mit Perplexica verbinden

Es gibt zwei Möglichkeiten, die Modelle zu konfigurieren: über die Datei config.toml vor dem Start oder über den Einstellungsbildschirm der Weboberfläche danach. Für den Einstieg ist die Oberfläche einfacher; die Datei ist praktisch für eine reproduzierbare Bereitstellung.

Der kritische Punkt ist die Adresse von Ollama. Perplexica läuft in einem Container; für ihn bedeutet localhost den Container selbst, nicht Ihre Maschine. Wenn Ollama auf dem Host installiert ist, verwenden Sie host.docker.internal (Windows/Mac und Linux mit der richtigen Host-Option) anstelle von localhost.

config.toml
# Extrait de configuration côté Ollama
# Depuis un conteneur, on ne peut PAS utiliser localhost pour joindre l'hôte
[MODELS.OLLAMA]
API_URL = "http://host.docker.internal:11434"

# Sur une machine Linux, si host.docker.internal ne résout pas,
# ajoutez dans docker-compose : extra_hosts: ["host.docker.internal:host-gateway"]
  1. 01
    Einstellungen öffnen
    In der Weboberfläche gelangen Sie über das Einstellungssymbol zur Auswahl der Modellanbieter. Wählen Sie Ollama als Anbieter.
  2. 02
    Ollama-URL eingeben
    Geben Sie die API-Adresse ein (host.docker.internal:11434 beim Zugriff aus Docker). Perplexica fragt dann Ollama ab und listet automatisch Ihre verfügbaren Modelle auf.
  3. 03
    Chat-Modell auswählen
    Select the model that will draft the responses (e.g. qwen3.5:9b). This is the number 1 lever for quality.
  4. 04
    Modell für Embeddings auswählen
    Wählen Sie nomic-embed-text (oder ein gleichwertiges Modell) für die erneute Rangordnung der Auszüge. Ohne gültige Embeddings ist die Sortierung der Quellen beeinträchtigt.
  5. 05
    Eine erste Frage stellen
    Testen Sie mit einer Frage zu einem aktuellen Sachverhalt. Wenn unter der Antwort nummerierte Quellen erscheinen, funktioniert die gesamte Verarbeitungskette.
→
Ollama und Perplexica in derselben Docker-Compose-Konfiguration
Sie können Ollama auch als Dienst in docker-compose hinzufügen, um alles zusammenzuhalten. In diesem Fall lautet die URL http://ollama:11434 (ollama ist der Dienstname), und Sie benötigen host.docker.internal nicht mehr.

#Fokus-Modi: akademisch, Videos, Reddit…

Das ist die charakteristische Funktion von Perplexica. Statt überall auf dieselbe Weise zu suchen, wählen Sie einen „focus mode“, der SearXNG auf einen bestimmten Quellentyp ausrichtet und die Art der Textgestaltung anpasst. Der richtige Modus verändert die Relevanz grundlegend.

All Mode
Standardmodus: allgemeine Suche im gesamten Web. Für offene Fragen ohne spezifischen Bereich geeignet.
Academic Search
Richtet die Suche auf wissenschaftliche Quellen und Forschungsartikel aus. Ideal für eine Literaturübersicht oder eine anspruchsvolle technische Frage.
Writing Assistant
Ein Modus ohne Webrecherche: Perplexica nutzt ausschließlich den LLM für die Erstellung oder Umformulierung von Inhalten. Geeignet, wenn externe Quellen nicht benötigt werden.
YouTube Search
Konzentriert sich auf Videos: Die Antwort stützt sich auf relevante YouTube-Inhalte und enthält die zugehörigen Links. Nützlich für Tutorials und Demonstrationen.
Wolfram Alpha Search
Für Fragen zu Berechnungen, Wissenschaft und Fakten: Die Antwort stützt sich auf Wolfram Alpha.
Reddit Search
Durchsucht Reddit-Diskussionen: Bewertungen, Erfahrungsberichte und Community-Debatten. Besonders hilfreich bei Meinungsfragen oder Fragen zu Produkten.
i
Der Fokus wirkt auf SearXNG, nicht auf das Modell
Ein Moduswechsel beeinflusst vor allem, welche Quellen SearXNG abfragt und wie Perplexica sie filtert. Der LLM selbst bleibt unverändert: Es ist weiterhin Ihr Ollama-Modell, das den Text verfasst. Ein ungeeigneter Modus liefert schlechte Quellen, und keine noch so brillante Synthese kann thematisch unpassende Quellen ausgleichen.

#Die tatsächliche Qualität der Antworten

Seien wir ehrlich: Mit einem kleinen lokalen Modell ist die Zusammenfassung weniger flüssig und weniger nuanciert als mit den Spitzenmodellen, auf denen Perplexity basiert. Aber die Pipeline zählt genauso viel wie das Modell. Drei Stellschrauben bestimmen das Endergebnis.

Die Größe des Chatmodells
Das ist der entscheidende Faktor. Ein 7–8B-Modell verfasst korrekte, aber manchmal oberflächliche Antworten; ein 14B-Modell befolgt Anweisungen zu Quellenangaben besser und fasst Inhalte sauberer zusammen. Bei noch größeren Modellen kommt ein 32B-Modell (~19 GB VRAM) einem überzeugenden Nutzungserlebnis nahe.
Der Betriebszustand von SearXNG
Wenn Suchmaschinen blockiert sind oder ihr Anfragelimit erreicht haben, liefert SearXNG nur wenige Ergebnisse, und die Antwort verliert entsprechend an Substanz. Eine inhaltsarme Antwort liegt häufig an fehlenden Quellen, nicht am LLM.
Verfügbares Kontextvolumen
Perplexica fügt Auszüge aus mehreren Seiten in den Prompt ein. Ein Modell mit kurzem Kontextfenster schneidet die Quellen ab und verliert Informationen. Bevorzugen Sie ein Modell mit ausreichend großem Kontextfenster (mindestens 8k, wenn möglich mehr).
→
Eine enttäuschende Antwort diagnostizieren
Schauen Sie sich zuerst die zitierten Quellen an. Wenige oder gar keine Quellen? Das Problem liegt bei SearXNG (blockierte Suchmaschinen, schlecht umformulierte Suchanfrage). Relevante Quellen, aber eine schwache Zusammenfassung? Das Problem liegt beim Modell: Wählen Sie ein größeres oder ein anderes Modell. Diese Vorgehensweise verhindert, dass Sie das falsche Glied in der Kette optimieren.

#Im Vergleich zu Perplexity: Was man verliert, was man gewinnt

Perplexica ist kein perfekter Klon, und das zu behaupten wäre unehrlich. Hier folgt eine realistische Abwägung, damit Sie entscheiden können, ob sich der Aufwand in Ihrem Fall lohnt.

Vorteil — Datenschutz
Keine Anfrage verlässt Ihr Netzwerk. Weder das Thema Ihrer Recherchen noch die Antworten werden über Dritte geleitet. Für die Beobachtung sensibler Themen ist das entscheidend.
Vorteile — Kosten und Kontingente
Nichts zu bezahlen, keine Begrenzung der Anfragen. Sie können so viele Suchanfragen starten, wie Ihre Hardware bewältigt, und das Tool ohne API-Rechnung in andere Tools integrieren.
Man gewinnt — Kontrolle
Sie wählen das Modell und die über SearXNG abgefragten Suchmaschinen und können das gesamte System dauerhaft in einem Homelab selbst hosten.
Was verloren geht — sprachliche Feinheit
Die Cloud-Modelle von Perplexity sind größer und leistungsfähiger. Mit bescheidener Hardware fallen lokale Zusammenfassungen blasser aus und enthalten mehr Ungenauigkeiten.
Was verloren geht – die Zuverlässigkeit einer sofort einsatzbereiten Lösung
Perplexity kümmert sich für Sie um die Infrastruktur. Bei Ihrer eigenen Installation müssen Sie selbst die Ursache finden und das Problem beheben, wenn SearXNG an ein Rate-Limit stößt oder Ollama den VRAM vollständig belegt.
Man verliert — einige Funktionen
Keine ausgereifte mobile App, keine ebenso ausgereifte mehrstufige Pro Search, keine proprietären Integrationen. Perplexica deckt das Wesentliche ab, bietet aber nicht den gesamten Komfort des kommerziellen Produkts.

#Behebung häufiger Probleme

Perplexica erkennt Ollama nicht
Fast immer liegt es an der Adresse. Wenn Sie aus einem Docker-Container zugreifen, ersetzen Sie localhost durch host.docker.internal (und fügen Sie unter Linux extra_hosts mit host-gateway hinzu). Prüfen Sie, ob Ollama auf Verbindungen lauscht, und lassen Sie bei Bedarf Verbindungen von außerhalb von localhost zu.
Keine Quellen in den Antworten
SearXNG liefert nichts zurück. Öffnen Sie direkt die SearXNG-Oberfläche, um eine Suche zu testen: Wenn sie fehlschlägt, sind einige Suchmaschinen blockiert oder ihre Anfragelimits sind erreicht. Verringern Sie die Anzahl der aktiven Suchmaschinen oder warten Sie.
Die Liste der Modelle ist leer
Perplexica fragt Ollama beim Laden der Einstellungen ab. Wenn die Liste leer ist, ist die API-URL falsch oder Ollama verfügt über kein Modell. Prüfen Sie das mit ollama list auf dem Host.
Sehr langsame Antworten
Das Chatmodell ist wahrscheinlich zu groß für Ihren VRAM und wird teilweise auf der CPU ausgeführt. Wechseln Sie zu einer leichteren Quantisierung (Q4_K_M) oder zu einem kleineren Modell; prüfen Sie, ob die GPU tatsächlich genutzt wird.
Fehler bei den Embeddings
Das Embedding-Modell ist nicht ausgewählt oder wurde nicht heruntergeladen. Führen Sie ollama pull nomic-embed-text aus und wählen Sie es ausdrücklich in den Einstellungen aus.
Der Port 3000 ist bereits belegt
Ein anderer Dienst belegt den Port. Ändern Sie die Portzuordnung in docker-compose (z. B. 3001:3000) und laden Sie den Stack neu.

#Weiterführende Informationen

Perplexica ist nur so gut wie das Modell und die Infrastruktur, die es tragen. Diese Anleitungen stärken die Grundlagen, auf denen es basiert.

Ollama, was ist das und wie funktioniert es?
Der Daemon, der Ihr Chatmodell und Ihre Embeddings über Port 11434 bereitstellt – der Baustein, von dem die gesamte Qualität der Texterstellung abhängt.
Quantisierung wählen
Q4_K_M, Q5_K_M, Q8_0: den Kompromiss zwischen VRAM-Bedarf und Qualität verstehen, um das passende Modell zur Zusammenfassung für Ihre Grafikkarte auszuwählen.
AnythingLLM: Produktionsreifes RAG lokal
Um über die Websuche hinauszugehen und ein RAG-System auf Basis Ihrer eigenen Dokumente aufzubauen, mit demselben Ollama-Backend.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.