Mittelstufe 12 Min.No-code

Flowise: KI-Agenten per Drag-and-drop erstellen auf Ollama

Mit Flowise wird der Aufbau von LLM-Agenten zum Zusammenfügen von Bausteinen auf einem Canvas. Statt LangChain-Code zu schreiben, ziehen Sie Knoten auf die Arbeitsfläche, verbinden sie und testen direkt in einem integrierten Chat. In Verbindung mit Ollama führt die Kombination aus Flowise und Ollama Chatflows, Agenten mit Werkzeugen und RAG-Pipelines vollständig lokal aus, ohne dass eine Anfrage Ihren Rechner verlässt. Dieser Leitfaden beginnt mit der Installation, erstellt einen ersten Chatflow, ergänzt eine dokumentbasierte RAG-Lösung und veröffentlicht anschließend einen Chatbot, der sich auf Ihrer Website einbetten lässt.

Von Marie L.·Aktualisierung 2026-09-17·Unter Windows, macOS und Linux getestet

#Warum Flowise

Flowise ist ein visueller Open-Source-Builder (Apache-2.0-Lizenz), der auf LangChain und LangGraph aufbaut. Er stellt dieselben Bausteine – Modelle, Gedächtnis, Retriever, Tools – als Knoten bereit, die miteinander verbunden werden. So wird aus einem Agentenprototyp mit mehreren hundert Zeilen Python-Code ein Graph, den man auf einen Blick erfassen kann.

Im Vergleich zu Dify, der anderen No-Code-Plattform auf dieser Website, setzt Flowise stärker auf eine detaillierte Orchestrierung: Während Dify eine klar strukturierte Produktumgebung bietet (Apps, Prompt-Sammlungen, Teamverwaltung), macht Flowise die zugrunde liegende LangChain-Infrastruktur sichtbar und eignet sich besser, wenn Sie jeden Schritt eines Agenten verstehen und anpassen möchten. Beide Plattformen lassen sich auf dieselbe Weise mit Ollama verbinden.

100 % lokal
In Kombination mit Ollama wird weder ein Token noch ein Dokument an eine Cloud-API gesendet. Ideal für sensible Daten oder den Offline-Einsatz.
Schnelle Iteration
Der Testchat ist in den Canvas integriert: Sie ändern einen Knoten und sehen sofort die Auswirkung, ohne irgendetwas erneut bereitstellen zu müssen.
Bereitstellung als API und Widget
Jeder Chatflow wird automatisch zu einem REST-Endpunkt und einem einbettbaren Web-Widget, ohne dass Sie ein Backend schreiben müssen.
Erweiterbar
Marktplatz für Vorlagen, benutzerdefinierte Knoten in JavaScript und Integration von Tools (Websuche, Taschenrechner, HTTP-Aufrufe).

#Voraussetzungen

Das Kit „Copilote Local“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Flowise ist ressourcenschonend: Ollama und das geladene Modell sind es, die den Speicher verbrauchen. Planen Sie eine Maschine ein, auf der das gewünschte LLM problemlos laufen kann.

Ollama installiert
Der Daemon muss laufen und auf http://localhost:11434 (Standardwert) hören. Prüfen Sie mit „ollama list“.
Ein Chatmodell
Ein Modell, das Tool Calling für Agenten unterstützt: Qwen 3.5 8B, Granite 4.2 8B oder Mistral Small 24B, je nach verfügbarem VRAM (7B ≈ 5 GB, 14B ≈ 9 GB, 24B ≈ 16 GB in Q4_K_M).
Ein Embeddings-Modell
Für RAG: „nomic-embed-text“ oder „mxbai-embed-large“, leichte Modelle, verfügbar über Ollama.
Node.js 18.15+ oder Docker
Flowise wird über npm oder als Container installiert. Docker wird für eine saubere, persistente Bereitstellung empfohlen.
i
Welches Modell für Agenten?
Die Flowise-Agenten basieren auf Tool-Calling: Das Modell muss entscheiden, wann es ein Tool aufruft. Modelle mit 3B Parametern können dies oft nicht zuverlässig leisten. Setzen Sie mindestens auf ein aktuelles Modell mit 7–8B Parametern, idealerweise auf ein Modell, das ausdrücklich für Function Calling trainiert wurde.

#Flowise installieren

Zwei Methoden. Die schnellste Möglichkeit zum Testen ist npx; für dauerhafte Nutzung mit persistierenden Daten empfiehlt sich Docker.

Schnelle Installation über npm
# Lancement direct, sans installation permanente
npx flowise start

# Ou installation globale puis démarrage
npm install -g flowise
flowise start
Installation über Docker (empfohlen)
docker run -d \
  --name flowise \
  -p 3000:3000 \
  --add-host=host.docker.internal:host-gateway \
  -v ~/.flowise:/root/.flowise \
  flowiseai/flowise

Öffnen Sie anschließend http://localhost:3000 in Ihrem Browser: Die Canvas-Oberfläche wird angezeigt. Das eingebundene Volume (~/.flowise) bewahrt Ihre Chatflows und Schlüssel zwischen zwei Neustarts des Containers auf.

→
Den Zugriff von Anfang an absichern
Standardmäßig ist die Benutzeroberfläche frei zugänglich. Fügen Sie dem Docker-Befehl „-e FLOWISE_USERNAME=admin -e FLOWISE_PASSWORD=motdepasse“ hinzu, um den Zugriff durch eine Anmeldung zu schützen, insbesondere wenn der Rechner über das Netzwerk erreichbar ist.

#Ollama mit Flowise verbinden

Der Knoten „ChatOllama“ dient als Brücke zwischen Flowise und Ihrem lokalen Daemon. Der entscheidende Punkt ist die Basis-URL: Sie hängt davon ab, wie Flowise gestartet wird.

  1. 01
    Den ChatOllama-Knoten hinzufügen
    Öffnen Sie im Canvas das Knotenpanel, wählen Sie die Kategorie „Chat Models“ und ziehen Sie „ChatOllama“ auf die Arbeitsfläche.
  2. 02
    Die Basis-URL angeben
    Wenn Flowise nativ (npx/npm) läuft, verwenden Sie http://localhost:11434. Wenn es in Docker läuft, verwenden Sie http://host.docker.internal:11434 — der Container sieht „localhost“ des Hosts nicht.
  3. 03
    Das Modell auswählen
    Im Feld « Model Name » geben Sie den genauen Namen des geladenen Modells in Ollama ein, beispielsweise « qwen3.5:8b » oder « mistral-small ».
  4. 04
    Parameter einstellen
    Passen Sie Temperature (0,7 für Chat, 0,1–0,3 für faktenbasiertes RAG) und bei Bedarf die Kontextgröße über num_ctx in den erweiterten Optionen an.
!
Fehler „fetch failed“ in Docker
In neun von zehn Fällen liegt es an einer localhost-URL innerhalb eines Containers, wenn ein Chatflow „fetch failed“ oder „ECONNREFUSED“ zurückgibt. Ersetzen Sie diese durch host.docker.internal:11434 und prüfen Sie unter Linux, ob der Docker-Befehl tatsächlich --add-host=host.docker.internal:host-gateway enthält.

#Die zentralen Knoten eines Chatflows

Ein Chatflow wird von links nach rechts gelesen: Die Knoten, die Modell, Speicher und Werkzeuge bereitstellen, versorgen einen „Ketten“- oder „Agenten“-Knoten, der die Antwort erzeugt. Hier sind die wenigen Bausteine, die in fast allen Abläufen vorkommen.

Chat Model (ChatOllama)
Das Gehirn: das LLM, das die Antworten erzeugt. Immer vorhanden.
Memory (Buffer Memory)
Speichert den Gesprächsverlauf, damit der Agent von einem Gesprächsschritt zum nächsten den Faden behält.
Prompt Template
Definiert die Systemanweisungen und die Formatierung der Frage. Hier werden dem Modell eine Rolle und ein Rahmen vorgegeben.
Chain / Agent
Der abschließende Knoten. „Conversation Chain“ für einen einfachen Chat; „Tool Agent“, wenn das Modell entscheiden muss, ob es Tools aufruft.
Tools
Externe Funktionen: Taschenrechner, Websuche, HTTP-Anfrage, Lesen von Dateien. Mit einem Agenten verbunden erweitern sie dessen Fähigkeiten.
Document Loaders & Vector Store
Die RAG-Komponente: Sie laden Dokumente, zerlegen sie, indexieren sie und machen sie abfragbar (siehe unten).

#Einen ersten Chatflow aufbauen

Beginnen wir mit dem Einfachsten: einem Chat-Assistenten mit Gedächtnis, der an Ollama angebunden ist. Er wird als Grundlage für alles Weitere dienen.

  1. 01
    Einen neuen Chatflow erstellen
    Klicken Sie auf dem Startbildschirm im Tab Chatflows auf „Add New“. Eine leere Arbeitsfläche öffnet sich.
  2. 02
    Die drei Grundknoten positionieren
    Ziehen Sie „ChatOllama“, „Buffer Memory“ und „Conversation Chain“ auf das Canvas.
  3. 03
    Die Verbindungen herstellen
    Verbinden Sie die Ausgabe von ChatOllama mit dem Eingang „Chat Model“ der Conversation Chain und die Ausgabe von Buffer Memory mit dem Eingang „Memory“ derselben Kette.
  4. 04
    System-Prompt anpassen
    Öffnen Sie in der Conversation Chain das Feld System Message und geben Sie eine Rolle vor: „Du bist ein technischer Assistent, der sich kurzfasst und auf Französisch antwortet.“
  5. 05
    Im integrierten Chat testen
    Klicken Sie oben rechts auf das Chat-Symbol, stellen Sie eine Frage und anschließend eine zweite, die von der ersten abhängt, um zu prüfen, ob das Gesprächsgedächtnis funktioniert.
→
Speichern Sie vor dem Testen
Flowise führt einen Chatflow nur aus, wenn er gespeichert ist. Geben Sie ihm einen Namen und klicken Sie auf das Speichersymbol (Diskette), bevor Sie den Chat öffnen, sonst werden Ihre letzten Änderungen nicht berücksichtigt.

#Ein vollständiges RAG-System per Drag-and-drop

RAG (Retrieval-Augmented Generation) ermöglicht es dem Modell, auf Grundlage Ihrer eigenen Dokumente zu antworten. In Flowise erfolgt alles auf dem Canvas: Man lädt die Dateien hoch, vektorisiert sie und verbindet den Retriever mit einer Frage-Antwort-Kette.

  1. 01
    Dokumente laden
    Fügen Sie einen zu Ihrer Quelle passenden „Document Loader“-Knoten hinzu: PDF File, Text File oder Folder. Er liest den Rohinhalt ein.
  2. 02
    In Chunks teilen
    Verbinden Sie einen „Recursive Character Text Splitter“ mit dem Loader. Stellen Sie die Chunk-Größe auf etwa 1000 Zeichen mit einer Überlappung von 100 Zeichen ein, um den Kontext zwischen den Abschnitten zu erhalten.
  3. 03
    Embeddings generieren
    Fügen Sie einen Knoten „Ollama Embeddings“ mit dem Modell „nomic-embed-text“ und der gleichen Basis-URL wie ChatOllama hinzu.
  4. 04
    In einem Vector Store indexieren
    Ziehen Sie einen „In-Memory Vector Store“ (einfach für den Einstieg) oder „Chroma“ für die persistente Speicherung hinein. Verbinden Sie den Splitter und die Embeddings damit.
  5. 05
    Eine Retrieval QA Chain anbinden
    Verbinden Sie den Vector Store (als Retriever) und ChatOllama mit einem Knoten „Retrieval QA Chain“ oder „Conversational Retrieval QA Chain“, um den Gesprächsverlauf im Gedächtnis zu behalten.
  6. 06
    Dokumente abfragen
    Speichern Sie, öffnen Sie den Chat und stellen Sie eine Frage, deren Antwort in Ihren Dateien steht. Das Modell zitiert nun Ihre Inhalte.
Die notwendigen Modelle für RAG herunterladen
ollama pull qwen3.5:8b
ollama pull nomic-embed-text
i
In-Memory vs Chroma
Ein Vector Store im Arbeitsspeicher ist ideal für Prototypen: Er lässt sich schnell einbinden, wird aber bei jedem Neustart geleert und indexiert die Dokumente jedes Mal neu. Sobald das Korpus wächst oder dauerhaft gespeichert werden muss, wechseln Sie zu Chroma oder Qdrant, um es nur einmal neu indexieren zu müssen.

#Chatbot veröffentlichen und integrieren

Sobald der Chatflow zufriedenstellend ist, stellt Flowise ihn auf zwei Arten bereit, ohne dass Sie eine Zeile Backend-Code schreiben müssen: als REST-API und als Web-Widget zum Einbetten in Ihre Website.

Klicken Sie auf « API Endpoint » oder das Symbol </> in der oberen rechten Ecke des Canvas. Flowise erzeugt die Vorhersage-URL sowie Beispiele, die sofort kopiert werden können. Der Endpoint folgt stets demselben Schema mit der eindeutigen ID des Chatflow.

Den Chatflow über cURL aufrufen
curl http://localhost:3000/api/v1/prediction/<CHATFLOW_ID> \
  -H "Content-Type: application/json" \
  -d '{"question": "Résume la politique de retour en une phrase."}'

Für die Webintegration stellt der Tab „Embed“ einen Skriptausschnitt bereit, den Sie vor dem schließenden </body>-Tag Ihrer Seiten einfügen. Das Widget zeigt eine frei schwebende, vollständig konfigurierbare Chatblase an (Farben, Begrüßungsnachricht, Avatar).

Einbettbares Widget zum Einfügen in Ihre Seite
<script type="module">
  import Chatbot from 'https://cdn.jsdelivr.net/npm/flowise-embed/dist/web.js'
  Chatbot.init({
    chatflowid: '<CHATFLOW_ID>',
    apiHost: 'http://localhost:3000',
  })
</script>
!
localhost in der Produktion nicht öffentlich zugänglich machen
Ein apiHost mit der Adresse http://localhost:3000 funktioniert nur auf Ihrem Rechner. Für eine öffentliche Website muss Flowise auf einem erreichbaren Server laufen (hinter einem HTTPS-Reverse-Proxy), und apiHost muss auf diese Domain verweisen. Aktivieren Sie außerdem einen API-Schlüssel für den Chatflow, damit nicht jeder beliebig Ihr Modell aufrufen kann.

#Häufige Fallstricke und ihre Behebung

« fetch failed » bei ChatOllama
Falsche Basis-URL. In Docker verwenden Sie host.docker.internal:11434, nicht localhost. Stellen Sie außerdem sicher, dass Ollama ordnungsgemäß läuft (ollama list).
Das Modell ruft niemals Tools auf
Das LLM unterstützt Tool Calling nicht oder nur unzureichend. Wechseln Sie zu einem aktuellen Modell, das dafür trainiert wurde (Qwen 3.5, Mistral Small), und prüfen Sie, ob Sie einen „Tool Agent“ verwenden und nicht nur eine einfache Verarbeitungskette.
Langsame oder abgebrochene Antworten
Der Kontext ist zu groß für den VRAM: Das Modell wird teilweise auf die CPU ausgelagert. Verringern Sie num_ctx oder die Größe der RAG-Chunks oder wählen Sie ein kleineres Modell.
RAG findet nichts Relevantes
Unpassende Chunk-Größe oder ungeeignetes Embedding-Modell. Passen Sie die Chunk-Größe an, erhöhen Sie die Anzahl der abgerufenen Dokumente (top-k) und überprüfen Sie, ob die Indexierung korrekt durchgeführt wurde.
Die Daten verschwinden beim Neustart
Bei Docker geht ohne eingebundenes Volume alles verloren. Stellen Sie sicher, dass „-v ~/.flowise:/root/.flowise“ angegeben ist, und verwenden Sie einen persistenten Vektorspeicher statt eines Vektorspeichers im Arbeitsspeicher.

#Weiterführende Informationen

Flowise ist nur eine visuelle Schicht: Die Qualität Ihrer Agenten hängt vor allem vom Modell und dem darunterliegenden Stack ab. Drei Leitfäden auf dieser Website führen diesen Leitfaden weiter: Sie zeigen, wie Sie Ollama sauber installieren, bevor Sie Flowise anbinden, vergleichen den No-Code-Ansatz von Dify mit dem von Flowise und erklären die Funktionsweise eines RAG in Python, damit Sie genau abstimmen können, was der Canvas automatisiert.


Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.