Flowise: KI-Agenten per Drag-and-drop erstellen auf Ollama
Mit Flowise wird der Aufbau von LLM-Agenten zum Zusammenfügen von Bausteinen auf einem Canvas. Statt LangChain-Code zu schreiben, ziehen Sie Knoten auf die Arbeitsfläche, verbinden sie und testen direkt in einem integrierten Chat. In Verbindung mit Ollama führt die Kombination aus Flowise und Ollama Chatflows, Agenten mit Werkzeugen und RAG-Pipelines vollständig lokal aus, ohne dass eine Anfrage Ihren Rechner verlässt. Dieser Leitfaden beginnt mit der Installation, erstellt einen ersten Chatflow, ergänzt eine dokumentbasierte RAG-Lösung und veröffentlicht anschließend einen Chatbot, der sich auf Ihrer Website einbetten lässt.
#Warum Flowise
Flowise ist ein visueller Open-Source-Builder (Apache-2.0-Lizenz), der auf LangChain und LangGraph aufbaut. Er stellt dieselben Bausteine – Modelle, Gedächtnis, Retriever, Tools – als Knoten bereit, die miteinander verbunden werden. So wird aus einem Agentenprototyp mit mehreren hundert Zeilen Python-Code ein Graph, den man auf einen Blick erfassen kann.
Im Vergleich zu Dify, der anderen No-Code-Plattform auf dieser Website, setzt Flowise stärker auf eine detaillierte Orchestrierung: Während Dify eine klar strukturierte Produktumgebung bietet (Apps, Prompt-Sammlungen, Teamverwaltung), macht Flowise die zugrunde liegende LangChain-Infrastruktur sichtbar und eignet sich besser, wenn Sie jeden Schritt eines Agenten verstehen und anpassen möchten. Beide Plattformen lassen sich auf dieselbe Weise mit Ollama verbinden.
- 100 % lokal
- In Kombination mit Ollama wird weder ein Token noch ein Dokument an eine Cloud-API gesendet. Ideal für sensible Daten oder den Offline-Einsatz.
- Schnelle Iteration
- Der Testchat ist in den Canvas integriert: Sie ändern einen Knoten und sehen sofort die Auswirkung, ohne irgendetwas erneut bereitstellen zu müssen.
- Bereitstellung als API und Widget
- Jeder Chatflow wird automatisch zu einem REST-Endpunkt und einem einbettbaren Web-Widget, ohne dass Sie ein Backend schreiben müssen.
- Erweiterbar
- Marktplatz für Vorlagen, benutzerdefinierte Knoten in JavaScript und Integration von Tools (Websuche, Taschenrechner, HTTP-Aufrufe).
#Voraussetzungen
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Flowise ist ressourcenschonend: Ollama und das geladene Modell sind es, die den Speicher verbrauchen. Planen Sie eine Maschine ein, auf der das gewünschte LLM problemlos laufen kann.
- Ollama installiert
- Der Daemon muss laufen und auf http://localhost:11434 (Standardwert) hören. Prüfen Sie mit „ollama list“.
- Ein Chatmodell
- Ein Modell, das Tool Calling für Agenten unterstützt: Qwen 3.5 8B, Granite 4.2 8B oder Mistral Small 24B, je nach verfügbarem VRAM (7B ≈ 5 GB, 14B ≈ 9 GB, 24B ≈ 16 GB in Q4_K_M).
- Ein Embeddings-Modell
- Für RAG: „nomic-embed-text“ oder „mxbai-embed-large“, leichte Modelle, verfügbar über Ollama.
- Node.js 18.15+ oder Docker
- Flowise wird über npm oder als Container installiert. Docker wird für eine saubere, persistente Bereitstellung empfohlen.
#Flowise installieren
Zwei Methoden. Die schnellste Möglichkeit zum Testen ist npx; für dauerhafte Nutzung mit persistierenden Daten empfiehlt sich Docker.
Öffnen Sie anschließend http://localhost:3000 in Ihrem Browser: Die Canvas-Oberfläche wird angezeigt. Das eingebundene Volume (~/.flowise) bewahrt Ihre Chatflows und Schlüssel zwischen zwei Neustarts des Containers auf.
#Ollama mit Flowise verbinden
Der Knoten „ChatOllama“ dient als Brücke zwischen Flowise und Ihrem lokalen Daemon. Der entscheidende Punkt ist die Basis-URL: Sie hängt davon ab, wie Flowise gestartet wird.
- 01Den ChatOllama-Knoten hinzufügenÖffnen Sie im Canvas das Knotenpanel, wählen Sie die Kategorie „Chat Models“ und ziehen Sie „ChatOllama“ auf die Arbeitsfläche.
- 02Die Basis-URL angebenWenn Flowise nativ (npx/npm) läuft, verwenden Sie http://localhost:11434. Wenn es in Docker läuft, verwenden Sie http://host.docker.internal:11434 — der Container sieht „localhost“ des Hosts nicht.
- 03Das Modell auswählenIm Feld « Model Name » geben Sie den genauen Namen des geladenen Modells in Ollama ein, beispielsweise « qwen3.5:8b » oder « mistral-small ».
- 04Parameter einstellenPassen Sie Temperature (0,7 für Chat, 0,1–0,3 für faktenbasiertes RAG) und bei Bedarf die Kontextgröße über num_ctx in den erweiterten Optionen an.
#Die zentralen Knoten eines Chatflows
Ein Chatflow wird von links nach rechts gelesen: Die Knoten, die Modell, Speicher und Werkzeuge bereitstellen, versorgen einen „Ketten“- oder „Agenten“-Knoten, der die Antwort erzeugt. Hier sind die wenigen Bausteine, die in fast allen Abläufen vorkommen.
- Chat Model (ChatOllama)
- Das Gehirn: das LLM, das die Antworten erzeugt. Immer vorhanden.
- Memory (Buffer Memory)
- Speichert den Gesprächsverlauf, damit der Agent von einem Gesprächsschritt zum nächsten den Faden behält.
- Prompt Template
- Definiert die Systemanweisungen und die Formatierung der Frage. Hier werden dem Modell eine Rolle und ein Rahmen vorgegeben.
- Chain / Agent
- Der abschließende Knoten. „Conversation Chain“ für einen einfachen Chat; „Tool Agent“, wenn das Modell entscheiden muss, ob es Tools aufruft.
- Tools
- Externe Funktionen: Taschenrechner, Websuche, HTTP-Anfrage, Lesen von Dateien. Mit einem Agenten verbunden erweitern sie dessen Fähigkeiten.
- Document Loaders & Vector Store
- Die RAG-Komponente: Sie laden Dokumente, zerlegen sie, indexieren sie und machen sie abfragbar (siehe unten).
#Einen ersten Chatflow aufbauen
Beginnen wir mit dem Einfachsten: einem Chat-Assistenten mit Gedächtnis, der an Ollama angebunden ist. Er wird als Grundlage für alles Weitere dienen.
- 01Einen neuen Chatflow erstellenKlicken Sie auf dem Startbildschirm im Tab Chatflows auf „Add New“. Eine leere Arbeitsfläche öffnet sich.
- 02Die drei Grundknoten positionierenZiehen Sie „ChatOllama“, „Buffer Memory“ und „Conversation Chain“ auf das Canvas.
- 03Die Verbindungen herstellenVerbinden Sie die Ausgabe von ChatOllama mit dem Eingang „Chat Model“ der Conversation Chain und die Ausgabe von Buffer Memory mit dem Eingang „Memory“ derselben Kette.
- 04System-Prompt anpassenÖffnen Sie in der Conversation Chain das Feld System Message und geben Sie eine Rolle vor: „Du bist ein technischer Assistent, der sich kurzfasst und auf Französisch antwortet.“
- 05Im integrierten Chat testenKlicken Sie oben rechts auf das Chat-Symbol, stellen Sie eine Frage und anschließend eine zweite, die von der ersten abhängt, um zu prüfen, ob das Gesprächsgedächtnis funktioniert.
#Ein vollständiges RAG-System per Drag-and-drop
RAG (Retrieval-Augmented Generation) ermöglicht es dem Modell, auf Grundlage Ihrer eigenen Dokumente zu antworten. In Flowise erfolgt alles auf dem Canvas: Man lädt die Dateien hoch, vektorisiert sie und verbindet den Retriever mit einer Frage-Antwort-Kette.
- 01Dokumente ladenFügen Sie einen zu Ihrer Quelle passenden „Document Loader“-Knoten hinzu: PDF File, Text File oder Folder. Er liest den Rohinhalt ein.
- 02In Chunks teilenVerbinden Sie einen „Recursive Character Text Splitter“ mit dem Loader. Stellen Sie die Chunk-Größe auf etwa 1000 Zeichen mit einer Überlappung von 100 Zeichen ein, um den Kontext zwischen den Abschnitten zu erhalten.
- 03Embeddings generierenFügen Sie einen Knoten „Ollama Embeddings“ mit dem Modell „nomic-embed-text“ und der gleichen Basis-URL wie ChatOllama hinzu.
- 04In einem Vector Store indexierenZiehen Sie einen „In-Memory Vector Store“ (einfach für den Einstieg) oder „Chroma“ für die persistente Speicherung hinein. Verbinden Sie den Splitter und die Embeddings damit.
- 05Eine Retrieval QA Chain anbindenVerbinden Sie den Vector Store (als Retriever) und ChatOllama mit einem Knoten „Retrieval QA Chain“ oder „Conversational Retrieval QA Chain“, um den Gesprächsverlauf im Gedächtnis zu behalten.
- 06Dokumente abfragenSpeichern Sie, öffnen Sie den Chat und stellen Sie eine Frage, deren Antwort in Ihren Dateien steht. Das Modell zitiert nun Ihre Inhalte.
#Chatbot veröffentlichen und integrieren
Sobald der Chatflow zufriedenstellend ist, stellt Flowise ihn auf zwei Arten bereit, ohne dass Sie eine Zeile Backend-Code schreiben müssen: als REST-API und als Web-Widget zum Einbetten in Ihre Website.
Klicken Sie auf « API Endpoint » oder das Symbol </> in der oberen rechten Ecke des Canvas. Flowise erzeugt die Vorhersage-URL sowie Beispiele, die sofort kopiert werden können. Der Endpoint folgt stets demselben Schema mit der eindeutigen ID des Chatflow.
Für die Webintegration stellt der Tab „Embed“ einen Skriptausschnitt bereit, den Sie vor dem schließenden </body>-Tag Ihrer Seiten einfügen. Das Widget zeigt eine frei schwebende, vollständig konfigurierbare Chatblase an (Farben, Begrüßungsnachricht, Avatar).
#Häufige Fallstricke und ihre Behebung
- « fetch failed » bei ChatOllama
- Falsche Basis-URL. In Docker verwenden Sie host.docker.internal:11434, nicht localhost. Stellen Sie außerdem sicher, dass Ollama ordnungsgemäß läuft (ollama list).
- Das Modell ruft niemals Tools auf
- Das LLM unterstützt Tool Calling nicht oder nur unzureichend. Wechseln Sie zu einem aktuellen Modell, das dafür trainiert wurde (Qwen 3.5, Mistral Small), und prüfen Sie, ob Sie einen „Tool Agent“ verwenden und nicht nur eine einfache Verarbeitungskette.
- Langsame oder abgebrochene Antworten
- Der Kontext ist zu groß für den VRAM: Das Modell wird teilweise auf die CPU ausgelagert. Verringern Sie num_ctx oder die Größe der RAG-Chunks oder wählen Sie ein kleineres Modell.
- RAG findet nichts Relevantes
- Unpassende Chunk-Größe oder ungeeignetes Embedding-Modell. Passen Sie die Chunk-Größe an, erhöhen Sie die Anzahl der abgerufenen Dokumente (top-k) und überprüfen Sie, ob die Indexierung korrekt durchgeführt wurde.
- Die Daten verschwinden beim Neustart
- Bei Docker geht ohne eingebundenes Volume alles verloren. Stellen Sie sicher, dass „-v ~/.flowise:/root/.flowise“ angegeben ist, und verwenden Sie einen persistenten Vektorspeicher statt eines Vektorspeichers im Arbeitsspeicher.
#Weiterführende Informationen
Flowise ist nur eine visuelle Schicht: Die Qualität Ihrer Agenten hängt vor allem vom Modell und dem darunterliegenden Stack ab. Drei Leitfäden auf dieser Website führen diesen Leitfaden weiter: Sie zeigen, wie Sie Ollama sauber installieren, bevor Sie Flowise anbinden, vergleichen den No-Code-Ansatz von Dify mit dem von Flowise und erklären die Funktionsweise eines RAG in Python, damit Sie genau abstimmen können, was der Canvas automatisiert.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.