Mittelstufe 12 Min.Nextcloud

Nextcloud Assistant + Ollama: Die KI in Ihrem Cloud-System selbst gehostet

Nextcloud verfügt inzwischen über einen eigenen KI-Assistenten: E-Mails zusammenfassen, Texte umformulieren, Texte generieren und über die eigenen Dokumente chatten – direkt in der Benutzeroberfläche. Standardmäßig lenkt Nextcloud Sie zu Cloud-Diensten, doch Sie müssen diese nicht nutzen. Dieser Leitfaden zeigt, wie Sie Nextcloud Assistant mit einer selbst gehosteten Ollama-Instanz verbinden, damit 100 % Ihrer Daten bei Ihnen bleiben: die Konfiguration von AppAPI und ExApp Schritt für Schritt, die OpenAI-kompatible Integration, empfohlene Modelle und die Dimensionierung des Servers für die Nutzung in der Familie oder in kleinen und mittleren Unternehmen.

Von Marie L.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Nextcloud an Ollama anbinden?

Nextcloud Assistant ist das in Nextcloud integrierte KI-Fenster (Symbol „Zauberstab“ in der oberen Leiste): Es bündelt Aufgaben wie das Zusammenfassen und Umformulieren von Texten, das Erstellen eines Entwurfs, das Herausarbeiten wichtiger Punkte oder das Übersetzen. Über Nextcloud ermöglicht ein Assistent für „kontextbezogenen Chat“ auch, mit einem Modell zu sprechen und mit dem passenden Kontext die eigenen Dateien zu befragen.

Das Problem: Die standardmäßig angebotenen oder in der Demo verwendeten Backends verweisen oft auf Cloud-APIs (OpenAI oder die von Nextcloud gehosteten Dienste). Bei einer selbst gehosteten Cloud führt das genau das wieder ein, was man vermeiden wollte – die Übermittlung privater Inhalte an Dritte. Wenn Sie den Assistenten mit Ollama verbinden, das auf Ihrem eigenen Rechner läuft und unter http://localhost:11434 auf Anfragen wartet, bleibt der Text Ihrer Dokumente ausschließlich auf Ihrer Infrastruktur.

Datensouveränität
Keine Inhalte aus Dateien, E-Mails oder Notizen verlassen Ihren Server. Das hilft sowohl bei der Einhaltung der DSGVO als auch dabei, einfach beruhigt zu sein.
Keine Nutzungskosten
Keine Abrechnung pro Token: Sobald sich die Hardware amortisiert hat, sind Zusammenfassungen und Texterstellung kostenlos und unbegrenzt.
Freie Modellwahl
Sie wählen das Modell (Qwen, Gemma, Granite) und seine Quantisierung passend zu Ihrem VRAM, statt auf ein vorgegebenes Modell festgelegt zu sein.
Offline-Funktionalität
Der Assistent bleibt auch ohne Internetzugang verfügbar, solange der Nextcloud-Server und Ollama laufen.
i
Nextcloud Assistant gegenüber Nextcloud AI
„Assistant“ ist die Oberfläche (der Zauberstab und der Chat). Sie tut nichts allein: Sie delegiert an „Provider“ für KI-Aufgaben, die von Backend-Anwendungen bereitgestellt werden. Dieses Backend werden wir so konfigurieren, dass es auf Ollama verweist — die Oberfläche selbst bleibt unverändert.

#Wie es funktioniert: AppAPI und ExApp

Das Kit für lokale KI in Unternehmen

Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Nextcloud kommuniziert nicht direkt mit Ollama. Dazwischen liegt ein Mechanismus für externe Anwendungen. Wer die drei Bausteine versteht, erspart sich bei der Konfiguration viel Ausprobieren.

Assistent
Die integrierte Frontend-Anwendung in Nextcloud, die die Aufgaben (Zusammenfassung, Umformulierung, Chat) in der Benutzeroberfläche anzeigt.
AppAPI
Die Nextcloud-Anwendung, die den Lebenszyklus externer Anwendungen (ExApps) verwaltet: Installation, Bereitstellung, Kommunikation. Sie bildet die Grundlage und muss zuerst installiert werden.
ExApp Backend mit KI
Eine externe Anwendung (Container), die Aufgabenanbieter implementiert und mit einer Inferenz-Engine kommunizieren kann. Am häufigsten werden für den lokalen Betrieb „integration_openai“ (kompatibel mit jedem OpenAI-kompatiblen Endpunkt, einschließlich Ollama) und „LocalAI“ über die dafür vorgesehene ExApp verwendet.
Deploy Daemon
Der Dienst (häufig Docker), den AppAPI steuert, um ExApps-Container zu starten und zu beenden. Ohne einen funktionsfähigen Deploy-Daemon kann keine ExApp bereitgestellt werden.

Eine Anfrage nimmt also folgenden Weg: Sie klicken im Assistenten auf „Zusammenfassen“ → Nextcloud übergibt die Aufgabe an den Provider → die ExApp (z. B. integration_openai) erstellt einen Aufruf im OpenAI-Format → dieser Aufruf geht an den Endpunkt von Ollama → die Antwort nimmt denselben Weg zurück. Entscheidend ist, die Integrations-ExApp im OpenAI-kompatiblen Modus auf die URL von Ollama auszurichten.

→
Der Shortcut integration_openai
Ollama stellt unter /v1 (http://IP:11434/v1) eine OpenAI-kompatible API bereit. Die mit dieser URL konfigurierte Nextcloud-Anwendung „OpenAI and LocalAI integration“ reicht in vielen Fällen aus und erspart die Verwaltung einer vollständigen containerisierten ExApp. Wir erläutern beide Wege weiter unten.

#Voraussetzungen

Aktuelle Version von Nextcloud Hub
Eine Version, die AppAPI und den Assistenten (Hub 6/7 oder neuer) unterstützt. Idealerweise eine Docker/AIO-Installation oder ein Server, den Sie selbst verwalten, um AppAPI und einen Deploy Daemon installieren zu können.
Ollama installiert und erreichbar
Auf demselben Rechner oder einem Rechner im Netzwerk. Der Daemon lauscht standardmäßig auf http://localhost:11434. Überprüfen Sie dies mit „ollama --version“ und „ollama ps“.
Docker für den Deploy Daemon
AppAPI stellt die ExApps über einen Docker-Daemon bereit. Bei Nextcloud AIO ist das integriert; bei einer manuellen Installation ist Zugriff auf Docker erforderlich (Socket oder API).
Ein wenig VRAM oder RAM
Als Richtwert für Q4: Ein 7B-Modell passt in etwa 5 GB, ein 14B-Modell in etwa 9 GB. Ohne GPU übernimmt der Arbeitsspeicher, allerdings langsamer – für gelegentliche Zusammenfassungen akzeptabel.
Admin-Zugriff auf Nextcloud
Die Einstellungen für Assistant, AppAPI und Integrationen werden in den „Verwaltungseinstellungen“ vorgenommen.

#1. Ollama vorbereiten und ein Modell auswählen

Beginnen Sie mit einem vielseitigen, französischsprachigen Instruct-Modell. Für den Einsatz in der Familie oder in einem kleinen Team bietet Qwen 3.5 9B in Q4_K_M den besten Kompromiss zwischen Qualität und Speicherbedarf: Es fasst französische Texte sehr gut zusammen und formuliert sie um, verarbeitet einen sehr großen Kontext (256k Tokens) und passt in etwa 6,6 GB VRAM. Noch sparsamer ist Granite 4.2 8B (IBM, Apache 2.0), das mit etwa 5,3 GB auskommt und sich damit für einen bescheidener ausgestatteten Server eignet.

Terminal — Modell abrufen
# Modèle polyvalent, bon en français, léger
ollama pull qwen3.5:9b

# Alternative très sobre (IBM, Apache 2.0)
ollama pull granite4.2:8b

# Vérifier qu'il répond
ollama run qwen3.5:9b "Résume en une phrase : Nextcloud est un cloud auto-hébergé."

Entscheidend ist: Ollama muss von Nextcloud aus erreichbar sein. Wenn Nextcloud in Docker läuft, bezeichnet „localhost“ den Container, nicht Ihren Rechner. Konfigurieren Sie Ollama so, dass es auf allen Netzwerkschnittstellen lauscht, und richten Sie die Integration auf die IP-Adresse des Hosts aus (oder je nach Plattform auf host.docker.internal).

Terminal — Ollama im Netzwerk verfügbar machen (systemd)
# Éditer le service
sudo systemctl edit ollama

# Ajouter dans la section [Service] :
#   Environment="OLLAMA_HOST=0.0.0.0:11434"

# Recharger et redémarrer
sudo systemctl daemon-reload
sudo systemctl restart ollama

# Depuis le serveur Nextcloud, tester l'accès
curl http://IP_DE_L_HOTE:11434/api/tags
!
Machen Sie Ollama nicht über das Internet zugänglich
OLLAMA_HOST=0.0.0.0 öffnet Port 11434 für das gesamte Netzwerk – praktisch im LAN, aber gefährlich, wenn der Rechner öffentlich erreichbar ist. Die Ollama-API hat keine Authentifizierung. Bleiben Sie im lokalen Netzwerk oder schalten Sie eine Firewall bzw. einen Reverse Proxy mit Authentifizierung davor. Richten Sie auf Ihrem Router niemals eine Weiterleitung für diesen Port ein.

#2. AppAPI und einen Deploy Daemon installieren

In Nextcloud wird KI über AppAPI eingebunden. Dieser Schritt schafft die Grundlage, um ExApps für KI-Aufgaben bereitzustellen.

  1. 01
    AppAPI installieren
    Verwaltungseinstellungen → Anwendungen → Kategorie „Tools“ (oder „Outils“) → suchen Sie nach „AppAPI“ und aktivieren Sie sie. Sie erscheint anschließend als eigener Eintrag in den Admin-Einstellungen.
  2. 02
    Einen Deploy Daemon konfigurieren
    Fügen Sie unter Admin-Einstellungen → AppAPI einen „Deploy Daemon“ vom Typ Docker hinzu. Bei Nextcloud AIO ist der Daemon bereits bereitgestellt; andernfalls geben Sie die Angaben für den Zugriff auf den Docker-Socket (z. B. /var/run/docker.sock) ein und starten den integrierten Verbindungstest.
  3. 03
    Status überprüfen
    AppAPI zeigt den Status des Daemons (grün = bereit). Solange er nicht grün ist, können die ExApps nicht bereitgestellt werden — es lohnt sich nicht weiterzugehen, bevor dieses Problem behoben ist.
  4. 04
    Die App Assistant installieren
    Aktivieren Sie ebenfalls unter „Applications“ die App „Assistant“, falls sie noch nicht vorhanden ist. Sie sorgt dafür, dass der Zauberstab in der Oberfläche angezeigt wird.
i
Zwei mögliche Wege
Sie können entweder eine containerisierte Backend-ExApp über AppAPI bereitstellen (z. B. die ExApp LocalAI/Ollama) oder den einfacheren Weg über die Anwendung „OpenAI and LocalAI integration“ wählen, die nur eine URL benötigt. Für den Einstieg mit Ollama ist dieser zweite Weg der direkteste – er wird im nächsten Schritt ausführlich beschrieben.

#3. Die OpenAI/LocalAI-Integration anbinden

Die Anwendung „OpenAI and LocalAI integration“ kann mit jedem Endpunkt kommunizieren, der der OpenAI-API entspricht. Da Ollama /v1 bereitstellt, genügt es, die richtige URL anzugeben und das Modell auszuwählen.

  1. 01
    Die Integration installieren
    Anwendungen → suchen Sie nach « OpenAI and LocalAI integration » und aktivieren Sie diese. Sie registriert Task-Provider (Textgenerierung, Zusammenfassung usw.), die der Assistent nutzen kann.
  2. 02
    Ollama-URL eingeben
    Administrationseinstellungen → „Connected accounts“ (oder der Integrationsbereich) → Feld „Service URL“: Geben Sie den OpenAI-Endpunkt von Ollama an, zum Beispiel http://IP_DE_L_HOTE:11434/v1. Lassen Sie den API-Schlüssel leer oder geben Sie einen beliebigen Platzhalterwert ein: Ollama überprüft den Schlüssel nicht.
  3. 03
    Standardmodell wählen
    Wählen Sie auf derselben Seite das Modell aus, das Sie für die Textgenerierung verwenden möchten (z. B. qwen3.5:9b). Falls es nicht in der Liste erscheint, geben Sie seinen genauen Namen so ein, wie ihn „ollama list“ ausgibt.
  4. 04
    Speichern und testen
    Bestätigen Sie. Die Integration fragt den Endpunkt ab, um die Modelle aufzulisten; ein Fehler an dieser Stelle deutet fast immer auf ein Problem mit der URL oder dem Netzwerk hin (siehe Fehlerbehebung).
Terminal — den OpenAI-Endpunkt von Ollama überprüfen
# Depuis le serveur Nextcloud, l'endpoint /v1 doit répondre
curl http://IP_DE_L_HOTE:11434/v1/models

# Et une complétion de chat au format OpenAI
curl http://IP_DE_L_HOTE:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:9b",
    "messages": [{"role": "user", "content": "Dis bonjour en une phrase."}]
  }'
→
URL je nach Standort von Ollama
Ollama auf demselben Rechner außerhalb von Docker: http://localhost:11434/v1. Nextcloud in Docker und Ollama auf dem Host: http://host.docker.internal:11434/v1 (oder die LAN-IP des Hosts). Ollama auf einem anderen Rechner: dessen Netzwerk-IP. Testen Sie die URL immer mit curl aus der Nextcloud-Umgebung, nicht von Ihrem Arbeitsplatzrechner aus.

#4. Zusammenfassen, Texte verfassen und über die eigenen Dateien chatten

Sobald der Provider angebunden ist, erwacht der Zauberstab des Assistenten zum Leben. Hier sind die konkreten Einsatzmöglichkeiten, von den einfachsten bis zu den umfangreichsten.

Einen Text zusammenfassen
Öffnen Sie den Assistenten (Zauberstab), fügen Sie einen Text ein oder wählen Sie einen aus und wählen Sie die Aufgabe „Résumé“. Ideal für eine lange E-Mail in Nextcloud Mail oder eine endlose Notiz.
Umformulieren / Korrigieren
Einen Absatz in einem formelleren Ton umschreiben, den Stil korrigieren, kürzen. Praktisch in Nextcloud Text und in Deck-Karten.
Entwurf erstellen
Ausgehend von einer Anweisung („Schreibe eine Einladung zur Besprechung am Freitag“) erstellt der Assistent einen ersten Entwurf, der noch überarbeitet werden muss.
Die wichtigsten Punkte extrahieren
Ein Protokoll in eine Liste von Aktionen oder Entscheidungen umwandeln.
Kontextbasiertes Chatten
Der Chat-Tab des Assistenten ermöglicht einen freien Dialog mit dem Ollama-Modell – hilfreich für Brainstorming, ohne Nextcloud zu verlassen.

Um im eigentlichen Sinne „über Ihre Dateien zu chatten“ (also Fragen zu stellen, deren Antwort in Ihren Dokumenten steht), muss dem Modell Kontext bereitgestellt werden. Es gibt zwei Ansätze: Für ein einzelnes, gelegentlich benötigtes Dokument den Dateiinhalt in den Chat einfügen oder eine ExApp vom Typ „Context Chat“ bereitstellen, die Ihre Dateien indexiert und das Modell über semantische Suche mit Kontext versorgt — das entspricht einem in Nextcloud integrierten RAG. Der erste Ansatz lässt sich sofort umsetzen; der zweite erfordert eine zusätzliche ExApp und mehr Ressourcen.

i
Context Chat = hauseigenes RAG
Die ExApp „Context Chat“ (über AppAPI) erstellt einen Vektorindex Ihrer Dateien und kombiniert ihn mit dem Ollama-Modell, um Antworten mit Zitaten aus Ihren Dokumenten zu geben. Das ist leistungsfähig, aber ressourcenintensiv (Embeddings + Vektorspeicher): Verwenden Sie die ExApp nur auf einem ausreichend dimensionierten Server und beginnen Sie mit dem einfachen Chat, um die Verarbeitungskette zu überprüfen.

#Den Server dimensionieren

Die passende Hardware hängt von der Anzahl gleichzeitig aktiver Nutzer und vom angestrebten Einsatzumfang ab (gelegentliche Zusammenfassungen gegenüber dauerhaftem RAG). Hier sind realistische Richtwerte.

Nutzung in der Familie (1–5 Personen)
Modell mit 7–8 Milliarden Parametern in Q4_K_M. Eine Einsteiger-GPU wie die RTX 3060 mit 12 GB oder ein Mac mit Apple Silicon und vereinheitlichtem Arbeitsspeicher reicht für Zusammenfassungen und das Verfassen von Texten völlig aus. Ohne GPU funktioniert es auf der CPU mit einigen Sekunden bis zu mehreren zehn Sekunden pro Anfrage.
Kleines Unternehmen (5–20 Personen)
Modell mit 7–14B Parametern. Eine RTX 4070/4080 mit 16 GB fängt Lastspitzen ab; ein 14B-Modell in Q4 passt in etwa 9 GB. Planen Sie ausreichend System-RAM für den Rest des Nextcloud-Stacks ein.
Intensive Nutzung / Context Chat
Berücksichtigen Sie zusätzlich die Last durch Embeddings und den Vector Store. Streben Sie eine RTX 4090 mit 24 GB oder einen Mac M4 Pro mit 24–48 GB Unified Memory an und behalten Sie « ollama ps » im Blick, um zu prüfen, ob das Modell auf der GPU bleibt.
Nur CPU
Für einen Haushalt mit geringen Ansprüchen geeignet: Bevorzugen Sie ein Modell mit 3B–7B und nehmen Sie die Latenz in Kauf. Darüber hinaus wird eine GPU schnell unverzichtbar, damit die Nutzung flüssig bleibt.
→
Nur ein Modell gleichzeitig geladen
Ollama entlädt und lädt Modelle je nach Bedarf neu. Wenn Nextcloud und ein weiterer Dienst dieselbe Ollama-Instanz nutzen, halten Sie idealerweise nur ein Modell „warm“, um aufwendige Neuladevorgänge zu vermeiden. „OLLAMA_KEEP_ALIVE“ ermöglicht es, das Modell zwischen zwei Anfragen im Speicher zu halten.

#Fehlerbehebung

« Connection refused » / kein Modell angezeigt
Nextcloud kann Ollama nicht erreichen. Meistens verweist die URL auf localhost, während Nextcloud in Docker läuft. Testen Sie die URL mit curl aus dem Nextcloud-Container und verwenden Sie host.docker.internal oder die IP-Adresse des Hosts.
Der Deploy Daemon bleibt rot
AppAPI greift nicht auf Docker zu. Prüfen Sie die Mount-Konfiguration von /var/run/docker.sock und die Berechtigungen; bei AIO starten Sie den Hauptcontainer neu. Ohne grünen Daemon wird keine ExApp bereitgestellt.
Der Assistent zeigt keine Aufgaben an
Kein Anbieter ist registriert. Prüfen Sie, ob „OpenAI and LocalAI integration“ (oder das ExApp-Backend) aktiviert und korrekt konfiguriert ist, und laden Sie anschließend die Seite neu.
Das angeforderte Modell ist nicht auffindbar
Der Name stimmt nicht mit « ollama list » überein. Geben Sie den genauen Tag (z. B. qwen3.5:9b) ein und überprüfen Sie, ob er korrekt abgerufen wurde (« ollama pull »).
Sehr langsame Antworten
Das Modell läuft wegen fehlenden VRAMs auf der CPU. Prüfen Sie das mit „ollama ps“ (GPU vs. CPU) und wechseln Sie zu einem kleineren Modell oder zur nächstniedrigeren Quantisierungsstufe.
Englische Antworten
Einige Modelle antworten standardmäßig auf Englisch. Wählen Sie ein Modell, das Französisch gut beherrscht (Qwen, Mistral), oder fügen Sie dem System-Prompt der Integration die Anweisung „Antworte auf Französisch“ hinzu.

#Weiterführende Informationen

Dieser Aufbau verwendet Bausteine, die auf der Website bereits behandelt wurden. Die folgenden Anleitungen führen diese Anleitung weiter:

Ollama installieren: Windows, macOS und Linux
Die grundlegende Installationsanleitung, wenn Sie bei null anfangen, bevor Sie Nextcloud daran anbinden.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um zwischen Modellgröße und verfügbarem VRAM auf Ihrem Nextcloud-Server abzuwägen.
KI-Chatbot für das Team im Intranet deployen
Für den Ausbau zu einem umfangreicheren Ollama-Stack für mehrere Nutzer rund um Ihre Cloud.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.