Mittelstufe 11 Min.Suche

Zotero + LLM lokal: Zusammenfassung und Abfrage von bibliographie

Zotero bündelt Ihre Literaturreferenzen und PDF-Dateien; ein lokales LLM kann sie lesen und zusammenfassen. Verbindet man beide miteinander, erhält man einen Forschungsassistenten, der einen Artikel zusammenfassen, mehrere wissenschaftliche Arbeiten vergleichen und einen Überblick über den Forschungsstand vorbereiten kann – ohne Ihre unveröffentlichten Arbeiten jemals in eine Cloud zu senden. Dieser Leitfaden zeigt, wie Sie diese Zotero-KI-Pipeline mit Ollama und einer RAG-Komponente von Anfang bis Ende aufbauen.

Von Clara M.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum eine lokale KI mit Zotero verbinden?

Ein Forscher sammelt in Zotero schnell Hunderte von Artikeln, die meisten noch unveröffentlicht, unter Embargo oder durch eine Vertraulichkeitsklausel geschützt. Das PDF eines Manuskripts, das gerade begutachtet wird, in einen Cloud-Chatbot einzufügen, bedeutet, dessen Inhalt einem Dritten anzuvertrauen — manchmal zum Training seiner Modelle. Ein LLM lokal auszuführen, löst dieses Problem an der Wurzel: Die Dateien bleiben auf Ihrer Festplatte, die Inferenz findet auf Ihrem Rechner statt, und keine Daten verlassen ihn.

Der Nutzen von Zotero als KI-Werkzeug für die Recherche beschränkt sich nicht auf die Vertraulichkeit. Ihre Bibliothek ist bereits strukturiert: Sammlungen nach Projekt, Tags, sauber gepflegte Metadaten und annotierte PDFs. Das ist eine sofort nutzbare Dokumentenbasis für ein LLM. Statt wissenschaftliche Arbeiten erneut herunterzuladen und neu zu organisieren, bindet man das Modell direkt an die bereits von Zotero geordneten Inhalte an.

Zusammenfassen
In dreißig Sekunden das Ziel, die Methode und die Ergebnisse eines zwanzigseitigen Artikels in Ihrer Sprache erhalten.
Abfragen
Eine Frage stellen und das Modell die Antwort in einer ganzen Sammlung suchen lassen, nicht nur in einem einzelnen PDF.
Vergleichen
Die Methoden oder Ergebnisse mehrerer Papers miteinander vergleichen, um einen ersten Überblick über den Forschungsstand zu gewinnen.
Datenschutz
Verarbeiten von Manuskripten unter Embargo oder Daten von Kollegen ohne Vertraulichkeitsverpflichtung.
i
Was lokale KI nicht ersetzt
Ein lokales LLM spart Ihnen Zeit beim Lesen, ersetzt aber keine Sorgfalt. Es erstellt Entwürfe für Zusammenfassungen, die Sie prüfen müssen, keine Wahrheiten, die Sie unverändert zitieren können. Der Abschnitt über die Grenzen erklärt, wo es sich weiterhin irrt.

#Wie Zotero und der LLM miteinander kommunizieren

Das Kit Lokales RAG

Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Zotero „spricht“ nicht von Haus aus mit einem Sprachmodell. Die Verbindung erfolgt über Dateien: Zotero speichert jede PDF-Datei auf Ihrem Laufwerk, und genau diese PDF-Datei gibt man dem LLM zum Lesen. Es gibt zwei grundlegende Ansätze, die häufig kombiniert werden.

Zusammenfassung auf Anfrage
Man extrahiert den Text aus einer bestimmten PDF-Datei und sendet ihn mit der Anweisung, eine Zusammenfassung zu erstellen, an Ollama. Einfach, schnell, ideal, um jeweils einen Artikel zu bearbeiten.
RAG auf Basis der Bibliothek
Ein ganzer Ordner mit PDFs wird in einer Vektordatenbank indexiert und anschließend in natürlicher Sprache abgefragt. Das Modell liest nur die relevanten Passagen, sodass sich Dutzende wissenschaftliche Arbeiten abdecken lassen.

In beiden Fällen bleibt der Speicherordner von Zotero das zentrale Element, in dem sich alle PDFs befinden. Zotero 7 stellt auch eine lokale API (auf Port 23119) bereit, mit der sich seine Einträge programmgesteuert auflisten lassen. Für den Einstieg ist es jedoch am robustesten und transparentesten, direkt auf die Dateien zu verweisen.

#Voraussetzungen

Zotero 7
Mit Ihren PDF-Dateien als Anhängen zu den Literaturangaben (nicht nur mit den Metadaten). Der integrierte PDF-Reader ist nicht erforderlich, aber die Dateien müssen lokal gespeichert sein.
Ollama
Der Daemon, der die Modelle bereitstellt, standardmäßig unter http://localhost:11434. Falls die Installation noch nicht erfolgt ist, die Installationsanleitung konsultieren.
Ein Modell zum Zusammenfassen
Qwen 3.5 9B (≈6,6 GB VRAM mit Q4_K_M, 256k Kontext und Bildverarbeitung) oder Mistral Small 24B für hervorragendes Französisch; auf einem Rechner mit begrenzten Ressourcen reicht Qwen 3.5 4B (3,4 GB).
Ein Embeddings-Modell
Für RAG: nomic-embed-text oder mxbai-embed-large, mit ollama pull herunterladbar. Diese Modelle sind ressourcenschonend und laufen sogar ohne GPU.
Eine RAG-Komponente (optional)
AnythingLLM oder Open WebUI, wenn Sie die gesamte Bibliographie ohne Programmieren abfragen möchten.
Modelle abrufen
# Modèle de synthèse (adaptez à votre VRAM)
ollama pull qwen3.5:9b

# Modèle d'embeddings pour le RAG
ollama pull nomic-embed-text
→
Größe entsprechend der GPU wählen
Bei Q4_K_M sollten Sie mit etwa 5 GB VRAM für ein 7B-Modell, 9 GB für ein 14B-Modell und 19 GB für ein 32B-Modell rechnen. Eine RTX 3060 mit 12 GB führt ein 14B-Modell problemlos aus; auf einem Mac mit gemeinsamem Arbeitsspeicher bleibt ein 32B-Modell eine mögliche Option.

#Schritt 1: Die PDF-Dateien in Zotero wiederfinden

Zotero legt jeden Anhang in einem Unterordner des Verzeichnisses storage ab, der nach einem Schlüssel aus acht Zeichen benannt ist. Sie müssen diese Verzeichnisstruktur nicht im Detail verstehen: Es reicht zu wissen, wo sie sich befindet, um dem LLM diesen Pfad anzugeben.

Windows
C:\Users\\Zotero\storage
macOS
~/Zotero/storage
Linux
~/Zotero/storage

Im Zweifelsfall ist der genaue Pfad in Zotero unter Bearbeiten ▸ Einstellungen ▸ Erweitert ▸ Dateien und Ordner ▸ „Datenverzeichnis“ angegeben. Der Ordner storage befindet sich direkt darin.

Um sauber an einem bestimmten Projekt zu arbeiten, exportieren Sie am besten eine Sammlung, statt den gesamten Ordner storage zu durchsuchen. Rechtsklick auf eine Sammlung ▸ „Sammlung exportieren“: Zotero kann die PDFs und eine Bibliografie (BibTeX, CSV, JSON) in einen eigenen Ordner kopieren, den Sie anschließend dem LLM bereitstellen.

i
Text extrahieren, nicht das Bild
Das LLM liest Text, keine Pixel. Eine „gescannte“ PDF-Datei ohne Textebene muss zunächst mit OCR verarbeitet werden (zum Beispiel mit ocrmypdf). Moderne PDF-Dateien von Verlagen enthalten bereits eine direkt nutzbare Textebene.

#Schritt 2: Einen wissenschaftlichen Artikel zusammenfassen

Der häufigste Fall: Sie öffnen einen wissenschaftlichen Artikel in Zotero und möchten eine Zusammenfassung, bevor Sie entscheiden, ob er eine vollständige Lektüre wert ist. Zuerst wird der Text aus der PDF-Datei extrahiert und dann an Ollama gesendet. Die Bibliothek pymupdf (fitz) erledigt die Extraktion sauber und schnell.

Abhängigkeiten
pip install pymupdf requests
resumer_article.py
import sys, fitz, requests

def extraire_texte(pdf_path):
    doc = fitz.open(pdf_path)
    return "\n".join(page.get_text() for page in doc)

SYSTEM = (
    "Tu es un assistant de recherche. Tu résumes des articles "
    "scientifiques en français, avec rigueur, sans rien inventer. "
    "Tu t'appuies uniquement sur le texte fourni."
)

texte = extraire_texte(sys.argv[1])

resp = requests.post("http://localhost:11434/api/chat", json={
    "model": "qwen3.5:9b",
    "stream": False,
    "options": {"num_ctx": 16384, "temperature": 0.2},
    "messages": [
        {"role": "system", "content": SYSTEM},
        {"role": "user", "content": PROMPT + "\n\n---\n" + texte},
    ],
})

print(resp.json()["message"]["content"])

Wir rufen die REST-API von Ollama über Port 11434 auf: Sie trennt die Systemnachricht (die Rolle) vom Inhalt (dem Artikel). Zwei Einstellungen sind hier wichtig – eine niedrige Temperatur (0,2), um erfundene Ausschmückungen zu begrenzen, und ein ausreichend großer Wert für num_ctx, um einen ganzen Artikel einzulesen, ohne ihn abzuschneiden.

!
Das Kontextfenster setzt Ihnen eine feste Grenze
Ein zwanzigseitiger Artikel umfasst oft 12 000 bis 18 000 Wörter. Wenn num_ctx zu klein ist, sieht das Modell nur den Anfang des PDFs und fasst das Ende blind zusammen. Prüfen Sie den Kontext des Modells, erhöhen Sie num_ctx, wenn der VRAM es hergibt, andernfalls teilen Sie in Abschnitte auf.

#Ein zuverlässiger Zusammenfassungsprompt

Die Qualität der Zusammenfassung hängt stärker vom Prompt als vom Modell ab. Ein vager Prompt liefert einen nichtssagenden Absatz; ein strukturierter Prompt liefert eine wiederverwendbare Lektürenotiz. Das Geheimnis: Ein Format mit Abschnitten vorgeben, das der Struktur eines wissenschaftlichen Artikels folgt, und dem Modell verbieten, über den Text hinauszugehen.

Prompt für eine Lektürenotiz
Rédige une fiche de lecture en français de l'article ci-dessous, en respectant EXACTEMENT ce format :

## Question de recherche
Ce que l'article cherche à établir, en une à deux phrases.

## Méthode
Données, protocole, modèles ou outils utilisés.

## Résultats principaux
- Une puce par résultat marquant, chiffré si l'article donne des chiffres.

## Limites annoncées
- Les limites que les auteurs reconnaissent eux-mêmes.

## À retenir pour mon état de l'art
Deux à trois phrases sur l'apport et le positionnement de l'article.

Règles :
- Ne reprends que ce qui est réellement écrit dans l'article.
- Si une section n'est pas renseignée dans le texte, écris « non précisé ».
- N'invente aucun chiffre, aucune référence, aucun nom d'auteur.
Das vorgegebene Format
Die Abschnittsüberschriften zwingen das Modell, die Inhalte zu ordnen, statt sie unnötig auszuwalzen. Sie erhalten für jeden Artikel dasselbe Raster und können die Ergebnisse auf einen Blick vergleichen.
Die Anti-Halluzinations-Regel
„Übernehmen Sie nur, was geschrieben steht“ und „nicht angegeben“ verringern das Risiko, dass das LLM ein Ergebnis oder eine Referenz erfindet – die größte Gefahr im wissenschaftlichen Kontext.
Der Abschnitt zum Forschungsstand
Indem Sie ausdrücklich nach der Einordnung fragen, machen Sie die Zusammenfassung zu Ausgangsmaterial, das sich direkt in einer Literaturübersicht weiterverwenden lässt.
→
Prüfen Sie die Zahlen immer anhand der Originalquelle
Auch bei niedriger Temperatur und strikten Anweisungen kann ein LLM eine Zahl von einer Zeile in eine andere übertragen. Betrachten Sie jede Zahl in der Zusammenfassung als einen Hinweis, den Sie im PDF bestätigen müssen, bevor Sie die Zahl zitieren.

#Schritt 3: Die gesamte Bibliographie im RAG-Verfahren abfragen

Ein PDF zusammenzufassen ist nützlich; fünfzig wissenschaftliche Arbeiten auf einmal zu befragen verändert jedoch die Vorbereitung einer Übersicht über den Forschungsstand. Dafür geht man zu RAG (Retrieval-Augmented Generation) über: Die PDFs werden in Abschnitte aufgeteilt und mit dem Embedding-Modell in Vektoren umgewandelt, und das LLM liest für jede Frage nur die relevanten Passagen.

Am einfachsten geht es ohne Programmierung: Richten Sie AnythingLLM oder Open WebUI auf den aus Zotero exportierten Ordner aus (oder direkt auf storage). Diese Tools übernehmen die Indexierung und die Verwaltung der Vektordatenbank für Sie; Sie müssen lediglich Ollama als Anbieter und nomic-embed-text als Embedding-Modell auswählen.

  1. 01
    Die Sammlung exportieren
    Exportieren Sie aus Zotero die betreffende Sammlung mit ihren PDF-Dateien in einen dafür vorgesehenen Ordner, beispielsweise ~/recherche/etat-de-l-art.
  2. 02
    Arbeitsbereich erstellen
    Erstellen Sie in AnythingLLM einen Workspace und stellen Sie den LLM-Anbieter auf Ollama (http://localhost:11434) und das Embedding-Modell auf nomic-embed-text ein.
  3. 03
    Dokumente importieren
    Ziehen Sie den PDF-Ordner in den Workspace. Das Tool extrahiert den Text, teilt ihn auf und indexiert ihn automatisch.
  4. 04
    Fragen in natürlicher Sprache stellen
    Stellen Sie publikationsübergreifende Fragen: „Welche Evaluationsmethoden kommen am häufigsten vor?“, „Welche wissenschaftlichen Arbeiten widersprechen der Hypothese X?“.

Der große Vorteil von RAG gegenüber einer einfachen Zusammenfassung: Das Modell zitiert die verwendeten Passagen. Sie können zur ursprünglichen PDF-Datei zurückgehen, um die Angaben zu überprüfen, was in der Forschung unverzichtbar ist. Fordern Sie das Modell stets auf, für jede Aussage das Dokument anzugeben, aus dem sie stammt.

i
RAG liest nicht „alles“
Entgegen einer verbreiteten Annahme lässt RAG das Modell nicht die vollständigen wissenschaftlichen Artikel lesen: Es liefert nur die wenigen Passagen, die der Frage inhaltlich am nächsten kommen. Eine schlecht formulierte Frage führt zu den falschen Auszügen. Formulieren Sie die Frage neu, wenn die Antwort am Thema vorbeizugehen scheint.

#Grenzen bei sehr technischen wissenschaftlichen Arbeiten

Hier muss man ehrlich sein: Bei einem sehr formalen Artikel über Mathematik, theoretische Physik oder ML stößt ein lokales LLM schnell an seine Grenzen. Wer diese blinden Flecken versteht, vermeidet es, dem Modell dort zu vertrauen, wo das nicht angebracht ist.

Formeln
Bei der Textextraktion geht die Formatierung von Gleichungen verloren: Indizes, Exponenten und griechische Symbole geraten durcheinander oder verschwinden. Das Modell zieht dann Schlüsse aus verfälschten Formeln und kann dabei zu falschen Ergebnissen kommen.
Die Tabellen
Eine Tabelle wird zu einem Zahlenbrei, sobald sie als reiner Text extrahiert wird. Die Zuordnungen zwischen Zeilen und Spalten gehen verloren, weshalb Zahlen, die aus einer Tabelle zitiert werden, wenig zuverlässig sind.
Die Grafiken
Ein Textmodell kann Diagramme nicht sehen. Jedes Ergebnis, das nur in einer Abbildung dargestellt ist, entgeht ihm vollständig – es wird dieses Ergebnis nicht erwähnen oder es anhand der Bildunterschrift erfinden.
Mathematisches Schlussfolgern
Einen mathematischen Beweis nachzuvollziehen oder eine Herleitung zu überprüfen, übersteigt das, was ein lokales 14B-Modell zuverlässig leisten kann. Es paraphrasiert den Beweis, ohne ihn zu validieren.

Konkret: Nutzen Sie das LLM für die „narrative“ Ebene eines Artikels – Forschungsfrage, Motivation, angekündigte Beiträge, Grenzen und Positionierung. Prüfen Sie alles, was Formeln, Zahlentabellen und Abbildungen betrifft, weiterhin selbst. Bei wissenschaftlichen Artikeln mit vielen Gleichungen liefert ein multimodales Modell, das die Seiten als Bilder lesen kann (statt den extrahierten Text), bessere Ergebnisse. Es bleibt aber eine Ergänzung und ersetzt nicht Ihre eigene Lektüre.

!
Niemals ungeprüft zitieren
Übernehmen Sie niemals eine vom Modell erzeugte Zahl, Formel oder Aussage, ohne sie zuvor im PDF wiedergefunden zu haben. Das LLM soll Ihnen Orientierung geben und die Vorarbeit erleichtern, nicht die wissenschaftliche Überprüfung ersetzen.

#Fehlerbehebung

Die PDF liefert bei der Textextraktion keinen Inhalt
Es handelt sich um einen Scan ohne Textebene. Führen Sie vor der Extraktion eine OCR-Verarbeitung durch (ocrmypdf entree.pdf sortie.pdf).
Die Zusammenfassung ignoriert das Ende des Artikels
num_ctx ist zu klein: Der Text wurde abgeschnitten. Erhöhen Sie den Wert, wenn der VRAM es zulässt. Andernfalls fassen Sie den Text abschnittsweise zusammen und erstellen anschließend eine Zusammenfassung der Zusammenfassungen.
RAG antwortet an der Frage vorbei
Es wurden die falschen Passagen abgerufen. Formulieren Sie die Frage mit den genauen Fachbegriffen neu oder reduzieren Sie die Chunk-Größe bei der Indexierung.
Langsame Antworten
Ein 9B-Modell läuft auf der CPU langsam. Prüfen Sie, ob Ollama tatsächlich die GPU nutzt, oder wechseln Sie für alltägliche Zusammenfassungen zu Qwen 3.5 4B (3,4 GB).
Zahlen, die nicht mit dem PDF übereinstimmen
Typisches Symptom einer fehlerhaft extrahierten Tabelle oder einer Halluzination. Senken Sie die Temperatur und gleichen Sie die Angaben vor allem mit der Quelle ab.

#Weiterführende Informationen

Dieser Leitfaden baut auf Bausteinen auf, die auf der Website bereits ausführlich beschrieben sind. Wenn Sie insbesondere die Installation oder RAG vertiefen möchten:

Ollama installieren: Windows, macOS und Linux
Der Ausgangspunkt, um Ihre Modelle lokal über Port 11434 bereitzustellen, falls dies noch nicht eingerichtet ist.
Lokales RAG mit Ollama ohne Programmieren (Open WebUI, AnythingLLM)
Der Referenzleitfaden zum Aufbau eines RAG-Bausteins, der Ihre gesamte Bibliografie abfragt, ohne dass Sie eine einzige Zeile Code schreiben müssen.
Lokales RAG mit LM Studio: mit Ihren Dokumenten chatten
Eine All-in-one-Alternative, wenn Sie LM Studio der Kombination aus Ollama und einer separaten Benutzeroberfläche vorziehen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.