Zotero + LLM lokal: Zusammenfassung und Abfrage von bibliographie
Zotero bündelt Ihre Literaturreferenzen und PDF-Dateien; ein lokales LLM kann sie lesen und zusammenfassen. Verbindet man beide miteinander, erhält man einen Forschungsassistenten, der einen Artikel zusammenfassen, mehrere wissenschaftliche Arbeiten vergleichen und einen Überblick über den Forschungsstand vorbereiten kann – ohne Ihre unveröffentlichten Arbeiten jemals in eine Cloud zu senden. Dieser Leitfaden zeigt, wie Sie diese Zotero-KI-Pipeline mit Ollama und einer RAG-Komponente von Anfang bis Ende aufbauen.
#Warum eine lokale KI mit Zotero verbinden?
Ein Forscher sammelt in Zotero schnell Hunderte von Artikeln, die meisten noch unveröffentlicht, unter Embargo oder durch eine Vertraulichkeitsklausel geschützt. Das PDF eines Manuskripts, das gerade begutachtet wird, in einen Cloud-Chatbot einzufügen, bedeutet, dessen Inhalt einem Dritten anzuvertrauen — manchmal zum Training seiner Modelle. Ein LLM lokal auszuführen, löst dieses Problem an der Wurzel: Die Dateien bleiben auf Ihrer Festplatte, die Inferenz findet auf Ihrem Rechner statt, und keine Daten verlassen ihn.
Der Nutzen von Zotero als KI-Werkzeug für die Recherche beschränkt sich nicht auf die Vertraulichkeit. Ihre Bibliothek ist bereits strukturiert: Sammlungen nach Projekt, Tags, sauber gepflegte Metadaten und annotierte PDFs. Das ist eine sofort nutzbare Dokumentenbasis für ein LLM. Statt wissenschaftliche Arbeiten erneut herunterzuladen und neu zu organisieren, bindet man das Modell direkt an die bereits von Zotero geordneten Inhalte an.
- Zusammenfassen
- In dreißig Sekunden das Ziel, die Methode und die Ergebnisse eines zwanzigseitigen Artikels in Ihrer Sprache erhalten.
- Abfragen
- Eine Frage stellen und das Modell die Antwort in einer ganzen Sammlung suchen lassen, nicht nur in einem einzelnen PDF.
- Vergleichen
- Die Methoden oder Ergebnisse mehrerer Papers miteinander vergleichen, um einen ersten Überblick über den Forschungsstand zu gewinnen.
- Datenschutz
- Verarbeiten von Manuskripten unter Embargo oder Daten von Kollegen ohne Vertraulichkeitsverpflichtung.
#Wie Zotero und der LLM miteinander kommunizieren
Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Zotero „spricht“ nicht von Haus aus mit einem Sprachmodell. Die Verbindung erfolgt über Dateien: Zotero speichert jede PDF-Datei auf Ihrem Laufwerk, und genau diese PDF-Datei gibt man dem LLM zum Lesen. Es gibt zwei grundlegende Ansätze, die häufig kombiniert werden.
- Zusammenfassung auf Anfrage
- Man extrahiert den Text aus einer bestimmten PDF-Datei und sendet ihn mit der Anweisung, eine Zusammenfassung zu erstellen, an Ollama. Einfach, schnell, ideal, um jeweils einen Artikel zu bearbeiten.
- RAG auf Basis der Bibliothek
- Ein ganzer Ordner mit PDFs wird in einer Vektordatenbank indexiert und anschließend in natürlicher Sprache abgefragt. Das Modell liest nur die relevanten Passagen, sodass sich Dutzende wissenschaftliche Arbeiten abdecken lassen.
In beiden Fällen bleibt der Speicherordner von Zotero das zentrale Element, in dem sich alle PDFs befinden. Zotero 7 stellt auch eine lokale API (auf Port 23119) bereit, mit der sich seine Einträge programmgesteuert auflisten lassen. Für den Einstieg ist es jedoch am robustesten und transparentesten, direkt auf die Dateien zu verweisen.
#Voraussetzungen
- Zotero 7
- Mit Ihren PDF-Dateien als Anhängen zu den Literaturangaben (nicht nur mit den Metadaten). Der integrierte PDF-Reader ist nicht erforderlich, aber die Dateien müssen lokal gespeichert sein.
- Ollama
- Der Daemon, der die Modelle bereitstellt, standardmäßig unter http://localhost:11434. Falls die Installation noch nicht erfolgt ist, die Installationsanleitung konsultieren.
- Ein Modell zum Zusammenfassen
- Qwen 3.5 9B (≈6,6 GB VRAM mit Q4_K_M, 256k Kontext und Bildverarbeitung) oder Mistral Small 24B für hervorragendes Französisch; auf einem Rechner mit begrenzten Ressourcen reicht Qwen 3.5 4B (3,4 GB).
- Ein Embeddings-Modell
- Für RAG: nomic-embed-text oder mxbai-embed-large, mit ollama pull herunterladbar. Diese Modelle sind ressourcenschonend und laufen sogar ohne GPU.
- Eine RAG-Komponente (optional)
- AnythingLLM oder Open WebUI, wenn Sie die gesamte Bibliographie ohne Programmieren abfragen möchten.
#Schritt 1: Die PDF-Dateien in Zotero wiederfinden
Zotero legt jeden Anhang in einem Unterordner des Verzeichnisses storage ab, der nach einem Schlüssel aus acht Zeichen benannt ist. Sie müssen diese Verzeichnisstruktur nicht im Detail verstehen: Es reicht zu wissen, wo sie sich befindet, um dem LLM diesen Pfad anzugeben.
- Windows
- C:\Users\
\Zotero\storage - macOS
- ~/Zotero/storage
- Linux
- ~/Zotero/storage
Im Zweifelsfall ist der genaue Pfad in Zotero unter Bearbeiten ▸ Einstellungen ▸ Erweitert ▸ Dateien und Ordner ▸ „Datenverzeichnis“ angegeben. Der Ordner storage befindet sich direkt darin.
Um sauber an einem bestimmten Projekt zu arbeiten, exportieren Sie am besten eine Sammlung, statt den gesamten Ordner storage zu durchsuchen. Rechtsklick auf eine Sammlung ▸ „Sammlung exportieren“: Zotero kann die PDFs und eine Bibliografie (BibTeX, CSV, JSON) in einen eigenen Ordner kopieren, den Sie anschließend dem LLM bereitstellen.
#Schritt 2: Einen wissenschaftlichen Artikel zusammenfassen
Der häufigste Fall: Sie öffnen einen wissenschaftlichen Artikel in Zotero und möchten eine Zusammenfassung, bevor Sie entscheiden, ob er eine vollständige Lektüre wert ist. Zuerst wird der Text aus der PDF-Datei extrahiert und dann an Ollama gesendet. Die Bibliothek pymupdf (fitz) erledigt die Extraktion sauber und schnell.
Wir rufen die REST-API von Ollama über Port 11434 auf: Sie trennt die Systemnachricht (die Rolle) vom Inhalt (dem Artikel). Zwei Einstellungen sind hier wichtig – eine niedrige Temperatur (0,2), um erfundene Ausschmückungen zu begrenzen, und ein ausreichend großer Wert für num_ctx, um einen ganzen Artikel einzulesen, ohne ihn abzuschneiden.
#Ein zuverlässiger Zusammenfassungsprompt
Die Qualität der Zusammenfassung hängt stärker vom Prompt als vom Modell ab. Ein vager Prompt liefert einen nichtssagenden Absatz; ein strukturierter Prompt liefert eine wiederverwendbare Lektürenotiz. Das Geheimnis: Ein Format mit Abschnitten vorgeben, das der Struktur eines wissenschaftlichen Artikels folgt, und dem Modell verbieten, über den Text hinauszugehen.
- Das vorgegebene Format
- Die Abschnittsüberschriften zwingen das Modell, die Inhalte zu ordnen, statt sie unnötig auszuwalzen. Sie erhalten für jeden Artikel dasselbe Raster und können die Ergebnisse auf einen Blick vergleichen.
- Die Anti-Halluzinations-Regel
- „Übernehmen Sie nur, was geschrieben steht“ und „nicht angegeben“ verringern das Risiko, dass das LLM ein Ergebnis oder eine Referenz erfindet – die größte Gefahr im wissenschaftlichen Kontext.
- Der Abschnitt zum Forschungsstand
- Indem Sie ausdrücklich nach der Einordnung fragen, machen Sie die Zusammenfassung zu Ausgangsmaterial, das sich direkt in einer Literaturübersicht weiterverwenden lässt.
#Schritt 3: Die gesamte Bibliographie im RAG-Verfahren abfragen
Ein PDF zusammenzufassen ist nützlich; fünfzig wissenschaftliche Arbeiten auf einmal zu befragen verändert jedoch die Vorbereitung einer Übersicht über den Forschungsstand. Dafür geht man zu RAG (Retrieval-Augmented Generation) über: Die PDFs werden in Abschnitte aufgeteilt und mit dem Embedding-Modell in Vektoren umgewandelt, und das LLM liest für jede Frage nur die relevanten Passagen.
Am einfachsten geht es ohne Programmierung: Richten Sie AnythingLLM oder Open WebUI auf den aus Zotero exportierten Ordner aus (oder direkt auf storage). Diese Tools übernehmen die Indexierung und die Verwaltung der Vektordatenbank für Sie; Sie müssen lediglich Ollama als Anbieter und nomic-embed-text als Embedding-Modell auswählen.
- 01Die Sammlung exportierenExportieren Sie aus Zotero die betreffende Sammlung mit ihren PDF-Dateien in einen dafür vorgesehenen Ordner, beispielsweise ~/recherche/etat-de-l-art.
- 02Arbeitsbereich erstellenErstellen Sie in AnythingLLM einen Workspace und stellen Sie den LLM-Anbieter auf Ollama (http://localhost:11434) und das Embedding-Modell auf nomic-embed-text ein.
- 03Dokumente importierenZiehen Sie den PDF-Ordner in den Workspace. Das Tool extrahiert den Text, teilt ihn auf und indexiert ihn automatisch.
- 04Fragen in natürlicher Sprache stellenStellen Sie publikationsübergreifende Fragen: „Welche Evaluationsmethoden kommen am häufigsten vor?“, „Welche wissenschaftlichen Arbeiten widersprechen der Hypothese X?“.
Der große Vorteil von RAG gegenüber einer einfachen Zusammenfassung: Das Modell zitiert die verwendeten Passagen. Sie können zur ursprünglichen PDF-Datei zurückgehen, um die Angaben zu überprüfen, was in der Forschung unverzichtbar ist. Fordern Sie das Modell stets auf, für jede Aussage das Dokument anzugeben, aus dem sie stammt.
#Grenzen bei sehr technischen wissenschaftlichen Arbeiten
Hier muss man ehrlich sein: Bei einem sehr formalen Artikel über Mathematik, theoretische Physik oder ML stößt ein lokales LLM schnell an seine Grenzen. Wer diese blinden Flecken versteht, vermeidet es, dem Modell dort zu vertrauen, wo das nicht angebracht ist.
- Formeln
- Bei der Textextraktion geht die Formatierung von Gleichungen verloren: Indizes, Exponenten und griechische Symbole geraten durcheinander oder verschwinden. Das Modell zieht dann Schlüsse aus verfälschten Formeln und kann dabei zu falschen Ergebnissen kommen.
- Die Tabellen
- Eine Tabelle wird zu einem Zahlenbrei, sobald sie als reiner Text extrahiert wird. Die Zuordnungen zwischen Zeilen und Spalten gehen verloren, weshalb Zahlen, die aus einer Tabelle zitiert werden, wenig zuverlässig sind.
- Die Grafiken
- Ein Textmodell kann Diagramme nicht sehen. Jedes Ergebnis, das nur in einer Abbildung dargestellt ist, entgeht ihm vollständig – es wird dieses Ergebnis nicht erwähnen oder es anhand der Bildunterschrift erfinden.
- Mathematisches Schlussfolgern
- Einen mathematischen Beweis nachzuvollziehen oder eine Herleitung zu überprüfen, übersteigt das, was ein lokales 14B-Modell zuverlässig leisten kann. Es paraphrasiert den Beweis, ohne ihn zu validieren.
Konkret: Nutzen Sie das LLM für die „narrative“ Ebene eines Artikels – Forschungsfrage, Motivation, angekündigte Beiträge, Grenzen und Positionierung. Prüfen Sie alles, was Formeln, Zahlentabellen und Abbildungen betrifft, weiterhin selbst. Bei wissenschaftlichen Artikeln mit vielen Gleichungen liefert ein multimodales Modell, das die Seiten als Bilder lesen kann (statt den extrahierten Text), bessere Ergebnisse. Es bleibt aber eine Ergänzung und ersetzt nicht Ihre eigene Lektüre.
#Fehlerbehebung
- Die PDF liefert bei der Textextraktion keinen Inhalt
- Es handelt sich um einen Scan ohne Textebene. Führen Sie vor der Extraktion eine OCR-Verarbeitung durch (ocrmypdf entree.pdf sortie.pdf).
- Die Zusammenfassung ignoriert das Ende des Artikels
- num_ctx ist zu klein: Der Text wurde abgeschnitten. Erhöhen Sie den Wert, wenn der VRAM es zulässt. Andernfalls fassen Sie den Text abschnittsweise zusammen und erstellen anschließend eine Zusammenfassung der Zusammenfassungen.
- RAG antwortet an der Frage vorbei
- Es wurden die falschen Passagen abgerufen. Formulieren Sie die Frage mit den genauen Fachbegriffen neu oder reduzieren Sie die Chunk-Größe bei der Indexierung.
- Langsame Antworten
- Ein 9B-Modell läuft auf der CPU langsam. Prüfen Sie, ob Ollama tatsächlich die GPU nutzt, oder wechseln Sie für alltägliche Zusammenfassungen zu Qwen 3.5 4B (3,4 GB).
- Zahlen, die nicht mit dem PDF übereinstimmen
- Typisches Symptom einer fehlerhaft extrahierten Tabelle oder einer Halluzination. Senken Sie die Temperatur und gleichen Sie die Angaben vor allem mit der Quelle ab.
#Weiterführende Informationen
Dieser Leitfaden baut auf Bausteinen auf, die auf der Website bereits ausführlich beschrieben sind. Wenn Sie insbesondere die Installation oder RAG vertiefen möchten:
- Ollama installieren: Windows, macOS und Linux
- Der Ausgangspunkt, um Ihre Modelle lokal über Port 11434 bereitzustellen, falls dies noch nicht eingerichtet ist.
- Lokales RAG mit Ollama ohne Programmieren (Open WebUI, AnythingLLM)
- Der Referenzleitfaden zum Aufbau eines RAG-Bausteins, der Ihre gesamte Bibliografie abfragt, ohne dass Sie eine einzige Zeile Code schreiben müssen.
- Lokales RAG mit LM Studio: mit Ihren Dokumenten chatten
- Eine All-in-one-Alternative, wenn Sie LM Studio der Kombination aus Ollama und einer separaten Benutzeroberfläche vorziehen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.