Der Referenzleitfaden · 16 Kapitel · Skripte inklusive · lebenslange Updates

Ein lokales RAG, das
wirklich etwas taugt

Hinweis: Die Kits (PDF und Online-Bereich) sind auf Französisch verfasst. Kauf und Zahlung erfolgen auf QuelLLM.fr.

Das RAG-Local-Kit : DER Referenzleitfaden zum Aufbau eines zuverlässigen RAG auf Basis Ihrer eigenen Dokumente — PDFs, Notizen, E-Mails, Zotero-Bibliografie — ohne irgendetwas in die Cloud zu senden. Ein RAG, das mit 300 PDFs zuverlässig funktioniert, statt einer Demo, die nur jedes dritte Mal funktioniert.

Kit erhalten — 24 €

24 € · Einmalzahlung · lebenslange Updates inklusive

✓ Sofortiger Zugriff (online + PDF) ✓ Sichere Zahlung über Stripe ✓ Fortlaufend aktualisierte Ausgabe (lebenslange Updates)

Die 16 Kapitel ansehen →

Was ist das RAG-Local-Kit?

Das RAG-Local-Kit ist ein Referenzhandbuch mit 16 Kapiteln (103 Seiten), 20 Skripten und Vorlagen sowie lebenslangem Zugang zu einem Onlinebereich. Es richtet sich an Fachkräfte, Forscher und Entwickler, die mit der Kommandozeile vertraut sind und einen PC (8–16 GB VRAM) oder einen Mac mini M4 mit 24 GB nutzen. Ergebnis: eine vollständige RAG-Pipeline – Ingestion, Chunking, französische Embeddings, Index, hybride Suche, Reranking –, deren Leistung mit einem Recall@k-Protokoll gemessen wurde, statt sie nur an drei Beispielen zu testen.

  • 16 Kapitel (103 Seiten) und 20 Skripte, Vorlagen und Vergleiche zum Herunterladen.
  • 2 Profile abgedeckt: PC mit 8–16 GB VRAM oder Mac mini M4 mit 24 GB.
  • Behandelte Vektordatenbanken: ChromaDB, Qdrant und LanceDB, frei wählbar.
  • Französische Embeddings verglichen: bge-m3 und nomic-embed-text-v2-moe.
  • Messprotokoll für recall@k anhand eines Satzes von 30 bis 50 Fragen.
  • 24 € als einmalige Zahlung, lebenslange Updates inklusive.
Cover des RAG-Local-Kits — RAG Local

✓ Für Sie, wenn…

Sie sind beruflicher Anwender, Forscher oder Entwickler, mit der Kommandozeile vertraut (Python ist für die meisten Kapitel nützlich, aber nicht zwingend erforderlich), nutzen bereits lokale KI (Ollama/LM Studio, gegebenenfalls das IA-Local-Kit) und möchten ein RAG-System, das bei der Arbeit mit Dutzenden oder Hunderten von Dokumenten über bloßes Knopfdrücken hinausgeht — Verträge, Zotero-Bibliografie, Korrespondenz, internes Wiki.

✗ Nicht für Sie, wenn…

Sie möchten nur gelegentlich eine Frage zu drei PDF-Dateien stellen (das deckt bereits das IA-Local-Kit, Kap. 8, ab); Sie suchen dokumentenbasiertes RAG, um einen Code-Copiloten mit Informationen zu versorgen (dafür gibt es das Copilot-Local-Kit); oder Sie stellen das System für mehrere Nutzer in einem Unternehmen bereit und müssen dabei DSGVO-Vorgaben einhalten (das IA-Local-Kit für Unternehmen).

24 € Einmalige Zahlung · lebenslange Updates inklusive 7 über die Website verstreute RAG-Anleitungen + stundenlange Zusammenstellung. Dieses Kit: 24 €, die bereits zusammengestellte und getestete Pipeline.

Warum Sie sich darauf verlassen können

Verfasst und gepflegt wird dieser Guide von dem Team von QuelLLM.fr — 253 indexierte Modelle, 341 Anleitungen, jeden Morgen aktualisiert — das auch das ganze Jahr über KI-Plattformen im Produktivbetrieb betreibt (RegulIA, IAPRO). Jeder Befehl, jedes Modell und jede Lizenz dieses Leitfadens wird zum Zeitpunkt der Ausgabe anhand der offiziellen Quelle überprüft (und bei jeder Ausgabe erneut überprüft), und zwar auf den Rechnerkonfigurationen, die wir selbst verwenden (PC mit 8–16 GB VRAM, Mac mini M4 mit 24 GB); alle Skripte des Pakets lassen sich kompilieren und werden einzeln durchgesehen. Was Sie lesen, ist kompakt, überprüft und kommt ohne Umwege auf den Punkt. Keine Sammlung zufällig gefundener Tutorials. Wer steckt hinter QuelLLM →

Das Problem

Sie haben bereits einen lokalen KI-Assistenten, vielleicht sogar eine RAG-Lösung auf Knopfdruck (AnythingLLM, Open WebUI). Sie ziehen eine PDF-Datei hinein, stellen eine Frage und erhalten eine Antwort – bis die Antwort eines Tages an der Frage vorbeigeht oder, schlimmer noch, ein Zitat erfunden wird, das im Dokument gar nicht existiert. Bei 300 PDF-Dateien, einer ganzen Zotero-Bibliothek oder jahrelanger Korrespondenz stößt die Lösung auf Knopfdruck an ihre Grenzen: naives Chunking, keine überprüfbaren Zitate und vor allem nie wird etwas gemessen — Sie vertrauen ihm aufgrund von drei Beispielen, nicht aufgrund eines Prüfprotokolls.

Die grundlegenden Informationen sind bereits kostenlos auf der Website verfügbar, verteilt auf 7 Leitfäden (ChromaDB, Chunking, hybride Suche mit BM25, Zotero, französische Embeddings, Reranking, LlamaIndex). Das Kit ist DIE Referenzmethode: die vollständige, zusammengestellte und getestete Pipeline — Datenaufnahme, messtechnisch erfasstes Chunking, französische Embeddings, ein skalierbarer Index, hybride Suche, Reranking und eine Methode, um zu überprüfen, ob alles wirklich funktioniert — keine Sammlung von Tutorials, die Sie selbst miteinander abgleichen müssen.

RAG aufgebaut und gemessen im Vergleich zu RAG per Knopfdruck und zum Einfügen aller Inhalte in das LLM

Dasselbe Bedürfnis – Fragen zu Ihren Dokumenten stellen – und drei Möglichkeiten, es zu erfüllen. Ein ehrlicher Vergleich:

Zusammengestelltes RAG (dieses Set)RAG auf KnopfdruckAlles beim LLM einfügen
Funktioniert mit Hunderten von DokumentenJaBegrenztNein
Durchgehend überprüfbare QuellenangabenJa, erforderlichSelten zuverlässigNein
Hybride Suche (Identifikatoren, Eigennamen)Ja (BM25 + vektoriell)NeinNicht anwendbar
Gemessene Qualität (recall@k vorher/nachher)Ja, Protokoll bereitgestelltNeinNein
EinrichtungMehrere Sitzungen, eigenständiger PipelineEinige MinutenSofort
Vertraulichkeit (100 % lokal)JaJaJe nach dem verwendeten LLM
Kosten0 €/Monat nach der Installation0 €/MonatHohe Kontextkosten bei mehr als wenigen Dokumenten

Die Bedienung per Mausklick bleibt eine gute Wahl für die gelegentliche Arbeit mit drei Dokumenten (dafür ist das Kit Lokale KI, Kap. 8, gedacht). Dieses Kit übernimmt, wenn der Dokumentbestand, die Tragweite der Aufgabe oder die erforderliche Zuverlässigkeit die Möglichkeiten der Bedienung per Mausklick übersteigen.

Was Sie erhalten

Werkzeuge: ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embeddings: bge-m3, nomic-embed-text-v2-moe. Nach der Einrichtung zu 100 % lokal, 0 €/Monat.

Die 16 Kapitel des Kits

103 Seiten, von den Grundlagen der Pipeline bis zu einem RAG-System, dessen Leistung gemessen und dessen Zuverlässigkeit verbessert wurde. Nichts überspringen: Jedes Kapitel verweist auf die folgenden.

Teil 1 – Grundlagen eines funktionsfähigen RAG
  • Ihr aktuelles RAG lügt (oder warum dieses Kit existiert)
  • Anatomie einer zuverlässigen RAG-Pipeline
  • Den eigenen Stack wählen: Skript, Framework oder erweiterte Benutzeroberfläche
Teil 2 — Ingestion: über das schöne PDF hinaus
  • OCR, Bereinigung, Deduplizierung: die tatsächlich vorhandenen Daten einlesen
  • Zotero: Die eigene Bibliografie an ein RAG-System anbinden, das tatsächlich Quellen zitiert
  • E-Mails und Korrespondenz: ein Korpus, das bei RAG übersehen wird
  • Chunking: Die 5 Strategien und wie Sie messen, welche am besten abschneidet
Teil 3 — Der Motor: Embeddings, Index, Retrieval
  • Mehrsprachige Embeddings für Französisch: Auswahl und Überprüfung
  • Lokaler Vektorindex: ChromaDB, Qdrant, LanceDB – welcher 2026?
  • Hybride Suche: wenn der rein vektorielle Ansatz nicht ausreicht
  • Reranking: der Cross-Encoder, der das Retrieval korrigiert
Teil 4 — Orchestrieren, messen, zuverlässiger machen
  • LlamaIndex und LangChain lokal: Über selbst geschriebene Skripte hinausgehen
  • Open WebUI Knowledge und AnythingLLM im fortgeschrittenen Einsatz
  • Das eigene RAG evaluieren: Fragenkatalog, Zitate, Halluzinationen
  • Kosten, Geschwindigkeit, Fehlerbehebung je Rechner
  • RAG bei der Arbeit — und was danach kommt

Fortlaufend aktualisierte Ausgabe: Jede Aktualisierung erweitert dieses Inhaltsverzeichnis (datiertes Update-Log, Kap. 16) — Sie müssen die nächste Version nicht erneut kaufen.

Trois Quick Wins noch bevor Sie ein Terminal öffnen

Kapitel 1 führt nicht nur in das Thema ein: Es bietet Ihnen drei messbare Verbesserungen für Ihre aktuelle Installation, jede in weniger als 30 Minuten umsetzbar.

1 · Überprüfen Sie Ihr aktuelles RAG

Die 10-Punkte-Checkliste identifiziert in 10 Minuten die größte Schwachstelle Ihrer bestehenden Installation (oder stellt fest, dass keine Installation vorhanden ist).

2 · Wechseln Sie den Embedder mit einem einzigen Befehl

ollama pull bge-m3, stellen Sie den Embedder in AnythingLLM oder Open WebUI um und vergleichen Sie die Ergebnisse vor und nach der Umstellung.

3 · Verlangen Sie eine überprüfbare Quellenangabe

Eine strenge Zitiervorgabe, ergänzt zu einer bereits gestellten Frage — und Sie prüfen, ob die zitierte Passage tatsächlich existiert.

4 · Bauen Sie anschließend die vollständige Pipeline auf

Ingestion, messtechnisch überprüftes Chunking, französische Embeddings, Index, hybride Suche, Reranking: Die Teile 2 bis 4 führen Sie Schritt für Schritt dorthin.

24 €
Einmalzahlung · lebenslange Updates inklusive
7 über die Website verstreute RAG-Anleitungen, stundenlanges Zusammenstellen und Testen. Dieses Kit: einmalig 24 €, eine bereits zusammengestellte Pipeline.
  • Lebenslanger Zugang zum Online-Bereich: 16 stets aktuelle Kapitel (vollständiges Inhaltsverzeichnis weiter oben)
  • Der PDF-Leitfaden (103 Seiten) + die 20 Dateien (Skripte, Vorlagen, Vergleiche — Zotero, Chunking, hybride Ansätze, Reranking, Evaluation …) zum Herunterladen
  • Die 2 Referenzprofile (PC 8–16 GB, Mac 24 GB) und der RAG-Fehlerbehebungsbaum
  • Alle zukünftigen Ausgaben, lebenslang – sie erscheinen in Ihrem Bereich
  • Sofortiger Zugriff nach Zahlung, Zugangscode per E-Mail gesendet
Alle Anwendungsfälle, ein Kauf

8 verfügbare Kits plus zukünftige Kits. PDFs, Assets und Online-Bereich, lebenslange Updates.

Alle Kits auswählen — 49 € →
Ich nehme das Kit — 24 €

Sichere Zahlung über Stripe. PDF-Rechnung wird automatisch versendet · Umsatzsteuer nicht anwendbar gemäß Art. 293 B des CGI.

Ich nehme das Kit — 24 €

La ungeschönte Wahrheit

Ein lokal aufgebautes RAG-System, dessen Leistung gemessen wurde, deckt Ihre eigenen Dokumente sehr gut ab, ist aber keine Lösung für alles. Ein Referenzleitfaden schuldet Ihnen diese ehrliche Übersicht:

Dieses Set gewinntvollständige Vertraulichkeit · überprüfbare Quellenangaben · funktioniert mit Hunderten von Dokumenten · gemessene statt nur angenommener Qualität · 0 €/Monat nach der Einrichtung
Lösungen auf Knopfdruck oder die Cloud bleiben im Vorteilgelegentliche Nutzung mit 2–3 Dokumenten · sofortige Einrichtung ohne Skript · Bereitstellung für mehrere Benutzer im Unternehmen · Orchestrierung mehrstufiger Agenten

Am Ende können Sie Folgendes:

Ausgabe vivante — wie alle QuelLLM-Kits

„Lebenslange Updates“ ist kein Slogan: Das Kit hält für Sie mit den Entwicklungen im RAG-Ökosystem (Embedding-Modelle, Vektordatenbanken, Frameworks) Schritt, ohne dass Sie erneut etwas bezahlen müssen.

CHANGELOG.md — im Paket enthalten

v2026.09 (aktuelle Ausgabe) — erste Ausgabe des Kits: 16 Kapitel, 2 Referenzprofile (PC mit 8–16 GB VRAM, Mac mini M4 mit 24 GB), 20 Dateien (Skripte, Vorlagen, Vergleiche).

Die nächsten Ausgaben (neue Embedding-Modelle, Vektordatenbanken, Frameworks) werden hier mit Datum hinzugefügt und stehen Ihnen in Ihrem Bereich zur Verfügung, ohne dass Sie erneut etwas bezahlen müssen.

Häufige Fragen

Wie unterscheidet sich das vom lokalen KI-Kit, das bereits ein Kapitel zu RAG enthält?

Das lokale KI-Kit (Kap. 8) richtet Ihnen per Mausklick einen RAG in AnythingLLM oder Open WebUI ein – eine PDF-Datei hineinziehen, eine Frage stellen: Für eine gelegentliche Nutzung funktioniert das. Dieses Kit beginnt dort, wo dieses Kapitel aufhört: messtechnisch überprüftes Chunking, ein Vergleich französischer Embeddings, ein skalierbarer Vektorindex, hybride Suche, Reranking und vor allem eine Methode, um zu überprüfen, ob Ihr RAG richtig antwortet – und nicht nur, ob er überhaupt antwortet. Inhalte aus Kap. 8 werden hier nicht erneut erklärt; behandelt werden ausschließlich die fortgeschrittenen Einstellungen und die Bausteine, die bei der Einrichtung per Mausklick fehlen.

Wie unterscheidet sich das von den 7 kostenlosen RAG-Anleitungen auf der Website?

Die kostenlosen Anleitungen von QuelLLM.fr behandeln jede Komponente einzeln (ChromaDB allein, Chunking allein, hybride Suche mit BM25 allein, Zotero allein …). Das Set fügt die vollständige Pipeline in der richtigen Reihenfolge zusammen (Ingestion → Chunking → Embeddings → Index → hybride Suche → Reranking → Generierung → Quellenangabe → Messung), stellt die Verbindungen her, die jede einzelne Anleitung für sich nicht herstellt, und liefert die 20 getesteten Dateien (Skripte, Vorlagen, Vergleiche), die keine einzelne Anleitung bietet – bezahlt werden die Zusammenstellung und die Skripte, nicht die grundlegenden Informationen.

Muss man in Python programmieren können, um diesem Kit folgen zu können?

Python 3.10+ ist nützlich und hilft Ihnen in den meisten Kapiteln (Kap. 4 bis Kap. 12) — die Skripte werden mitgeliefert und müssen angepasst, nicht von Grund auf neu geschrieben werden. Kapitel 13 (Open WebUI Knowledge, AnythingLLM mit erweiterten Einstellungen) bleibt zugänglich, ohne eine Zeile Code schreiben zu müssen. Dieses Kit setzt einen sicheren Umgang mit der Kommandozeile voraus; wenn Sie bei lokaler KI bei null anfangen, beginnen Sie mit dem lokalen KI-Kit.

Wie lange dauert es bis zu einem ersten konkreten Ergebnis?

Kapitel 1 bietet 3 schnell umsetzbare Verbesserungen, die jeweils weniger als 30 Minuten dauern und sich auf ein bereits bestehendes RAG-System anwenden lassen (Schnellaudit, Wechsel des Embedders mit einem einzigen Befehl, eine überprüfbare Quellenangabe verlangen) – Sie erzielen eine messbare Verbesserung, noch bevor Sie die vollständige Pipeline angehen. Der Aufbau einer vollständigen Pipeline mit Ihrem eigenen Korpus (Teile 2 bis 4) erfordert mehrere Sitzungen, nicht eine Stunde.

Auf welchem Gerät funktioniert das?

Zwei Referenzprofile, die bei jedem Beispiel genannt werden: ein PC mit 8 bis 16 GB VRAM (das empfohlene Modell für die Generierung hängt davon ab, ob die untere oder obere Grenze zugrunde liegt) oder ein Mac mit Apple Silicon und 24 GB gemeinsamem Speicher. Bei RAG ist der Engpass fast nie die Generierung, sondern die Datenaufnahme (OCR, Embeddings) und die Größe des Index – die beiden Profile decken den Großteil der tatsächlich eingesetzten Konfigurationen für professionelle Nutzung und Entwicklung ab.

Bleiben meine Dokumente vertraulich?

Genau darum geht es: Die Pipeline (Datenaufnahme, Embeddings, Index, Generierung) läuft vollständig auf Ihrem Rechner; nichts wird an Dritte übertragen. Kapitel 15 behandelt speziell, was das für einen Bestand an E-Mails oder sensiblen Dokumenten bedeutet. Für eine Bereitstellung mit mehreren Nutzern im Unternehmen (DSGVO, AI Act, Serverarchitektur) ist das Unternehmen-Kit für lokale KI (quelllm.fr/kit-ia-entreprise) vorgesehen, nicht dieses Kit.

Deckt das Kit Agenten oder Automatisierung ab?

Kapitel 12 zeigt, wie ein minimaler Agent RAG als Werkzeug nutzt (ein Agent, zwei Werkzeuge) — gerade genug, um das Prinzip zu verstehen, mit einem ausdrücklichen Verweis auf das Kit lokaler Agenten (quelllm.fr/kit-agents-locaux) für die Orchestrierung mehrerer Schritte, MCP oder n8n. Diese Themen sind nicht Gegenstand des vorliegenden Kits.

Wie wird es bereitgestellt, und wie lange haben Sie Zugriff darauf?

Sofortiger Zugriff nach der Zahlung: Ihr Online-Bereich auf Lebenszeit (immer mit der neuesten Ausgabe) sowie das PDF und das ZIP-Archiv mit den 20 Dateien zum Herunterladen – beides gehört Ihnen für immer. Künftige Aktualisierungen (neue Embedder, neue Vektordatenbanken, Weiterentwicklungen der Frameworks) erscheinen in Ihrem Online-Bereich, ohne dass Sie erneut bezahlen müssen.

Kann ich eine Rechnung erhalten?

Ja, automatisch. Sobald die Zahlung (Stripe) erfolgt ist, erhalten Sie per E-Mail Ihre Stripe-Quittung und Ihre PDF-Rechnung auf den Namen von Falcon Consulting (Herausgeber von QuelLLM) an Ihre angegebenen Kontaktdaten – geben Sie im vorgesehenen Feld zum Zeitpunkt der Zahlung Ihr Unternehmen oder Ihre SIREN-Nummer an. Keine Mehrwertsteuer, Art. 293 B des CGI.

Bleibt das Kit aktuell? Vektordatenbanken und RAG-Frameworks entwickeln sich schnell.

Das ist das Prinzip lebenslanger Updates: Wenn sich der Status eines Embedders ändert, eine Vektordatenbank ausgereifter wird oder ein Framework eine bestehende Kompatibilität aufhebt, wird die Ausgabe entsprechend aktualisiert – wie bei den anderen QuelLLM-Kits. Kapitel 16 erklärt außerdem, wie Sie zwischen zwei Ausgaben selbst prüfen können, ob eine zitierte Tatsache noch aktuell ist.

Und wenn ich mehrere QuelLLM-Kits möchte?

Das Bundle „Alle Kits, lebenslang“ umfasst alle aktuellen und zukünftigen Kits für 49 €. Wenn Sie bereits ein Kit für 24 € gekauft haben, kostet das Upgrade auf das Bundle 25 €, nicht 49 € — der Coupon wird automatisch angewendet.

Was genau ist RAG?

RAG (Retrieval-Augmented Generation) bedeutet, dass ein LLM vor seiner Antwort in Ihren eigenen Dokumenten nach Informationen sucht, statt ausschließlich mit dem zu antworten, was es während seines Trainings gelernt hat – grundsätzlich mit einer überprüfbaren Quellenangabe. Das lokale RAG-Kit baut diese vollständige Pipeline auf Grundlage Ihrer PDFs, Ihrer Bibliografie oder Ihrer E-Mails auf und misst ihre Leistung.

Wie lässt sich Ollama an ein RAG anbinden?

Ollama dient in einer RAG-Pipeline als Engine für die Textgenerierung und häufig auch für die Erzeugung von Embeddings: Für den gelegentlichen Einsatz lässt sich ein per Mausklick bedienbares Tool wie AnythingLLM oder Open WebUI Knowledge direkt damit verbinden. Für eine Pipeline, die auch mit Hunderten von Dokumenten zuverlässig funktioniert, zeigt das RAG Local-Kit, wie Sie Ollama mit ChromaDB oder Qdrant verbinden – mit einem getesteten Skript statt nur einer Benutzeroberfläche.

Welches LLM sollte man für ein lokales RAG wählen?

Die Modellwahl ist weniger entscheidend als die Pipeline drumherum: Ein universell einsetzbares Modell, das auf Ihrem Rechner läuft, reicht für die Generierung aus, sofern das vorgelagerte Retrieval (Chunking, Embeddings, hybride Suche, Reranking) ihm die richtigen Textpassagen zum Lesen liefert. Das RAG Local-Kit erläutert diese gesamte Verarbeitungskette, nicht nur die Wahl des abschließenden Modells.

Erstellen Sie ein zuverlässiges RAG-System.

Der Referenzleitfaden: vom ersten eingelesenen PDF bis zu einem anhand von Messungen bewerteten und zuverlässigen RAG für Ihre gesamte Bibliothek — ohne irgendetwas in die Cloud zu senden. Heute, nicht „irgendwann“.

Kit erhalten — 24 €