Was ist RAG und wie funktioniert es (Leitfaden Anfänger)
Was ist RAG? Die kurze Antwort: ein Aufbau, der ein LLM mit Ihren Dokumenten verbindet, damit es mit echten Fakten antwortet, statt etwas zu erfinden. Die ausführliche Antwort finden Sie in diesem Leitfaden. Keine Mathematik, kein vorgeschriebenes Framework – nur die Bausteine (Embeddings, Vektordatenbank, LLM) und wie sie ineinandergreifen. Am Ende wissen Sie, warum ein gut aufgebautes RAG-System deutlich weniger halluziniert und wie Sie lokal einsteigen können.
#RAG in 30 Sekunden
RAG steht für Retrieval-Augmented Generation: Textgenerierung, die durch eine Suche ergänzt wird. Statt dem LLM direkt zu sagen „Beantworte diese Frage“, sucht man zunächst in einer Dokumentensammlung nach den relevantesten Textpassagen und fügt sie dann in den Prompt ein, mit der Anweisung: „Hier sind die Quellen, stütze deine Antwort darauf.“
Ein anschaulicher Vergleich: Ein LLM allein ist wie ein brillanter Student, der in einer Prüfung Fragen aus dem Gedächtnis beantwortet. RAG ist wie derselbe Student, der seine Kursunterlagen auf dem Tisch aufschlagen darf. Er erfindet weniger, nennt die richtige Seite und kann auch Fragen zu Kursunterlagen beantworten, die er noch nie gesehen hat (Ihre PDFs, Ihre E-Mails, Ihr internes Wiki), wenn man sie ihm zur Verfügung stellt.
#Warum (und wann) man es braucht
Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein LLM hat zwei große Schwächen, die deutlich werden, sobald man es ernsthaft nutzt: Es erfindet Dinge, wenn es etwas nicht weiß (die berühmten „Halluzinationen“), und es kennt nur die Daten, die es beim Training gesehen hat. Qwen 3.5 9B hat weder Ihren Vertrag noch Ihr Notion-Wiki noch Ihre Datenbank mit Vorfällen gelesen. Es zu bitten, Fragen dazu direkt zu beantworten, ist so, als würde man jemanden bitten, sich den Inhalt eines Buches vorzustellen, das er nicht aufgeschlagen hat.
RAG löst beide Probleme gleichzeitig: Die passenden Auszüge werden in den Prompt eingefügt, das LLM nutzt sie als faktische Grundlage, und die Antworten werden nachvollziehbar – Sie können die Quellen anzeigen.
- Mit Ihren PDF-Dateien chatten
- Technische Dokumentation, Verträge, wissenschaftliche Artikel, Handbücher — alles, was zu umfangreich ist, um in ein Kontextfenster zu passen.
- Interner Team-Assistent
- Wiki, Support-Wissensdatenbank, Produktdokumentation. Statt einer ungenauen Suche mit Ctrl+F erhalten Sie eine Antwort auf Französisch, die die richtigen Seiten als Quellen anführt.
- Informationsbeobachtung und Zusammenfassung
- Hunderte Artikel oder Berichte indexieren, übergreifende Fragen stellen, Quellen vergleichen.
- Aktuelle oder private Daten
- Alles, was das LLM nicht sehen konnte: Ihr Code, Ihre E-Mails, Veröffentlichungen nach dem Stichtag seiner Trainingsdaten.
#Die Pipeline in 4 Schritten
Ein RAG besteht aus zwei Phasen: der Indexierung (einmal im Voraus) und der Abfrage (jedes Mal bei einer Frage). Hier sind die vier Bausteine, die nacheinander folgen.
- 011. Chunking — Aufteilen der DokumenteIhre PDF-Dateien, Markdown-Dateien oder Webseiten werden zunächst in Abschnitte (chunks) von etwa 200 bis 800 Wörtern aufgeteilt. Ein ganzes Buch kann nicht auf einmal eingebettet werden, und außerdem wollen wir den genauen Abschnitt finden, der auf die Frage antwortet, nicht den gesamten Dokumentinhalt.
- 022. Embeddings — Text in Vektoren umwandelnJeder Chunk wird von einem Embedding-Modell verarbeitet, das ihn in einen Zahlenvektor umwandelt (typischerweise mit 384 bis 1024 Dimensionen). Zwei Textpassagen, die dasselbe Thema behandeln, ergeben in diesem Raum nahe beieinanderliegende Vektoren – das ist die Magie, die semantische Suche ermöglicht.
- 033. Speicherung in einer VektordatenbankDie Vektoren und der Originaltext werden in einer spezialisierten Datenbank (Chroma, Qdrant, FAISS…) gespeichert, die schnell die Frage beantworten kann: „Welche Vektoren liegen meinem am nächsten?“
- 044. Retrieval + GenerierungFür die Frage des Benutzers wird deren Embedding berechnet. Die 3 bis 10 ähnlichsten Chunks werden abgerufen und mit einer Anweisung wie „Antworte auf Grundlage dieser Auszüge“ in den Prompt des LLM eingefügt. Anschließend erzeugt das LLM die Antwort.
#Embeddings: das Herz des Retrievals
Ein Embedding-Modell ist ein kleiner LLM, der auf eine einzige Aufgabe spezialisiert ist: einen Textabschnitt in einen Zahlenvektor umzuwandeln, der dessen „Bedeutung“ erfasst. Zwei Sätze, die dasselbe Thema behandeln, ergeben ähnliche Vektoren, selbst wenn sie kein Wort gemeinsam haben. Das unterscheidet RAG von einem simplen Ctrl+F.
Die Qualität des RAG hängt letztlich ebenso stark — oft sogar stärker — vom Embedding-Modell ab wie vom dahinterstehenden LLM. Ein schlechtes Embedding liefert die falschen Textabschnitte, und selbst das beste LLM der Welt kann auf Grundlage von Textfragmenten, die am Thema vorbeigehen, keine korrekte Antwort geben.
- nomic-embed-text
- 137M Parameter, 768 Dimensionen, Kontextfenster mit 8192 Tokens. Die von Ollama vorgeschlagene vernünftige Standardoption. Gut auf Englisch, ordentlich auf Französisch.
- mxbai-embed-large
- 335 Millionen Parameter, 1024 Dimensionen. Genauer, aber 3-mal langsamer. Sinnvoll, wenn die Retrieval-Qualität der begrenzende Faktor ist.
- multilingual-e5-large
- 560M, 1024 Dimensionen. Die beste Wahl, wenn Ihre Dokumente auf Französisch oder mehrsprachig sind.
- bge-m3
- Hervorragend für Französisch, unterstützt lange Kontexte. Benötigt mehr Ressourcen beim Betrieb, gilt aber als Referenz für mehrsprachige Inhalte.
#Die Vektordatenbank: Wo die Vektoren liegen
Eine Vektordatenbank ist eine Datenbank, die auf eine bestimmte Operation spezialisiert ist: „Finde mir die N Vektoren, die diesem Vektor am nächsten liegen.“ Im Hintergrund nutzt sie Algorithmen (HNSW, IVF …), die diese Suche selbst bei Millionen von Vektoren schnell machen. Für den Einstieg müssen Sie diese Algorithmen nicht verstehen – Sie müssen nur wissen, welche Vektordatenbank Sie wählen sollten.
- Chroma
- Open-Source-Vektordatenbank, eingebettet in Ihr Python-Projekt oder als Server betrieben. Ideal für den Einstieg: keine Konfiguration, dauerhafte Speicherung auf Datenträger.
- Qdrant
- Robuster für den Produktionsbetrieb: dedizierter Server, Filter, Mandantenfähigkeit. Lässt sich mit einem einzigen Befehl in einem Docker-Container starten.
- FAISS
- Bibliothek von Facebook (Meta). Sehr schnell, aber lediglich ein Index – keine Metadatenverwaltung. Gut geeignet für performancekritische Anwendungsfälle.
- Gespeichert im Tool
- Open WebUI, AnythingLLM und LM Studio bringen ihre eigene Vektordatenbank mit. Das geschieht im Hintergrund — Sie laden eine PDF-Datei hoch, und sie wird indexiert. Ideal, um ohne Programmieren einzusteigen.
#Der LLM: gesteuerte Generierung
Der LLM ist der letzte Baustein. Er erhält einen Prompt, der so aussieht: „Hier sind 5 Ausschnitte aus der Dokumentation. Beantworte die Frage ausschließlich auf dieser Grundlage. Wenn die Information nicht in den Ausschnitten enthalten ist, sag das.“
Dieser Rahmen verändert alles. Ohne eingefügten Kontext antwortet das LLM aus dem Wissen, das es im Training gelernt hat – und erfindet Inhalte, wenn dieses Wissen lückenhaft ist. Mit den richtigen Auszügen im Prompt hat es eine faktische Grundlage vor Augen und beschränkt sich darauf, umzuformulieren oder zusammenzufassen.
- Welche LLM-Größe?
- Für einfaches RAG reicht ein kleines Modell aus dem Jahr 2026, das in 8 GB Speicher passt (Qwen 3.5 9B, Granite 4.2 8B), völlig aus. Die Qualität des Retrievals ist wichtiger als die Größe des LLM.
- Welche Kontextlänge?
- Mindestens 4096 Tokens. Die abgerufenen Chunks plus die Frage plus die Systemanweisung verbrauchen schnell 2000 bis 3000 Tokens. Mit 8192 oder mehr sind Sie gut bedient.
- Welcher Systemprompt?
- Etwa so: „Du antwortest auf Französisch und stützt dich ausschließlich auf die bereitgestellten Auszüge. Wenn die Information darin nicht enthalten ist, sag das deutlich.“
#Lokales RAG im Vergleich zu einer Cloud-API
Sie können ein RAG-System mit der OpenAI- oder Claude-API aufbauen (schnell einzurichten, maximale Leistung) oder vollständig lokal mit Ollama + einer Vektordatenbank + einem Embedding-Modell (kein Datenabfluss, keine Nutzungskosten). Die Wahl hängt von der Sensibilität der Dokumente und Ihrem Budget ab.
- RAG über Cloud-API
- Ihre Dokumente werden bei der Indexierung und bei jeder Frage an den Anbieter (OpenAI, Anthropic, Mistral…) übermittelt. Leistung und Qualität sind erstklassig, aber mit vertraulichen Daten ist das nicht vereinbar (DSGVO, ärztliche Schweigepflicht, Kundenverträge).
- RAG 100 % lokal
- Ollama für das LLM, nomic oder bge für die Embeddings, Chroma oder Qdrant für die Datenbank. Keine Daten verlassen den Rechner. Ideal für Fachleute (Juristen, Ärzte, Personalverantwortliche), Unternehmen, die der DSGVO unterliegen, und alle, die die Kontrolle behalten möchten.
- Hybrid
- Embeddings lokal, LLM über API: begrenzt die Datenweitergabe (die vollständigen Dokumente bleiben lokal; nur die relevanten Chunks werden bei einer Frage in die Cloud gesendet). Ein pragmatischer Kompromiss, von dem jedoch abzuraten ist, wenn die Chunks selbst sensible Daten enthalten.
#Wo konkret anfangen
Drei Wege je nach Ihrem Profil. Alle drei laufen 100 % lokal auf Ihrem Gerät.
- 01Ohne Programmieren, mit einer Benutzeroberfläche (Open WebUI oder AnythingLLM)Sie installieren Ollama, starten Open WebUI oder AnythingLLM in Docker, laden Ihre PDF-Dateien in eine « Knowledge Base » hoch und beginnen zu chatten. Alles – Chunking, Embeddings, Retrieval – wird für Sie erledigt. 30 Minuten von Anfang bis Ende.
- 02Ohne Programmieren mit einer All-in-one-Lösung (LM Studio)Seit Version 0.3 verfügt LM Studio über die Funktion „Chat with Documents“: Sie hängen eine Datei an den Chat an, und LM Studio kümmert sich darum. Einschränkungen: 5 Dateien pro Chat und nur bestimmte Formate (textbasierte PDFs, DOCX, TXT, MD). Ideal für gelegentliche Fragen zu einem Dokument.
- 03In Python mit LangChain oder LlamaIndexVolle Kontrolle: Auswahl des Chunkers, des Embedding-Modells, der Datenbank, des LLM und des Prompts. Planen Sie einen halben Tag für einen ersten sauberen Prototyp ein, mehr, wenn Sie optimieren möchten (Reranker, hybride Suche usw.).
#Die typischen Fallstricke beim Einstieg
- Embedder auf Englisch, Dokumente auf Französisch
- Ursache Nummer 1 für enttäuschendes RAG in Frankreich. Stellen Sie sicher, dass Ihr Embeddings-Modell Französisch unterstützt (multilingual-e5, bge-m3).
- Zu große oder zu kleine Chunks
- 500 Wörter sind ein guter Ausgangspunkt. Sind die Chunks zu klein (< 100 Wörter), verlieren sie ihren Kontext; sind sie zu groß (> 1500 Wörter), mittelt das Embedding über den gesamten Inhalt und verliert dadurch an Präzision.
- Den Embedder wechseln, ohne neu zu indexieren
- Die Vektoren eines Modells sind nicht mit denen eines anderen kompatibel. Wenn Sie von nomic zu bge wechseln, müssen Sie alles neu indexieren – sonst liefert das Retrieval unsinnige Ergebnisse.
- Zu viele Chunks im Kontext
- Bei mehr als 8–10 Chunks beginnt das LLM, den Überblick zu verlieren. Besser sind 5 sehr relevante Chunks als 20 mäßig relevante (hier kommt auf einem fortgeschritteneren Niveau ein Reranker ins Spiel).
- Keine Quellenangaben angezeigt
- Um sicherzustellen, dass ein RAG tatsächlich funktioniert, zeigen Sie die verwendeten Quellen bei jeder Antwort an. Ohne diese Sichtbarkeit können Sie keine gute Antwort von einer überzeugenden Halluzination unterscheiden.
#Weiterführende Informationen
Jetzt, da Sie wissen, was RAG ist, finden Sie hier die passenden weiterführenden Anleitungen für den Einstieg in die Praxis.
- Lokales RAG mit Ollama ohne Programmieren
- Die Schritt-für-Schritt-Anleitung mit Open WebUI + AnythingLLM, um Ihr erstes RAG in 30 Minuten aufzubauen, auch ohne GPU.
- Die besten Embedding-Modelle für Französisch
- Detaillierter Vergleich zur Auswahl zwischen nomic, multilingual-e5, bge-m3 und Solon entsprechend Ihrem Korpus.
- Lokales RAG: Einführung
- Der ausführliche Leitfaden zu den Konzepten: Chunking, Retrieval, Reranking, Bewertungsmetriken.
- Was ist Ollama und wie funktioniert es
- Wenn Sie Ollama noch nicht installiert haben, finden Sie es hier.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.