BGE-M3: Embeddings, die wirklich sprechen französisch
BGE-M3 (BAAI, MIT-Lizenz) ist ein Embedding-Modell, das mehr als 100 Sprachen unterstützt, bis zu 8.192 Tokens pro Passage akzeptiert und in einem einzigen Durchlauf drei Repräsentationen erzeugt: eine dichte (Gesamtbedeutung), eine lexikalische (exakte Begriffe, ähnlich wie bei BM25) und eine Multi-Vektor-Repräsentation (Neusortierung ähnlich wie bei ColBERT). Für ein französischsprachiges Korpus ist es eine verlässlichere Wahl als die englischsprachigen Modelle aus öffentlichen Ranglisten. Über Ollama benötigt es 1,2 GB (bge-m3:567m) und läuft ohne Grafikkarte.
Die meisten der bestplatzierten Embedding-Modelle werden überwiegend mit englischen Texten trainiert. Bei einem französischen Korpus funktionieren sie ohne Fehlermeldung, finden relevante Inhalte aber schlechter – ein besonders tückisches Versagen, da nichts darauf hinweist. BGE-M3, veröffentlicht vom chinesischen Forschungslabor BAAI, ist eines der wenigen wirklich mehrsprachigen Modelle und bietet zudem eine nützliche Besonderheit: Es erzeugt drei Arten von Repräsentationen auf einmal, ohne zusätzliche Kosten.
#Das Problem mit dem Französischen
Ein Embedding-Modell lernt sein Verständnis von Ähnlichkeit aus seinem Trainingskorpus. Wenn dieses Korpus zu 90 % englischsprachig ist, ordnet das Modell englische Texte im Verhältnis zueinander korrekt ein, französische Texte dagegen deutlich weniger differenziert. In der Praxis bedeutet das bei einem französischen Dokumentenkorpus, dass relevante Passagen nicht gefunden werden und stattdessen themenfremde Passagen auftauchen – ohne jede Fehlermeldung, ohne Warnung in den Protokollen und oft, ohne dass es jemand bemerkt, bis ein Nutzer eine Antwort meldet, die am Thema vorbeigeht.
Deshalb fällt die Antwort auf die Frage „Welches Embedding-Modell?“ je nach Sprache unterschiedlich aus. Öffentliche Ranglisten (wie MTEB) werden weitgehend von englischsprachigen Aufgaben dominiert; sie sagen weder voraus, wie sich ein Modell bei Ihren Dokumenten verhält, noch, wie es mit Ihrem Fachvokabular zurechtkommt. Genau für diesen Fall hat das chinesische Labor BAAI (Beijing Academy of Artificial Intelligence) BGE-M3 entwickelt: Der Name steht für Multi-Functionality, Multi-Linguality, Multi-Granularity – drei Suchfunktionen, mehr als 100 Sprachen und Eingaben vom kurzen Satz bis zum langen Dokument, vereint in einem einzigen Modell statt auf mehrere Werkzeuge verteilt.
#Was BGE-M3 bietet
Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Von Grund auf mehrsprachig
- Das Modell unterstützt laut seiner offiziellen Modellbeschreibung mehr als 100 Arbeitssprachen; es verarbeitet Französisch korrekt und ermöglicht es auch, einen englischsprachigen Korpus auf Französisch abzufragen.
- Langer Kontext: 8.192 Token
- Es akzeptiert deutlich längere Textpassagen als die meisten Embedding-Modelle (oft auf 512 Tokens begrenzt), was Spielraum bei der Größe der indexierten Textabschnitte lässt.
- Drei Darstellungen gleichzeitig
- Dichte, lexikalische und Multi-Vektor-Repräsentationen, in einem einzigen Durchlauf erzeugt, laut BAAI ohne zusätzlichen Rechenaufwand.
- MIT-Lizenz
- Ohne besondere Einschränkungen im Unternehmen nutzbar; prüfen Sie bei der Integration stets die Modellbeschreibung, da sich die Lizenz von einer Version zur nächsten ändern kann.
- Keine zusätzliche Anweisung erforderlich
- Anders als bei anderen älteren BGE-Modellen muss bei BGE-M3 keine Anweisung mehr zu den Anfragen hinzugefügt werden: Das Modell wird direkt verwendet, was die Integration vereinfacht.
#Dicht, lexikalisch, mit mehreren Vektoren: Wozu dient das?
| Darstellung | Was sie erfasst | Was geboten wird |
|---|---|---|
| Dense | Der Text wird auf einen einzigen Vektor reduziert, der seine Gesamtbedeutung erfasst | Klassische semantische Suche |
| Lexikalisch (sparse) | Ein Gewicht pro Begriff im Vokabular, das außer bei den im Text vorkommenden Wörtern null ist | Findet Referenzen, Abkürzungen und Eigennamen, die die semantische Suche übersieht, ähnlich wie BM25 |
| Multi-vecteur | Mehrere Vektoren pro Text, wie bei ColBERT | Eine präzisere Neusortierung der besten Kandidaten |
Der Vorteil ist, dass eine hybride Suche möglich ist, ohne zwei separate Modelle auszuführen: Die offizielle Modellkarte empfiehlt ausdrücklich die Kombination aus hybrider Suche und Reranking. Dabei nutzt sie die lexikalischen Gewichte, die gleichzeitig mit dem dichten Embedding „ohne zusätzliche Kosten“ gewonnen werden. Der lexikalische Teil gleicht gezielt die Fehler des dichten Teils aus, und der Multi-Vektor-Teil dient dazu, die rund zwanzig ausgewählten Kandidaten neu zu ordnen. Nicht alle Vektordatenbanken können die drei Ausgaben nutzen, doch die dichte Ausgabe allein reicht bereits für einen üblichen Einsatz aus. Das ist auch die einfachste Konfiguration für den Einstieg, bevor Sie die lexikalische Ebene hinzufügen, falls die Genauigkeit noch nicht ausreicht.
#Lokal nutzen
Der schnellste Weg, BGE-M3 lokal zu testen, führt über Ollama, das eine quantisierte Version des Modells unter dem Namen bge-m3:567m bereitstellt — 567 Millionen Parameter, ein Download von etwa 1,2 GB und ein auf der Modellseite angegebenes Kontextfenster von 8.000 Tokens. Das Modell basiert auf XLM-RoBERTa-large, dessen Kontextlänge zunächst durch ein spezielles Vortraining (RetroMAE) auf 8.192 Tokens erweitert wurde. Anschließend erfolgte ein einheitliches Fine-Tuning für die drei Retrieval-Aufgaben in einem einzigen Trainingsschritt, statt drei separate Modelle pflegen zu müssen.
Für eine vollständige RAG-Pipeline ist nur die dichte Ausgabe ohne spezielle Konfiguration direkt mit den meisten gängigen Vektordatenbanken (Qdrant, Milvus, pgvector) nutzbar; die lexikalische Ausgabe und die Multi-Vektor-Ausgabe erfordern eine Engine, die sie kombinieren kann. Dies dokumentieren beispielsweise die von BAAI angeführten Integrationen für Milvus und Vespa.
In einer klassischen RAG-Pipeline mit einem lokalen LLM ersetzt BGE-M3 einfach das standardmäßig verwendete Embedding-Modell: Jeder Dokumentabschnitt wird bei der Indexierung einmal kodiert, die Frage des Nutzers wird bei jeder Anfrage kodiert, und anschließend werden die besten gefundenen Passagen an das unter Ollama oder LM Studio geladene LLM (Qwen, Mistral, Llama…) übergeben. Die Wahl des Embedding-Modells und die Wahl des Generierungsmodells sind zwei unabhängige Entscheidungen: Für beide Schritte muss keineswegs ein Modell aus derselben Familie verwendet werden, und in der Praxis ist das sogar selten der Fall.
#An Ihren eigenen Dokumenten überprüfen
Die Angabe „mehr als 100 Sprachen“ in einer Produktbeschreibung garantiert keine einheitliche Qualität: Sie beschreibt die Sprachabdeckung, keinen Leistungswert pro Sprache. BAAI evaluiert BGE-M3 auf MIRACL (mehrsprachige Suche) und auf MLDR, einem Datensatz für die Suche nach langen Dokumenten, der 13 Sprachen abdeckt und den das Labor speziell für dieses Modell veröffentlicht hat; die zugehörige Evaluierungspipeline ist frei zugänglich. Diese Evaluierungen zeigen eine allgemeine Tendenz, die anhand standardisierter Forschungskorpora gemessen wurde; sie ersetzen keinen Test mit Ihrem eigenen Korpus, in Ihrem eigenen Fachgebiet, mit Ihrem eigenen technischen Vokabular und Ihren eigenen Frageformulierungen.
- 01Eine kleine repräsentative Stichprobe zusammenstellenZwanzig bis dreißig echte Dokumente aus dem vorgesehenen Korpus, mit der üblichen Vielfalt an Textlängen und Wortschatz, keine handverlesene Auswahl.
- 02Fragen so formulieren, wie Ihre Benutzer sie stellen würdenZehn bis zwanzig echte Fragen, darunter auch Fragen, die Synonyme verwenden oder anders formuliert sind als im Quelldokument.
- 03Zwei oder drei Modelle anhand derselben Stichprobe vergleichenBGE-M3 im Vergleich mit einem renommierten englischsprachigen Modell und, wenn möglich, einem weiteren mehrsprachigen Modell. Notieren, wie oft die richtige Passage unter den ersten drei Ergebnissen erscheint.
- 04Vor dem Massenimport eine Entscheidung treffenDer Test nimmt einen halben Tag in Anspruch; ein Modellwechsel nach der Indexierung eines vollständigen Korpus erfordert, alles neu zu kodieren, wie bereits weiter oben erwähnt.
#Was es kostet
Es handelt sich um ein schwereres Embedding-Modell als die kleinen englischsprachigen Modelle, die derzeit im Trend liegen: Mit 567 Millionen Parametern und einer Downloadgröße von 1,2 GB gehört es in dieser Kategorie zum Mittelfeld, weit entfernt von Modellen mit nur einigen zehn Millionen Parametern, die die Ranglisten zur reinen Geschwindigkeit dominieren. Es kodiert langsamer und belegt mehr Speicher. Bei der erstmaligen Indexierung eines großen Korpus fällt das auf; bei einer einzelnen Frage ist der Unterschied angesichts der Generierungszeit des nachfolgenden Sprachmodells nicht wahrnehmbar.
Eine weitere Folge: Seine dichten Vektoren haben 1.024 Dimensionen, sodass der Index mehr Platz benötigt als bei Modellen mit 384 oder 768 Dimensionen. Bei einer Million Textpassagen fällt dieser Größenunterschied deutlich ins Gewicht; dann lohnt sich ein Blick auf die Kompressionsmöglichkeiten Ihrer Vektordatenbank.
| Modell | Dimension | Maximale Länge | Anwendungsbereich |
|---|---|---|---|
| BAAI/bge-m3 | 1 024 | 8 192 Tokens | Mehrsprachig, drei vereinheitlichte Retrieval-Verfahren |
| BAAI/bge-large-en-v1.5 | 1 024 | 512 Tokens | Nur Englisch |
| BAAI/bge-base-en-v1.5 | 768 | 512 Tokens | Nur Englisch, leichter |
| BAAI/bge-small-en-v1.5 | 384 | 512 Tokens | Nur Englisch, am leichtesten |
Der Unterschied ist deutlich: Bei gleicher Dimension (1.024) akzeptiert BGE-M3 sechzehnmal so viele Tokens pro Passage wie bge-large-en-v1.5 und deckt mehr als 100 Sprachen ab, während die gesamte „en“-Familie von BAAI auf Englisch beschränkt ist. Dafür muss man eine größere Downloadmenge und längere Kodierungszeiten in Kauf nehmen, muss aber nicht für jede Sprache im Korpus ein anderes Modell auswählen oder je nach Sprache der eingehenden Dokumente mehrere getrennte Indizes pflegen.
#Wann es wählen, wann darauf verzichten
| Situation | Auswahl |
|---|---|
| Französisches oder mehrsprachiges Korpus | BGE-M3 oder ein anderes wirklich mehrsprachiges Modell |
| Fragen auf Französisch zu englischen Dokumenten | Unbedingt ein mehrsprachiges Modell |
| Rein englischsprachiges Korpus, Geschwindigkeit hat Priorität | Ein kleines, spezialisiertes englischsprachiges Modell |
| Lange Abschnitte (über 512 Tokens), die man nicht weiter aufteilen möchte | BGE-M3, für seine Eingabelänge von 8.192 Tokens |
| Sehr eingeschränkte Hardware | Ein leichteres Modell, auch wenn dies zulasten der Relevanz bei französischen Texten geht |
- Der Überblick über die Embedding-Modelle für Französisch
- Ein Embedding-Modell lokal ausführen
- Kandidaten neu ordnen, um die Genauigkeit zu erhöhen
- Speichern Sie diese Vektoren in PostgreSQL mit pgvector
- Quelle: offizielle Modellkarte zu BGE-M3 auf Hugging Face
- Quelle: bge-m3 in der Ollama-Bibliothek
- Quelle: offizielles Repository und offizieller Quellcode von BGE-M3 (FlagEmbedding)
#FAQ
Ist BGE-M3 gut auf Französisch?+
Kann man englische Dokumente auf Französisch abfragen?+
Braucht man eine Grafikkarte?+
Wozu dienen seine drei Ausgaben?+
Wie viele Tokens kann BGE-M3 pro Passage verarbeiten?+
Kann ich später zu einem anderen Modell wechseln?+
Ist BGE-M3 für Französisch besser als die OpenAI-Modelle?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.