Mittelstufe 11 Min.Embeddings

BGE-M3: Embeddings, die wirklich sprechen französisch

Direkte Antwort

BGE-M3 (BAAI, MIT-Lizenz) ist ein Embedding-Modell, das mehr als 100 Sprachen unterstützt, bis zu 8.192 Tokens pro Passage akzeptiert und in einem einzigen Durchlauf drei Repräsentationen erzeugt: eine dichte (Gesamtbedeutung), eine lexikalische (exakte Begriffe, ähnlich wie bei BM25) und eine Multi-Vektor-Repräsentation (Neusortierung ähnlich wie bei ColBERT). Für ein französischsprachiges Korpus ist es eine verlässlichere Wahl als die englischsprachigen Modelle aus öffentlichen Ranglisten. Über Ollama benötigt es 1,2 GB (bge-m3:567m) und läuft ohne Grafikkarte.

Die meisten der bestplatzierten Embedding-Modelle werden überwiegend mit englischen Texten trainiert. Bei einem französischen Korpus funktionieren sie ohne Fehlermeldung, finden relevante Inhalte aber schlechter – ein besonders tückisches Versagen, da nichts darauf hinweist. BGE-M3, veröffentlicht vom chinesischen Forschungslabor BAAI, ist eines der wenigen wirklich mehrsprachigen Modelle und bietet zudem eine nützliche Besonderheit: Es erzeugt drei Arten von Repräsentationen auf einmal, ohne zusätzliche Kosten.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Das Problem mit dem Französischen

Ein Embedding-Modell lernt sein Verständnis von Ähnlichkeit aus seinem Trainingskorpus. Wenn dieses Korpus zu 90 % englischsprachig ist, ordnet das Modell englische Texte im Verhältnis zueinander korrekt ein, französische Texte dagegen deutlich weniger differenziert. In der Praxis bedeutet das bei einem französischen Dokumentenkorpus, dass relevante Passagen nicht gefunden werden und stattdessen themenfremde Passagen auftauchen – ohne jede Fehlermeldung, ohne Warnung in den Protokollen und oft, ohne dass es jemand bemerkt, bis ein Nutzer eine Antwort meldet, die am Thema vorbeigeht.

Deshalb fällt die Antwort auf die Frage „Welches Embedding-Modell?“ je nach Sprache unterschiedlich aus. Öffentliche Ranglisten (wie MTEB) werden weitgehend von englischsprachigen Aufgaben dominiert; sie sagen weder voraus, wie sich ein Modell bei Ihren Dokumenten verhält, noch, wie es mit Ihrem Fachvokabular zurechtkommt. Genau für diesen Fall hat das chinesische Labor BAAI (Beijing Academy of Artificial Intelligence) BGE-M3 entwickelt: Der Name steht für Multi-Functionality, Multi-Linguality, Multi-Granularity – drei Suchfunktionen, mehr als 100 Sprachen und Eingaben vom kurzen Satz bis zum langen Dokument, vereint in einem einzigen Modell statt auf mehrere Werkzeuge verteilt.

#Was BGE-M3 bietet

Das RAG-Local-Kit

Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Von Grund auf mehrsprachig
Das Modell unterstützt laut seiner offiziellen Modellbeschreibung mehr als 100 Arbeitssprachen; es verarbeitet Französisch korrekt und ermöglicht es auch, einen englischsprachigen Korpus auf Französisch abzufragen.
Langer Kontext: 8.192 Token
Es akzeptiert deutlich längere Textpassagen als die meisten Embedding-Modelle (oft auf 512 Tokens begrenzt), was Spielraum bei der Größe der indexierten Textabschnitte lässt.
Drei Darstellungen gleichzeitig
Dichte, lexikalische und Multi-Vektor-Repräsentationen, in einem einzigen Durchlauf erzeugt, laut BAAI ohne zusätzlichen Rechenaufwand.
MIT-Lizenz
Ohne besondere Einschränkungen im Unternehmen nutzbar; prüfen Sie bei der Integration stets die Modellbeschreibung, da sich die Lizenz von einer Version zur nächsten ändern kann.
Keine zusätzliche Anweisung erforderlich
Anders als bei anderen älteren BGE-Modellen muss bei BGE-M3 keine Anweisung mehr zu den Anfragen hinzugefügt werden: Das Modell wird direkt verwendet, was die Integration vereinfacht.

#Dicht, lexikalisch, mit mehreren Vektoren: Wozu dient das?

Drei Ausgaben, drei Anwendungsfälle (nach der offiziellen Modellbeschreibung)
DarstellungWas sie erfasstWas geboten wird
DenseDer Text wird auf einen einzigen Vektor reduziert, der seine Gesamtbedeutung erfasstKlassische semantische Suche
Lexikalisch (sparse)Ein Gewicht pro Begriff im Vokabular, das außer bei den im Text vorkommenden Wörtern null istFindet Referenzen, Abkürzungen und Eigennamen, die die semantische Suche übersieht, ähnlich wie BM25
Multi-vecteurMehrere Vektoren pro Text, wie bei ColBERTEine präzisere Neusortierung der besten Kandidaten

Der Vorteil ist, dass eine hybride Suche möglich ist, ohne zwei separate Modelle auszuführen: Die offizielle Modellkarte empfiehlt ausdrücklich die Kombination aus hybrider Suche und Reranking. Dabei nutzt sie die lexikalischen Gewichte, die gleichzeitig mit dem dichten Embedding „ohne zusätzliche Kosten“ gewonnen werden. Der lexikalische Teil gleicht gezielt die Fehler des dichten Teils aus, und der Multi-Vektor-Teil dient dazu, die rund zwanzig ausgewählten Kandidaten neu zu ordnen. Nicht alle Vektordatenbanken können die drei Ausgaben nutzen, doch die dichte Ausgabe allein reicht bereits für einen üblichen Einsatz aus. Das ist auch die einfachste Konfiguration für den Einstieg, bevor Sie die lexikalische Ebene hinzufügen, falls die Genauigkeit noch nicht ausreicht.

!
Die Auswahl erfolgt vor dem ersten Import
Ein Wechsel des Embedding-Modells erfordert, alles neu zu encodieren: Die Vektoren zweier Modelle sind nicht vergleichbar. Bei einem umfangreichen Korpus dauert diese Verarbeitung mehrere Stunden. Zwei oder drei Modelle anhand einer Auswahl Ihrer eigenen Fragen zu testen, kostet einen halben Tag und erspart diese erneute Verarbeitung.

#Lokal nutzen

Der schnellste Weg, BGE-M3 lokal zu testen, führt über Ollama, das eine quantisierte Version des Modells unter dem Namen bge-m3:567m bereitstellt — 567 Millionen Parameter, ein Download von etwa 1,2 GB und ein auf der Modellseite angegebenes Kontextfenster von 8.000 Tokens. Das Modell basiert auf XLM-RoBERTa-large, dessen Kontextlänge zunächst durch ein spezielles Vortraining (RetroMAE) auf 8.192 Tokens erweitert wurde. Anschließend erfolgte ein einheitliches Fine-Tuning für die drei Retrieval-Aufgaben in einem einzigen Trainingsschritt, statt drei separate Modelle pflegen zu müssen.

Terminal — Modell herunterladen und testen
ollama pull bge-m3
ollama run bge-m3 "Quel est le délai de rétractation légal en France ?"

Für eine vollständige RAG-Pipeline ist nur die dichte Ausgabe ohne spezielle Konfiguration direkt mit den meisten gängigen Vektordatenbanken (Qdrant, Milvus, pgvector) nutzbar; die lexikalische Ausgabe und die Multi-Vektor-Ausgabe erfordern eine Engine, die sie kombinieren kann. Dies dokumentieren beispielsweise die von BAAI angeführten Integrationen für Milvus und Vespa.

In einer klassischen RAG-Pipeline mit einem lokalen LLM ersetzt BGE-M3 einfach das standardmäßig verwendete Embedding-Modell: Jeder Dokumentabschnitt wird bei der Indexierung einmal kodiert, die Frage des Nutzers wird bei jeder Anfrage kodiert, und anschließend werden die besten gefundenen Passagen an das unter Ollama oder LM Studio geladene LLM (Qwen, Mistral, Llama…) übergeben. Die Wahl des Embedding-Modells und die Wahl des Generierungsmodells sind zwei unabhängige Entscheidungen: Für beide Schritte muss keineswegs ein Modell aus derselben Familie verwendet werden, und in der Praxis ist das sogar selten der Fall.

i
Ein Detail, das häufig zur Stolperfalle wird
Das beim Indexieren verwendete Embedding-Modell muss exakt mit dem bei der Abfrage verwendeten Modell identisch bleiben. Ein Versionswechsel, selbst bei einer Nebenversion, oder eine Änderung der Normalisierungseinstellung zwischen den beiden Schritten verschlechtert die Relevanz, ohne einen sichtbaren Fehler auszulösen – dasselbe unbemerkte Problem wie in der Einleitung beschrieben, diesmal jedoch selbst verursacht.

#An Ihren eigenen Dokumenten überprüfen

Die Angabe „mehr als 100 Sprachen“ in einer Produktbeschreibung garantiert keine einheitliche Qualität: Sie beschreibt die Sprachabdeckung, keinen Leistungswert pro Sprache. BAAI evaluiert BGE-M3 auf MIRACL (mehrsprachige Suche) und auf MLDR, einem Datensatz für die Suche nach langen Dokumenten, der 13 Sprachen abdeckt und den das Labor speziell für dieses Modell veröffentlicht hat; die zugehörige Evaluierungspipeline ist frei zugänglich. Diese Evaluierungen zeigen eine allgemeine Tendenz, die anhand standardisierter Forschungskorpora gemessen wurde; sie ersetzen keinen Test mit Ihrem eigenen Korpus, in Ihrem eigenen Fachgebiet, mit Ihrem eigenen technischen Vokabular und Ihren eigenen Frageformulierungen.

  1. 01
    Eine kleine repräsentative Stichprobe zusammenstellen
    Zwanzig bis dreißig echte Dokumente aus dem vorgesehenen Korpus, mit der üblichen Vielfalt an Textlängen und Wortschatz, keine handverlesene Auswahl.
  2. 02
    Fragen so formulieren, wie Ihre Benutzer sie stellen würden
    Zehn bis zwanzig echte Fragen, darunter auch Fragen, die Synonyme verwenden oder anders formuliert sind als im Quelldokument.
  3. 03
    Zwei oder drei Modelle anhand derselben Stichprobe vergleichen
    BGE-M3 im Vergleich mit einem renommierten englischsprachigen Modell und, wenn möglich, einem weiteren mehrsprachigen Modell. Notieren, wie oft die richtige Passage unter den ersten drei Ergebnissen erscheint.
  4. 04
    Vor dem Massenimport eine Entscheidung treffen
    Der Test nimmt einen halben Tag in Anspruch; ein Modellwechsel nach der Indexierung eines vollständigen Korpus erfordert, alles neu zu kodieren, wie bereits weiter oben erwähnt.
→
Der Website-Katalog als Referenz
Um die Größe eines Embedding-Modells im Verhältnis zu den LLMs einzuordnen, die Sie bereits lokal betreiben, liefert der QuelLLM-Katalog (quelllm.fr/api/models.json) die Größen und den Speicherbedarf der auf der Website aufgeführten Modelle.

#Was es kostet

Es handelt sich um ein schwereres Embedding-Modell als die kleinen englischsprachigen Modelle, die derzeit im Trend liegen: Mit 567 Millionen Parametern und einer Downloadgröße von 1,2 GB gehört es in dieser Kategorie zum Mittelfeld, weit entfernt von Modellen mit nur einigen zehn Millionen Parametern, die die Ranglisten zur reinen Geschwindigkeit dominieren. Es kodiert langsamer und belegt mehr Speicher. Bei der erstmaligen Indexierung eines großen Korpus fällt das auf; bei einer einzelnen Frage ist der Unterschied angesichts der Generierungszeit des nachfolgenden Sprachmodells nicht wahrnehmbar.

Eine weitere Folge: Seine dichten Vektoren haben 1.024 Dimensionen, sodass der Index mehr Platz benötigt als bei Modellen mit 384 oder 768 Dimensionen. Bei einer Million Textpassagen fällt dieser Größenunterschied deutlich ins Gewicht; dann lohnt sich ein Blick auf die Kompressionsmöglichkeiten Ihrer Vektordatenbank.

BGE-M3 in der Familie der von BAAI veröffentlichten Modelle
ModellDimensionMaximale LängeAnwendungsbereich
BAAI/bge-m31 0248 192 TokensMehrsprachig, drei vereinheitlichte Retrieval-Verfahren
BAAI/bge-large-en-v1.51 024512 TokensNur Englisch
BAAI/bge-base-en-v1.5768512 TokensNur Englisch, leichter
BAAI/bge-small-en-v1.5384512 TokensNur Englisch, am leichtesten

Der Unterschied ist deutlich: Bei gleicher Dimension (1.024) akzeptiert BGE-M3 sechzehnmal so viele Tokens pro Passage wie bge-large-en-v1.5 und deckt mehr als 100 Sprachen ab, während die gesamte „en“-Familie von BAAI auf Englisch beschränkt ist. Dafür muss man eine größere Downloadmenge und längere Kodierungszeiten in Kauf nehmen, muss aber nicht für jede Sprache im Korpus ein anderes Modell auswählen oder je nach Sprache der eingehenden Dokumente mehrere getrennte Indizes pflegen.

#Wann es wählen, wann darauf verzichten

Ehrlich entscheiden
SituationAuswahl
Französisches oder mehrsprachiges KorpusBGE-M3 oder ein anderes wirklich mehrsprachiges Modell
Fragen auf Französisch zu englischen DokumentenUnbedingt ein mehrsprachiges Modell
Rein englischsprachiges Korpus, Geschwindigkeit hat PrioritätEin kleines, spezialisiertes englischsprachiges Modell
Lange Abschnitte (über 512 Tokens), die man nicht weiter aufteilen möchteBGE-M3, für seine Eingabelänge von 8.192 Tokens
Sehr eingeschränkte HardwareEin leichteres Modell, auch wenn dies zulasten der Relevanz bei französischen Texten geht

#FAQ

Ist BGE-M3 gut auf Französisch?+
Ja, genau darin liegt sein Vorteil: Laut seiner offiziellen Modellbeschreibung unterstützt es mehr als 100 Arbeitssprachen, während die meisten bestplatzierten Modelle überwiegend auf Englisch ausgerichtet sind. Testen Sie es dennoch mit Ihren eigenen Fragen, da die öffentlichen Ranglisten weiterhin vom Englischen dominiert werden.
Kann man englische Dokumente auf Französisch abfragen?+
Das ist einer der Vorteile eines mehrsprachigen Modells wie BGE-M3: Anders als bei einem Modell, das nur auf einer Sprache trainiert wurde, müssen die Frage und das Dokument nicht in derselben Sprache vorliegen, um im Vektorraum nahe beieinander zu liegen. Das ist für eine gemischtsprachige Dokumentensammlung nützlich, etwa für eine technische Dokumentation auf Englisch, die von einem französischsprachigen Team abgefragt wird.
Braucht man eine Grafikkarte?+
Nein, das Modell läuft auf dem Prozessor: Die Ollama-Version benötigt bei 567 Millionen Parametern etwa 1,2 GB, eine für den CPU-Betrieb angemessene Größe. Eine GPU verkürzt die Indexierungszeit eines großen Korpus deutlich; bei einer einzelnen Abfrage ist der Unterschied im Vergleich zum Sprachmodell, das anschließend die Antwort verarbeitet, vernachlässigbar.
Wozu dienen seine drei Ausgaben?+
Die dichte Ausgabe übernimmt die klassische semantische Suche, die lexikalische (Sparse-)Ausgabe erfasst exakte Begriffe wie Referenzen und Kürzel nach dem Prinzip von BM25, und die Multi-Vektor-Ausgabe dient nach dem Prinzip von ColBERT dazu, die besten Kandidaten präzise neu zu ordnen. Nur die dichte Ausgabe zu verwenden, ist bereits eine sinnvolle Nutzung und lässt sich am einfachsten in eine Standard-Vektordatenbank integrieren.
Wie viele Tokens kann BGE-M3 pro Passage verarbeiten?+
Bis zu 8.192 Tokens laut der offiziellen Modellkarte, gegenüber 512 bei der englischsprachigen Modellfamilie bge-large-en-v1.5, bge-base-en-v1.5 und bge-small-en-v1.5 desselben Herausgebers. Das ist nützlich, um lange Passagen wie Verträge oder Berichte zu indexieren, ohne sie weiter aufzuteilen, allerdings auf Kosten einer langsameren Encodierung bei großen Dokumentmengen.
Kann ich später zu einem anderen Modell wechseln?+
Ja, allerdings muss dafür der gesamte Korpus neu kodiert werden: Die Vektoren zweier Modelle sind nicht miteinander vergleichbar, selbst wenn sie dieselbe Dimension haben. Testen Sie besser zwei oder drei Modelle an einer Stichprobe vor dem ersten umfangreichen Import, statt das Problem erst nachträglich bei einem bereits indexierten Korpus zu entdecken.
Ist BGE-M3 für Französisch besser als die OpenAI-Modelle?+
Ein von BAAI zitierter unabhängiger Vergleich sieht das Modell in diesem konkreten Test sowohl im Englischen als auch in den anderen Sprachen vor OpenAI-Modellen. Ein einzelner Vergleich ersetzt jedoch keinen Test mit Ihrem eigenen Korpus. Es empfiehlt sich weiterhin, mehrere Modelle anhand Ihrer eigenen Fragen zu testen, bevor Sie eines auswählen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.