Mittelstufe 14 Min.Embeddings

Die besten Embedding-Modelle FR

Direkte Antwort

Für französischsprachige Texte ist BGE-M3 der verlässlichste Ausgangspunkt: mehrsprachig, ein Kontextfenster von 8.192 Tokens, MIT-Lizenz, in Ollama verfügbar. Qwen3-Embedding und EmbeddingGemma sind neuere Alternativen, die Sie testen sollten. Auf Englisch ausgerichtete Modelle (nomic-embed-text, mxbai-embed-large, all-MiniLM) sollten Sie für französischsprachige Texte vermeiden. Überprüfen Sie Ihre endgültige Wahl anhand Ihrer eigenen Dokumente.

Ein Embedding-Modell wandelt jeden Text in einen Vektor um: Es bestimmt, dass „CDD“ und „contrat à durée déterminée“ nahe beieinander liegen. Für Französisch misst der Benchmark MTEB-French einen Unterschied von 22 Punkten beim Retrieval zwischen BGE-M3 und all-MiniLM-L12-v2. Diese Seite stellt eine Rangliste offener Modelle auf, die lokal genutzt werden können, nennt veröffentlichte Messwerte und deren Grenzen und behandelt anschließend die kostspieligen Aspekte des produktiven Betriebs: Präfixe, Trunkierung, Dimensionen, Speicherung und Neuindexierung.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Was ein Embedding-Modell ist und warum Französisch die Sache komplizierter macht

Ein Embedding-Modell ist ein neuronales Netz, das einen Text (einen Satz, einen Absatz, einen Chunk) in einen Zahlenvektor mit je nach Modell 384 bis 4.096 Dimensionen umwandelt. Zwei Texte mit ähnlicher Bedeutung ergeben ähnliche Vektoren; ihre Ähnlichkeit wird meist anhand der Kosinusähnlichkeit gemessen. So kann ein RAG eine Passage über einen „befristeten Arbeitsvertrag“ finden, wenn der Nutzer „CDD“ schreibt, ohne dass die beiden Formulierungen ein Wort gemeinsam haben. Dasselbe Modell muss die Fragen und die Dokumente kodieren, wie die Ollama-Dokumentation betont; ein Modellwechsel erfordert daher eine Neuindexierung des gesamten Korpus. Für die Auswahl genügen drei Fragen: Wurde das Modell auf französischsprachigen Texten trainiert? Deckt sein Kontext Ihre Chunks ab? Erlaubt seine Lizenz Ihre Nutzung?

Französisch bringt eigene Schwierigkeiten mit sich: Akzente, Elisionen („l'employeur“), juristische Abkürzungen und technische Anglizismen im Text. Der Unterschied zwischen den Modellen ist deutlich. Im Benchmark MTEB-French reicht der Retrieval-Score von 0,43 für all-MiniLM-L12-v2 bis 0,65 für BGE-M3, also ein Unterschied von 22 Punkten beim selben Satz von Fragen.

i
Dimension ≠ Qualität
Ein längerer Vektor ist nicht von Natur aus präziser. Im mehrsprachigen MTEB-Ranking sinkt der Wert von EmbeddingGemma von 61,15 auf 60,71, wenn seine Vektoren von 768 auf 512 Dimensionen reduziert werden. Google nennt außerdem Vektorgrößen von 256 und 128 Dimensionen. Die Speicherplatzeinsparung ist proportional, der Qualitätsverlust ist es nicht.

#Die fünf Kriterien, die Modelle wirklich unterscheiden

Das Kit Lokales RAG

Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
Trainingssprachen
BGE-M3 und Qwen3-Embedding geben Unterstützung für mehr als 100 Sprachen an, multilingual-e5-large für 94. Die Modellkarten von nomic-embed-text-v1.5 und mxbai-embed-large-v1, die in Ollama sehr häufig heruntergeladen werden, sind mit „English“ gekennzeichnet.
Maximaler Kontext
512 Tokens für multilingual-e5-large, Solon und mxbai-embed-large; 2.048 für EmbeddingGemma; 8.192 für BGE-M3; 32.000 für Qwen3-Embedding und Granite R2. Ein längerer Chunk wird abgeschnitten, nicht abgelehnt.
Dimensionen und Speicherung
384 bis 4.096 Dimensionen, also 4 Byte pro Dimension und pro Vektor in float32 (Berechnung weiter unten).
Lizenz
MIT für BGE-M3, multilingual-e5-large und Solon; Apache 2.0 für Qwen3-Embedding, Granite R2, nomic und mxbai; Gemma-Bedingungen für EmbeddingGemma; CC BY-NC 4.0 (nicht kommerziell) für jina-clip-v2.
Präfixe und Anweisungen
Einige Modelle erfordern ein Präfix vor jedem Text („query:“ und „passage:“ bei E5, auch auf Französisch). Wird es vergessen, verschlechtert sich das Retrieval, ohne dass eine Fehlermeldung erscheint.

#Rangliste 2026 für Französisch: neun Modelle verglichen

Diese Rangliste ist eine redaktionelle Auswahl, kein eigener Benchmark-Test: Sie berücksichtigt die Unterstützung des Französischen, veröffentlichte Benchmarks und die lokale Verfügbarkeit. Die Größenangaben zu den Modellgewichten stammen aus der Ollama-Bibliothek, sofern das Modell dort enthalten ist, andernfalls aus den Schätzungen der MTEB-French-Studie für float32.

Embedding-Modelle für Französisch: von den Anbietern veröffentlichte Eigenschaften
ModellDimensionen / KontextLizenzModellgrößeWas die Quellen über das Französische sagen
BGE-M3 (BAAI)1 024 / 8 192MIT1,2 GB (Ollama)Retrieval auf MTEB-French: 0,65. Dense-, Sparse- und Multi-Vektor-Verfahren. Empfohlener Ausgangspunkt.
Qwen3-Embedding 0,6B / 4B / 8B1 024 / 2 560 / 4 096 ; 32 000Apache 2.0639 MB / 2,5 GB / 4,7 GB (Ollama)Mehr als 100 Sprachen. Multilinguales MTEB laut Qwen: 64,33 / 69,45 / 70,58.
EmbeddingGemma 300M (Google)768 (512, 256, 128) / 2 048Gemma622 MB (Ollama)Mehr als 100 Sprachen. Mehrsprachiges MTEB v2: 61,15 laut Google.
multilingual-e5-large1 024 / 512MIT2,24 GB (float32)Retrieval MTEB-French 0,59. Präfixe erforderlich.
Solon-embeddings-large-0.11 024 / 512MIT2,24 GB (float32)Französisches Modell veröffentlicht von Ordalie Technologies. Retrieval MTEB-French 0,63.
Granite Embedding 311M Multilingual R2 (IBM)768 / 32 768Apache 2.0311 Mio. ParameterFranzösisch gehört zu den 52 Sprachen mit verbesserter Unterstützung. Laut IBM 65,2 beim mehrsprachigen MTEB-Retrieval; keine unabhängige Messung für Französisch herangezogen.
nomic-embed-text v1.5768 / 8 192 (2 048 unter Ollama)Apache 2.0274 MB (Ollama)Die Modellkarte ist mit „Englisch“ gekennzeichnet. Nur für englische Korpora verwenden.
mxbai-embed-large-v1Kontextgröße 512Apache 2.0670 MB (Ollama)Die Modellkarte ist mit „Englisch“ gekennzeichnet. Nur für englische Korpora verwenden.
all-MiniLM-L12-v2384Apache 2.033 Mio. ParameterRetrieval MTEB-French 0,43. Prototyp ausschließlich für die CPU.

BGE-M3 bleibt der beste Ansatz: Sein französischer Retrieval ist veröffentlicht, sein Kontext von 8.192 Tokens vermeidet die meisten künstlichen Schnitte und liefert zudem die lexikalischen Gewichte, die für eine hybride Suche nützlich sind. Qwen3-Embedding ist die Wahl, wenn eine Grafikkarte verfügbar ist: Die 8B-Version war bei der MTEB-Multilingual-Liste am 5. Juni 2025 an der Spitze, gemäß Qwen, doch ihre 4.096 Dimensionen belasten den Speicher. EmbeddingGemma richtet sich an geringere Systeme.

Solon, das oft als Spezialist für juristisches und administratives Französisch vorgestellt wird, gewinnt bei keinem der drei Retrieval-Datensätze der MTEB-French-Studie: Beim Syntec-Tarifvertrag liegt es gleichauf mit BGE-M3 und bleibt bei den Gesetzesartikeln (BSARD) und den schulischen Fragen (Alloprof) dahinter zurück.

#Was die französischen Benchmarktests sagen und was sie nicht sagen

Die veröffentlichte Referenz ist MTEB-French (Ciancone et al., Mai 2024): 18 Datensätze, 8 Aufgabenkategorien, 51 verglichene Modelle. Die Autoren kommen zu dem Schluss, dass große mehrsprachige Modelle, die auf Satzähnlichkeit vortrainiert wurden, außergewöhnlich gut abschneiden. Hier sind die Retrieval-Ergebnisse (NDCG@10) für drei Datensätze: Gesetzesartikel auf Französisch (BSARD), der Syntec-Tarifvertrag und Schulfragen von Alloprof.

MTEB-French: Retrieval (NDCG@10) je Datensatz, Studie 2024
ModellDurchschnittlicher Retrieval-WertRecht (BSARD)Syntec-TarifvertragAlloprof
text-embedding-3-large (OpenAI-API)0,730,730,870,60
mistral-embed (Mistral-API)0,680,680,790,57
BGE-M30,650,600,850,49
Solon-embeddings-large-0.10,630,580,850,47
multilingual-e5-large0,590,590,810,38
multilingual-e5-small0,520,520,760,27
paraphrase-multilingual-MiniLM-L12-v20,440,380,660,27
all-MiniLM-L12-v20,430,340,610,33

Drei Einschränkungen verhindern, daraus eine endgültige Rangliste abzuleiten. Die Studie stammt aus dem Jahr 2024: Sie enthält weder Qwen3-Embedding (Juni 2025) noch EmbeddingGemma (September 2025) noch Granite R2, und für diese Seite wurden keine vergleichbaren Messungen dieser Modelle für die französische Sprache herangezogen. Die Korpora (Gesetzesartikel, Tarifvertrag, schulische Fragen) ähneln Ihren eigenen nicht unbedingt. Schließlich stammen die veröffentlichten mehrsprachigen Scores von den Anbietern selbst und fassen alle Sprachen zusammen.

!
Keiner dieser Werte stammt aus Ihren eigenen Tests
Diese Tabellen stammen aus einer veröffentlichten Studie und den Herstellerinformationen, nicht aus einem eigenen Test. Sie zeigen, wo man hinschauen sollte, nicht, welches Modell bei Ihnen gewinnt. Um zwischen zwei ähnlichen Modellen zu entscheiden, verwendet die Methode im letzten Abschnitt Ihre eigenen Daten.

#Welches Modell für welchen Anwendungsfall: Entscheidungstabelle

Ein Embedding-Modell für französische Texte auswählen
Ihre SituationErstes Modell zum TestenWarumAchtung
Französisches oder französisch-englisches Korpus, ausreichend leistungsfähiger RechnerBGE-M3Retrieval-Wert für Französisch von 0,65, auf dem Niveau der besten offenen Modelle der Studie1,2 GB in Ollama; kein Präfix
Rechtswesen, Verwaltung, PersonalwesenBGE-M3, dann Solon im VergleichBGE-M3 erreicht oder übertrifft die Leistung von Solon auf allen drei französischen Datensätzen der StudieEin Modell ohne interne juristische Testdaten bleibt ein Risiko
Rechner mit geringer Leistung oder nur CPUEmbeddingGemma 300M oder multilingual-e5-small622 MB in Ollama; von Google für Laptops und Mobilgeräte entwickelt2.048-Token-Kontext: kurze Chunks
Grafikkarte verfügbar, maximale QualitätQwen3-Embedding-4B oder 8B32.000 Tokens, anpassbare Dimensionen, über 100 Sprachen2.560 und 4.096 Dimensionen: Speicherung und Grenzen von Indexen
Lange Chunks, strukturierte DokumenteBGE-M3, Qwen3-Embedding oder Granite R2Kontextfenster von 8.192 bis 32.768 TokensBei einem sehr langen Chunk wird der Bedeutungsgehalt verwässert
Kommerzieller Einsatz, LizenzauditBGE-M3, multilingual-e5-large, Solon, Qwen3-Embedding, Granite R2MIT oder Apache 2.0Gemmas Nutzungsbedingungen erneut lesen; jina-clip-v2 ist nur für nichtkommerzielle Nutzung lizenziert

#Maßgeschneidertes Embedding für Unternehmen: offenes Modell, Fine-Tuning oder API

„Maßgeschneidert“ bedeutet nicht, von Anfang an ein eigenes Modell zu trainieren. Die Reihenfolge, die Zeitverschwendung vermeidet: ein offenes, allgemeines Modell, sorgfältiges Chunking, eine hybride Suche und ein Reranker; anschließend eine Messung des Recalls anhand Ihrer tatsächlichen Fragen; danach, nur wenn die Fehler weiterhin auftreten und auf das Fachvokabular zurückzuführen sind (interne Referenzen, unternehmensinterne Abkürzungen), ein Fine-Tuning.

Philipp Schmid hat im Juni 2024 das Modell bge-base-en-v1.5 mit 6.300 Frage-Textpassage-Paaren aus Finanzdokumenten feinabgestimmt: Der Retrieval-Score stieg auf seinem Testdatensatz um etwa 7,4 %, bei einer Trainingsdauer von drei Minuten auf einer handelsüblichen Grafikkarte. Das ist ein englischsprachiges Beispiel mit nur einem Korpus und von einem LLM erzeugten Paaren: eine Größenordnung, kein Versprechen. BAAI dokumentiert auch die Feinabstimmung von BGE-M3.

Drei Möglichkeiten, ein für das Unternehmen geeignetes Embedding zu erhalten
OptionWann diese Option wählen?Grenzen
Offenes, allgemeines lokales Modell (BGE-M3, Qwen3-Embedding)Standardmäßiger Ausgangspunkt; die Texte bleiben in Ihrem Netzwerk; MIT- oder Apache-LizenzBranchenspezifisches Vokabular nicht erlernt; anhand Ihrer Dokumente zu bewerten
Fine-tuning eines offenen ModellsRecall stagniert trotz hybrider Suche und Reranker; mehrere Tausend Frage-Passage-PaareKorpus muss neu encodiert werden; Modell muss wie Software versioniert werden; Risiko der Überanpassung
Embedding-API (Mistral, OpenAI)Keine GPU, moderates Verarbeitungsvolumen; text-embedding-3-large und mistral-embed liegen in der MTEB-French-Studie von 2024 an der SpitzeDie Texte verlassen Ihr Netzwerk; das Modell kann sich auf Anbieterseite ändern; laufende Kosten
→
Der geeignete Test vor dem Fine-Tuning
Wenn der relevante Abschnitt in den ersten zwanzig Ergebnissen, aber nicht in den ersten fünf enthalten ist, ist dies ein Anwendungsfall für einen Reranker: BAAI empfiehlt zudem hybride Suche gefolgt von Reranking. Das Fine-Tuning von Embeddings zielt auf Abschnitte ab, die nie in den Ergebnissen erscheinen.

#Multimodales Embedding: Suchen in Bildern und Dokumentseiten

Ein multimodales Embedding-Modell ordnet Text und Bilder im selben Vektorraum an. So lässt sich anhand eines Satzes ein Foto finden oder eine gescannte PDF-Seite, ohne OCR zu verwenden. Die für diese Seite betrachteten Modelle aus der Ollama-Bibliothek (BGE-M3, Qwen3-Embedding, EmbeddingGemma, nomic-embed-text, mxbai-embed-large) akzeptieren ausschließlich Text: Die unten aufgeführten multimodalen Modelle werden über Hugging Face (Sentence-Transformers oder Transformers) verwendet.

Offene multimodale Embedding-Modelle
ModellEingabenLizenzGut zu wissen
Qwen3-VL-Embedding 2B / 8BText, Bilder, Screenshots, VideoApache 2.032.000 Tokens; 2.048 und 4.096 Dimensionen; anpassbare Dimensionen
jina-clip-v2Text und Bilder; 94 SprachenCC BY-NC 4.0Nicht kommerziell: Ohne Zustimmung des Herausgebers für ein kostenpflichtiges Produkt oder eine kostenpflichtige Dienstleistung nicht verwenden
ColPali v1.3Dokumentseiten als Bilder, mehrere VektorenMIT (Modellkarte)Modellkarte mit der Sprachangabe Englisch; mehrere Vektoren pro Seite verändern die Speicherung

Ein multimodales Modell ist bei reinem Text nicht besser. In den von Qwen veröffentlichten Tabellen erreicht Qwen3-VL-Embedding-2B auf dem multilingualen MTEB 63,87, gegenüber 64,33 für Qwen3-Embedding-0.6B, ein Textmodell, das mehr als dreimal kleiner ist. Konvertieren Sie PDFs, deren nützlicher Inhalt Text ist, in sauberen Text (mit Docling oder OCR) und bleiben Sie bei einem Text-Embedding. Reservieren Sie multimodale Embeddings für visuelle Korpora: Diagramme, Pläne, Screenshots, Folien.

#Embeddings verwalten: Präfixe, Kürzung, Speicherung und Neuindexierung

Die Qualität eines RAG leidet oft stärker unter diesen Details als unter der Modellwahl. Erstes Detail: Jede Modellfamilie erwartet unterschiedliche Eingabeformate für Fragen und Dokumente.

Erwartete Präfixe je Modell (Fragen und Dokumente)
ModellVor der FrageVor dem Dokument
BGE-M3NichtsNichts
multilingual-e5-largequery: passage: (erforderlich, auch auf Französisch)
Solon-embeddings-large-0.1query : Nichts
nomic-embed-text v1.5search_query: search_document:
mxbai-embed-large-v1Stellen Sie diesen Satz zur Suche relevanter Abschnitte dar: Nichts
Qwen3-EmbeddingInstruct: {Aufgabe in einem Satz}, Zeilenumbruch, Query: {Frage}Nichts
EmbeddingGemmatask: search result | query: {question}title: {titre ou none} | text: {contenu}

Bei Ollama enthält das offizielle Beispiel für mxbai-embed-large das Präfix direkt im übermittelten Text: Fügen Sie es selbst in Ihrem Code hinzu. Qwen gibt an, dass die Anweisungen im Allgemeinen eine Verbesserung von 1 bis 5 % bringen, und empfiehlt, sie auch für ein mehrsprachiges Korpus auf Englisch zu verfassen.

#Die Falle bei Ollama: stilles Abschneiden

Der Ollama-Endpunkt /api/embed hat einen Parameter truncate, dessen Standardwert true ist: Eine Eingabe, die das Kontextfenster des Modells überschreitet, wird ohne Fehlermeldung abgeschnitten. Bei mxbai-embed-large (512 Tokens in Ollama) wird ein Chunk mit 700 Tokens ohne seinen Schluss indexiert, und niemand bemerkt es. Die Kontextlänge in Ollama kann auch von der ursprünglichen Modellbeschreibung abweichen: 2K für nomic-embed-text gegenüber den von Nomic angegebenen 8.192. Setzen Sie truncate während der Tests auf false: Eine Fehlermeldung ist besser als ein abgeschnittener Text.

#Dimensionen, Speicher und Grenzen des Indexes

Der Speicherbedarf berechnet sich einfach: Anzahl der Chunks × Dimensionen × 4 Byte in float32, ohne Index. Für eine Million Chunks beanspruchen die Vektoren allein:

Eine Million Chunks in float32, Vektoren allein (Berechnung)
DimensionenBeispielmodellSpeicher
256EmbeddingGemma oder Qwen3 mit reduzierter Dimensionalität (Matryoshka)1,0 GB
384all-MiniLM-L12-v21,5 GB
768EmbeddingGemma, Granite R2, nomic3,1 GB
1 024BGE-M3, multilingual-e5-large, Qwen3-0.6B4,1 GB
2 560Qwen3-Embedding-4B10,2 GB
4 096Qwen3-Embedding-8B16,4 GB

Auch Datenbanken setzen Obergrenzen. Bei pgvector kann ein Index Vektoren mit höchstens 2.000 Dimensionen erfassen, bei halber Präzision (halfvec) sind es 4.000: Die 4.096 Dimensionen von Qwen3-Embedding-8B überschreiten selbst diese Grenze. Abhilfe schafft das Kürzen der Vektoren, das mit nach dem Matryoshka-Verfahren trainierten Modellen möglich ist (Qwen3-Embedding, EmbeddingGemma, nomic v1.5). Anschließend müssen sie erneut normalisiert werden, wie Google für EmbeddingGemma erläutert. Ollamas API /api/embed akzeptiert den Parameter dimensions, der nur für diese Modelle verwendet werden sollte.

#Versionieren und neu indexieren

Zu bewahrende Metadaten
Genauer Modellname, Revision, Dimension, Präfixvorlage, Chunking-Parameter, Indexierungsdatum. Ohne diese Angaben weiß niemand, warum sich das Retrieval verändert hat.
Modellwechsel
Kodieren Sie den gesamten Korpus erneut in eine neue Collection, evaluieren Sie diese und stellen Sie anschließend darauf um. Mischen Sie niemals zwei Modelle in derselben Collection.
Normalisierung
Ollama liefert L2-normalisierte Vektoren: Verwenden Sie die gleiche Metrik (Cosinus oder Skalarprodukt) überall.

#Ein Modell in der Praxis verwenden und mit Ihren Dokumenten testen

Ollama : BGE-M3 herunterladen und Embedding generieren
ollama pull bge-m3

curl http://localhost:11434/api/embed -d '{
  "model": "bge-m3",
  "input": "Le contrat débute le 1er mai."
}'
Ollama in Python: zwei ähnliche Texte, ein unähnlicher Text
import numpy as np
import ollama

textes = [
    "Le contrat débute le 1er mai.",
    "Date de début : 01/05.",
    "La voiture est rouge.",
]
vecteurs = np.array(ollama.embed(model="bge-m3", input=textes)["embeddings"])

# Les vecteurs d'Ollama sont normalisés : le produit scalaire vaut le cosinus
print(vecteurs[0] @ vecteurs[1])
print(vecteurs[0] @ vecteurs[2])

Merken Sie sich nur die Reihenfolge der beiden Werte: Der erste muss deutlich höher sein als der zweite. Um zwei oder drei Kandidaten seriös zu vergleichen, ersetzt das folgende Verfahren sämtliche veröffentlichten Ranglisten.

  1. 01
    Ein echtes Testset erstellen
    Sammeln Sie 50 bis 100 Fragen von echten Nutzern (Support, Tickets, häufig gestellte Fragen) und notieren Sie für jede den Chunk, der die Antwort enthält. Von einem LLM erfundene Fragen lassen die Ergebnisse besser aussehen, als sie tatsächlich sind.
  2. 02
    Mit jedem Modellkandidaten encodieren
    Kodieren Sie zuerst die Chunks und anschließend die Fragen unter Beachtung der Präfixtabelle. Verwenden Sie für alle Kandidaten dieselbe Chunk-Länge und dieselbe Speicherdimension.
  3. 03
    Den Recall@5 messen
    Prüfen Sie für jede Frage, ob der richtige Chunk unter den ersten fünf Ergebnissen enthalten ist. Das folgende Skript führt diese Berechnung durch.
  4. 04
    Anhand eines Kostenkriteriums entscheiden
    Behalten Sie das kleinste Modell, dessen recall@5 nur ein oder zwei Punkte hinter dem besten liegt: Ein achtmal größeres Modell kostet bei jeder Neuindexierung zusätzlichen Speicherplatz und zusätzliche Zeit.
Sentence-Transformers: recall@5 auf Ihren Daten
import numpy as np
from sentence_transformers import SentenceTransformer

modele = SentenceTransformer("BAAI/bge-m3")

chunks = [...]      # vos chunks (liste de textes)
questions = [...]   # 50 à 100 vraies questions
cible = [...]       # pour chaque question, l'index du bon chunk

C = modele.encode(chunks, normalize_embeddings=True)
Q = modele.encode(questions, normalize_embeddings=True)

top5 = np.argsort(-(Q @ C.T), axis=1)[:, :5]
recall5 = np.mean([cible[i] in top5[i] for i in range(len(questions))])
print(f"recall@5 = {recall5:.0%}")
→
Speichern Sie die Vektoren dauerhaft
Den gesamten Korpus bei jedem Start neu zu kodieren, ist der langsamste Schritt in einem einfachen RAG-System für Einsteiger. Speichern Sie die Vektoren in einer Datenbank (Chroma, Qdrant, pgvector, FAISS) und kodieren Sie nur die neuen Chunks neu.
FAQ
Welches ist das beste Embedding-Modell für Französisch?+
BGE-M3 ist der beste Ausgangspunkt: Sein Retrieval-Ergebnis für Französisch ist veröffentlicht (0,65 in MTEB-French), es verarbeitet 8.192 Tokens, steht unter der MIT-Lizenz und wird von Ollama angeboten. Qwen3-Embedding und EmbeddingGemma sind neuer und in dieser Studie nicht enthalten. Testen Sie sie anhand von fünfzig Fragen aus Ihrem Korpus, bevor Sie sich entscheiden.
Kann man nomic-embed-text oder mxbai-embed-large auf Französisch verwenden?+
Ihre Modellkarten auf Hugging Face sind mit der Sprachkennzeichnung Englisch versehen, und die Modelle sind in der MTEB-French-Studie nicht vertreten. Sie funktionieren technisch mit französischen Texten, aber nichts garantiert die Qualität. In Ollama stellt nomic-embed-text nur 2.048 Tokens Kontext bereit, gegenüber den von Nomic angegebenen 8.192. Im Vergleich der beiden bietet nomic mehr Kontext (2.048 Tokens in Ollama gegenüber 512); mxbai benötigt ein Präfix nur für Abfragen. Bevorzugen Sie BGE-M3.
Gibt es ein Modell bge-m4?+
Das offizielle FlagEmbedding-Repository erwähnt kein bge-m4. Das mehrsprachige Modell der Familie heißt BGE-M3, und M3 steht für drei Eigenschaften: Multifunktionalität (dense, sparse, Multi-Vektoren), Mehrsprachigkeit (mehr als 100 Sprachen) und Multigranularität (bis zu 8.192 Tokens). Wenn eine Website ein bge-m4 anbietet, überprüfen Sie vor dem Herunterladen die Herkunft des Modells.
Muss man beim Wechsel des Embedding-Modells neu indexieren?+
Ja, vollständig. Die Vektoren zweier Modelle liegen in unterschiedlichen Vektorräumen und haben oft nicht einmal dieselbe Dimension. Erstellen Sie eine neue Collection, encodieren Sie alle Chunks mit dem neuen Modell und dessen Präfixvorlage erneut, messen Sie den Recall und stellen Sie anschließend um. Mischen Sie niemals zwei Modelle in derselben Collection.
Ersetzt ein multimodales Embedding-Modell ein Textmodell?+
Nein, außer wenn der Inhalt visuell ist. In den Tabellen von Qwen liegt Qwen3-VL-Embedding-2B (63,87) bei reinem Text weiterhin unter Qwen3-Embedding-0.6B (64,33). Wandeln Sie textbasierte PDFs in Text um und bleiben Sie bei einem Text-Embedding. Multimodale Embeddings eignen sich für Diagramme, Screenshots und Folien; Achtung: jina-clip-v2 ist nicht für die kommerzielle Nutzung freigegeben.
Ist ein maßgeschneidertes Embedding für Unternehmen notwendig?+
Zu Beginn nur selten. Ein allgemeines offenes Modell, sorgfältiges Chunking, eine hybride Suche und ein Reranker lösen die meisten Fälle. Fine-Tuning ist gerechtfertigt, wenn sich der Recall wegen des Fachvokabulars nicht weiter verbessern lässt und Sie über mehrere Tausend Frage-Passage-Paare verfügen, mit anschließender vollständiger Neuindexierung.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.