Die besten Embedding-Modelle FR
Für französischsprachige Texte ist BGE-M3 der verlässlichste Ausgangspunkt: mehrsprachig, ein Kontextfenster von 8.192 Tokens, MIT-Lizenz, in Ollama verfügbar. Qwen3-Embedding und EmbeddingGemma sind neuere Alternativen, die Sie testen sollten. Auf Englisch ausgerichtete Modelle (nomic-embed-text, mxbai-embed-large, all-MiniLM) sollten Sie für französischsprachige Texte vermeiden. Überprüfen Sie Ihre endgültige Wahl anhand Ihrer eigenen Dokumente.
Ein Embedding-Modell wandelt jeden Text in einen Vektor um: Es bestimmt, dass „CDD“ und „contrat à durée déterminée“ nahe beieinander liegen. Für Französisch misst der Benchmark MTEB-French einen Unterschied von 22 Punkten beim Retrieval zwischen BGE-M3 und all-MiniLM-L12-v2. Diese Seite stellt eine Rangliste offener Modelle auf, die lokal genutzt werden können, nennt veröffentlichte Messwerte und deren Grenzen und behandelt anschließend die kostspieligen Aspekte des produktiven Betriebs: Präfixe, Trunkierung, Dimensionen, Speicherung und Neuindexierung.
#Was ein Embedding-Modell ist und warum Französisch die Sache komplizierter macht
Ein Embedding-Modell ist ein neuronales Netz, das einen Text (einen Satz, einen Absatz, einen Chunk) in einen Zahlenvektor mit je nach Modell 384 bis 4.096 Dimensionen umwandelt. Zwei Texte mit ähnlicher Bedeutung ergeben ähnliche Vektoren; ihre Ähnlichkeit wird meist anhand der Kosinusähnlichkeit gemessen. So kann ein RAG eine Passage über einen „befristeten Arbeitsvertrag“ finden, wenn der Nutzer „CDD“ schreibt, ohne dass die beiden Formulierungen ein Wort gemeinsam haben. Dasselbe Modell muss die Fragen und die Dokumente kodieren, wie die Ollama-Dokumentation betont; ein Modellwechsel erfordert daher eine Neuindexierung des gesamten Korpus. Für die Auswahl genügen drei Fragen: Wurde das Modell auf französischsprachigen Texten trainiert? Deckt sein Kontext Ihre Chunks ab? Erlaubt seine Lizenz Ihre Nutzung?
Französisch bringt eigene Schwierigkeiten mit sich: Akzente, Elisionen („l'employeur“), juristische Abkürzungen und technische Anglizismen im Text. Der Unterschied zwischen den Modellen ist deutlich. Im Benchmark MTEB-French reicht der Retrieval-Score von 0,43 für all-MiniLM-L12-v2 bis 0,65 für BGE-M3, also ein Unterschied von 22 Punkten beim selben Satz von Fragen.
#Die fünf Kriterien, die Modelle wirklich unterscheiden
Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
- Trainingssprachen
- BGE-M3 und Qwen3-Embedding geben Unterstützung für mehr als 100 Sprachen an, multilingual-e5-large für 94. Die Modellkarten von nomic-embed-text-v1.5 und mxbai-embed-large-v1, die in Ollama sehr häufig heruntergeladen werden, sind mit „English“ gekennzeichnet.
- Maximaler Kontext
- 512 Tokens für multilingual-e5-large, Solon und mxbai-embed-large; 2.048 für EmbeddingGemma; 8.192 für BGE-M3; 32.000 für Qwen3-Embedding und Granite R2. Ein längerer Chunk wird abgeschnitten, nicht abgelehnt.
- Dimensionen und Speicherung
- 384 bis 4.096 Dimensionen, also 4 Byte pro Dimension und pro Vektor in float32 (Berechnung weiter unten).
- Lizenz
- MIT für BGE-M3, multilingual-e5-large und Solon; Apache 2.0 für Qwen3-Embedding, Granite R2, nomic und mxbai; Gemma-Bedingungen für EmbeddingGemma; CC BY-NC 4.0 (nicht kommerziell) für jina-clip-v2.
- Präfixe und Anweisungen
- Einige Modelle erfordern ein Präfix vor jedem Text („query:“ und „passage:“ bei E5, auch auf Französisch). Wird es vergessen, verschlechtert sich das Retrieval, ohne dass eine Fehlermeldung erscheint.
#Rangliste 2026 für Französisch: neun Modelle verglichen
Diese Rangliste ist eine redaktionelle Auswahl, kein eigener Benchmark-Test: Sie berücksichtigt die Unterstützung des Französischen, veröffentlichte Benchmarks und die lokale Verfügbarkeit. Die Größenangaben zu den Modellgewichten stammen aus der Ollama-Bibliothek, sofern das Modell dort enthalten ist, andernfalls aus den Schätzungen der MTEB-French-Studie für float32.
| Modell | Dimensionen / Kontext | Lizenz | Modellgröße | Was die Quellen über das Französische sagen |
|---|---|---|---|---|
| BGE-M3 (BAAI) | 1 024 / 8 192 | MIT | 1,2 GB (Ollama) | Retrieval auf MTEB-French: 0,65. Dense-, Sparse- und Multi-Vektor-Verfahren. Empfohlener Ausgangspunkt. |
| Qwen3-Embedding 0,6B / 4B / 8B | 1 024 / 2 560 / 4 096 ; 32 000 | Apache 2.0 | 639 MB / 2,5 GB / 4,7 GB (Ollama) | Mehr als 100 Sprachen. Multilinguales MTEB laut Qwen: 64,33 / 69,45 / 70,58. |
| EmbeddingGemma 300M (Google) | 768 (512, 256, 128) / 2 048 | Gemma | 622 MB (Ollama) | Mehr als 100 Sprachen. Mehrsprachiges MTEB v2: 61,15 laut Google. |
| multilingual-e5-large | 1 024 / 512 | MIT | 2,24 GB (float32) | Retrieval MTEB-French 0,59. Präfixe erforderlich. |
| Solon-embeddings-large-0.1 | 1 024 / 512 | MIT | 2,24 GB (float32) | Französisches Modell veröffentlicht von Ordalie Technologies. Retrieval MTEB-French 0,63. |
| Granite Embedding 311M Multilingual R2 (IBM) | 768 / 32 768 | Apache 2.0 | 311 Mio. Parameter | Französisch gehört zu den 52 Sprachen mit verbesserter Unterstützung. Laut IBM 65,2 beim mehrsprachigen MTEB-Retrieval; keine unabhängige Messung für Französisch herangezogen. |
| nomic-embed-text v1.5 | 768 / 8 192 (2 048 unter Ollama) | Apache 2.0 | 274 MB (Ollama) | Die Modellkarte ist mit „Englisch“ gekennzeichnet. Nur für englische Korpora verwenden. |
| mxbai-embed-large-v1 | Kontextgröße 512 | Apache 2.0 | 670 MB (Ollama) | Die Modellkarte ist mit „Englisch“ gekennzeichnet. Nur für englische Korpora verwenden. |
| all-MiniLM-L12-v2 | 384 | Apache 2.0 | 33 Mio. Parameter | Retrieval MTEB-French 0,43. Prototyp ausschließlich für die CPU. |
BGE-M3 bleibt der beste Ansatz: Sein französischer Retrieval ist veröffentlicht, sein Kontext von 8.192 Tokens vermeidet die meisten künstlichen Schnitte und liefert zudem die lexikalischen Gewichte, die für eine hybride Suche nützlich sind. Qwen3-Embedding ist die Wahl, wenn eine Grafikkarte verfügbar ist: Die 8B-Version war bei der MTEB-Multilingual-Liste am 5. Juni 2025 an der Spitze, gemäß Qwen, doch ihre 4.096 Dimensionen belasten den Speicher. EmbeddingGemma richtet sich an geringere Systeme.
Solon, das oft als Spezialist für juristisches und administratives Französisch vorgestellt wird, gewinnt bei keinem der drei Retrieval-Datensätze der MTEB-French-Studie: Beim Syntec-Tarifvertrag liegt es gleichauf mit BGE-M3 und bleibt bei den Gesetzesartikeln (BSARD) und den schulischen Fragen (Alloprof) dahinter zurück.
#Was die französischen Benchmarktests sagen und was sie nicht sagen
Die veröffentlichte Referenz ist MTEB-French (Ciancone et al., Mai 2024): 18 Datensätze, 8 Aufgabenkategorien, 51 verglichene Modelle. Die Autoren kommen zu dem Schluss, dass große mehrsprachige Modelle, die auf Satzähnlichkeit vortrainiert wurden, außergewöhnlich gut abschneiden. Hier sind die Retrieval-Ergebnisse (NDCG@10) für drei Datensätze: Gesetzesartikel auf Französisch (BSARD), der Syntec-Tarifvertrag und Schulfragen von Alloprof.
| Modell | Durchschnittlicher Retrieval-Wert | Recht (BSARD) | Syntec-Tarifvertrag | Alloprof |
|---|---|---|---|---|
| text-embedding-3-large (OpenAI-API) | 0,73 | 0,73 | 0,87 | 0,60 |
| mistral-embed (Mistral-API) | 0,68 | 0,68 | 0,79 | 0,57 |
| BGE-M3 | 0,65 | 0,60 | 0,85 | 0,49 |
| Solon-embeddings-large-0.1 | 0,63 | 0,58 | 0,85 | 0,47 |
| multilingual-e5-large | 0,59 | 0,59 | 0,81 | 0,38 |
| multilingual-e5-small | 0,52 | 0,52 | 0,76 | 0,27 |
| paraphrase-multilingual-MiniLM-L12-v2 | 0,44 | 0,38 | 0,66 | 0,27 |
| all-MiniLM-L12-v2 | 0,43 | 0,34 | 0,61 | 0,33 |
Drei Einschränkungen verhindern, daraus eine endgültige Rangliste abzuleiten. Die Studie stammt aus dem Jahr 2024: Sie enthält weder Qwen3-Embedding (Juni 2025) noch EmbeddingGemma (September 2025) noch Granite R2, und für diese Seite wurden keine vergleichbaren Messungen dieser Modelle für die französische Sprache herangezogen. Die Korpora (Gesetzesartikel, Tarifvertrag, schulische Fragen) ähneln Ihren eigenen nicht unbedingt. Schließlich stammen die veröffentlichten mehrsprachigen Scores von den Anbietern selbst und fassen alle Sprachen zusammen.
#Welches Modell für welchen Anwendungsfall: Entscheidungstabelle
| Ihre Situation | Erstes Modell zum Testen | Warum | Achtung |
|---|---|---|---|
| Französisches oder französisch-englisches Korpus, ausreichend leistungsfähiger Rechner | BGE-M3 | Retrieval-Wert für Französisch von 0,65, auf dem Niveau der besten offenen Modelle der Studie | 1,2 GB in Ollama; kein Präfix |
| Rechtswesen, Verwaltung, Personalwesen | BGE-M3, dann Solon im Vergleich | BGE-M3 erreicht oder übertrifft die Leistung von Solon auf allen drei französischen Datensätzen der Studie | Ein Modell ohne interne juristische Testdaten bleibt ein Risiko |
| Rechner mit geringer Leistung oder nur CPU | EmbeddingGemma 300M oder multilingual-e5-small | 622 MB in Ollama; von Google für Laptops und Mobilgeräte entwickelt | 2.048-Token-Kontext: kurze Chunks |
| Grafikkarte verfügbar, maximale Qualität | Qwen3-Embedding-4B oder 8B | 32.000 Tokens, anpassbare Dimensionen, über 100 Sprachen | 2.560 und 4.096 Dimensionen: Speicherung und Grenzen von Indexen |
| Lange Chunks, strukturierte Dokumente | BGE-M3, Qwen3-Embedding oder Granite R2 | Kontextfenster von 8.192 bis 32.768 Tokens | Bei einem sehr langen Chunk wird der Bedeutungsgehalt verwässert |
| Kommerzieller Einsatz, Lizenzaudit | BGE-M3, multilingual-e5-large, Solon, Qwen3-Embedding, Granite R2 | MIT oder Apache 2.0 | Gemmas Nutzungsbedingungen erneut lesen; jina-clip-v2 ist nur für nichtkommerzielle Nutzung lizenziert |
#Maßgeschneidertes Embedding für Unternehmen: offenes Modell, Fine-Tuning oder API
„Maßgeschneidert“ bedeutet nicht, von Anfang an ein eigenes Modell zu trainieren. Die Reihenfolge, die Zeitverschwendung vermeidet: ein offenes, allgemeines Modell, sorgfältiges Chunking, eine hybride Suche und ein Reranker; anschließend eine Messung des Recalls anhand Ihrer tatsächlichen Fragen; danach, nur wenn die Fehler weiterhin auftreten und auf das Fachvokabular zurückzuführen sind (interne Referenzen, unternehmensinterne Abkürzungen), ein Fine-Tuning.
Philipp Schmid hat im Juni 2024 das Modell bge-base-en-v1.5 mit 6.300 Frage-Textpassage-Paaren aus Finanzdokumenten feinabgestimmt: Der Retrieval-Score stieg auf seinem Testdatensatz um etwa 7,4 %, bei einer Trainingsdauer von drei Minuten auf einer handelsüblichen Grafikkarte. Das ist ein englischsprachiges Beispiel mit nur einem Korpus und von einem LLM erzeugten Paaren: eine Größenordnung, kein Versprechen. BAAI dokumentiert auch die Feinabstimmung von BGE-M3.
| Option | Wann diese Option wählen? | Grenzen |
|---|---|---|
| Offenes, allgemeines lokales Modell (BGE-M3, Qwen3-Embedding) | Standardmäßiger Ausgangspunkt; die Texte bleiben in Ihrem Netzwerk; MIT- oder Apache-Lizenz | Branchenspezifisches Vokabular nicht erlernt; anhand Ihrer Dokumente zu bewerten |
| Fine-tuning eines offenen Modells | Recall stagniert trotz hybrider Suche und Reranker; mehrere Tausend Frage-Passage-Paare | Korpus muss neu encodiert werden; Modell muss wie Software versioniert werden; Risiko der Überanpassung |
| Embedding-API (Mistral, OpenAI) | Keine GPU, moderates Verarbeitungsvolumen; text-embedding-3-large und mistral-embed liegen in der MTEB-French-Studie von 2024 an der Spitze | Die Texte verlassen Ihr Netzwerk; das Modell kann sich auf Anbieterseite ändern; laufende Kosten |
#Multimodales Embedding: Suchen in Bildern und Dokumentseiten
Ein multimodales Embedding-Modell ordnet Text und Bilder im selben Vektorraum an. So lässt sich anhand eines Satzes ein Foto finden oder eine gescannte PDF-Seite, ohne OCR zu verwenden. Die für diese Seite betrachteten Modelle aus der Ollama-Bibliothek (BGE-M3, Qwen3-Embedding, EmbeddingGemma, nomic-embed-text, mxbai-embed-large) akzeptieren ausschließlich Text: Die unten aufgeführten multimodalen Modelle werden über Hugging Face (Sentence-Transformers oder Transformers) verwendet.
| Modell | Eingaben | Lizenz | Gut zu wissen |
|---|---|---|---|
| Qwen3-VL-Embedding 2B / 8B | Text, Bilder, Screenshots, Video | Apache 2.0 | 32.000 Tokens; 2.048 und 4.096 Dimensionen; anpassbare Dimensionen |
| jina-clip-v2 | Text und Bilder; 94 Sprachen | CC BY-NC 4.0 | Nicht kommerziell: Ohne Zustimmung des Herausgebers für ein kostenpflichtiges Produkt oder eine kostenpflichtige Dienstleistung nicht verwenden |
| ColPali v1.3 | Dokumentseiten als Bilder, mehrere Vektoren | MIT (Modellkarte) | Modellkarte mit der Sprachangabe Englisch; mehrere Vektoren pro Seite verändern die Speicherung |
Ein multimodales Modell ist bei reinem Text nicht besser. In den von Qwen veröffentlichten Tabellen erreicht Qwen3-VL-Embedding-2B auf dem multilingualen MTEB 63,87, gegenüber 64,33 für Qwen3-Embedding-0.6B, ein Textmodell, das mehr als dreimal kleiner ist. Konvertieren Sie PDFs, deren nützlicher Inhalt Text ist, in sauberen Text (mit Docling oder OCR) und bleiben Sie bei einem Text-Embedding. Reservieren Sie multimodale Embeddings für visuelle Korpora: Diagramme, Pläne, Screenshots, Folien.
#Embeddings verwalten: Präfixe, Kürzung, Speicherung und Neuindexierung
Die Qualität eines RAG leidet oft stärker unter diesen Details als unter der Modellwahl. Erstes Detail: Jede Modellfamilie erwartet unterschiedliche Eingabeformate für Fragen und Dokumente.
| Modell | Vor der Frage | Vor dem Dokument |
|---|---|---|
| BGE-M3 | Nichts | Nichts |
| multilingual-e5-large | query: | passage: (erforderlich, auch auf Französisch) |
| Solon-embeddings-large-0.1 | query : | Nichts |
| nomic-embed-text v1.5 | search_query: | search_document: |
| mxbai-embed-large-v1 | Stellen Sie diesen Satz zur Suche relevanter Abschnitte dar: | Nichts |
| Qwen3-Embedding | Instruct: {Aufgabe in einem Satz}, Zeilenumbruch, Query: {Frage} | Nichts |
| EmbeddingGemma | task: search result | query: {question} | title: {titre ou none} | text: {contenu} |
Bei Ollama enthält das offizielle Beispiel für mxbai-embed-large das Präfix direkt im übermittelten Text: Fügen Sie es selbst in Ihrem Code hinzu. Qwen gibt an, dass die Anweisungen im Allgemeinen eine Verbesserung von 1 bis 5 % bringen, und empfiehlt, sie auch für ein mehrsprachiges Korpus auf Englisch zu verfassen.
#Die Falle bei Ollama: stilles Abschneiden
Der Ollama-Endpunkt /api/embed hat einen Parameter truncate, dessen Standardwert true ist: Eine Eingabe, die das Kontextfenster des Modells überschreitet, wird ohne Fehlermeldung abgeschnitten. Bei mxbai-embed-large (512 Tokens in Ollama) wird ein Chunk mit 700 Tokens ohne seinen Schluss indexiert, und niemand bemerkt es. Die Kontextlänge in Ollama kann auch von der ursprünglichen Modellbeschreibung abweichen: 2K für nomic-embed-text gegenüber den von Nomic angegebenen 8.192. Setzen Sie truncate während der Tests auf false: Eine Fehlermeldung ist besser als ein abgeschnittener Text.
#Dimensionen, Speicher und Grenzen des Indexes
Der Speicherbedarf berechnet sich einfach: Anzahl der Chunks × Dimensionen × 4 Byte in float32, ohne Index. Für eine Million Chunks beanspruchen die Vektoren allein:
| Dimensionen | Beispielmodell | Speicher |
|---|---|---|
| 256 | EmbeddingGemma oder Qwen3 mit reduzierter Dimensionalität (Matryoshka) | 1,0 GB |
| 384 | all-MiniLM-L12-v2 | 1,5 GB |
| 768 | EmbeddingGemma, Granite R2, nomic | 3,1 GB |
| 1 024 | BGE-M3, multilingual-e5-large, Qwen3-0.6B | 4,1 GB |
| 2 560 | Qwen3-Embedding-4B | 10,2 GB |
| 4 096 | Qwen3-Embedding-8B | 16,4 GB |
Auch Datenbanken setzen Obergrenzen. Bei pgvector kann ein Index Vektoren mit höchstens 2.000 Dimensionen erfassen, bei halber Präzision (halfvec) sind es 4.000: Die 4.096 Dimensionen von Qwen3-Embedding-8B überschreiten selbst diese Grenze. Abhilfe schafft das Kürzen der Vektoren, das mit nach dem Matryoshka-Verfahren trainierten Modellen möglich ist (Qwen3-Embedding, EmbeddingGemma, nomic v1.5). Anschließend müssen sie erneut normalisiert werden, wie Google für EmbeddingGemma erläutert. Ollamas API /api/embed akzeptiert den Parameter dimensions, der nur für diese Modelle verwendet werden sollte.
#Versionieren und neu indexieren
- Zu bewahrende Metadaten
- Genauer Modellname, Revision, Dimension, Präfixvorlage, Chunking-Parameter, Indexierungsdatum. Ohne diese Angaben weiß niemand, warum sich das Retrieval verändert hat.
- Modellwechsel
- Kodieren Sie den gesamten Korpus erneut in eine neue Collection, evaluieren Sie diese und stellen Sie anschließend darauf um. Mischen Sie niemals zwei Modelle in derselben Collection.
- Normalisierung
- Ollama liefert L2-normalisierte Vektoren: Verwenden Sie die gleiche Metrik (Cosinus oder Skalarprodukt) überall.
#Ein Modell in der Praxis verwenden und mit Ihren Dokumenten testen
Merken Sie sich nur die Reihenfolge der beiden Werte: Der erste muss deutlich höher sein als der zweite. Um zwei oder drei Kandidaten seriös zu vergleichen, ersetzt das folgende Verfahren sämtliche veröffentlichten Ranglisten.
- 01Ein echtes Testset erstellenSammeln Sie 50 bis 100 Fragen von echten Nutzern (Support, Tickets, häufig gestellte Fragen) und notieren Sie für jede den Chunk, der die Antwort enthält. Von einem LLM erfundene Fragen lassen die Ergebnisse besser aussehen, als sie tatsächlich sind.
- 02Mit jedem Modellkandidaten encodierenKodieren Sie zuerst die Chunks und anschließend die Fragen unter Beachtung der Präfixtabelle. Verwenden Sie für alle Kandidaten dieselbe Chunk-Länge und dieselbe Speicherdimension.
- 03Den Recall@5 messenPrüfen Sie für jede Frage, ob der richtige Chunk unter den ersten fünf Ergebnissen enthalten ist. Das folgende Skript führt diese Berechnung durch.
- 04Anhand eines Kostenkriteriums entscheidenBehalten Sie das kleinste Modell, dessen recall@5 nur ein oder zwei Punkte hinter dem besten liegt: Ein achtmal größeres Modell kostet bei jeder Neuindexierung zusätzlichen Speicherplatz und zusätzliche Zeit.
- Sentence Transformers: Embeddings lokal
- Chunking-Strategien: die Größe der Chunks im Zusammenhang mit dem Modellkontext
- Hybride Suche: BM25 + Vektorsuche
- Einen Reranker vor dem Fine-Tuning hinzufügen
- pgvector: Dimensionsgrenzen und Indizes
- Ragas: den eigenen RAG anhand von Zahlen bewerten
- Quelle: offizielle Modellkarte von BGE-M3 (BAAI)
- Quelle: MTEB-French, Studie von Ciancone et al. (2024)
- Quelle: Dokumentation der Embeddings von Ollama
- Quelle: Modellkarte von Qwen3-Embedding
- Quelle: Modellkarte von EmbeddingGemma (Google)
Welches ist das beste Embedding-Modell für Französisch?+
Kann man nomic-embed-text oder mxbai-embed-large auf Französisch verwenden?+
Gibt es ein Modell bge-m4?+
Muss man beim Wechsel des Embedding-Modells neu indexieren?+
Ersetzt ein multimodales Embedding-Modell ein Textmodell?+
Ist ein maßgeschneidertes Embedding für Unternehmen notwendig?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.