MMLU-Pro: der Wissensbenchmark für lokale LLMs
Le MMLU-Pro-Benchmark ist zum Maßstab für die Bewertung der Wissenstiefe und der Schlussfolgerungsfähigkeit lokal ausgeführter Modelle mit offenen Gewichten geworden. Dieser 2024 von TIGER-Lab veröffentlichte MMLU-Pro-Benchmark behebt die Schwächen des ursprünglichen MMLU (Sättigung, mehrdeutige Fragen, zu leicht zu erratende Antwortmöglichkeiten), indem er 12.032 Fragen mit jeweils 10 Antwortoptionen aus 14 Fachgebieten einführt. Dieser Artikel erläutert das Protokoll, die bei den Modellen im Katalog von quelllm.fr beobachteten Ergebnisse, den Einfluss der Quantisierung auf die Ergebnisse sowie die Methode, mit der Sie den Benchmark zu Hause auf einer Consumer-GPU oder einer Workstation reproduzieren können.
Warum MMLU-Pro MMLU in seriösen Bewertungen ersetzt hat
Der klassische MMLU (Hendrycks et al., 2020) stößt bei den besten Modellen bei etwa 88–90 % an seine Leistungsgrenze, wodurch eine Unterscheidung zwischen Frontier-Modellen praktisch unmöglich wird. Das Paper auf arXiv mit der Kennung 2406.01574 führt drei wesentliche Korrekturen ein:
- 10 Optionen pro Frage anstelle von 4 : Die zufällige Erfolgsrate sinkt von 25 % auf 10 %, was die Spanne der Ergebnisse erweitert.
- Manuelle Filterung mehrdeutiger Fragen : Etwa 5.000 Fragen aus dem ursprünglichen MMLU wurden von Experten entfernt oder umformuliert.
- Hinzufügen von Fragen mit hohen Anforderungen an das logische Denken : Einbeziehung von Aufgaben aus dem STEM-Bereich (TheoremQA, SciBench), die Berechnungen in mehreren Schritten statt eines einfachen Abrufs aus dem Gedächtnis erfordern.
Ergebnis: Die durchschnittliche Punktzahl liegt um 15 bis 25 Prozentpunkte niedriger als bei MMLU. Ein Modell, das bei MMLU 86 % erreicht, fällt bei MMLU-Pro typischerweise auf etwa 66 %. Diese Verschiebung zu niedrigeren Werten macht die Messung für den Vergleich moderner Open-Weights-Modelle wieder aussagekräftig.
Die vollständige Datensammlung ist auf HuggingFace TIGER-Lab/MMLU-Pro und die Referenzbewertung erfolgt über das offizielles GitHub-Repository.
Im Katalog von quelllm.fr erfasste MMLU-Pro-Scores
Die folgenden Ergebnisse stammen aus dem offiziellen Leaderboard von TIGER-Lab und aus technischen Berichten der Anbieter. Die mit „geschätzt“ gekennzeichneten Werte stammen aus Teilmessungen der Community, die noch bestätigt werden müssen.
- DeepSeek V3 671B : 75,9 % — höchster bis Ende 2024 erfasster Wert eines allgemein einsetzbaren Open-Weights-Modells. Vollständiges Modellprofil unter /modele/deepseek-v3-671b.
- DeepSeek R1 671B : 84,0 % (Reasoning aktiviert) – Zugewinn von ~8 Punkten dank der internen Chain-of-Thought. Details unter /modele/deepseek-r1-671b.
- Qwen 3 235B-A22B : 72,1 % geschätzt — MoE-Architektur, siehe /modele/qwen3-235b-a22b.
- Llama 3.1 405B Instruct : 73,3 % — Referenz von Meta, Modellseite /modele/llama-3-1-405b.
- Llama 3.3 70B Instruct : 68,9 % — bestes Verhältnis von Leistung zu VRAM für Rechner mit 40 GB, Modellprofil /modele/llama33-70b.
- Mistral Large 3 675B : 71,5 % geschätzt — siehe /modele/mistral-large-3.
- gpt-oss 120B : geschätzte 70,2 % — destillierte OpenAI-Variante, Modelleintrag /modele/gpt-oss-120b.
- Qwen 2.5 72B Instruct : 65,4 % — solide mehrsprachige Basis, Modellübersicht /modele/qwen25-72b.
- Mixtral 8x22B Instruct : 56,2 % – ein älterer Wert, der für Vergleiche weiterhin relevant ist, Modellprofil /modele/mixtral-8x22b.
Die Unterschiede zwischen den Kategorien (Recht, Medizin, Ingenieurwissenschaften) können bei ein und demselben Modell bis zu 20 Punkte betragen: Ein Durchschnittsscore verdeckt oft eine Schwäche in einem bestimmten Fachgebiet.
Einfluss der Quantisierung auf den MMLU-Score von LLM
Die Quantisierung reduziert den VRAM-Bedarf, verschlechtert aber die Scores. Empirische Messungen an den Modellen im Katalog ergeben folgende Größenordnungen (Quellen: llama.cpp-Issues, Unsloth-Berichte):
- FP16 → Q8_0 : Verlust < 0,5 Punkte bei MMLU-Pro, in der Regel nicht signifikant.
- Q8 → Q5_K_M : Verlust von 1 bis 2 Punkten je nach Disziplin (Mathematik ist stärker betroffen).
- Q5 → Q4_K_M : Verlust von 2 bis 4 Punkten, stärker ausgeprägt bei Fragen, die mehrstufiges Schlussfolgern erfordern.
- Q4 → Q3 : deutlicher Einbruch möglich (> 5 Punkte), bei anspruchsvollen Anwendungen zu vermeiden.
Pour Llama 3.3 70B Instruct, zum Beispiel, lässt sich ein Rückgang von ~68 % in FP16 auf ~64 % in Q4_K_M auf der Teilmenge „law“ beobachten. Bei Qwen 2.5 72B Instruct, ist der Unterschied geringer (1,5 Punkte). Als Faustregel gilt: Q5_K_M bleibt der beste Kompromiss für ernsthafte Evaluierungen, Q4 eignet sich für den täglichen Gebrauch.
Siehe den Leitfaden zur GGUF-Quantisierung für weitere Details zu den Formaten.
VRAM und Hardwarekosten für die Ausführung des Wissensbenchmarks
Die lokale Wiederherstellung von MMLU-Pro erfordert das Laden des Modells in den Arbeitsspeicher und die Erzeugung von etwa 12.032 Antworten (mit CoT entspricht das 5 bis 10 Millionen Ausgabetokens). Materielle Kosten pro Batch:
- 24 GB VRAM (RTX 4090) : auf Modelle mit ~30B in Q4 begrenzt; kein Zugriff auf große Open-Weights-Modelle.
- 48 GB VRAM (2× RTX 4090 oder RTX 6000 Ada) : ermöglicht Llama 3.3 70B Instruct in Q4 (~40 GB), Qwen 2.5 72B Instruct (~42 GB), Qwen3-Coder-Next 80B-A3B (~48 GB).
- 96 GB VRAM (2× RTX 6000 Ada) : ermöglicht den Einsatz von Mixtral 8x22B Instruct (~82 GB), gpt-oss 120B (~70 GB), Mistral Small 4 (~72 GB).
- 160-200 GB VRAM (4-5× RTX 6000 Ada oder H100) : Llama 3.1 405B Instruct in Q4 (~240 GB mit CPU-Offloading), Qwen 3 235B-A22B (~142 GB).
- 400+ GB VRAM (Cluster H100/H200) : DeepSeek V3 671B, DeepSeek R1 671B, Kimi K2.5 und darüber hinaus.
Ein umfassender Benchmark für einen 70B in Q4 dauert 4 bis 8 Stunden auf einer RTX 6000 Ada gemäß dem Durchsatz (~25–35 Tokens pro Sekunde). Um Ihre Einrichtung zu kalibrieren, bietet das Tool /configurateur bietet das passende Hardware-Setup für ein Ziel-VRAM-Budget.
Methode zur lokalen Reproduktion des Benchmarks
Das Standardprotokoll verwendet vllm oder llama.cpp im Backend mit dem offiziellen Python-Skript aus dem Repository TIGER-AI-Lab.
Hauptschritte:
- Herunterladen des Datensatzes depuis HuggingFace (etwa 12 MB).
- Modellkonfiguration im Chat-Completion-Modus mit Temperatur 0 und Top-p 1. Der Systemprompt muss 5 Few-shot-Beispiele pro Kategorie enthalten (CoT aktiviert).
- Start der Bewertung Fachgebiet für Fachgebiet (14 Kategorien: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
- Parsing der Antworten : Extraktion des abschließenden Buchstabens (A bis J) aus der letzten Zeile mithilfe eines regulären Ausdrucks.
- Score-Berechnung mit Gewichtung nach Kategorie oder als Gesamtdurchschnitt.
Vollständige Details in der GitHub-README. Um zwei Modelle nebeneinander zu vergleichen, siehe /compare/llama33-70b-vs-qwen25-72b oder die allgemeine Rangliste aufrufen unter /meilleur-llm/raisonnement.
Grenzen von MMLU-Pro und ergänzende Benchmarks
Kein Benchmark reicht für sich allein aus. MMLU-Pro misst akademisches Wissen und strukturiertes Schlussfolgern, deckt jedoch Folgendes nicht ab:
- Der Code : HumanEval, MBPP oder LiveCodeBench verwenden. Das Modell Qwen3-Coder-Next 80B-A3B ist für diese Kategorie konzipiert (fiche).
- Fortgeschrittene Mathematik : AIME, MATH, GSM8K bleiben unerlässlich. DeepSeek R1 671B brilliert hier besonders.
- Mehrsprachigkeit : MGSM, Multilingual MMLU, Belebele für Französisch. Mistral Large 3 675B et Rakuten AI 3.0 werden in diesen Bereichen besser bewertet.
- Langer Kontext : RULER, LongBench. Llama 4 Scout 109B (Kontextlänge von 10 Millionen Tokens) oder MiMo V2.5 Pro (1 Mio. Tokens) setzen hier die Maßstäbe.
- L'agentique : SWE-bench, BFCL, AgentBench.
Ein robustes Testverfahren kombiniert mindestens MMLU-Pro + HumanEval + GSM8K + einen agentenbasierten Benchmark.
FAQ
F: Was ist der praktische Unterschied zwischen MMLU und MMLU-Pro?
MMLU bietet 4 Antwortmöglichkeiten pro Frage und erreicht oberhalb von 88 % einen Sättigungsbereich. MMLU-Pro erhöht die Zahl der Antwortmöglichkeiten auf 10, filtert mehrdeutige Fragen heraus und integriert mehrstufiges Schlussfolgern. Ergebnis: Die Scores sinken um 15 bis 25 Punkte, wodurch sich die Modelle wieder besser unterscheiden lassen. Für den Einsatz ab 2025 ist MMLU-Pro inzwischen die Referenz in den technischen Berichten der Anbieter.
F: Ist eine Chain-of-Thought-Aktivierung erforderlich, um ein Modell zu bewerten?
Ja für die Benchmark-Vergleiche, da das offizielle MMLU-Pro-Protokoll dies verwendet. Ohne Chain-of-Thought sinken die Punktzahlen um 5 bis 15 Punkte je nach Modell. Auf DeepSeek R1 671B, der Reasoning-Modus erzielt im Vergleich zu einem direkten Aufruf etwa 8 Punkte mehr. Um die Relevanz in der Produktion ohne CoT zu messen, starten Sie die Bewertung im Modus "answer only" separat.
F: Kann ich den Knowledge Benchmark auf einem Mac M4 laufen lassen?
Ja, mit llama.cpp oder MLX. Ein Mac Studio M4 Max mit 128 GB betreibt Llama 3.3 70B Instruct in Q4 (~40 GB) bei 8–12 Tokens/sec, also 6 bis 10 Stunden für den vollständigen Benchmark. Modelle über 100B erfordern einen M4 Ultra 192 GB oder einen sehr langsamen SSD-Offload. Weitere Informationen im Leitfaden für Macs mit Apple Silicon für die empfohlenen Konfigurationen.
F: Ist der MMLU-Pro-Score zuverlässig, um ein Modell für fachliche Anwendungen auszuwählen?
Teilweise. MMLU-Pro bildet die allgemeinen Fähigkeiten gut ab, aber ein Gesamtergebnis von 70 % kann 55 % in Recht und 82 % in Physik verdecken. Wenn Ihr Anwendungsfall auf eine bestimmte Disziplin abzielt, sehen Sie sich die im Leaderboard veröffentlichten Ergebnisse nach Kategorie an. Für Coding oder juristische Anwendungen im französischsprachigen Umfeld ergänzen Sie die Bewertung durch HumanEval-FR und einen internen Test mit Ihren eigenen Daten.
F: Welche Lizenz gilt für die Top-Modelle des Benchmark-Tests?
Die besten Ergebnisse unter den Open-Weights-Modellen erzielen Modelle unter permissiven Lizenzen: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Zu beachten: Llama 3.1 405B Instruct steht unter der Llama 3.1 Community-Lizenz (Beschränkungen bei mehr als 700 Millionen monatlich aktiven Nutzern). Prüfen Sie jede Lizenz vor einem kommerziellen Einsatz.
F: Wie viel kostet eine vollständige Evaluierung auf einer gemieteten GPU?
Bei 2 €/h für eine H100 mit 80 GB in einer Bare-Metal-Cloud kostet ein vollständiger MMLU-Pro-Benchmark mit einem 70B-Modell in Q4 je nach Durchsatz 8 bis 16 €. Für ein 405B-Modell in Q4, das 4 H100 benötigt, rechnen Sie mit 80 bis 160 €. Das ist deutlich günstiger als der Kauf der Hardware, aber lokale Inferenz bleibt für wiederholte Evaluierungen oder sensible Daten relevant.
Fazit
Le MMLU-Pro-Benchmark bietet heute die trennschärfste Messung von Wissen und Schlussfolgerungsfähigkeit bei LLMs mit offenen Modellgewichten. In Kombination mit spezialisierten Benchmarks (HumanEval, AIME, LongBench) liefert er einen objektiven Rahmen für die Modellauswahl. Um die Hardwarekonfiguration zu ermitteln, mit der Sie die besten Modelle der Rangliste ausführen können, nutzen Sie den Konfigurator quelllm.fr oder erkunden Sie die 249 im komplettes Katalog.