Benchmark lokaler LLM: MMLU, HumanEval, AIME 2026

Un Benchmark für lokale LLM Die Ausnahme aus der Methodik entspricht dem Vergleich zweier Marathonzeiten ohne die Höhenprofilangaben des Streckenverlaufs. Zwei Modelle mit 88 Punkten auf MMLU können sich um 16 Punkte auf MMLU-Pro und um 30 Punkte auf AIME 2026 unterscheiden, abhängig von der Anwesenheit eines Chain-of-Thought-Trainings, der Quantisierung, dem Decodierprotokoll (cons@64 vs. pass@1 strict) und der genauen Version des geladenen Datensatzes. Diese Seite dient nicht als Kaufleitfaden: Es handelt sich um eine Audit-Grille für die drei historischen Serien (MMLU/MMLU-Pro, HumanEval/HumanEval+, AIME 2024/2025/2026), mit veröffentlichten Ergebnissen, Wiedergabebedingungen, gemessenen VRAM-Kosten Q4, Token-Throughput unter realen Konfigurationen sowie einer Aufzählung der Bias, die in den Verkaufsmitteilungen unterblieben werden. Das Ziel ist ausgestattet: Es ermöglicht es, eine Zahl selbstständig mit einer festen Seed zu reproduzieren, ohne zwischen proprietären und open-weight Modellen zu wählen.

Warum der Bewertungsrahmen von 2026 Benchmarks aus der Zeit vor 2024 ungültig macht

Das Ökosystem hat sich in zwei Jahren gewandelt. MMLU mit 4 Auswahlmöglichkeiten war bereits gesättigt Llama 3.1 405B bei 88,6, und Architekturen mit Expertenaktivierung (DeepSeek V3, Qwen 3, GLM-5.1) liegen inzwischen nahe an der Obergrenze; einen MMLU-Wert auf einen halben Punkt genau zu betrachten, liefert mittlerweile keinen Informationsgewinn mehr. Drei strukturelle Veränderungen haben die Bewertungsmatrix neu geordnet:

  1. Mit RL trainierte Reasoning-Modelle (DeepSeek R1, Ring-1T, gpt-oss 120B mit zuschaltbarem Thinking), die AIME und MATH-500 zu besonders aussagekräftigen Unterscheidungskriterien machen. Bei AIME 2024 beträgt der Abstand zwischen Llama 3.1 405B (~23 pass@1) und DeepSeek R1 671B (~79 pass@1) 55 Punkte — eine Differenz, die sich bei MMLU nicht beobachten lässt.
  2. Anzahl der Gesamtparameter im Vergleich zu den aktiven Parametern. Qwen 3 235B-A22B aktiviert nur 22B Parameter pro Token, MiniMax-M2.7 folgt derselben MoE-Logik. Der Benchmark muss bei vergleichbaren Inferenzkosten (Tokens/Sekunde × VRAM) interpretiert werden, nicht anhand der angegebenen Gesamtzahl der Parameter.
  3. Testsuiten gegen Datenkontamination. LiveBench erneuert seine Aufgaben jeden Monat, LiveCodeBench versieht die Codeforces-Aufgaben mit Zeitstempeln, um diejenigen nach dem Stichtag für die Vortrainingsdaten gesondert zu betrachten, und SimpleBench misst die Robustheit des gesunden Menschenverstands dort, wo MMLU an seine Grenzen stößt. Die HuggingFace Open LLM Leaderboard v2 ist aus diesem Grund ausdrücklich auf MMLU-Pro, GPQA, MUSR und IFEval umgestiegen.

Ein einzelner Score ist nicht mehr aussagekräftig: Nur die Matrix {MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond} liefert verwertbare Informationen. Der Leitfaden /guide/matrice-benchmarks-2026 erläutert die empfohlene Gewichtung.

Methodik: Was jede Benchmark-Suite tatsächlich misst

Le MMLU LLM (Massive Multitask Language Understanding, Hendrycks et al. 2021) deckt 57 Fachgebiete (Medizin, Recht, Ethik, elementare Mathematik) mit Multiple-Choice-Fragen mit jeweils 4 Antwortmöglichkeiten ab, nach dem standardmäßigen 5-Shot-Protokoll. Referenz-Repository: GitHub Hendrycks, Fachartikel arXiv:2009.03300. Ab 85 % wurde er durch MMLU-Pro (10 Antwortmöglichkeiten, mehrstufiges Schlussfolgern, 12.032 Aufgaben) auf HuggingFace TIGER-Lab, mit einer typischen Abnahme von 15 bis 25 Punkten im Vergleich zum klassischen MMLU. Neue Variante: MMLU-Redux (Paper arXiv:2406.04127) korrigiert etwa 6,5 % der als fehlerhaft oder mehrdeutig erkannten Aufgaben des ursprünglichen Datensatzes – ein selten hervorgehobener Punkt, der erklärt, warum zwei identische Testläufe je nach geladener Version um 1 bis 2 Punkte voneinander abweichen können. Informationen zu den Filtern und zum Bewertungsverfahren finden Sie unter /guide/mmlu-pro-protocole-strict.

HumanEval, veröffentlicht von OpenAI (arXiv:2107.03374), bewertet 164 Python-Aufgaben mit Funktionssignaturen und Unit-Tests. Die Standardmetrik ist pass@1 mais pass@10 et pass@100 erfordern jeweils 10 und 100 Samples pro Problem und vervielfachen die Evaluierungskosten entsprechend. Sein Nachfolger HumanEval+ (evalplus) fügt etwa 80-mal mehr durch Mutation erzeugte Testfälle hinzu; übertrainierte Modelle verlieren zwischen den beiden Versionen typischerweise 5 bis 10 Punkte, was den Grad der Überanpassung an die ursprünglichen Tests direkt sichtbar macht. Für eine weitergehende Bewertung anhand von Code aus der Praxis SWE-bench Verified misst die Lösung echter GitHub-Issues (500 von Menschen validierte Tickets) und LiveCodeBench stellt fortlaufend Codeforces-Aufgaben mit Zeitstempeln bereit, die sich nach Datum filtern lassen. Das vollständige Verfahren zur Extraktion für HumanEval+ wird beschrieben in /guide/humaneval-plus-protocole.

AIME 2024 LLM entspricht den 15 jährlichen Aufgaben des American Invitational Mathematics Examination (zwei Durchgänge, AIME I und II), mit ganzzahligen Antworten zwischen 0 und 999. Mit dem Aufkommen von Reasoning-Modellen ist dieser Benchmark zentral geworden und unterscheidet deutlich zwischen Architekturen mit oder ohne durch RL trainiertes Chain-of-Thought. Der Aufgabensatz von 2024 ist dokumentiert in der Modellkarte DeepSeek R1. AIME 2025 (März 2025) und anschließend AIME 2026 (Februar 2026) dienen nun als aktuelle Prüfungen, da die Aufgaben von 2024 in großem Umfang indexiert wurden. Die technischen Berichte von Ende 2025 verwenden häufig cons@64 (Mehrheitsentscheidung über 64 generierte Antworten, Temperatur 0,6, top-p 0,95), was den Rohwert gegenüber einem strikten pass@1 bei Temperatur 0 um 10 bis 15 Punkte erhöhen kann.

Über diese drei Säulen hinaus umfasst das Bewertungsraster 2026 zusätzlich GPQA Diamond (198 von Experten validierte Fragen auf Promotionsniveau), MATH-500 (Olympiadeaufgaben), MuSR (mehrstufiges narratives Schlussfolgern), RULER (Informationsabruf aus langen Kontexten mit bis zu 1 Million Tokens), IFEval (strikte Befolgung von Anweisungen), BFCL v3 (Berkeley Function Calling Leaderboard) für strukturiertes Tool-Calling. Seriöse technische Berichte veröffentlichen inzwischen diese vollständige Matrix statt eines isolierten MMLU-Scores.

Veröffentlichte Ergebnisse: vergleichende Betrachtung bei gleichwertiger Hardware

Die nachstehenden Zahlen stammen aus offiziellen Datenblättern oder HuggingFace-Berichten. Sie müssen noch reproduziert werden, und zwar mithilfe von lm-evaluation-harness von EleutherAI, dem einzigen unabhängigen Protokoll, das in der Open-Source-Community als maßgeblich gilt.

Stufe S — Reasoning-Modelle an der Spitze des Stands der Technik (> 600 Milliarden Parameter) :

Stufe A – ausführbar auf 1 bis 4 hochleistungsfähigen GPUs (100B bis 400B) :

Stufe B — eine einzelne Workstation (40 bis 80 GB VRAM) :

Geringfügige Vergleiche sind auf /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.

Detaillierte Hardwarekosten: VRAM, Quantisierungen, gemessene Durchsatzraten

Ein reiner Benchmarkwert ist ohne die zugehörigen Inferenzkosten wertlos. Die folgenden Werte beziehen sich auf das Q4_K_M-Format von llama.cpp. Die Konvertierungen in Q5_K_M, Q8_0 oder FP16 erhöhen den VRAM-Bedarf ungefähr um den Faktor 1,25, 2 beziehungsweise 4. Die Rechner quelllm.fr/configurateur filtert nach GPU-Budget.

Modell Q4 VRAM Zielkonfiguration Ungefährer Durchsatz in Q4
DeepSeek V4 Pro 1.6T ~960 GB 8×H200 141 GB, TPU-v5p-Pod 15-20 Tok/s tensor-parallel
MiMo V2.5 Pro 1020B ~595 GB 8×H100 80 GB tensor-parallel 20–30 Tok/s
Mistral Large 3 675B ~405 GB 6×H100 80 GB oder 4×H200 25-35 Tok/s
Llama 3.1 405B ~240 GB 4×A100 80 GB oder 3×H100 20–30 Tok/s
Qwen 3 235B-A22B ~142 GB 2×H100 oder 1×H200 141 GB 40–60 Tok/s (MoE)
Hunyuan Large 2.0 ~245 GB 3×H100 80 GB 25-30 tok/s
gpt-oss 120B ~70 GB 1×H100, Mac Studio M3 Ultra 192 GB 35–50 Tok/s
Mistral Small 4 119B ~72 GB 1×H100, A100 80 GB 30–45 Tok/s
Llama 3.3 70B ~40 GB RTX A6000 48 GB, 2×RTX 4090 15 bis 25 Tok/s auf 2×4090
DBRX Instruct 132B ~76 GB 1×H100, 2×A100 40 GB 30-40 Tok/s

Die Zahlen geben ungefähre Größenordnungen bei einem einzelnen Batch an; Multi-Tenant-Deployments mit vLLM oder SGLang erzielen bis zu 5× mehr aggregierter Durchsatz durch continuous batching und prefix caching. Auf Mac Studio M3 Ultra (Speicherbandbreite 800 GB/s), Llama 3.3 70B erreicht in Q4_K_M je nach tatsächlicher Kontextlänge 8 bis 12 tok/s im Single-Stream-Betrieb. Die MoE-Architekturen (Mixtral 8x22B, Qwen 3, DeepSeek V3) profitieren besonders von SGLang dank des im Batch gemeinsam genutzten Experten-Routings. Der Leitfaden /guide/quantization-q4-q5-q8 erläutert die Abwägung zwischen Qualität und VRAM und /guide/inference-vllm-vs-llamacpp vergleicht die Inferenz-Engines im Detail. Für einen Benchmark Ihres eigenen Setups siehe /guide/bench-tokens-par-seconde.

Drei Verzerrungen, die die Interpretation der Ranglisten verfälschen

  1. Kontamination der Datensätze. MMLU und HumanEval sind seit 2021 verfügbar; einige Modelle haben die Fragen während des Vortrainings gesehen, was die Ergebnisse künstlich erhöht. Die Arbeit LiveCodeBench verfolgt die Aufgaben für HumanEval zeitlich, um diejenigen zu isolieren, die nach dem Stichtag für die Vortrainingsdaten entstanden sind. Die Erkennung von Datenkontamination anhand von n-Gramm-Überschneidungen (Methode arXiv:2311.04850) zeigt, dass bis zu 12 % der MMLU-Aufgaben wortwörtlich in den indexierten Webkorpora vorkommen.
  2. Decodierungsvariabilität. Ein bei einer Temperatur von 0,6 mit 64 Samples berechneter AIME-pass@1-Score (cons@64, Majority Voting) kann um 10 Punkte von einem strikten pass@1 bei Temperatur 0 abweichen. Bei GSM8K beträgt der Unterschied durch Self-Consistency je nach Anzahl der Samples 5 bis 8 Punkte. Immer prüfen: temperature, top_p, max_tokens, Anzahl der Samples und Aggregationsregel in der Model-Card oder im technischen Bericht.
  3. Spezifische Prompts. Die Berichte von DeepSeek, Qwen und Mistral verwenden häufig optimierte Systemprompts, manchmal mit manuell kuratierten Few-Shot-Beispielen. Versucht man, die Ergebnisse ohne solche Anpassungen im Zero-Shot-Modus zu reproduzieren, erzielt man typischerweise 3 bis 8 Punkte weniger, bei Reasoning-Testsuiten manchmal noch weniger. Bei AIME kann das Hinzufügen des Präfixes „Let's think step by step“ den Score bei Modellen ohne antrainierten Thinking-Modus um 4 bis 6 Punkte verschieben.

Benchmarks, die auf Nutzeraufgaben ausgerichtet sind — LMArena (ehemals Chatbot Arena), LiveBench, SWE-bench Verified — bieten eine Ergänzung, die weniger anfällig für Manipulationen ist. SWE-bench bleibt die Referenz zur Bewertung eines agentischen Modells anhand echten Codes: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B erzielen dort Ergebnisse von über 40 %, die noch anhand der aktualisierten Rangliste bestätigt werden müssen. BFCL v3 ergänzt die für den Einsatz von KI-Agenten nützliche Dimension des strukturierten Tool-Callings.

Einen Benchmark von Anfang bis Ende reproduzieren: Standardverfahren

Um einen belastbaren AIME-2026-Score für beispielsweise DeepSeek R1 Distill Llama 70B :

  1. Die Modellgewichte herunterladen auf HuggingFace (# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) anschließend in GGUF Q4_K_M konvertieren, und zwar mit llama.cpp/convert_hf_to_gguf.py wenn Sie CPUs oder Apple-Geräte nutzen möchten, oder für vLLM beim safetensors-Format bleiben.
  2. Hyperparameter festlegen : Temperatur 0.6, top-p 0.95, max_tokens 32768 (das Modell muss ausführlich schlussfolgern), Seed für die Reproduzierbarkeit gespeichert.
  3. Das AIME 2026-Dataset laden aus einem aktualisierten HuggingFace-Datensatz. Sicherstellen, dass der Herausgeber die Lösung nicht versehentlich in den Prompt aufgenommen hat — ein häufiger Fehler bei neueren Forks.
  4. 64 Kompletionen pro Problem generieren für cons@64 und 1 Vervollständigung bei Temperatur 0 für die strenge pass@1-Auswertung.
  5. Endgültige Antwort extrahieren mithilfe eines regulären Ausdrucks für das Tag \boxed{} oder die letzte Folge aus 1 bis 3 Ziffern. Den Fall berücksichtigen, dass das Modell mehrere Tags ausgibt <thinking> verschachtelt.
  6. Mit offiziellen Lösungen vergleichen AIME (Ganzzahl 0–999), Skript und Seed veröffentlichen.

Etwa 6 bis 10 Stunden auf 2×H100 für ein 70B-Modell mit cons@64 für die 15 AIME-2026-Aufgaben einplanen. Der Leitfaden /guide/reproduire-benchmark-aime erläutert die Fallstricke bei der Antwortextraktion, insbesondere den Umgang mit Tags <thinking> bei Reasoning-Modellen und die Normalisierung ausgegebener Brüche.

Zahlenbasierte Fallstudien: drei konkrete Szenarien

Szenario A – Universitätslabor mit 4×A100 80 GB zur Bewertung des mathematischen Denkens. Ziel: eine reproduzierbare AIME-Kurve für 2024/2025/2026 erstellen. Gute Wahl: DeepSeek R1 Distill Llama 70B in Q8_0 (140 GB, zwei GPUs), verglichen mit Llama 3.3 70B ohne Reasoning auf den beiden verbleibenden GPUs, um den reinen Beitrag von Chain-of-Thought zu messen. Aufwand für einen vollständigen cons@64-Durchlauf mit den 45 Aufgaben (AIME 2024 + 2025 + 2026): etwa 30 GPU-Stunden. Siehe /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.

Szenario B — Startup mit 1×H100 80 GB zum Benchmarking eines Code-Assistenten. Drei Kandidaten im direkten Vergleich: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. Protokoll: HumanEval+ pass@1, MBPP+ pass@1, LiveCodeBench filtriert auf Aufgaben nach Oktober 2024, SWE-bench Verified Lite (50 Aufgaben). Der MoE-Durchsatz von Qwen3-Coder-Next (3B aktive) ermöglicht typischerweise 3-mal mehr Kandidaten pro Stunde als dichte Modelle mit vergleichbarer VRAM, was den Vorteil einer aggressiven Quantisierung verringert.

Szenario C — Daten-Team mit Mac Studio M3 Ultra 192 GB. Die Speicherbandbreite von 800 GB/s bleibt der begrenzende Faktor. Llama 3.3 70B Q5_K_M passt problemlos in den Speicher und liefert 6 bis 10 Tokens pro Sekunde. Qwen 3 235B-A22B passt in Q4 mit 142 GB gerade noch hinein, Durchsatz 4–6 Tokens/s, aber höhere Qualität. gpt-oss 120B belegt in Q4 70 GB und lässt Spielraum für den KV-Cache bei langen Kontexten. Siehe /guide/llm-mac-studio-m3-ultra.

Szenario D — eine Regression zwischen zwei feinabgestimmten Checkpoints anhand von Benchmarks messen. Typischer Anwendungsfall in der Industrie: LoRA-Fine-Tuning mit 10.000 fachspezifischen Beispielen auf Basis von Llama 3.3 70B. Das Risiko ist die katastrophale Regression bei den allgemeinen Fähigkeiten. Minimales Protokoll: MMLU (5-shot), IFEval, GSM8K, HumanEval+ vor und nach dem Fine-Tuning, identischer Seed. Ein Rückgang von mehr als 2 Punkten in 2 der 4 Testreihen signalisiert Overfitting. Siehe /guide/fine-tuning-sans-regression.

Lizenzen und genaue Bedingungen für die kommerzielle Nutzung

Le Benchmark für lokale LLM ist nutzlos, wenn die Lizenz den vorgesehenen Einsatz verbietet. Vier Familien dominieren das Open-Weights-Ökosystem des Jahres 2026:

Für einen detaillierten Vergleich der einzelnen Lizenzen siehe /guide/licences-llm-open-source.

Modellwahl entsprechend dem gewünschten Benchmarkprofil

FAQ

F: Welche Unterschiede gibt es zwischen MMLU und MMLU-Pro?

MMLU bietet pro Frage 4 Antwortmöglichkeiten, und die besten Open-Weights-Modelle erreichen eine Obergrenze von etwa 88–90 %, wodurch der Benchmark nur wenig Trennschärfe besitzt. MMLU-Pro erhöht die Zahl der Antwortmöglichkeiten auf 10, entfernt mehrdeutige Fragen und ergänzt Aufgaben, die mehrstufiges Schlussfolgern erfordern. Die Ergebnisse fallen typischerweise um 15 bis 25 Punkte niedriger aus, wodurch die Trennschärfe wiederhergestellt wird. Für den Vergleich moderner Modelle wie DeepSeek V3.2 oder Qwen 3 235B-A22B ist MMLU-Pro inzwischen aussagekräftiger als der klassische MMLU.

F: Wie lässt sich ein HumanEval-Score lokal reproduzieren?

Installieren evalplus, das Modell über vLLM oder llama.cpp laden, je nach angestrebter Metrik 1 bis 200 Vervollständigungen pro Problem generieren und anschließend die Python-Tests ausführen. Für ein 70B-Modell bei pass@1 über die 164 Probleme einen GPU-Tag einplanen, für pass@100 mehr. Ein Score bei Temperatur 0 unterscheidet sich von einem über mehrere Stichproben gemittelten Score: immer die Hyperparameter dokumentieren und das Skript veröffentlichen, um Vergleiche zwischen den Ergebnissen zu ermöglichen.

F: Sollte bei einem zuverlässigen Benchmark Q4, Q5 oder Q8 bevorzugt werden?

Q4_K_M verliert gegenüber FP16 typischerweise 1 bis 3 Punkte bei MMLU, manchmal mehr bei AIME, wo lange Schlussfolgerungsketten empfindlich auf kumulierte Fehler reagieren. Q5_K_M und Q6_K verringern den Abstand auf weniger als einen Punkt. Q8_0 ist bei den meisten Testsuiten kaum von FP16 zu unterscheiden. Für ehrliche Benchmarks immer die verwendete Quantisierung angeben. Der Leitfaden /guide/quantization-q4-q5-q8 beschreibt die gemessenen Leistungseinbußen für jedes Format im Detail.

F: Sind die AIME-2024-Scores kontaminiert?

Die Aufgabenstellungen von AIME 2024 wurden im Februar 2024 online veröffentlicht und kurz darauf von Crawlern indexiert. Modelle mit einem Datenstichtag nach Mitte 2024 können daher die Lösungen bereits gesehen haben. Aus diesem Grund werden AIME 2025 und AIME 2026 in aktuellen Evaluierungen bevorzugt, sofern die Modelle diesen Aufgaben und Lösungen noch nicht ausgesetzt waren. Stets den vom Anbieter in der Model Card angegebenen Datenstichtag des Vortrainings prüfen und zur Bestätigung mit LiveBench abgleichen.

F: Welches Modell für einen Rechner mit 24 GB VRAM?

24 GB schließen Modelle mit 70B oder mehr in Q4 aus, die mindestens 40 GB benötigen. Praktikable Optionen sind Modelle mit 30B bis 40B in Q4 oder 70B-Modelle mit aggressiven Quantisierungen wie IQ2_XXS, allerdings auf Kosten eines erheblichen Qualitätsverlusts (5 bis 10 Punkte bei MMLU). Um eine akzeptable Qualität zu erhalten, Modelle mit 14B bis 32B anstreben. Siehe den Konfigurator unter /configurateur für eine Filterung nach VRAM.

F: Warum unterscheiden sich die Scores auf HuggingFace von denen in den Berichten der Anbieter?

Die Anbieter optimieren die Prompts, verwenden spezielle Decodierungen (cons@64, majority voting) und wählen manchmal die besten Runs aus mehreren Seeds aus. Unabhängige Leaderboards wie HuggingFace Open LLM Leaderboard schreiben ein einheitliches Protokoll vor (Zero-Shot oder ein festes Few-Shot-Verfahren, standardisierte Prompts). Eine Differenz von 3 bis 10 Punkten zwischen den beiden Quellen ist zu erwarten. Im Produktivbetrieb zählt das reproduzierbare Protokoll, nicht der höchste Wert.

Fazit

Un Benchmark für lokale LLM führt in die Irre, wenn er ohne Berücksichtigung der Lizenz, der Quantisierung und des Decodierungsprotokolls gelesen wird. Eine belastbare Methode besteht darin, mindestens MMLU-Pro, HumanEval+, AIME 2025/2026 und einen agentischen Benchmark wie SWE-bench Verified gemeinsam auszuwerten und vor jeder Festlegung den VRAM der vorgesehenen Hardware sowie die Lizenz zu prüfen. Der Umfang beschränkt sich hier bewusst auf die Messung: Auf dieser Seite zählt, eine veröffentlichte Zahl reproduzieren zu können, ihre Fehlerspanne zu verstehen und zu überprüfen, ob das Modell auf Ihrer Hardware Platz findet. Um die erfassten Modelle nach Ihrem GPU-Budget und Ihrem Anwendungsfall zu filtern, starten Sie den Konfigurator WelchesLLM oder durchsuchen Sie den komplettes Katalog.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.