Benchmark lokaler LLM: MMLU, HumanEval, AIME 2026
Un Benchmark für lokale LLM Die Ausnahme aus der Methodik entspricht dem Vergleich zweier Marathonzeiten ohne die Höhenprofilangaben des Streckenverlaufs. Zwei Modelle mit 88 Punkten auf MMLU können sich um 16 Punkte auf MMLU-Pro und um 30 Punkte auf AIME 2026 unterscheiden, abhängig von der Anwesenheit eines Chain-of-Thought-Trainings, der Quantisierung, dem Decodierprotokoll (cons@64 vs. pass@1 strict) und der genauen Version des geladenen Datensatzes. Diese Seite dient nicht als Kaufleitfaden: Es handelt sich um eine Audit-Grille für die drei historischen Serien (MMLU/MMLU-Pro, HumanEval/HumanEval+, AIME 2024/2025/2026), mit veröffentlichten Ergebnissen, Wiedergabebedingungen, gemessenen VRAM-Kosten Q4, Token-Throughput unter realen Konfigurationen sowie einer Aufzählung der Bias, die in den Verkaufsmitteilungen unterblieben werden. Das Ziel ist ausgestattet: Es ermöglicht es, eine Zahl selbstständig mit einer festen Seed zu reproduzieren, ohne zwischen proprietären und open-weight Modellen zu wählen.
Warum der Bewertungsrahmen von 2026 Benchmarks aus der Zeit vor 2024 ungültig macht
Das Ökosystem hat sich in zwei Jahren gewandelt. MMLU mit 4 Auswahlmöglichkeiten war bereits gesättigt Llama 3.1 405B bei 88,6, und Architekturen mit Expertenaktivierung (DeepSeek V3, Qwen 3, GLM-5.1) liegen inzwischen nahe an der Obergrenze; einen MMLU-Wert auf einen halben Punkt genau zu betrachten, liefert mittlerweile keinen Informationsgewinn mehr. Drei strukturelle Veränderungen haben die Bewertungsmatrix neu geordnet:
- Mit RL trainierte Reasoning-Modelle (DeepSeek R1, Ring-1T, gpt-oss 120B mit zuschaltbarem Thinking), die AIME und MATH-500 zu besonders aussagekräftigen Unterscheidungskriterien machen. Bei AIME 2024 beträgt der Abstand zwischen Llama 3.1 405B (~23 pass@1) und DeepSeek R1 671B (~79 pass@1) 55 Punkte — eine Differenz, die sich bei MMLU nicht beobachten lässt.
- Anzahl der Gesamtparameter im Vergleich zu den aktiven Parametern. Qwen 3 235B-A22B aktiviert nur 22B Parameter pro Token, MiniMax-M2.7 folgt derselben MoE-Logik. Der Benchmark muss bei vergleichbaren Inferenzkosten (Tokens/Sekunde × VRAM) interpretiert werden, nicht anhand der angegebenen Gesamtzahl der Parameter.
- Testsuiten gegen Datenkontamination. LiveBench erneuert seine Aufgaben jeden Monat, LiveCodeBench versieht die Codeforces-Aufgaben mit Zeitstempeln, um diejenigen nach dem Stichtag für die Vortrainingsdaten gesondert zu betrachten, und SimpleBench misst die Robustheit des gesunden Menschenverstands dort, wo MMLU an seine Grenzen stößt. Die HuggingFace Open LLM Leaderboard v2 ist aus diesem Grund ausdrücklich auf MMLU-Pro, GPQA, MUSR und IFEval umgestiegen.
Ein einzelner Score ist nicht mehr aussagekräftig: Nur die Matrix {MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond} liefert verwertbare Informationen. Der Leitfaden /guide/matrice-benchmarks-2026 erläutert die empfohlene Gewichtung.
Methodik: Was jede Benchmark-Suite tatsächlich misst
Le MMLU LLM (Massive Multitask Language Understanding, Hendrycks et al. 2021) deckt 57 Fachgebiete (Medizin, Recht, Ethik, elementare Mathematik) mit Multiple-Choice-Fragen mit jeweils 4 Antwortmöglichkeiten ab, nach dem standardmäßigen 5-Shot-Protokoll. Referenz-Repository: GitHub Hendrycks, Fachartikel arXiv:2009.03300. Ab 85 % wurde er durch MMLU-Pro (10 Antwortmöglichkeiten, mehrstufiges Schlussfolgern, 12.032 Aufgaben) auf HuggingFace TIGER-Lab, mit einer typischen Abnahme von 15 bis 25 Punkten im Vergleich zum klassischen MMLU. Neue Variante: MMLU-Redux (Paper arXiv:2406.04127) korrigiert etwa 6,5 % der als fehlerhaft oder mehrdeutig erkannten Aufgaben des ursprünglichen Datensatzes – ein selten hervorgehobener Punkt, der erklärt, warum zwei identische Testläufe je nach geladener Version um 1 bis 2 Punkte voneinander abweichen können. Informationen zu den Filtern und zum Bewertungsverfahren finden Sie unter /guide/mmlu-pro-protocole-strict.
HumanEval, veröffentlicht von OpenAI (arXiv:2107.03374), bewertet 164 Python-Aufgaben mit Funktionssignaturen und Unit-Tests. Die Standardmetrik ist pass@1 mais pass@10 et pass@100 erfordern jeweils 10 und 100 Samples pro Problem und vervielfachen die Evaluierungskosten entsprechend. Sein Nachfolger HumanEval+ (evalplus) fügt etwa 80-mal mehr durch Mutation erzeugte Testfälle hinzu; übertrainierte Modelle verlieren zwischen den beiden Versionen typischerweise 5 bis 10 Punkte, was den Grad der Überanpassung an die ursprünglichen Tests direkt sichtbar macht. Für eine weitergehende Bewertung anhand von Code aus der Praxis SWE-bench Verified misst die Lösung echter GitHub-Issues (500 von Menschen validierte Tickets) und LiveCodeBench stellt fortlaufend Codeforces-Aufgaben mit Zeitstempeln bereit, die sich nach Datum filtern lassen. Das vollständige Verfahren zur Extraktion für HumanEval+ wird beschrieben in /guide/humaneval-plus-protocole.
AIME 2024 LLM entspricht den 15 jährlichen Aufgaben des American Invitational Mathematics Examination (zwei Durchgänge, AIME I und II), mit ganzzahligen Antworten zwischen 0 und 999. Mit dem Aufkommen von Reasoning-Modellen ist dieser Benchmark zentral geworden und unterscheidet deutlich zwischen Architekturen mit oder ohne durch RL trainiertes Chain-of-Thought. Der Aufgabensatz von 2024 ist dokumentiert in der Modellkarte DeepSeek R1. AIME 2025 (März 2025) und anschließend AIME 2026 (Februar 2026) dienen nun als aktuelle Prüfungen, da die Aufgaben von 2024 in großem Umfang indexiert wurden. Die technischen Berichte von Ende 2025 verwenden häufig cons@64 (Mehrheitsentscheidung über 64 generierte Antworten, Temperatur 0,6, top-p 0,95), was den Rohwert gegenüber einem strikten pass@1 bei Temperatur 0 um 10 bis 15 Punkte erhöhen kann.
Über diese drei Säulen hinaus umfasst das Bewertungsraster 2026 zusätzlich GPQA Diamond (198 von Experten validierte Fragen auf Promotionsniveau), MATH-500 (Olympiadeaufgaben), MuSR (mehrstufiges narratives Schlussfolgern), RULER (Informationsabruf aus langen Kontexten mit bis zu 1 Million Tokens), IFEval (strikte Befolgung von Anweisungen), BFCL v3 (Berkeley Function Calling Leaderboard) für strukturiertes Tool-Calling. Seriöse technische Berichte veröffentlichen inzwischen diese vollständige Matrix statt eines isolierten MMLU-Scores.
Veröffentlichte Ergebnisse: vergleichende Betrachtung bei gleichwertiger Hardware
Die nachstehenden Zahlen stammen aus offiziellen Datenblättern oder HuggingFace-Berichten. Sie müssen noch reproduziert werden, und zwar mithilfe von lm-evaluation-harness von EleutherAI, dem einzigen unabhängigen Protokoll, das in der Open-Source-Community als maßgeblich gilt.
Stufe S — Reasoning-Modelle an der Spitze des Stands der Technik (> 600 Milliarden Parameter) :
- DeepSeek R1 671B : MMLU ~90,8, HumanEval ~96, AIME 2024 ~79,8 pass@1. MoE-Architektur mit 37B aktiven Parametern, MIT-Lizenz, standardmäßig im Reasoning-Modus.
- DeepSeek V3.2 : MMLU ~88,5, HumanEval ~93 geschätzt, Kontextfenster 128k, Allzweckversion ohne langes Reasoning – deutlich geringere Inferenzkosten als bei R1.
- DeepSeek V4 Pro 1.6T : 1600 Milliarden Parameter, Kontextfenster von 1 Million Tokens, sehr hohe RULER-Werte für lange Kontexte, realistischer Einsatz nur auf einem Cluster mit 8×H200.
- Kimi K2.6 : MMLU ~89 geschätzt, AIME 2024 ~74 gemäß Moonshot. Nachfolger von Kimi K2.5, gleicher VRAM-Bedarf in Q4: ~600 GB, Lizenz: Modified MIT.
- GLM-5.1 : 744B MoE-Parameter, konkurrenzfähige MMLU-Ergebnisse, von Z.AI angegebene AIME-2024-Ergebnisse, die noch unabhängig bestätigt werden müssen.
- Mistral Large 3 675B : Apache 2.0, MMLU auf dem Niveau von DeepSeek V3, besonders stark im Französischen, mit nativem Function Calling.
- Ring-1T et Ling 2.6 1T von Ant Group / inclusionAI: 1000 Milliarden Parameter, MIT-Lizenz, Schwerpunkt auf explizitem Schlussfolgern.
Stufe A – ausführbar auf 1 bis 4 hochleistungsfähigen GPUs (100B bis 400B) :
- Llama 3.1 405B Instruct : MMLU 88,6, HumanEval 89,0 (Meta-Bericht), historische Referenz für dichte Modelle.
- Llama 4 Maverick 400B : MoE mit einem Kontextfenster von 1 Million Tokens, Bereitstellung in Q4 mit ~240 GB.
- Qwen 3 235B-A22B : MMLU-Pro ~75 geschätzt, HumanEval ~92. Nur 22 Milliarden aktive Parameter: hervorragendes Verhältnis zwischen Qualität und VRAM-Bedarf auf 2×H100.
- DeepSeek V4 Flash 284B : Variante mit langem Kontext von 1 Million Tokens, für retrievalintensive Aufgaben ausgelegt.
- gpt-oss 120B : von OpenAI unter Apache 2.0 veröffentlicht, dank des Reasoning-Modus ein für die Modellgröße hohes Ergebnis bei AIME 2024, auf 1×H100 oder einem Mac Studio M3 Ultra mit 192 GB einsetzbar.
- Nemotron 3 Super 120B : NVIDIA, für TensorRT-LLM optimiert, wettbewerbsfähige MMLU-Ergebnisse.
- Mistral Small 4 119B : 256k Tokens, Apache 2.0, offene Alternative zu Mistral Medium 3.5.
- ERNIE 4.5 300B-A47B : Baidu, Apache 2.0, gute Ergebnisse in Chinesisch und Fenstergröße 131k.
- Hunyuan Large 2.0 : Tencent, MoE 389B/52B aktiv, Fenster 262k.
Stufe B — eine einzelne Workstation (40 bis 80 GB VRAM) :
- Llama 3.3 70B Instruct : MMLU ~86,0, HumanEval ~88,4 (Model Card von Meta).
- DeepSeek R1 Distill Llama 70B : destilliertes Reasoning-Modell, AIME 2024 ~70 pass@1 — ein Rekordverhältnis zwischen Reasoning-Leistung und VRAM-Bedarf bei 40 GB.
- Qwen3-Coder-Next 80B-A3B : auf Code spezialisiert, MoE mit 3 Milliarden aktiven Parametern, sehr hoher Durchsatz mit SGLang.
- Llama 3.1 Nemotron 70B : RLHF-Fine-Tuning durch NVIDIA, hohe Arena-Scores.
- Tülu 3 70B : vollständig offengelegtes Post-Training-Verfahren von Allen AI (github.com/allenai/open-instruct).
- Hunyuan-A13B Instruct : insgesamt 80 Milliarden Parameter, davon 13 Milliarden aktiv, interessante MoE-Alternative.
Geringfügige Vergleiche sind auf /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.
Detaillierte Hardwarekosten: VRAM, Quantisierungen, gemessene Durchsatzraten
Ein reiner Benchmarkwert ist ohne die zugehörigen Inferenzkosten wertlos. Die folgenden Werte beziehen sich auf das Q4_K_M-Format von llama.cpp. Die Konvertierungen in Q5_K_M, Q8_0 oder FP16 erhöhen den VRAM-Bedarf ungefähr um den Faktor 1,25, 2 beziehungsweise 4. Die Rechner quelllm.fr/configurateur filtert nach GPU-Budget.
| Modell | Q4 VRAM | Zielkonfiguration | Ungefährer Durchsatz in Q4 |
|---|---|---|---|
| DeepSeek V4 Pro 1.6T | ~960 GB | 8×H200 141 GB, TPU-v5p-Pod | 15-20 Tok/s tensor-parallel |
| MiMo V2.5 Pro 1020B | ~595 GB | 8×H100 80 GB tensor-parallel | 20–30 Tok/s |
| Mistral Large 3 675B | ~405 GB | 6×H100 80 GB oder 4×H200 | 25-35 Tok/s |
| Llama 3.1 405B | ~240 GB | 4×A100 80 GB oder 3×H100 | 20–30 Tok/s |
| Qwen 3 235B-A22B | ~142 GB | 2×H100 oder 1×H200 141 GB | 40–60 Tok/s (MoE) |
| Hunyuan Large 2.0 | ~245 GB | 3×H100 80 GB | 25-30 tok/s |
| gpt-oss 120B | ~70 GB | 1×H100, Mac Studio M3 Ultra 192 GB | 35–50 Tok/s |
| Mistral Small 4 119B | ~72 GB | 1×H100, A100 80 GB | 30–45 Tok/s |
| Llama 3.3 70B | ~40 GB | RTX A6000 48 GB, 2×RTX 4090 | 15 bis 25 Tok/s auf 2×4090 |
| DBRX Instruct 132B | ~76 GB | 1×H100, 2×A100 40 GB | 30-40 Tok/s |
Die Zahlen geben ungefähre Größenordnungen bei einem einzelnen Batch an; Multi-Tenant-Deployments mit vLLM oder SGLang erzielen bis zu 5× mehr aggregierter Durchsatz durch continuous batching und prefix caching. Auf Mac Studio M3 Ultra (Speicherbandbreite 800 GB/s), Llama 3.3 70B erreicht in Q4_K_M je nach tatsächlicher Kontextlänge 8 bis 12 tok/s im Single-Stream-Betrieb. Die MoE-Architekturen (Mixtral 8x22B, Qwen 3, DeepSeek V3) profitieren besonders von SGLang dank des im Batch gemeinsam genutzten Experten-Routings. Der Leitfaden /guide/quantization-q4-q5-q8 erläutert die Abwägung zwischen Qualität und VRAM und /guide/inference-vllm-vs-llamacpp vergleicht die Inferenz-Engines im Detail. Für einen Benchmark Ihres eigenen Setups siehe /guide/bench-tokens-par-seconde.
Drei Verzerrungen, die die Interpretation der Ranglisten verfälschen
- Kontamination der Datensätze. MMLU und HumanEval sind seit 2021 verfügbar; einige Modelle haben die Fragen während des Vortrainings gesehen, was die Ergebnisse künstlich erhöht. Die Arbeit LiveCodeBench verfolgt die Aufgaben für HumanEval zeitlich, um diejenigen zu isolieren, die nach dem Stichtag für die Vortrainingsdaten entstanden sind. Die Erkennung von Datenkontamination anhand von n-Gramm-Überschneidungen (Methode arXiv:2311.04850) zeigt, dass bis zu 12 % der MMLU-Aufgaben wortwörtlich in den indexierten Webkorpora vorkommen.
- Decodierungsvariabilität. Ein bei einer Temperatur von 0,6 mit 64 Samples berechneter AIME-pass@1-Score (cons@64, Majority Voting) kann um 10 Punkte von einem strikten pass@1 bei Temperatur 0 abweichen. Bei GSM8K beträgt der Unterschied durch Self-Consistency je nach Anzahl der Samples 5 bis 8 Punkte. Immer prüfen:
temperature,top_p,max_tokens, Anzahl der Samples und Aggregationsregel in der Model-Card oder im technischen Bericht. - Spezifische Prompts. Die Berichte von DeepSeek, Qwen und Mistral verwenden häufig optimierte Systemprompts, manchmal mit manuell kuratierten Few-Shot-Beispielen. Versucht man, die Ergebnisse ohne solche Anpassungen im Zero-Shot-Modus zu reproduzieren, erzielt man typischerweise 3 bis 8 Punkte weniger, bei Reasoning-Testsuiten manchmal noch weniger. Bei AIME kann das Hinzufügen des Präfixes „Let's think step by step“ den Score bei Modellen ohne antrainierten Thinking-Modus um 4 bis 6 Punkte verschieben.
Benchmarks, die auf Nutzeraufgaben ausgerichtet sind — LMArena (ehemals Chatbot Arena), LiveBench, SWE-bench Verified — bieten eine Ergänzung, die weniger anfällig für Manipulationen ist. SWE-bench bleibt die Referenz zur Bewertung eines agentischen Modells anhand echten Codes: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B erzielen dort Ergebnisse von über 40 %, die noch anhand der aktualisierten Rangliste bestätigt werden müssen. BFCL v3 ergänzt die für den Einsatz von KI-Agenten nützliche Dimension des strukturierten Tool-Callings.
Einen Benchmark von Anfang bis Ende reproduzieren: Standardverfahren
Um einen belastbaren AIME-2026-Score für beispielsweise DeepSeek R1 Distill Llama 70B :
- Die Modellgewichte herunterladen auf HuggingFace (
# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) anschließend in GGUF Q4_K_M konvertieren, und zwar mitllama.cpp/convert_hf_to_gguf.pywenn Sie CPUs oder Apple-Geräte nutzen möchten, oder für vLLM beim safetensors-Format bleiben. - Hyperparameter festlegen : Temperatur 0.6, top-p 0.95, max_tokens 32768 (das Modell muss ausführlich schlussfolgern), Seed für die Reproduzierbarkeit gespeichert.
- Das AIME 2026-Dataset laden aus einem aktualisierten HuggingFace-Datensatz. Sicherstellen, dass der Herausgeber die Lösung nicht versehentlich in den Prompt aufgenommen hat — ein häufiger Fehler bei neueren Forks.
- 64 Kompletionen pro Problem generieren für cons@64 und 1 Vervollständigung bei Temperatur 0 für die strenge pass@1-Auswertung.
- Endgültige Antwort extrahieren mithilfe eines regulären Ausdrucks für das Tag
\boxed{}oder die letzte Folge aus 1 bis 3 Ziffern. Den Fall berücksichtigen, dass das Modell mehrere Tags ausgibt<thinking>verschachtelt. - Mit offiziellen Lösungen vergleichen AIME (Ganzzahl 0–999), Skript und Seed veröffentlichen.
Etwa 6 bis 10 Stunden auf 2×H100 für ein 70B-Modell mit cons@64 für die 15 AIME-2026-Aufgaben einplanen. Der Leitfaden /guide/reproduire-benchmark-aime erläutert die Fallstricke bei der Antwortextraktion, insbesondere den Umgang mit Tags <thinking> bei Reasoning-Modellen und die Normalisierung ausgegebener Brüche.
Zahlenbasierte Fallstudien: drei konkrete Szenarien
Szenario A – Universitätslabor mit 4×A100 80 GB zur Bewertung des mathematischen Denkens. Ziel: eine reproduzierbare AIME-Kurve für 2024/2025/2026 erstellen. Gute Wahl: DeepSeek R1 Distill Llama 70B in Q8_0 (140 GB, zwei GPUs), verglichen mit Llama 3.3 70B ohne Reasoning auf den beiden verbleibenden GPUs, um den reinen Beitrag von Chain-of-Thought zu messen. Aufwand für einen vollständigen cons@64-Durchlauf mit den 45 Aufgaben (AIME 2024 + 2025 + 2026): etwa 30 GPU-Stunden. Siehe /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.
Szenario B — Startup mit 1×H100 80 GB zum Benchmarking eines Code-Assistenten. Drei Kandidaten im direkten Vergleich: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. Protokoll: HumanEval+ pass@1, MBPP+ pass@1, LiveCodeBench filtriert auf Aufgaben nach Oktober 2024, SWE-bench Verified Lite (50 Aufgaben). Der MoE-Durchsatz von Qwen3-Coder-Next (3B aktive) ermöglicht typischerweise 3-mal mehr Kandidaten pro Stunde als dichte Modelle mit vergleichbarer VRAM, was den Vorteil einer aggressiven Quantisierung verringert.
Szenario C — Daten-Team mit Mac Studio M3 Ultra 192 GB. Die Speicherbandbreite von 800 GB/s bleibt der begrenzende Faktor. Llama 3.3 70B Q5_K_M passt problemlos in den Speicher und liefert 6 bis 10 Tokens pro Sekunde. Qwen 3 235B-A22B passt in Q4 mit 142 GB gerade noch hinein, Durchsatz 4–6 Tokens/s, aber höhere Qualität. gpt-oss 120B belegt in Q4 70 GB und lässt Spielraum für den KV-Cache bei langen Kontexten. Siehe /guide/llm-mac-studio-m3-ultra.
Szenario D — eine Regression zwischen zwei feinabgestimmten Checkpoints anhand von Benchmarks messen. Typischer Anwendungsfall in der Industrie: LoRA-Fine-Tuning mit 10.000 fachspezifischen Beispielen auf Basis von Llama 3.3 70B. Das Risiko ist die katastrophale Regression bei den allgemeinen Fähigkeiten. Minimales Protokoll: MMLU (5-shot), IFEval, GSM8K, HumanEval+ vor und nach dem Fine-Tuning, identischer Seed. Ein Rückgang von mehr als 2 Punkten in 2 der 4 Testreihen signalisiert Overfitting. Siehe /guide/fine-tuning-sans-regression.
Lizenzen und genaue Bedingungen für die kommerzielle Nutzung
Le Benchmark für lokale LLM ist nutzlos, wenn die Lizenz den vorgesehenen Einsatz verbietet. Vier Familien dominieren das Open-Weights-Ökosystem des Jahres 2026:
- MIT / Apache 2.0 (freie kommerzielle Nutzung, Namensnennung erforderlich): DeepSeek R1 671B, DeepSeek V3.2, Mistral Large 3, Mixtral 8x22B, Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T, Ling 2.6 1T, GLM-5.1, Rakuten AI 3.0, Snowflake Arctic Instruct, MiniMax-M2.7, Step 3.5 Flash. Gute Voraussetzungen für B2B-SaaS ohne Schwellenwert bei der Nutzerzahl.
- Llama Community License (Einschränkungen bei mehr als 700 Millionen monatlich aktiven Nutzern): Llama 3.1 405B, Llama 4 Maverick 400B, Llama 4 Scout 109B, Llama 3.3 70B, Llama 3.1 70B. Vor jedem Produkt für ein breites Publikum mit hoher Nutzerzahl lesen.
- Anbieterspezifische Lizenzen : Tencent Hunyuan License für Hunyuan Large 2.0 et Hunyuan-A13B, Qwen License für Qwen 2.5 72B, Pangu Model License für Pangu Pro MoE 72B, NVIDIA Open Model License für Nemotron 3 Super 120B, Databricks Open Model License für DBRX.
- Nicht kommerziell : CC-BY-NC 4.0 für Command R+ 104B. Der akademischen Forschung vorbehalten, nicht im kostenpflichtigen Produktivbetrieb einsetzen.
Für einen detaillierten Vergleich der einzelnen Lizenzen siehe /guide/licences-llm-open-source.
Modellwahl entsprechend dem gewünschten Benchmarkprofil
- Mathematisches Denken (AIME, MATH-500, GPQA Diamond) : DeepSeek R1 671B in Q4 oder seine leichter zugängliche destillierte Variante DeepSeek R1 Distill Llama 70B. Siehe /meilleur-llm/raisonnement et /compare/deepseek-r1-671b-vs-qwen3-235b-a22b.
- Codegenerierung (HumanEval+, MBPP+, SWE-bench Verified) : Qwen3-Coder-Next 80B-A3B für einen Kompromiss zwischen VRAM und Qualität, Mistral Large 3 675B für die Spitzenklasse. Siehe /meilleur-llm/code et /compare/qwen3-coder-next-vs-mistral-large-3.
- Langer Kontext (RULER 128k-1M, Nadel im Heuhaufen) : MiMo V2.5, DeepSeek V4 Flash 284B, Llama 4 Maverick 400B. Llama 4 Scout 109B gibt 10 Millionen Tokens an; dies muss beim tatsächlichen Retrieval noch bestätigt werden.
- Multilingual mit Französisch : Mistral Large 3 675B, Mistral Medium 3.5 128B, Qwen 3 235B-A22B. Für Arabisch und MENA: Jais Adapted 70B Chat. Für Japanisch, Rakuten AI 3.0. Siehe /meilleur-llm/francais.
- Vision (MMMU, MathVista, DocVQA) : Qwen 3 VL 235B-A22B, Qwen 2.5 VL 72B, LLaVA-OneVision 72B, Molmo 72B. Siehe /meilleur-llm/vision.
- Begrenztes VRAM-Budget (< 48 GB) : Llama 3.3 70B, Llama 3.1 Nemotron 70B, Tülu 3 70B in Q4. Siehe /meilleur-llm/vram-48go.
- Tool-Calling (BFCL v3, Tau-Bench) : Mistral Large 3, Qwen 3 235B-A22B, Hunyuan-A13B. Siehe /meilleur-llm/agents.
FAQ
F: Welche Unterschiede gibt es zwischen MMLU und MMLU-Pro?
MMLU bietet pro Frage 4 Antwortmöglichkeiten, und die besten Open-Weights-Modelle erreichen eine Obergrenze von etwa 88–90 %, wodurch der Benchmark nur wenig Trennschärfe besitzt. MMLU-Pro erhöht die Zahl der Antwortmöglichkeiten auf 10, entfernt mehrdeutige Fragen und ergänzt Aufgaben, die mehrstufiges Schlussfolgern erfordern. Die Ergebnisse fallen typischerweise um 15 bis 25 Punkte niedriger aus, wodurch die Trennschärfe wiederhergestellt wird. Für den Vergleich moderner Modelle wie DeepSeek V3.2 oder Qwen 3 235B-A22B ist MMLU-Pro inzwischen aussagekräftiger als der klassische MMLU.
F: Wie lässt sich ein HumanEval-Score lokal reproduzieren?
Installieren evalplus, das Modell über vLLM oder llama.cpp laden, je nach angestrebter Metrik 1 bis 200 Vervollständigungen pro Problem generieren und anschließend die Python-Tests ausführen. Für ein 70B-Modell bei pass@1 über die 164 Probleme einen GPU-Tag einplanen, für pass@100 mehr. Ein Score bei Temperatur 0 unterscheidet sich von einem über mehrere Stichproben gemittelten Score: immer die Hyperparameter dokumentieren und das Skript veröffentlichen, um Vergleiche zwischen den Ergebnissen zu ermöglichen.
F: Sollte bei einem zuverlässigen Benchmark Q4, Q5 oder Q8 bevorzugt werden?
Q4_K_M verliert gegenüber FP16 typischerweise 1 bis 3 Punkte bei MMLU, manchmal mehr bei AIME, wo lange Schlussfolgerungsketten empfindlich auf kumulierte Fehler reagieren. Q5_K_M und Q6_K verringern den Abstand auf weniger als einen Punkt. Q8_0 ist bei den meisten Testsuiten kaum von FP16 zu unterscheiden. Für ehrliche Benchmarks immer die verwendete Quantisierung angeben. Der Leitfaden /guide/quantization-q4-q5-q8 beschreibt die gemessenen Leistungseinbußen für jedes Format im Detail.
F: Sind die AIME-2024-Scores kontaminiert?
Die Aufgabenstellungen von AIME 2024 wurden im Februar 2024 online veröffentlicht und kurz darauf von Crawlern indexiert. Modelle mit einem Datenstichtag nach Mitte 2024 können daher die Lösungen bereits gesehen haben. Aus diesem Grund werden AIME 2025 und AIME 2026 in aktuellen Evaluierungen bevorzugt, sofern die Modelle diesen Aufgaben und Lösungen noch nicht ausgesetzt waren. Stets den vom Anbieter in der Model Card angegebenen Datenstichtag des Vortrainings prüfen und zur Bestätigung mit LiveBench abgleichen.
F: Welches Modell für einen Rechner mit 24 GB VRAM?
24 GB schließen Modelle mit 70B oder mehr in Q4 aus, die mindestens 40 GB benötigen. Praktikable Optionen sind Modelle mit 30B bis 40B in Q4 oder 70B-Modelle mit aggressiven Quantisierungen wie IQ2_XXS, allerdings auf Kosten eines erheblichen Qualitätsverlusts (5 bis 10 Punkte bei MMLU). Um eine akzeptable Qualität zu erhalten, Modelle mit 14B bis 32B anstreben. Siehe den Konfigurator unter /configurateur für eine Filterung nach VRAM.
F: Warum unterscheiden sich die Scores auf HuggingFace von denen in den Berichten der Anbieter?
Die Anbieter optimieren die Prompts, verwenden spezielle Decodierungen (cons@64, majority voting) und wählen manchmal die besten Runs aus mehreren Seeds aus. Unabhängige Leaderboards wie HuggingFace Open LLM Leaderboard schreiben ein einheitliches Protokoll vor (Zero-Shot oder ein festes Few-Shot-Verfahren, standardisierte Prompts). Eine Differenz von 3 bis 10 Punkten zwischen den beiden Quellen ist zu erwarten. Im Produktivbetrieb zählt das reproduzierbare Protokoll, nicht der höchste Wert.
Fazit
Un Benchmark für lokale LLM führt in die Irre, wenn er ohne Berücksichtigung der Lizenz, der Quantisierung und des Decodierungsprotokolls gelesen wird. Eine belastbare Methode besteht darin, mindestens MMLU-Pro, HumanEval+, AIME 2025/2026 und einen agentischen Benchmark wie SWE-bench Verified gemeinsam auszuwerten und vor jeder Festlegung den VRAM der vorgesehenen Hardware sowie die Lizenz zu prüfen. Der Umfang beschränkt sich hier bewusst auf die Messung: Auf dieser Seite zählt, eine veröffentlichte Zahl reproduzieren zu können, ihre Fehlerspanne zu verstehen und zu überprüfen, ob das Modell auf Ihrer Hardware Platz findet. Um die erfassten Modelle nach Ihrem GPU-Budget und Ihrem Anwendungsfall zu filtern, starten Sie den Konfigurator WelchesLLM oder durchsuchen Sie den komplettes Katalog.