ARC-AGI 2: Das Schlussfolgerungsvermögen von Open-Source-LLMs testen

Le ARC-AGI 2-Benchmark ist ab 2025 die Referenz für die Messung der Generalisierung und des abstrakten Denkens bei LLM mit offenen Gewichten, weit über die klassischen MMLU-Fragen hinaus. Entwickelt von François Chollet und der Arc Prize Stiftung, der ARC-AGI 2-Benchmark stellt die Modelle vor neuartige visuelle Rätsel, bei denen Auswendiglernen und Brute Force nicht mehr ausreichen. Dieser Artikel gibt einen Überblick über das Bewertungsprotokoll, die bestplatzierten Open-Source-Modelle im Katalog von quelllm.fr, ihren Hardwarebedarf in Form von VRAM und bewährte Vorgehensweisen, um diese Tests lokal zu reproduzieren.

Was ist ARC-AGI 2 und warum verändert es die Spielregeln?

ARC-AGI 2 ist die zweite Iteration des Abstraction and Reasoning Corpus, veröffentlicht im Rahmen vonArc Prize 2025 mit einem Preisgeld von einer Million US-Dollar. Der Datensatz enthält etwa 1.000 öffentliche Trainingsaufgaben, 400 öffentliche Evaluierungsaufgaben und 100 private Aufgaben für den abschließenden Test. Jede Aufgabe besteht aus einem farbigen Eingaberaster und einem Ausgaberaster sowie 2 bis 5 Beispielen. Das Modell muss die Transformationsregel ableiten und sie anschließend auf einen neuen Fall anwenden.

Im Gegensatz zu MMLU oder HumanEval belohnt ARC-AGI 2 weder Allgemeinwissen noch syntaktischen Musterabgleich. Es zielt auf LLM-Reasoning im eigentlichen Sinne: Kombination von Regeln, Manipulation von Objekten, Symmetrie, Abzählen. Laut dem grundlegende Forschungsarbeit von Chollet (arXiv:1911.01547), erreicht ein ungeübter Mensch eine Erfolgsquote von über 80 %; die besten Open-Source-LLMs kamen Anfang 2025 nicht über 5–15 % hinaus.

Um die Rolle dieses Benchmarks im Ökosystem zu verstehen, siehe unseren Leitfaden zu LLM-Benchmarks 2025.

Bewertungsprotokoll: Was ARC-AGI 2 wirklich misst

Das offizielle Protokoll legt zwei Einschränkungen fest, die ARC-AGI 2 von den üblichen Benchmarks unterscheiden:

Der offizielle Score entspricht dem Prozentsatz der gelösten Aufgaben, wobei zwei Versuche erlaubt sind (pass@2). Das empfohlene Eingabeformat ist ein ASCII- oder JSON-Raster mit einer Farbcodierung von 0 bis 9. Das offizielles GitHub-Repository arc-prize/ARC-AGI-2 stellt die Evaluationsskripte, die Python-Test-Harnesses und die Referenz-Baselines bereit.

Drei Gruppen von Ansätzen dominieren die Open-Source-Einreichungen:

Test-Time-Training liefert derzeit die besten Ergebnisse, verbraucht aber 2- bis 10-mal so viele Tokens pro Aufgabe. Der Ansatz der Programmsynthese wurde vom MindsAI-Team mit seiner Einreichung von 2024 bekannt gemacht, die auf dem Arc-Prize-Blog.

Open-Source-Modelle zur Auswahl: VRAM und Lizenzen

Hier sind die Modelle aus dem Katalog quelllm.fr, die sich am besten eignen, um ein respektables Ergebnis beim ARC-AGI 2-Benchmark, sortiert nach Hardwareprofil.

Absolute Spitzenklasse (≥ 400 GB VRAM bei Q4) :

Mittelklasse, die sich auf Workstations betreiben lässt (60–250 GB Q4) :

Profil für Privatanwender (≤ 50 GB Q4) :

Die VRAM-Werte für Q4 sind Schätzungen auf Basis von GGUF Q4_K_M; bei Q8 ist mit dem 1,9-Fachen zu rechnen, bei FP16 mit dem 3,8-Fachen. Diese Zahlen müssen für die jeweils verwendete Laufzeitumgebung (llama.cpp, vLLM, SGLang) noch bestätigt werden.

Erwartete Leistung und Tokens pro Sekunde

Für diese Modelle liegen für Version 2 des Benchmarks noch keine konsolidierten offiziellen, öffentlich zugänglichen Ergebnisse vor — die Ranglisten ändern sich jeden Monat. Zur Orientierung: Die Rückmeldungen aus der Community zumArc Prize Leaderboard 2025 ordnen Modelle mit explizitem Schlussfolgern (R1, Ring-1T) bei pass@2 ohne TTT zwischen 8 % und 18 % ein, mit aggressivem Test-Time-Training sogar bei bis zu 25–35 %. Diese Zahlen müssen für die Q4-quantisierten Versionen noch bestätigt werden.

Zum Durchsatz auf einer Konfiguration mit 2× RTX 6000 Ada (insgesamt 96 GB VRAM) und llama.cpp:

Für detaillierte Vergleiche der Schlussfolgerungsfähigkeiten siehe DeepSeek R1 vs Llama 3.3 et die besten Reasoning-Modelle.

Praktische Umsetzung: ARC-AGI 2 lokal reproduzieren

Um einen Modell aus dem Katalog auf dem zu bewerten ARC-AGI 2-Benchmark, sieht der typische Workflow so aus:

  1. Das offizielle Repository klonen arc-prize/ARC-AGI-2 und die Python-Abhängigkeiten installieren.
  2. Das Modell über vLLM oder llama.cpp im OpenAI-kompatiblen Servermodus laden. Die vLLM-Dokumentation beinhaltet Modelle mit MoE-Technologie wie Qwen 3 235B-A22B.
  3. Jedes Raster als ASCII-Zeichenkette codieren und anschließend einen Prompt mit Few-Shot-Beispielen erstellen.
  4. Für Test-Time-Training einen LoRA-Adapter mit Rang 16–32 isolieren, der anhand der 2–5 Demonstrationen jeder Aufgabe trainiert wurde (zusätzlicher Zeitaufwand von 30–90 Sekunden pro Aufgabe). Die Bibliothek PEFT von HuggingFace deckt diesen Anwendungsfall ab.
  5. Bewerten mit dem Skript scoring.py bereitgestellt, der pass@1 und pass@2 berechnet.

Modelle mit langem Kontext wie MiMo V2.5 Pro (1 M Token) oder Llama 4 Maverick 400B (1 Mio. Tokens) ermöglichen es, zahlreiche Beispiele ohne Kürzung einzubinden, was bei Aufgaben mit kombinierten Regeln hilft.

Um Ihre Hardware zu dimensionieren, benötigen Sie das Konfigurator quelllm.fr berechnet den benötigten Grafikspeicher (VRAM) entsprechend der gewünschten Quantisierung.

Typische Fehler bei ARC-AGI 2 und Lösungsansätze

Die Analyse der fehlgeschlagenen Einreichungen im Repository arc-prize/ARC-AGI-2 zeigt drei Kategorien wiederkehrender Fehler bei Open-Source-LLMs auf:

Für alternative Ansätze zeigt die Arbeit des Greenblatt-Teams (sample-then-filter mit Claude Sonnet, siehe arXiv:2406.07394) zeigt, dass ein kleineres Modell durch massenhafte Generierung (1000+ Python-Programme mit Sample-and-Test) ein größeres Modell im Single-Shot-Verfahren übertreffen kann. Diese Logik lässt sich gut übertragen auf Qwen3-Coder-Next 80B-A3B, das bei der Programmsynthese hervorragende Leistungen erzielt.

Kurzer Vergleich mit ARC-AGI 1

ARC-AGI 1 (2019) war Ende 2024 durch hybride Lösungen mit Ergebnissen von über 55 % gesättigt. ARC-AGI 2 erhöht den Schwierigkeitsgrad bewusst wieder durch vier Änderungen:

Das Ergebnis: Die besten Einreichungen erreichen 2025 höchstens ~30 %, während sie bei v1 über 60 % erreichten. Zur Vertiefung siehe auch den Leitfaden zu LLM: Reasoning versus Mathematik und die Vergleichsseite DeepSeek R1 vs Ring-1T.

FAQ

F: Welches Open-Source-Modell erreicht Ende 2025 den besten ARC-AGI-2-Score?

Zum Zeitpunkt der Abfassung gibt es keine offizielle Rangliste, die die ersten drei Plätze unter den Open-Source-Modellen verbindlich festlegt. Die Einreichungen aus der Community platzieren DeepSeek R1 671B et Ring-1T dank ihres nativen Chain-of-Thought-Verfahrens an die Spitze. Die genauen Zahlen müssen noch bestätigt werden, da die Rangliste monatlich vom Arc-Prize-Team aktualisiert wird.

F: Ist ein Reasoning-Modell oder ein Allzweckmodell erforderlich?

Modelle mit explizitem Reasoning (R1, Ring-1T, gpt-oss 120B) übertreffen durchweg Allzweckmodelle mit vergleichbarer Parameterzahl. Bei ARC-AGI 2 wird der zusätzliche Aufwand an Reasoning-Tokens (oft ×3 bis ×10) durch den Zugewinn bei pass@2 mehr als ausgeglichen. Ein Llama 3.3 70B ist in der Standardversion weniger leistungsfähig als ein DeepSeek R1 Distill Llama 70B.

F: Wie viel VRAM ist mindestens nötig, um den Benchmark ernsthaft anzugehen?

Mit 40 GB VRAM (RTX 6000 Ada oder A6000) können Sie betreiben DeepSeek R1 Distill Llama 70B in Q4 ausführen und ein respektables Ergebnis anstreben. Um das Spitzenniveau im Open-Source-Bereich zu erreichen, sollten Sie insgesamt 250+ GB anpeilen (Multi-GPU oder aggressives CPU-Offloading) für Modelle wie Qwen 3 235B-A22B.

F: Bringt das Test-time Training einen echten Vorteil?

Ohne TTT, der LLM-Reasoning beruht ausschließlich auf In-Context-Inferenz. Mit einer schnellen LoRA, die auf den Demonstrationen der jeweiligen Aufgabe trainiert wurde, beobachtet man Verbesserungen von 8 bis 15 Prozentpunkten. Der Preis dafür sind um den Faktor 5 bis 10 höhere Rechenkosten und eine komplexere Implementierung. Bleiben Sie für einen ersten Test beim direkten Prompting.

F: Welche Lizenz für kommerziellen Gebrauch?

Bevorzugen Sie permissive Lizenzen. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B sind unter Apache 2.0 oder MIT lizenziert, ohne Einschränkungen der kommerziellen Nutzung. Vermeiden Sie Command R+ 104B unter CC-BY-NC 4.0 für ein kostenpflichtiges Produkt.

F: Wo finden sich die offiziellen Datensätze und Skripte?

Alles ist zentral verfügbar im GitHub-Repository arc-prize/ARC-AGI-2 und auf HuggingFace datasets/arc-prize. Das JSON-Format ist seit der ersten Iteration im Jahr 2019 dokumentiert und stabil.

Fazit

Le ARC-AGI 2-Benchmark wird 2026 einer der wenigen Tests bleiben, die gegen Kontamination und Auswendiglernen resistent sind. Das macht ihn zu einem wertvollen Werkzeug für alle, die das Schlussfolgerungsvermögen von Open-Source-LLMs objektiv vergleichen möchten. Bevor Sie eine Evaluierung starten, dimensionieren Sie Ihre GPUs präzise mit dem Konfigurator quelllm.fr oder durchsuchen Sie den komplettes Katalog um das Modell zu finden, das am besten zu Ihrem VRAM-Budget und Ihrer gewünschten Lizenz passt.

Artikel veröffentlicht am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.