Bestes LLM für 24 GB VRAM im Jahr 2026
Die Wahl des besten LLMs mit 24 GB VRAM hängt vor allem davon ab, wie Kontextlänge, Lizenz und Einsatzzweck zusammenpassen. Diese für eine RTX 3090 oder RTX 4090 typische Konfiguration ermöglicht den Zugriff auf Modelle mit 30 bis 40 Milliarden Parametern in Q4-Quantisierung. Dadurch verbessert sich das lokal verfügbare Schlussfolgerungsvermögen gegenüber einer GPU mit 12 oder 16 GB VRAM deutlich. Dieser Artikel stellt die Modelle vor, die tatsächlich in diesen Speicherrahmen passen, erläutert ihre Lizenzen und zeigt die Kompromisse auf, die vor der Auswahl zu berücksichtigen sind.
Welche Modelle passen in 24 GB bei Q4-Quantisierung
Bei 24 GB VRAM stehen nach Reservierung des KV-Caches zwischen 17 und 22 GB für die Modellgewichte zur Verfügung. Mehrere Modelle liegen knapp unter oder etwa an dieser Grenze:
- Seed-OSS 36B Instruct : ~22 GB in Q4, Apache-2.0-Lizenz, außergewöhnlich großes Kontextfenster von 524.288 Tokens.
- Qwen 3.6 35B-A3B : ~21 GB in Q4, MoE-Architektur mit 3B aktiven Parametern, Kontext von 262.000 Tokens.
- Salamandra 40B Instruct : ~24 GB in Q4, an der oberen Grenze des Speicherbudgets, Lizenz Apache 2.0.
- Command R 35B v01 et Aya 23 35B : jeweils etwa 20 GB in Q4, unter der Lizenz CC-BY-NC 4.0 (nicht kommerzielle Nutzung).
- Yi 1.5 34B Chat : ca. 20 GB in Q4, Kontext begrenzt auf 4.096 Tokens.
Le Mixtral 8x7B von Mistral AI mit insgesamt 47 Milliarden Parametern (MoE-Architektur) benötigt in Q4 etwa 26 GB – etwas mehr als 24 GB. Daher ist häufig eine aggressivere Quantisierung (Q3) oder eine teilweise Auslagerung auf die CPU nötig, damit das Modell auf eine einzige Karte passt. Die detaillierten Spezifikationen der jeweiligen Anbieter finden Sie weiterhin auf Mistral AI auf Hugging Face et BSC auf Hugging Face für Salamandra.
RTX 3090 vs RTX 4090: erwarteter tatsächlicher Durchsatz
Beide Karten verfügen über 24 GB GDDR6X-VRAM, aber die RTX 4090 bietet eine höhere Speicherbandbreite und Rechenleistung. Bei einem Modell der Klasse 32–35B in Q4:
- RTX 3090 : geschätzter Durchsatz zwischen 12 und 20 Tokens/s, je nach Modell und verwendetem Inferenzmotor.
- RTX 4090 : geschätzter Durchsatz zwischen 18 und 30 Tokens pro Sekunde unter gleichen Bedingungen.
Diese Werte variieren stark je nach Inferenz-Engine — llama.cpp (offizielles GitHub-Repository) et Ollama (offizielles GitHub-Repository) bleiben die einfachsten Optionen für quantisierte GGUF-Modelle, während vLLM (Dokumentation) ist eher auf die Bereitstellung mit hohem Durchsatz und mehreren gleichzeitigen Anfragen ausgerichtet. Bei MoE-Modellen wie Qwen 3 30B-A3B oder Nemotron Nano 3 30B-A3Bist der Durchsatz in der Regel höher als bei einem dichten Modell gleicher Größe, da nur ein Bruchteil der Parameter pro Token aktiviert wird.
Lizenzen: Apache 2.0, CC-BY-NC und proprietäre Lizenzen
Die Wahl der Lizenz bestimmt die kommerzielle Nutzung:
- Apache 2.0 (freie kommerzielle Nutzung): Mixtral 8x7B, Salamandra 40B, Seed-OSS 36B, Qwen 3.6 35B-A3B, nahezu die gesamte Qwen-2.5/3-Reihe, Gemma 4 31B, OLMo 3 32B, Granite 4.0 H-Small.
- CC-BY-NC 4.0 (nicht kommerziell): Command R 35B v01, Aya 23 35B, Aya Expanse 32B, veröffentlicht von Cohere — siehe Cohere auf Hugging Face.
- MIT : DeepSeek R1 Distill 32B et DeepSeek R2 32B, ebenfalls sehr liberal.
- Spezifische proprietäre Lizenzen : EXAONE 4.5 33B (EXAONE AI Model License, eingeschränkte Nutzung) und Nemotron 3 33B (NVIDIA Open Model License).
Für ein Projekt, das für den kommerziellen Produktivbetrieb bestimmt ist, vermeidet die Wahl von Apache 2.0 oder MIT rechtliche Grauzonen durch Klauseln, die eine kommerzielle Nutzung ausschließen.
Anwendungsfälle: Schlussfolgern, Programmieren und Vielseitigkeit
Mit 24 GB VRAM zeichnen sich drei Nutzungsprofile ab:
- Langes Reasoning : QwQ 32B und DeepSeek R1 Distill 32B sind auf Aufgaben mit komplexen logischen Schlussfolgerungsketten ausgerichtet, wobei üblicherweise Ergebnisse für AIME und MMLU in den öffentlichen Benchmarks des Open LLM Leaderboard (Hugging Face).
- Code : Qwen 2.5 Coder 32B bleibt bei HumanEval eine Referenz in dieser Größenklasse; Qwen3-Coder 30B-A3B bietet ein auf 262.144 Tokens erweitertes Kontextfenster für die Analyse umfangreicher Repositories.
- Mehrsprachig und vielseitig einsetzbar : Aya 23 35B und Aya Expanse 32B zielen explizit auf die multilinguale Abdeckung ab, während Jais 30B Chat v3 spezialisiert sich auf Arabisch.
Für eine direkte Vergleich zwischen zwei häufigen Kandidaten in dieser Klasse ist die Beschreibung Aya Expanse 32B vs Qwen 2.5 32B et DeepSeek R1 32B vs QwQ 32B zeigen die Unterschiede bei den Benchmark-Ergebnissen im direkten Vergleich detailliert auf.
Den verfügbaren Kontext mit dem KV-Cache optimieren
Ein Modell mit 32–35B in Q4 benötigt bereits 17 bis 22 GB VRAM allein für seine Gewichte. Der verbleibende Speicher für den KV-Cache begrenzt die tatsächlich nutzbare Kontextgröße, selbst wenn das Datenblatt einen maximalen Kontext von 128.000 oder 262.000 Tokens angibt. Um zu verstehen, wie sich durch die Quantisierung des Caches (Q8, Q4) mehrere GB einsparen lassen, ohne das Modell zu wechseln, lesen Sie den Leitfaden zur Quantisierung und zum KV-Cache und das Leitfaden zur Wahl der Quantisierung Q4/Q5/Q8.
FAQ
F: Welches Modell unter Apache 2.0 sollte man bei 24 GB für den kommerziellen Einsatz bevorzugen?
Seed-OSS 36B, Qwen 3.6 35B-A3B oder Qwen 2.5 32B Coder sind drei Optionen unter Apache 2.0, die in Q4 in 24 GB passen. Die Wahl hängt vom Bedarf ab: langer Kontext bei Seed-OSS, Code bei Qwen 2.5 Coder, MoE-Vielseitigkeit bei Qwen 3.6.
F: Passt Mixtral 8x7B wirklich in 24 GB?
Sein geschätzter Speicherbedarf von ~26 GB in Q4 überschreitet die verfügbaren 24 GB leicht. Eine Quantisierung mit weniger Bits (Q3) oder ein kürzerer Kontext reichen in der Regel aus, damit es in den Speicher passt, allerdings mit einem Qualitätsverlust, der im Einzelfall zu prüfen ist.
F: RTX 3090 oder RTX 4090 für diese Modelle?
Beide bieten die gleichen 24 GB VRAM und können daher Modelle im gleichen Umfang laden. Die RTX 4090 erreicht dank ihrer höheren Speicherbandbreite einen höheren Durchsatz in Tokens/sec (geschätzt), was für die Stapelverarbeitung oder lange Kontexte nützlich ist.
Q: Sind Command R 35B und Aya 23 35B in Unternehmen einsetzbar?
Ihre CC-BY-NC-4.0-Lizenz schränkt die kommerzielle Nutzung ohne gesonderte Vereinbarung mit Cohere ein. Für den Einsatz in einem Unternehmen ist ein Modell vergleichbarer Größe unter Apache 2.0 oder MIT vorzuziehen.
Q: Welches Tool verwendet man, um diese Modelle lokal zu nutzen?
llama.cpp (offizielles GitHub-Repository) et Ollama (offizielles GitHub-Repository) decken die Inferenz mit quantisierten GGUF-Modellen auf einer einzigen Karte ab. Für eine selbst gehostete Weboberfläche Open WebUI (offizielle GitHub-Seite) lässt sich auf dem einen oder dem anderen aufsetzen.
F: Sollte man 32 GB anstelle von 24 GB anstreben?
Der Wechsel zu 32 GB ermöglicht längere Kontexte und mehr Spielraum bei Modellen von 35-40B ohne Quantisierungskompromisse. Der Anleitung für 32 GB VRAM beschreibt im Detail, welche zusätzlichen Modelle mit dieser Speicherkapazität nutzbar sind.
Fazit
Le bestes LLM für 24 GB VRAM lässt sich nicht eindeutig bestimmen: Die Wahl hängt von der gewünschten Lizenz (Apache 2.0 für Seed-OSS 36B oder Qwen 3.6 35B-A3B, CC-BY-NC für Command R und Aya), vom Anwendungsfall (Programmierung, logisches Schlussfolgern, mehrsprachige Nutzung) und vom tatsächlich benötigten Kontext unter Berücksichtigung des KV-Caches ab. Der Konfigurator ermöglicht die automatische Kombination dieser Kriterien und der komplettes Katalog führt die 249 Modelle mit detaillierten VRAM-Spezifikationen für jede Quantisierung auf.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5090 bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.