Bestes LLM für 24 GB VRAM im Jahr 2026

Die Wahl des besten LLMs mit 24 GB VRAM hängt vor allem davon ab, wie Kontextlänge, Lizenz und Einsatzzweck zusammenpassen. Diese für eine RTX 3090 oder RTX 4090 typische Konfiguration ermöglicht den Zugriff auf Modelle mit 30 bis 40 Milliarden Parametern in Q4-Quantisierung. Dadurch verbessert sich das lokal verfügbare Schlussfolgerungsvermögen gegenüber einer GPU mit 12 oder 16 GB VRAM deutlich. Dieser Artikel stellt die Modelle vor, die tatsächlich in diesen Speicherrahmen passen, erläutert ihre Lizenzen und zeigt die Kompromisse auf, die vor der Auswahl zu berücksichtigen sind.

Welche Modelle passen in 24 GB bei Q4-Quantisierung

Bei 24 GB VRAM stehen nach Reservierung des KV-Caches zwischen 17 und 22 GB für die Modellgewichte zur Verfügung. Mehrere Modelle liegen knapp unter oder etwa an dieser Grenze:

Le Mixtral 8x7B von Mistral AI mit insgesamt 47 Milliarden Parametern (MoE-Architektur) benötigt in Q4 etwa 26 GB – etwas mehr als 24 GB. Daher ist häufig eine aggressivere Quantisierung (Q3) oder eine teilweise Auslagerung auf die CPU nötig, damit das Modell auf eine einzige Karte passt. Die detaillierten Spezifikationen der jeweiligen Anbieter finden Sie weiterhin auf Mistral AI auf Hugging Face et BSC auf Hugging Face für Salamandra.

RTX 3090 vs RTX 4090: erwarteter tatsächlicher Durchsatz

Beide Karten verfügen über 24 GB GDDR6X-VRAM, aber die RTX 4090 bietet eine höhere Speicherbandbreite und Rechenleistung. Bei einem Modell der Klasse 32–35B in Q4:

Diese Werte variieren stark je nach Inferenz-Engine — llama.cpp (offizielles GitHub-Repository) et Ollama (offizielles GitHub-Repository) bleiben die einfachsten Optionen für quantisierte GGUF-Modelle, während vLLM (Dokumentation) ist eher auf die Bereitstellung mit hohem Durchsatz und mehreren gleichzeitigen Anfragen ausgerichtet. Bei MoE-Modellen wie Qwen 3 30B-A3B oder Nemotron Nano 3 30B-A3Bist der Durchsatz in der Regel höher als bei einem dichten Modell gleicher Größe, da nur ein Bruchteil der Parameter pro Token aktiviert wird.

Lizenzen: Apache 2.0, CC-BY-NC und proprietäre Lizenzen

Die Wahl der Lizenz bestimmt die kommerzielle Nutzung:

Für ein Projekt, das für den kommerziellen Produktivbetrieb bestimmt ist, vermeidet die Wahl von Apache 2.0 oder MIT rechtliche Grauzonen durch Klauseln, die eine kommerzielle Nutzung ausschließen.

Anwendungsfälle: Schlussfolgern, Programmieren und Vielseitigkeit

Mit 24 GB VRAM zeichnen sich drei Nutzungsprofile ab:

Für eine direkte Vergleich zwischen zwei häufigen Kandidaten in dieser Klasse ist die Beschreibung Aya Expanse 32B vs Qwen 2.5 32B et DeepSeek R1 32B vs QwQ 32B zeigen die Unterschiede bei den Benchmark-Ergebnissen im direkten Vergleich detailliert auf.

Den verfügbaren Kontext mit dem KV-Cache optimieren

Ein Modell mit 32–35B in Q4 benötigt bereits 17 bis 22 GB VRAM allein für seine Gewichte. Der verbleibende Speicher für den KV-Cache begrenzt die tatsächlich nutzbare Kontextgröße, selbst wenn das Datenblatt einen maximalen Kontext von 128.000 oder 262.000 Tokens angibt. Um zu verstehen, wie sich durch die Quantisierung des Caches (Q8, Q4) mehrere GB einsparen lassen, ohne das Modell zu wechseln, lesen Sie den Leitfaden zur Quantisierung und zum KV-Cache und das Leitfaden zur Wahl der Quantisierung Q4/Q5/Q8.

FAQ

F: Welches Modell unter Apache 2.0 sollte man bei 24 GB für den kommerziellen Einsatz bevorzugen?

Seed-OSS 36B, Qwen 3.6 35B-A3B oder Qwen 2.5 32B Coder sind drei Optionen unter Apache 2.0, die in Q4 in 24 GB passen. Die Wahl hängt vom Bedarf ab: langer Kontext bei Seed-OSS, Code bei Qwen 2.5 Coder, MoE-Vielseitigkeit bei Qwen 3.6.

F: Passt Mixtral 8x7B wirklich in 24 GB?

Sein geschätzter Speicherbedarf von ~26 GB in Q4 überschreitet die verfügbaren 24 GB leicht. Eine Quantisierung mit weniger Bits (Q3) oder ein kürzerer Kontext reichen in der Regel aus, damit es in den Speicher passt, allerdings mit einem Qualitätsverlust, der im Einzelfall zu prüfen ist.

F: RTX 3090 oder RTX 4090 für diese Modelle?

Beide bieten die gleichen 24 GB VRAM und können daher Modelle im gleichen Umfang laden. Die RTX 4090 erreicht dank ihrer höheren Speicherbandbreite einen höheren Durchsatz in Tokens/sec (geschätzt), was für die Stapelverarbeitung oder lange Kontexte nützlich ist.

Q: Sind Command R 35B und Aya 23 35B in Unternehmen einsetzbar?

Ihre CC-BY-NC-4.0-Lizenz schränkt die kommerzielle Nutzung ohne gesonderte Vereinbarung mit Cohere ein. Für den Einsatz in einem Unternehmen ist ein Modell vergleichbarer Größe unter Apache 2.0 oder MIT vorzuziehen.

Q: Welches Tool verwendet man, um diese Modelle lokal zu nutzen?

llama.cpp (offizielles GitHub-Repository) et Ollama (offizielles GitHub-Repository) decken die Inferenz mit quantisierten GGUF-Modellen auf einer einzigen Karte ab. Für eine selbst gehostete Weboberfläche Open WebUI (offizielle GitHub-Seite) lässt sich auf dem einen oder dem anderen aufsetzen.

F: Sollte man 32 GB anstelle von 24 GB anstreben?

Der Wechsel zu 32 GB ermöglicht längere Kontexte und mehr Spielraum bei Modellen von 35-40B ohne Quantisierungskompromisse. Der Anleitung für 32 GB VRAM beschreibt im Detail, welche zusätzlichen Modelle mit dieser Speicherkapazität nutzbar sind.

Fazit

Le bestes LLM für 24 GB VRAM lässt sich nicht eindeutig bestimmen: Die Wahl hängt von der gewünschten Lizenz (Apache 2.0 für Seed-OSS 36B oder Qwen 3.6 35B-A3B, CC-BY-NC für Command R und Aya), vom Anwendungsfall (Programmierung, logisches Schlussfolgern, mehrsprachige Nutzung) und vom tatsächlich benötigten Kontext unter Berücksichtigung des KV-Caches ab. Der Konfigurator ermöglicht die automatische Kombination dieser Kriterien und der komplettes Katalog führt die 249 Modelle mit detaillierten VRAM-Spezifikationen für jede Quantisierung auf.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5090 bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Amazon RTX 5090 →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.