Fortgeschritten 11 Min.Nach VRAM

Welcher LLM für 32 GB VRAM? ?

Direkte Antwort

Mit 32 GB VRAM können Sie ein dichtes Modell mit 27 bis 32B Parametern in Q4 (16 bis 20 GB) mit langem Kontext vollständig laden, ebenso ein MoE mit 30–35B Parametern (19 bis 21 GB) oder gpt-oss-20b (14 GB) mit viel Spielraum. Ein 70B-Modell passt hingegen nicht vollständig hinein: Es benötigt 40 bis 43 GB in Q4 und muss daher zwangsläufig teilweise im Arbeitsspeicher liegen, wo die Geschwindigkeit einbricht. Rechnen Sie den Kontextcache immer zusätzlich zu den Modellgewichten ein.

32 GB VRAM sind die Schwelle, ab der man nicht mehr zwischen Modellgröße und Kontextlänge wählen muss. Diese Seite zeigt, was tatsächlich in den Speicher passt, was sich je nach Karte (RTX 5090 oder Radeon AI PRO R9700) ändert, warum ein 70B- oder 123B-Modell auch damit nicht komfortabel nutzbar wird und wann ein Mac mit gemeinsamem Arbeitsspeicher oder eine zweite Karte der bessere Kauf ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#32 GB VRAM: Was die höhere Kapazität gegenüber 24 GB verändert

Ein Modell in Q4 benötigt etwa 0,6 GB pro Milliarde Parameter, zuzüglich des Kontext-Caches, der mit der Länge des Gesprächs wächst. In 24 GB passt ein dichtes Modell mit 27 bis 32 Milliarden Parametern in Q4 (16 bis 20 GB), aber der Kontext muss kurz bleiben. Bei 32 GB bleiben 12 bis 16 GB für den Kontext, die Aktivierungen und das System: Dieses Speicherbudget ermöglicht Kontextfenster von 32.000 bis 128.000 Tokens bei einem 27B-Modell oder ein MoE-Modell mit 30 bis 35 Milliarden Parametern mit komfortablem Spielraum.

32-GB-Speicherbudget für einige gängige Modelle (Modellgröße in Q4, ohne Kontext)
ModellQ4-GewichteVerbleibt für Kontext und SystemFazit
gpt-oss-20b14 GB18 GBSehr viel Spielraum, langer Kontext
Qwen 3.5 27B / Qwen 3.8 27B16 GB16 GBKomfortabel, langer Kontext möglich
Gemma 4 31B18 GB14 GBKomfortabel
Qwen 3 32B19-20 GB12 GBGut, Kontext im Blick behalten
Qwen3-Coder 30B-A3B (MoE)19 GB13 GBGut, sehr schnell für seine Größe
Qwen 3.6 35B-A3B (MoE)21 GB11 GBGut, mittlerer Kontext
Llama 3.3 70B43 GBnegativPasst nicht in den Speicher: Offloading erforderlich

Diese Werte sind Dateigrößen, nicht der gesamte Speicherbedarf: Der Rechner dieser Website rechnet den Cache für das jeweilige Modell und den jeweiligen Kontext hinzu. Der Cache kann auch mit q8_0 quantisiert werden. Laut der FAQ von Ollama halbiert das seine Größe gegenüber f16 ungefähr, sofern Flash Attention aktiviert ist.

#Welche Karten bieten 32 GB an und warum ist die Bandbreite von Bedeutung?

Zwei Desktop-Karten stechen hervor. Die GeForce RTX 5090 verfügt über 32 GB GDDR7 mit einem 512-Bit-Bus und laut NVIDIA einer Bandbreite von 1.792 GB/s. Die Radeon AI PRO R9700 von AMD bietet ebenfalls 32 GB, allerdings GDDR6 mit einem 256-Bit-Bus und laut AMD einer Bandbreite von 640 GB/s, für den professionellen Einsatz in einem Desktop-Computer. Die Kapazität ist identisch; die Generierungsgeschwindigkeit ist es nicht.

Zwei Karten mit 32 GB: gleiche Kapazität, sehr unterschiedlicher theoretischer Durchsatz
KarteSpeicherBandbreiteObergrenze für ein Modell von 19 GB
GeForce RTX 509032 GB GDDR7, 512 Bit1 792 GB/setwa 94 t/s
Radeon AI PRO R970032 GB GDDR6, 256 Bit640 GB/setwa 34 t/s

Die theoretische Obergrenze wird berechnet, indem die Bandbreite durch die bei jedem Token gelesene Menge an Modellgewichten geteilt wird; sie wird nie vollständig erreicht, doch das Verhältnis bleibt gültig: Bei gleichem Modell generiert die RTX 5090 mehr als doppelt so schnell wie die R9700. Bei einer AMD-Karte spielen auch der Treiber und der Softwarestack (ROCm, Vulkan) eine Rolle; der Leitfaden zu AMD-Karten erläutert die Grenzen. Die einzelnen Karten haben eigene Seiten: Die Seite zur RTX 5090 enthält die Details zur Karte.

Zwei weitere Wege führen zu 32 GB. Mit llama.cpp lässt sich ein Modell auf zwei Karten mit jeweils 16 GB aufteilen, aber die PCIe-Verbindung verlangsamt den Datenaustausch, und das Modell muss sich sauber aufteilen lassen; der Multi-GPU-Leitfaden zeigt die Methode. Ein Mac mit 32 GB oder mehr gemeinsamem Speicher (Unified Memory) ist eine dritte Option, mit geringerer Bandbreite, aber ohne die Beschränkung durch einen dedizierten VRAM.

Die Preise ändern sich schnell: Die Preisbeobachtung der Website erfasst jeden Montag und jeden Donnerstag den niedrigsten Preis für Grafikkarten für lokale KI sowie den Preis pro GB VRAM.

#Empfohlene Modelle für 32 GB

Dichte Modelle mit 27B bis 32B Parametern
Die Qualitätsauswahl: Qwen 3.5 27B oder 3.8 27B (16 GB bei Q4), Gemma 4 31B (18 GB), Qwen 3 32B (19 bis 20 GB). Sie ermöglichen einen langen Kontext und eignen sich gut für feinere Quantisierungen (Q5, Q6), wenn Sie eine höhere Qualität wünschen.
MoE 30-35B
Qwen3-Coder 30B-A3B (19 GB) und Qwen 3.6 35B-A3B (21 GB) aktivieren pro Token nur etwa 3 Milliarden Parameter: Sie bieten die höchste Geschwindigkeit für ihre Größe und sind die richtige Wahl für Code und Agenten.
gpt-oss-20b
14 GB in der Ollama-Bibliothek; laut Ollama-Seite kann das Modell auf Systemen mit mindestens 16 GB Speicher laufen. Bei 32 GB bleibt Platz für einen enormen Kontext, und ein zweites Modell kann gleichzeitig geladen bleiben.
24B-Code-Modell
Devstral Small 2 24B (14 GB): ein Spezialist für Code-Agenten, der Platz für zwei gleichzeitig im Speicher gehaltene Modelle lässt.

Stellen Sie sich zur Auswahl drei Fragen. Muss das Modell mit einem langen Kontext umgehen können (Dokumente, Code-Repository)? Wählen Sie ein dichtes 27B-Modell in Q4, das 16 GB für den Cache übrig lässt. Brauchen Sie Geschwindigkeit (Agenten, Toolschleifen)? Dann ein MoE-Modell. Möchten Sie einfach eine höhere Qualität als mit 24 GB? Wechseln Sie bei einem 27B- bis 32B-Modell von Q4 zu Q6: Der Platz ist vorhanden.

#Prüfen, ob das Modell tatsächlich auf die Karte passt

Ein Modell, das „geladen wird“, befindet sich nicht unbedingt vollständig auf der GPU. Wenn der VRAM nicht ausreicht, verteilt Ollama die Schichten unbemerkt zwischen der Grafikkarte und dem Arbeitsspeicher, und die Geschwindigkeit sinkt ohne Fehlermeldung. Laut der offiziellen FAQ zeigt der Befehl ollama ps in der Spalte Processor an, wo das Modell geladen wurde: 100 % GPU bedeutet, dass es sich vollständig auf der GPU befindet; eine Verteilung wie 30 %/70 % CPU/GPU zeigt eine teilweise Auslagerung in den Arbeitsspeicher an.

  1. 01
    Modell mit dem beabsichtigten Kontext laden
    Starten Sie das Modell mit der Kontextgröße, die Sie tatsächlich für Ihren Einsatz benötigen, nicht mit dem Standardwert: Der Kontextcache führt dazu, dass der verfügbare Speicher nicht mehr ausreicht.
  2. 02
    Die Spalte Processor lesen
    Führen Sie ollama ps in einem anderen Terminal aus. Streben Sie 100 % GPU an; jeder CPU-Anteil verringert die Geschwindigkeit.
  3. 03
    Bei Bedarf reduzieren
    Wenn das Modell nicht in den verfügbaren VRAM passt, reduzieren Sie den Kontext, aktivieren Sie die Cache-Quantisierung in q8_0 mit Flash Attention oder wechseln Sie zu einer speichersparenderen Quantisierung.
  4. 04
    Den verbleibenden VRAM prüfen
    Unter Windows oder Linux zeigt nvidia-smi den verwendeten Speicher an; halten Sie ein bis zwei GB als Reserve für die Bildschirmausgabe und Spitzen im Speicherbedarf frei.
  5. 05
    Anhand Ihrer tatsächlichen Nutzung messen
    Vergleichen Sie die Geschwindigkeit mit einem kurzen Prompt und mit Ihrem echten Prompt: Der zweite Wert ist entscheidend.
!
Die Falle des Standardkontexts
Laut seiner FAQ verwendet Ollama standardmäßig ein Kontextfenster von 4.096 Tokens. Mit dieser Einstellung kann es so aussehen, als würde ein Modell in den VRAM passen, und dessen Kapazität dennoch überschreiten, sobald Sie das Kontextfenster auf 32.000 Tokens erhöhen, um ein Dokument zu analysieren. Testen Sie immer mit dem Kontext, den Sie benötigen.

#70B und 123B: Warum Offloading diese Modelle nicht nutzbar macht

Llama 3.3 70B ist in der Ollama-Bibliothek 43 GB groß, Mistral Large 123B 73 GB. Bei 32 GB VRAM müssen daher mindestens 11 GB für das 70B-Modell und 41 GB für das 123B-Modell im Arbeitsspeicher verbleiben. Bei jedem Token liest die CPU diese Schichten mit der Geschwindigkeit des Systemspeichers: maximal etwa 102 GB/s bei DDR5-6400 im Zweikanalbetrieb (6.400 MT/s × 8 Bytes × 2). Geteilt durch 41 GB ergibt sich für das 123B-Modell eine Obergrenze von etwa 2,5 Tokens pro Sekunde; für das 70B-Modell mit 11 GB im RAM sind es etwa 9 Tokens pro Sekunde. Das sind Obergrenzen, keine Messwerte: Sie zeigen vor allem, dass der Durchsatz nicht kontinuierlich, sondern stufenweise abnimmt, sobald die Schichten die Grafikkarte verlassen.

Was ein Modell leistet, das die 32 GB VRAM überschreitet (Berechnung anhand des Systemspeichers)
ModellGröße in OllamaAnteil im System-RAMRAM-Grenze (102 GB/s)
Llama 3.3 70B43 GBetwa 11 GB (34 %)etwa 9 Tokens/s
Mistral Large 123B73 GBetwa 41 GB (56 %)etwa 2,5 Tokens/s

Diese Berechnung setzt voraus, dass die Karte 32 GB Modellgewichte im VRAM hält; in der Praxis benötigt auch der Kontextcache Platz, sodass mehr Modellgewichte in den RAM ausgelagert werden und die Obergrenze sinkt. MoE-Modelle verhalten sich besser: llama.cpp bietet für Konfigurationen, die das Modell nicht vollständig auf die GPU laden können, eine Option, um die Experten bestimmter Schichten auf der CPU zu belassen (--n-cpu-moe). Damit lässt sich ein Modell betreiben, das nicht vollständig in den GPU-Speicher passt, aber ein Nutzer des llama.cpp-Repositorys berichtet von einem Geschwindigkeitsverlust von etwa 80 %, wenn alle Experten auf der CPU liegen: Das ist eine Lösung für den äußersten Notfall.

Ein zu großes MoE-Modell: Experten auf der CPU belassen (llama.cpp)
llama-server -m modele-moe.gguf -ngl 99 -fa --n-cpu-moe 12 -c 16384

Der Wert von --n-cpu-moe hängt von Ihrem Speicher ab; Sie müssen ihn durch Ausprobieren ermitteln. Für ein dichtes 70B-Modell ist bei 32 GB fast immer ein kleineres Modell oder mehr Speicher die richtige Lösung, nicht Offloading.

#Ein Modell mit 32 GB feinabstimmen: Was funktioniert und was nicht

Beim Fine-Tuning mit QLoRA bleiben die Modellgewichte in 4 Bit, und nur kleine Adapter werden trainiert. Allein die Gewichte eines 70B-Modells belegen bereits 40 GB, daher passt QLoRA-Training eines 70B-Modells nicht in 32 GB. Ein 32B-Modell in 4 Bit belegt etwa 19 bis 20 GB: Es bleiben 12 GB für die Aktivierungen, den Optimierer und die Adapter. Das ist mit einem kurzen Kontext und einer Batchgröße von 1 machbar, allerdings ohne Sicherheitsreserve. Ein Modell mit 7 bis 14 Milliarden Parametern lässt sich komfortabel trainieren. Das sind Größenordnungen, die Sie in dem von Ihnen verwendeten Tool bestätigen müssen.

#32 GB VRAM oder eine andere Lösung: Die Entscheidungstabelle

Die passende Wahl für Ihren Bedarf
BedarfLösungWarum
Dichte Modelle mit 27–32 Milliarden Parametern, langer Kontext, maximale GeschwindigkeitNVIDIA-Karte mit 32 GBHohe Bandbreite, CUDA-Ökosystem
Gleiche Kapazität bei geringerer elektrischer LeistungsaufnahmeRadeon AI PRO R9700Ebenfalls 32 GB, geringerer theoretischer Durchsatz
Modelle ab 64 GB, gelegentliche NutzungMac mit mindestens 64 GB vereinheitlichtem SpeicherSpeicherkapazität ohne Offload, geringere Geschwindigkeit
Begrenztes Budget, 30B-MoEOft reicht eine Karte mit 24 GB ausDas MoE-Modell mit 19 GB passt bei moderatem Kontext in den Speicher

#Häufig gestellte Fragen

FAQ
Welcher LLM eignet sich am besten für 32 GB VRAM?+
Für die Qualität: ein dichtes Modell mit 27 bis 32 Milliarden Parametern in Q4 (Qwen 3.5 oder 3.8 27B, Gemma 4 31B, Qwen 3 32B) mit langem Kontext. Für Geschwindigkeit und Code: ein MoE-Modell mit 30 bis 35 Milliarden Parametern wie Qwen3-Coder 30B-A3B. Kein Modell ist grundsätzlich das beste: Aufgabe und Sprache entscheiden.
Reichen 32 GB VRAM für Mistral Large 123B?+
Nein. Die Ollama-Bibliothek gibt für Mistral Large 123B 73 GB an. Mehr als 40 GB müssten im Arbeitsspeicher verbleiben, dessen Lesebandbreite auf etwa 100 GB/s begrenzt ist. Daraus ergibt sich eine theoretische Obergrenze von 2 bis 3 Tokens pro Sekunde. Das ist für die Verarbeitung im Hintergrund nutzbar, nicht für einen Chat.
RTX 5090 oder Mac Studio mit 64 GB für die lokale KI?+
Die Grafikkarte für die Geschwindigkeit: 1 792 GB/s gegenüber einigen Hundert GB/s bei einem Mac, für Modelle, die in 32 GB Speicher passen. Der Mac für die Kapazität: Ein Modell mit 40 bis 50 GB passt dort ohne Offloading in den Speicher, läuft aber langsamer. Wählen Sie je nach Größe der Modelle, die Sie laden.
Ist eine zweite Karte mit 16 GB einer Karte mit 32 GB gleichwertig?+
Zwei Karten mit jeweils 16 GB ergeben zusammen 32 GB, aber das Modell wird auf beide verteilt, und die PCIe-Verbindung verlangsamt den Datenaustausch; die Verteilung erfordert zudem Konfigurationsarbeit in llama.cpp. Eine Karte mit 32 GB ist bei gleicher Gesamtkapazität einfacher und schneller, es sei denn, Sie besitzen bereits eine der beiden Karten.
Kann man mit 32 GB zwei Modelle gleichzeitig laden?+
Ja, beispielsweise gpt-oss-20b (14 GB) und Devstral Small 2 24B (14 GB), also insgesamt 28 GB Modellgewichte, mit kurzem Kontext. Ollama hält die Modelle standardmäßig fünf Minuten im Speicher und kann mehrere gleichzeitig dort halten, wenn der Speicher ausreicht; behalten Sie den Kontextcache im Blick, der bei jedem Modell zusätzlich Speicher belegt.
Welche Quantisierung sollte man bei 32 GB wählen?+
Q4_K_M bleibt der beste Kompromiss für dichte Modelle mit 27 bis 32 Milliarden Parametern. Wenn Sie noch Spielraum haben (Modellgewichte von 14 bis 16 GB), wechseln Sie zu Q5 oder Q6, um die Qualität zu verbessern. Gehen Sie nur dann unter Q4, wenn ein zu großes Modell sonst nicht in den Speicher passt, und nehmen Sie dabei einen Qualitätsverlust in Kauf.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.