Welcher LLM für 32 GB VRAM? ?
Mit 32 GB VRAM können Sie ein dichtes Modell mit 27 bis 32B Parametern in Q4 (16 bis 20 GB) mit langem Kontext vollständig laden, ebenso ein MoE mit 30–35B Parametern (19 bis 21 GB) oder gpt-oss-20b (14 GB) mit viel Spielraum. Ein 70B-Modell passt hingegen nicht vollständig hinein: Es benötigt 40 bis 43 GB in Q4 und muss daher zwangsläufig teilweise im Arbeitsspeicher liegen, wo die Geschwindigkeit einbricht. Rechnen Sie den Kontextcache immer zusätzlich zu den Modellgewichten ein.
32 GB VRAM sind die Schwelle, ab der man nicht mehr zwischen Modellgröße und Kontextlänge wählen muss. Diese Seite zeigt, was tatsächlich in den Speicher passt, was sich je nach Karte (RTX 5090 oder Radeon AI PRO R9700) ändert, warum ein 70B- oder 123B-Modell auch damit nicht komfortabel nutzbar wird und wann ein Mac mit gemeinsamem Arbeitsspeicher oder eine zweite Karte der bessere Kauf ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#32 GB VRAM: Was die höhere Kapazität gegenüber 24 GB verändert
Ein Modell in Q4 benötigt etwa 0,6 GB pro Milliarde Parameter, zuzüglich des Kontext-Caches, der mit der Länge des Gesprächs wächst. In 24 GB passt ein dichtes Modell mit 27 bis 32 Milliarden Parametern in Q4 (16 bis 20 GB), aber der Kontext muss kurz bleiben. Bei 32 GB bleiben 12 bis 16 GB für den Kontext, die Aktivierungen und das System: Dieses Speicherbudget ermöglicht Kontextfenster von 32.000 bis 128.000 Tokens bei einem 27B-Modell oder ein MoE-Modell mit 30 bis 35 Milliarden Parametern mit komfortablem Spielraum.
| Modell | Q4-Gewichte | Verbleibt für Kontext und System | Fazit |
|---|---|---|---|
| gpt-oss-20b | 14 GB | 18 GB | Sehr viel Spielraum, langer Kontext |
| Qwen 3.5 27B / Qwen 3.8 27B | 16 GB | 16 GB | Komfortabel, langer Kontext möglich |
| Gemma 4 31B | 18 GB | 14 GB | Komfortabel |
| Qwen 3 32B | 19-20 GB | 12 GB | Gut, Kontext im Blick behalten |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 13 GB | Gut, sehr schnell für seine Größe |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 11 GB | Gut, mittlerer Kontext |
| Llama 3.3 70B | 43 GB | negativ | Passt nicht in den Speicher: Offloading erforderlich |
Diese Werte sind Dateigrößen, nicht der gesamte Speicherbedarf: Der Rechner dieser Website rechnet den Cache für das jeweilige Modell und den jeweiligen Kontext hinzu. Der Cache kann auch mit q8_0 quantisiert werden. Laut der FAQ von Ollama halbiert das seine Größe gegenüber f16 ungefähr, sofern Flash Attention aktiviert ist.
#Welche Karten bieten 32 GB an und warum ist die Bandbreite von Bedeutung?
Zwei Desktop-Karten stechen hervor. Die GeForce RTX 5090 verfügt über 32 GB GDDR7 mit einem 512-Bit-Bus und laut NVIDIA einer Bandbreite von 1.792 GB/s. Die Radeon AI PRO R9700 von AMD bietet ebenfalls 32 GB, allerdings GDDR6 mit einem 256-Bit-Bus und laut AMD einer Bandbreite von 640 GB/s, für den professionellen Einsatz in einem Desktop-Computer. Die Kapazität ist identisch; die Generierungsgeschwindigkeit ist es nicht.
| Karte | Speicher | Bandbreite | Obergrenze für ein Modell von 19 GB |
|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7, 512 Bit | 1 792 GB/s | etwa 94 t/s |
| Radeon AI PRO R9700 | 32 GB GDDR6, 256 Bit | 640 GB/s | etwa 34 t/s |
Die theoretische Obergrenze wird berechnet, indem die Bandbreite durch die bei jedem Token gelesene Menge an Modellgewichten geteilt wird; sie wird nie vollständig erreicht, doch das Verhältnis bleibt gültig: Bei gleichem Modell generiert die RTX 5090 mehr als doppelt so schnell wie die R9700. Bei einer AMD-Karte spielen auch der Treiber und der Softwarestack (ROCm, Vulkan) eine Rolle; der Leitfaden zu AMD-Karten erläutert die Grenzen. Die einzelnen Karten haben eigene Seiten: Die Seite zur RTX 5090 enthält die Details zur Karte.
Zwei weitere Wege führen zu 32 GB. Mit llama.cpp lässt sich ein Modell auf zwei Karten mit jeweils 16 GB aufteilen, aber die PCIe-Verbindung verlangsamt den Datenaustausch, und das Modell muss sich sauber aufteilen lassen; der Multi-GPU-Leitfaden zeigt die Methode. Ein Mac mit 32 GB oder mehr gemeinsamem Speicher (Unified Memory) ist eine dritte Option, mit geringerer Bandbreite, aber ohne die Beschränkung durch einen dedizierten VRAM.
Die Preise ändern sich schnell: Die Preisbeobachtung der Website erfasst jeden Montag und jeden Donnerstag den niedrigsten Preis für Grafikkarten für lokale KI sowie den Preis pro GB VRAM.
- Preisverfolgung für Grafikkarten im Bereich der lokalen KI
- LLM auf RTX 5090
- Multi-GPU-Setup mit llama.cpp
#Empfohlene Modelle für 32 GB
- Dichte Modelle mit 27B bis 32B Parametern
- Die Qualitätsauswahl: Qwen 3.5 27B oder 3.8 27B (16 GB bei Q4), Gemma 4 31B (18 GB), Qwen 3 32B (19 bis 20 GB). Sie ermöglichen einen langen Kontext und eignen sich gut für feinere Quantisierungen (Q5, Q6), wenn Sie eine höhere Qualität wünschen.
- MoE 30-35B
- Qwen3-Coder 30B-A3B (19 GB) und Qwen 3.6 35B-A3B (21 GB) aktivieren pro Token nur etwa 3 Milliarden Parameter: Sie bieten die höchste Geschwindigkeit für ihre Größe und sind die richtige Wahl für Code und Agenten.
- gpt-oss-20b
- 14 GB in der Ollama-Bibliothek; laut Ollama-Seite kann das Modell auf Systemen mit mindestens 16 GB Speicher laufen. Bei 32 GB bleibt Platz für einen enormen Kontext, und ein zweites Modell kann gleichzeitig geladen bleiben.
- 24B-Code-Modell
- Devstral Small 2 24B (14 GB): ein Spezialist für Code-Agenten, der Platz für zwei gleichzeitig im Speicher gehaltene Modelle lässt.
Stellen Sie sich zur Auswahl drei Fragen. Muss das Modell mit einem langen Kontext umgehen können (Dokumente, Code-Repository)? Wählen Sie ein dichtes 27B-Modell in Q4, das 16 GB für den Cache übrig lässt. Brauchen Sie Geschwindigkeit (Agenten, Toolschleifen)? Dann ein MoE-Modell. Möchten Sie einfach eine höhere Qualität als mit 24 GB? Wechseln Sie bei einem 27B- bis 32B-Modell von Q4 zu Q6: Der Platz ist vorhanden.
#Prüfen, ob das Modell tatsächlich auf die Karte passt
Ein Modell, das „geladen wird“, befindet sich nicht unbedingt vollständig auf der GPU. Wenn der VRAM nicht ausreicht, verteilt Ollama die Schichten unbemerkt zwischen der Grafikkarte und dem Arbeitsspeicher, und die Geschwindigkeit sinkt ohne Fehlermeldung. Laut der offiziellen FAQ zeigt der Befehl ollama ps in der Spalte Processor an, wo das Modell geladen wurde: 100 % GPU bedeutet, dass es sich vollständig auf der GPU befindet; eine Verteilung wie 30 %/70 % CPU/GPU zeigt eine teilweise Auslagerung in den Arbeitsspeicher an.
- 01Modell mit dem beabsichtigten Kontext ladenStarten Sie das Modell mit der Kontextgröße, die Sie tatsächlich für Ihren Einsatz benötigen, nicht mit dem Standardwert: Der Kontextcache führt dazu, dass der verfügbare Speicher nicht mehr ausreicht.
- 02Die Spalte Processor lesenFühren Sie ollama ps in einem anderen Terminal aus. Streben Sie 100 % GPU an; jeder CPU-Anteil verringert die Geschwindigkeit.
- 03Bei Bedarf reduzierenWenn das Modell nicht in den verfügbaren VRAM passt, reduzieren Sie den Kontext, aktivieren Sie die Cache-Quantisierung in q8_0 mit Flash Attention oder wechseln Sie zu einer speichersparenderen Quantisierung.
- 04Den verbleibenden VRAM prüfenUnter Windows oder Linux zeigt nvidia-smi den verwendeten Speicher an; halten Sie ein bis zwei GB als Reserve für die Bildschirmausgabe und Spitzen im Speicherbedarf frei.
- 05Anhand Ihrer tatsächlichen Nutzung messenVergleichen Sie die Geschwindigkeit mit einem kurzen Prompt und mit Ihrem echten Prompt: Der zweite Wert ist entscheidend.
#70B und 123B: Warum Offloading diese Modelle nicht nutzbar macht
Llama 3.3 70B ist in der Ollama-Bibliothek 43 GB groß, Mistral Large 123B 73 GB. Bei 32 GB VRAM müssen daher mindestens 11 GB für das 70B-Modell und 41 GB für das 123B-Modell im Arbeitsspeicher verbleiben. Bei jedem Token liest die CPU diese Schichten mit der Geschwindigkeit des Systemspeichers: maximal etwa 102 GB/s bei DDR5-6400 im Zweikanalbetrieb (6.400 MT/s × 8 Bytes × 2). Geteilt durch 41 GB ergibt sich für das 123B-Modell eine Obergrenze von etwa 2,5 Tokens pro Sekunde; für das 70B-Modell mit 11 GB im RAM sind es etwa 9 Tokens pro Sekunde. Das sind Obergrenzen, keine Messwerte: Sie zeigen vor allem, dass der Durchsatz nicht kontinuierlich, sondern stufenweise abnimmt, sobald die Schichten die Grafikkarte verlassen.
| Modell | Größe in Ollama | Anteil im System-RAM | RAM-Grenze (102 GB/s) |
|---|---|---|---|
| Llama 3.3 70B | 43 GB | etwa 11 GB (34 %) | etwa 9 Tokens/s |
| Mistral Large 123B | 73 GB | etwa 41 GB (56 %) | etwa 2,5 Tokens/s |
Diese Berechnung setzt voraus, dass die Karte 32 GB Modellgewichte im VRAM hält; in der Praxis benötigt auch der Kontextcache Platz, sodass mehr Modellgewichte in den RAM ausgelagert werden und die Obergrenze sinkt. MoE-Modelle verhalten sich besser: llama.cpp bietet für Konfigurationen, die das Modell nicht vollständig auf die GPU laden können, eine Option, um die Experten bestimmter Schichten auf der CPU zu belassen (--n-cpu-moe). Damit lässt sich ein Modell betreiben, das nicht vollständig in den GPU-Speicher passt, aber ein Nutzer des llama.cpp-Repositorys berichtet von einem Geschwindigkeitsverlust von etwa 80 %, wenn alle Experten auf der CPU liegen: Das ist eine Lösung für den äußersten Notfall.
Der Wert von --n-cpu-moe hängt von Ihrem Speicher ab; Sie müssen ihn durch Ausprobieren ermitteln. Für ein dichtes 70B-Modell ist bei 32 GB fast immer ein kleineres Modell oder mehr Speicher die richtige Lösung, nicht Offloading.
#Ein Modell mit 32 GB feinabstimmen: Was funktioniert und was nicht
Beim Fine-Tuning mit QLoRA bleiben die Modellgewichte in 4 Bit, und nur kleine Adapter werden trainiert. Allein die Gewichte eines 70B-Modells belegen bereits 40 GB, daher passt QLoRA-Training eines 70B-Modells nicht in 32 GB. Ein 32B-Modell in 4 Bit belegt etwa 19 bis 20 GB: Es bleiben 12 GB für die Aktivierungen, den Optimierer und die Adapter. Das ist mit einem kurzen Kontext und einer Batchgröße von 1 machbar, allerdings ohne Sicherheitsreserve. Ein Modell mit 7 bis 14 Milliarden Parametern lässt sich komfortabel trainieren. Das sind Größenordnungen, die Sie in dem von Ihnen verwendeten Tool bestätigen müssen.
#32 GB VRAM oder eine andere Lösung: Die Entscheidungstabelle
| Bedarf | Lösung | Warum |
|---|---|---|
| Dichte Modelle mit 27–32 Milliarden Parametern, langer Kontext, maximale Geschwindigkeit | NVIDIA-Karte mit 32 GB | Hohe Bandbreite, CUDA-Ökosystem |
| Gleiche Kapazität bei geringerer elektrischer Leistungsaufnahme | Radeon AI PRO R9700 | Ebenfalls 32 GB, geringerer theoretischer Durchsatz |
| Modelle ab 64 GB, gelegentliche Nutzung | Mac mit mindestens 64 GB vereinheitlichtem Speicher | Speicherkapazität ohne Offload, geringere Geschwindigkeit |
| Begrenztes Budget, 30B-MoE | Oft reicht eine Karte mit 24 GB aus | Das MoE-Modell mit 19 GB passt bei moderatem Kontext in den Speicher |
- Welches LLM für 24 GB VRAM
- Mac Studio für 64 bis 512 GB
- Quelle: NVIDIA, Ankündigung der RTX 50
- Quelle: AMD, Radeon AI PRO R9700
- Quelle: Ollama-Bibliothek, Mistral Large
#Häufig gestellte Fragen
Welcher LLM eignet sich am besten für 32 GB VRAM?+
Reichen 32 GB VRAM für Mistral Large 123B?+
RTX 5090 oder Mac Studio mit 64 GB für die lokale KI?+
Ist eine zweite Karte mit 16 GB einer Karte mit 32 GB gleichwertig?+
Kann man mit 32 GB zwei Modelle gleichzeitig laden?+
Welche Quantisierung sollte man bei 32 GB wählen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.