PC-Konfiguration für KI: Budget 32 GB VRAM
Mit 32 GB VRAM lässt sich ein dichtes Modell mit 32 Milliarden Parametern in Q4 (etwa 19 bis 20 GB) oder Qwen3-Coder 30B-A3B (19 GB) laden, aber weder ein Modell mit 30 Milliarden Parametern in Q8 (etwa 32 GB) noch ein 70B-Modell in Q4 (etwa 40 GB). Mit einer Karte mit 32 GB erreicht man 32 GB, mit zwei Karten mit jeweils 24 GB dagegen 48 GB.
Diese Seite erklärt, wie viel VRAM Sie je nach Modell anstreben sollten, vergleicht eine einzelne Karte mit 32 GB, zwei Karten mit je 24 GB und eine Karte mit 24 GB, erläutert die Dimensionierung von Netzteil, RAM, Speicher und Gehäuse und korrigiert einen Irrtum: Ein 30B-Modell in Q8 passt nicht in 32 GB.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was 32 GB VRAM tatsächlich ermöglichen
Mit 32 GB VRAM lässt sich ein dichtes Modell mit 32 Milliarden Parametern in Q4 (etwa 19 bis 20 GB Modellgewichte) problemlos mit mehreren Tausend Tokens Kontext laden. Alternativ lässt sich ein Expertenmodell mit 30 Milliarden Parametern wie Qwen3-Coder 30B-A3B laden, das in der Ollama-Bibliothek mit 19 GB angegeben wird. Ein Modell mit 30 Milliarden Parametern in Q8 lässt sich nicht laden: Es benötigt etwa 32 GB und belegt damit den gesamten Speicher der Karte, ohne Platz für den Kontext oder den vom Treiber reservierten Speicher zu lassen. Ein 70B-Modell in Q4 mit etwa 40 GB passt ebenfalls nicht hinein. Die 32 GB lassen sich mit einer einzelnen Karte mit 32 GB oder mit zwei Karten mit jeweils 24 GB erreichen – zwei Wege mit sehr unterschiedlichen Kompromissen.
| Modell | Modellgröße | 24 GB (1 Karte) | 32 GB (1 Karte) | 48 GB (2 × 24 GB) |
|---|---|---|---|---|
| Qwen3-Coder 30B-A3B in Q4 | ≈ 19 GB | Ja, mittlerer Kontext | Ja, langer Kontext | Ja |
| Dichtes 32B-Modell in Q4 | ≈ 19 bis 20 GB | Passt knapp, kurzer Kontext | Ja | Ja |
| Dichtes 32B-Modell in Q8 | ≈ 34 GB | Nein | Nein | Ja, mittlerer Kontext |
| 30B-Modell in Q8 | ≈ 32 GB | Nein | Nein, kein Spielraum | Ja |
| 70B in Q4 | ≈ 40 GB | Nein | Nein | Ja, kurzer Kontext |
Q8 benötigt ungefähr ein Byte pro Parameter: Deshalb passt ein Modell mit 30 Milliarden Parametern nicht in 32 GB. Da die Grafikkarte ihren Speicher nicht vollständig dem Modell zur Verfügung stellen kann, sollte das Modellgewicht mindestens 3 bis 4 GB unter der VRAM-Kapazität liegen, damit genug Platz für den KV-Cache bleibt. Der VRAM-Rechner auf der Website führt diese Berechnung für ein bestimmtes Modell und einen bestimmten Kontext durch.
#Die GPU: drei Wege, um 24 bis 48 GB zu erreichen
#Pfad A: eine Karte mit 32 GB
Die RTX 5090 verfügt laut NVIDIA über 32 GB GDDR7 mit einer 512-Bit-Schnittstelle. Ihre Gesamtgrafikleistung beträgt 575 W, und NVIDIA gibt eine erforderliche Systemleistung von 1.000 W an. Die Stromversorgung erfolgt über vier 8-polige PCIe-Kabel mit dem mitgelieferten Adapter oder über ein PCIe-Gen-5-Kabel mit 600 W. Eine einzelne GPU erspart jede Konfiguration mit mehreren Grafikkarten: Das ist der einfachste Weg und bietet die höchste Geschwindigkeit pro Modell, da der Speicher nicht auf mehrere Karten verteilt ist.
#Pfad B: zwei Karten mit 24 GB
Die RTX 3090 bietet 24 GB GDDR6X; NVIDIA gibt für eine einzelne Karte eine Leistungsaufnahme von 350 W und eine erforderliche Systemleistung von 750 W an. Zwei Karten bieten insgesamt 48 GB, verteilt auf beide Karten, wobei allein die Karten 700 W benötigen. In llama.cpp lautet die Option für die Verteilung --split-mode: Standardmäßig verteilt der Modus layer die Schichten auf die GPUs, und --tensor-split legt den Anteil fest, der jeder Karte zugewiesen wird. Der Modus tensor wird dort als experimentell beschrieben. Die Verteilung beschleunigt die Generierung nicht so, wie es eine einzelne schnellere Karte tun würde: Sie dient in erster Linie dazu, ein größeres Modell im Speicher unterzubringen.
#Weg C: eine einzige Karte mit 24 GB, knappes Budget
Eine gebrauchte RTX 3090 oder 4090 mit 24 GB reicht bereits für das Expertenmodell mit 30 Milliarden Parametern in Q4 und ein dichtes Modell mit 27 bis 32 Milliarden Parametern bei kurzem Kontext aus. Das ist der Weg bei einem Budget, das auf einige tausend Euro begrenzt ist: Die Preise ändern sich jede Woche, daher ist die Preisübersicht /prix-gpu-ia die einzige zuverlässige Referenz. Mit wachsendem Kontext schrumpft die Reserve schnell: Ein KV-Cache von mehreren Gigabyte beansprucht einen Teil der verbleibenden 4 bis 5 GB.
| Kriterium | Eine Karte mit 32 GB | Zwei Karten mit jeweils 24 GB | Eine Karte mit 24 GB |
|---|---|---|---|
| Nutzbarer VRAM | 32 GB | 48 GB verteilt | 24 GB |
| Komplexität | Keine | Aufteilung muss konfiguriert werden, zwei große Karten | Keine |
| Leistung der Grafikkarten | 575 W (RTX 5090) | 2 × 350 W (RTX 3090) | 350 W (RTX 3090) |
| Stromversorgung | Mindestens 1.000 W (NVIDIA) | Mindestens 1 200 W empfohlen (Berechnung dieses Leitfadens) | 750 W (NVIDIA) |
| Größtes Modell in Q4 | 32B mit Kontext | 70B mit kurzer Kontextlänge | 30B Experten, 32B kurz |
#Der Kontext: wie viel VRAM für den KV-Cache übrig bleibt
Die Modellgröße sagt nicht alles: Jedes Kontexttoken fügt dem KV-Cache einen Eintrag hinzu, der ebenfalls im VRAM gespeichert wird. Die Modellbeschreibung von Qwen3-Coder-30B-A3B nennt 48 Schichten und gruppierte Attention mit 32 Query-Heads und 4 KV-Heads. Diese Struktur reduziert die Größe des KV-Caches auf ein Achtel gegenüber einem Modell mit ebenso vielen KV-Heads wie Query-Heads. Das erklärt, warum ein solches Modell sehr lange Kontexte auf einer Karte mit 24 oder 32 GB unterstützt. Nicht alle Modelle sind so sparsam: Je mehr KV-Heads ein Modell hat, desto schneller wächst sein Cache mit dem Kontext.
Die Faustregel bleibt dieselbe: Gehen Sie von der Modellgröße aus, rechnen Sie 3 bis 4 GB Spielraum hinzu und prüfen Sie dann, was für die angestrebte Kontextlänge übrig bleibt. Fehlt der Spielraum, quantisieren Sie den KV-Cache, statt die Quantisierung des Modells zu reduzieren: Der zugehörige Leitfaden erklärt den Kompromiss.
#CPU, RAM und Mainboard: das Budget nicht verschwenden
Während der Generierung auf der GPU hat der Prozessor wenig zu tun: Er lädt die Modelle, tokenisiert, bereitet den Kontext vor und hält das System am Laufen. Ein Mittelklasseprozessor reicht aus, und das Geld ist besser in VRAM angelegt. Wichtiger ist das Mainboard: Für zwei Karten mit jeweils 24 GB benötigen Sie zwei PCIe-x16-Steckplätze mit ausreichend Abstand zueinander und genügend Platz für dicke Karten (NVIDIA beschreibt die RTX 3090 Founders Edition als Karte, die drei Slots belegt). Die Anzahl der PCIe-Lanes pro Steckplatz hat nach dem Laden des Modells nur wenig Einfluss auf die Generierung.
Beim Systemspeicher sind 32 GB die Untergrenze für einen PC mit einer Grafikkarte mit 32 GB Speicher; 64 GB sind komfortabler, wenn Sie eine IDE, einen Browser und einen Container geöffnet lassen, während das Modell läuft, oder wenn Sie einen Teil des Modells auf die CPU auslagern. Im letzteren Fall hängt die Geschwindigkeit vom Arbeitsspeicher ab: siehe den Leitfaden zu LLMs ohne GPU. Eine häufige Suchanfrage, „LLM 32 GB RAM“, bezeichnet oft diese Situation: Mit 32 GB RAM und ohne Grafikkarte bleiben Modelle mit 7 bis 14 Milliarden Parametern in Q4 nutzbar. Ein 32B-Modell in Q4 (etwa 19 bis 20 GB) passt in den Speicher, generiert aber langsam.
#Netzteil: Hier sollten Sie nicht sparen
NVIDIA gibt eine erforderliche Systemleistung von 1.000 W für eine RTX 5090 und 750 W für eine RTX 3090 an. Für zwei RTX 3090 ist die Rechnung einfach: 2 × 350 W für die Grafikkarten plus etwa 250 W für Prozessor, Mainboard, Laufwerke und Lüfter ergeben etwa 950 W unter Last, mit Spitzen darüber. Ein Netzteil mit 1.200 W oder mehr bietet eine angemessene Reserve; das ist eine Empfehlung dieses Leitfadens, keine Spezifikation von Apple oder NVIDIA. Prüfen Sie auch die Anzahl der 8-poligen PCIe-Anschlüsse: Eine RTX 5090 benötigt vier davon über den Adapter oder ein PCIe-Gen-5-Kabel mit 600 W.
#Massenspeicher: Ladegeschwindigkeit, nicht Kapazität
Bei jedem Modellwechsel wird ein Modell mit einer Größe von 20 bis 40 GB geladen. Berechnung mit Annahmen, die anzupassen sind: Bei 200 MB/s, der typischen Geschwindigkeit einer Festplatte, benötigen 40 GB etwa 200 Sekunden; bei 3,5 GB/s, der Geschwindigkeit einer NVMe-SSD, etwa 12 Sekunden. Eine NVMe-SSD mit 2 TB reicht für etwa zehn Modelle und einen RAG-Index; eine zweite Festplatte dient der Datensicherung. Eine PCIe-5.0-SSD bringt bei der Generierung keinen Vorteil: Diese findet im VRAM statt.
#Gehäuse und Kühlung
Eine Karte mit 575 W gibt so viel Wärme ab wie ein kleiner Heizkörper: Das Gehäuse muss die warme Luft schneller abführen, als sie einströmt, mit einem Lufteinlass an der Vorderseite und Lüftern hinten und oben. Zwei dicke Karten nebeneinander erwärmen sich gegenseitig: Lassen Sie einen Steckplatz zwischen ihnen frei oder wählen Sie dünnere Modelle. Der Leitfaden zum Temperaturmanagement bei der Inferenz erläutert die zu überwachenden Temperaturen und die Lüfterkurven.
- Welcher LLM für 32 GB VRAM?
- Welches LLM für 24 GB VRAM
- Welcher LLM auf RTX 5090?
- Welcher LLM für eine RTX 3090 und eine RTX 3090 Ti?
- LLM auf mehreren GPUs mit llama.cpp
- Preise für Grafikkarten für lokale KI
#Die Konfiguration vor dem Kauf überprüfen
- 01Vom Modell ausgehen, nicht von der GrafikkarteWählen Sie das gewünschte Modell und die gewünschte Quantisierung aus und rechnen Sie 3 bis 4 GB für den KV-Cache und den Treiber hinzu: Die Summe ergibt den Mindestbedarf an VRAM. Der VRAM-Rechner auf der Website übernimmt diese Berechnung.
- 02Die GPU-Option wählenEine Karte mit 32 GB für eine einfache Lösung, zwei Karten mit jeweils 24 GB, wenn das Budget Vorrang hat und Gehäuse sowie Mainboard dies zulassen, eine einzelne Karte mit 24 GB bei knappem Budget.
- 03Das Netzteil dimensionierenWählen Sie mindestens die Netzteilleistung, die NVIDIA für das System mit dieser Karte angibt, und planen Sie für zwei Karten zusätzliche Reserve ein. Zählen Sie die PCIe-Anschlüsse.
- 04Das Gehäuse prüfenLänge, Dicke und Luftzirkulation für jede Karte. Zwei dicke Karten erfordern ein breites Gehäuse und ein Mainboard mit weit auseinanderliegenden Steckplätzen.
- 05Nach dem Zusammenbau die Auslastung prüfenDer Befehl nvidia-smi zeigt den belegten VRAM und die Leistungsaufnahme jeder Karte an; ollama ps zeigt, ob das Modell vollständig auf der GPU läuft.
- Quelle: NVIDIA, technische Spezifikationen der GeForce RTX 5090
- Quelle: NVIDIA, Technische Spezifikationen der GeForce RTX 3090 und RTX 3090 Ti
- Quelle: Hugging-Face-Modellseite von Qwen3-Coder-30B-A3B
- Quelle: Ollama-Bibliothek, Qwen3-Coder
#Häufig gestellte Fragen
Reichen 32 GB VRAM für ein Modell mit 32 Milliarden Parametern aus?+
RTX 5090 oder zwei RTX 3090 für 32 GB VRAM?+
Welche Konfiguration für die Ausführung von Qwen3-Coder 30B-A3B?+
Reichen 32 GB RAM aus, um einen LLM ohne Grafikkarte zu betreiben?+
Welches Netzteil sollte man für eine RTX 5090 wählen?+
Wo finden Sie die aktuellen Preise für Grafikkarten für KI?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.