Mittelstufe 11 Min.Build

PC-Konfiguration für KI: Budget 32 GB VRAM

Direkte Antwort

Mit 32 GB VRAM lässt sich ein dichtes Modell mit 32 Milliarden Parametern in Q4 (etwa 19 bis 20 GB) oder Qwen3-Coder 30B-A3B (19 GB) laden, aber weder ein Modell mit 30 Milliarden Parametern in Q8 (etwa 32 GB) noch ein 70B-Modell in Q4 (etwa 40 GB). Mit einer Karte mit 32 GB erreicht man 32 GB, mit zwei Karten mit jeweils 24 GB dagegen 48 GB.

Diese Seite erklärt, wie viel VRAM Sie je nach Modell anstreben sollten, vergleicht eine einzelne Karte mit 32 GB, zwei Karten mit je 24 GB und eine Karte mit 24 GB, erläutert die Dimensionierung von Netzteil, RAM, Speicher und Gehäuse und korrigiert einen Irrtum: Ein 30B-Modell in Q8 passt nicht in 32 GB.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was 32 GB VRAM tatsächlich ermöglichen

Mit 32 GB VRAM lässt sich ein dichtes Modell mit 32 Milliarden Parametern in Q4 (etwa 19 bis 20 GB Modellgewichte) problemlos mit mehreren Tausend Tokens Kontext laden. Alternativ lässt sich ein Expertenmodell mit 30 Milliarden Parametern wie Qwen3-Coder 30B-A3B laden, das in der Ollama-Bibliothek mit 19 GB angegeben wird. Ein Modell mit 30 Milliarden Parametern in Q8 lässt sich nicht laden: Es benötigt etwa 32 GB und belegt damit den gesamten Speicher der Karte, ohne Platz für den Kontext oder den vom Treiber reservierten Speicher zu lassen. Ein 70B-Modell in Q4 mit etwa 40 GB passt ebenfalls nicht hinein. Die 32 GB lassen sich mit einer einzelnen Karte mit 32 GB oder mit zwei Karten mit jeweils 24 GB erreichen – zwei Wege mit sehr unterschiedlichen Kompromissen.

Was je nach verfügbarem VRAM hineinpasst (nur Modellgewichte nach den Richtwerten der Website, Speicherbedarf für den Kontext zusätzlich berücksichtigen)
ModellModellgröße24 GB (1 Karte)32 GB (1 Karte)48 GB (2 × 24 GB)
Qwen3-Coder 30B-A3B in Q4≈ 19 GBJa, mittlerer KontextJa, langer KontextJa
Dichtes 32B-Modell in Q4≈ 19 bis 20 GBPasst knapp, kurzer KontextJaJa
Dichtes 32B-Modell in Q8≈ 34 GBNeinNeinJa, mittlerer Kontext
30B-Modell in Q8≈ 32 GBNeinNein, kein SpielraumJa
70B in Q4≈ 40 GBNeinNeinJa, kurzer Kontext

Q8 benötigt ungefähr ein Byte pro Parameter: Deshalb passt ein Modell mit 30 Milliarden Parametern nicht in 32 GB. Da die Grafikkarte ihren Speicher nicht vollständig dem Modell zur Verfügung stellen kann, sollte das Modellgewicht mindestens 3 bis 4 GB unter der VRAM-Kapazität liegen, damit genug Platz für den KV-Cache bleibt. Der VRAM-Rechner auf der Website führt diese Berechnung für ein bestimmtes Modell und einen bestimmten Kontext durch.

#Die GPU: drei Wege, um 24 bis 48 GB zu erreichen

#Pfad A: eine Karte mit 32 GB

Die RTX 5090 verfügt laut NVIDIA über 32 GB GDDR7 mit einer 512-Bit-Schnittstelle. Ihre Gesamtgrafikleistung beträgt 575 W, und NVIDIA gibt eine erforderliche Systemleistung von 1.000 W an. Die Stromversorgung erfolgt über vier 8-polige PCIe-Kabel mit dem mitgelieferten Adapter oder über ein PCIe-Gen-5-Kabel mit 600 W. Eine einzelne GPU erspart jede Konfiguration mit mehreren Grafikkarten: Das ist der einfachste Weg und bietet die höchste Geschwindigkeit pro Modell, da der Speicher nicht auf mehrere Karten verteilt ist.

#Pfad B: zwei Karten mit 24 GB

Die RTX 3090 bietet 24 GB GDDR6X; NVIDIA gibt für eine einzelne Karte eine Leistungsaufnahme von 350 W und eine erforderliche Systemleistung von 750 W an. Zwei Karten bieten insgesamt 48 GB, verteilt auf beide Karten, wobei allein die Karten 700 W benötigen. In llama.cpp lautet die Option für die Verteilung --split-mode: Standardmäßig verteilt der Modus layer die Schichten auf die GPUs, und --tensor-split legt den Anteil fest, der jeder Karte zugewiesen wird. Der Modus tensor wird dort als experimentell beschrieben. Die Verteilung beschleunigt die Generierung nicht so, wie es eine einzelne schnellere Karte tun würde: Sie dient in erster Linie dazu, ein größeres Modell im Speicher unterzubringen.

#Weg C: eine einzige Karte mit 24 GB, knappes Budget

Eine gebrauchte RTX 3090 oder 4090 mit 24 GB reicht bereits für das Expertenmodell mit 30 Milliarden Parametern in Q4 und ein dichtes Modell mit 27 bis 32 Milliarden Parametern bei kurzem Kontext aus. Das ist der Weg bei einem Budget, das auf einige tausend Euro begrenzt ist: Die Preise ändern sich jede Woche, daher ist die Preisübersicht /prix-gpu-ia die einzige zuverlässige Referenz. Mit wachsendem Kontext schrumpft die Reserve schnell: Ein KV-Cache von mehreren Gigabyte beansprucht einen Teil der verbleibenden 4 bis 5 GB.

Die drei Ansätze vergleichen
KriteriumEine Karte mit 32 GBZwei Karten mit jeweils 24 GBEine Karte mit 24 GB
Nutzbarer VRAM32 GB48 GB verteilt24 GB
KomplexitätKeineAufteilung muss konfiguriert werden, zwei große KartenKeine
Leistung der Grafikkarten575 W (RTX 5090)2 × 350 W (RTX 3090)350 W (RTX 3090)
StromversorgungMindestens 1.000 W (NVIDIA)Mindestens 1 200 W empfohlen (Berechnung dieses Leitfadens)750 W (NVIDIA)
Größtes Modell in Q432B mit Kontext70B mit kurzer Kontextlänge30B Experten, 32B kurz

#Der Kontext: wie viel VRAM für den KV-Cache übrig bleibt

Die Modellgröße sagt nicht alles: Jedes Kontexttoken fügt dem KV-Cache einen Eintrag hinzu, der ebenfalls im VRAM gespeichert wird. Die Modellbeschreibung von Qwen3-Coder-30B-A3B nennt 48 Schichten und gruppierte Attention mit 32 Query-Heads und 4 KV-Heads. Diese Struktur reduziert die Größe des KV-Caches auf ein Achtel gegenüber einem Modell mit ebenso vielen KV-Heads wie Query-Heads. Das erklärt, warum ein solches Modell sehr lange Kontexte auf einer Karte mit 24 oder 32 GB unterstützt. Nicht alle Modelle sind so sparsam: Je mehr KV-Heads ein Modell hat, desto schneller wächst sein Cache mit dem Kontext.

Die Faustregel bleibt dieselbe: Gehen Sie von der Modellgröße aus, rechnen Sie 3 bis 4 GB Spielraum hinzu und prüfen Sie dann, was für die angestrebte Kontextlänge übrig bleibt. Fehlt der Spielraum, quantisieren Sie den KV-Cache, statt die Quantisierung des Modells zu reduzieren: Der zugehörige Leitfaden erklärt den Kompromiss.

#CPU, RAM und Mainboard: das Budget nicht verschwenden

Während der Generierung auf der GPU hat der Prozessor wenig zu tun: Er lädt die Modelle, tokenisiert, bereitet den Kontext vor und hält das System am Laufen. Ein Mittelklasseprozessor reicht aus, und das Geld ist besser in VRAM angelegt. Wichtiger ist das Mainboard: Für zwei Karten mit jeweils 24 GB benötigen Sie zwei PCIe-x16-Steckplätze mit ausreichend Abstand zueinander und genügend Platz für dicke Karten (NVIDIA beschreibt die RTX 3090 Founders Edition als Karte, die drei Slots belegt). Die Anzahl der PCIe-Lanes pro Steckplatz hat nach dem Laden des Modells nur wenig Einfluss auf die Generierung.

Beim Systemspeicher sind 32 GB die Untergrenze für einen PC mit einer Grafikkarte mit 32 GB Speicher; 64 GB sind komfortabler, wenn Sie eine IDE, einen Browser und einen Container geöffnet lassen, während das Modell läuft, oder wenn Sie einen Teil des Modells auf die CPU auslagern. Im letzteren Fall hängt die Geschwindigkeit vom Arbeitsspeicher ab: siehe den Leitfaden zu LLMs ohne GPU. Eine häufige Suchanfrage, „LLM 32 GB RAM“, bezeichnet oft diese Situation: Mit 32 GB RAM und ohne Grafikkarte bleiben Modelle mit 7 bis 14 Milliarden Parametern in Q4 nutzbar. Ein 32B-Modell in Q4 (etwa 19 bis 20 GB) passt in den Speicher, generiert aber langsam.

#Netzteil: Hier sollten Sie nicht sparen

NVIDIA gibt eine erforderliche Systemleistung von 1.000 W für eine RTX 5090 und 750 W für eine RTX 3090 an. Für zwei RTX 3090 ist die Rechnung einfach: 2 × 350 W für die Grafikkarten plus etwa 250 W für Prozessor, Mainboard, Laufwerke und Lüfter ergeben etwa 950 W unter Last, mit Spitzen darüber. Ein Netzteil mit 1.200 W oder mehr bietet eine angemessene Reserve; das ist eine Empfehlung dieses Leitfadens, keine Spezifikation von Apple oder NVIDIA. Prüfen Sie auch die Anzahl der 8-poligen PCIe-Anschlüsse: Eine RTX 5090 benötigt vier davon über den Adapter oder ein PCIe-Gen-5-Kabel mit 600 W.

!
Nicht am Netzteil sparen
Ein unterdimensioniertes Netzteil führt dazu, dass sich der PC unter Last abschaltet, und beschädigt im schlimmsten Fall die Grafikkarte oder das Mainboard. Bei der Generierung mit einem LLM bleibt die GPU viele Minuten lang nahe ihrer maximalen Leistungsaufnahme, anders als bei einem Spiel mit schwankender Last: Dimensionieren Sie das Netzteil für eine dauerhaft anliegende Spitzenlast.

#Massenspeicher: Ladegeschwindigkeit, nicht Kapazität

Bei jedem Modellwechsel wird ein Modell mit einer Größe von 20 bis 40 GB geladen. Berechnung mit Annahmen, die anzupassen sind: Bei 200 MB/s, der typischen Geschwindigkeit einer Festplatte, benötigen 40 GB etwa 200 Sekunden; bei 3,5 GB/s, der Geschwindigkeit einer NVMe-SSD, etwa 12 Sekunden. Eine NVMe-SSD mit 2 TB reicht für etwa zehn Modelle und einen RAG-Index; eine zweite Festplatte dient der Datensicherung. Eine PCIe-5.0-SSD bringt bei der Generierung keinen Vorteil: Diese findet im VRAM statt.

#Gehäuse und Kühlung

Eine Karte mit 575 W gibt so viel Wärme ab wie ein kleiner Heizkörper: Das Gehäuse muss die warme Luft schneller abführen, als sie einströmt, mit einem Lufteinlass an der Vorderseite und Lüftern hinten und oben. Zwei dicke Karten nebeneinander erwärmen sich gegenseitig: Lassen Sie einen Steckplatz zwischen ihnen frei oder wählen Sie dünnere Modelle. Der Leitfaden zum Temperaturmanagement bei der Inferenz erläutert die zu überwachenden Temperaturen und die Lüfterkurven.

#Die Konfiguration vor dem Kauf überprüfen

  1. 01
    Vom Modell ausgehen, nicht von der Grafikkarte
    Wählen Sie das gewünschte Modell und die gewünschte Quantisierung aus und rechnen Sie 3 bis 4 GB für den KV-Cache und den Treiber hinzu: Die Summe ergibt den Mindestbedarf an VRAM. Der VRAM-Rechner auf der Website übernimmt diese Berechnung.
  2. 02
    Die GPU-Option wählen
    Eine Karte mit 32 GB für eine einfache Lösung, zwei Karten mit jeweils 24 GB, wenn das Budget Vorrang hat und Gehäuse sowie Mainboard dies zulassen, eine einzelne Karte mit 24 GB bei knappem Budget.
  3. 03
    Das Netzteil dimensionieren
    Wählen Sie mindestens die Netzteilleistung, die NVIDIA für das System mit dieser Karte angibt, und planen Sie für zwei Karten zusätzliche Reserve ein. Zählen Sie die PCIe-Anschlüsse.
  4. 04
    Das Gehäuse prüfen
    Länge, Dicke und Luftzirkulation für jede Karte. Zwei dicke Karten erfordern ein breites Gehäuse und ein Mainboard mit weit auseinanderliegenden Steckplätzen.
  5. 05
    Nach dem Zusammenbau die Auslastung prüfen
    Der Befehl nvidia-smi zeigt den belegten VRAM und die Leistungsaufnahme jeder Karte an; ollama ps zeigt, ob das Modell vollständig auf der GPU läuft.
Terminal
nvidia-smi
ollama ps

#Häufig gestellte Fragen

FAQ
Reichen 32 GB VRAM für ein Modell mit 32 Milliarden Parametern aus?+
Ja, in Q4: Das Modell belegt etwa 19 bis 20 GB, sodass 12 GB für den Kontext und den Treiber übrig bleiben. Q8 passt mit etwa 34 GB nicht hinein. Sie können eine mittlere Quantisierung, Q5 oder Q6, anstreben, wenn Sie einen kürzeren Kontext akzeptieren. Der VRAM-Rechner der Website liefert die Antwort für Ihr Modell.
RTX 5090 oder zwei RTX 3090 für 32 GB VRAM?+
Die RTX 5090 bietet 32 GB auf einer einzigen Karte, ohne Multi-GPU-Konfiguration, bei 575 W. Zwei RTX 3090 bieten zusammen 48 GB, verteilt auf beide Karten, bei insgesamt 700 W für die Karten. Dafür sind ein Netzteil mit mindestens 1.200 W und ein geeignetes Mainboard erforderlich. Wählen Sie die 5090 für eine einfache Konfiguration und die beiden 3090, um ein 70B-Modell zu laden.
Welche Konfiguration für die Ausführung von Qwen3-Coder 30B-A3B?+
Das Modell hat 30,5 Milliarden Parameter, davon sind 3,3 Milliarden aktiv, und die Ollama-Bibliothek gibt für die Standardversion 19 GB an. Eine Karte mit 24 GB kann es mit mittlerem Kontext laden; 32 GB lassen Spielraum für einen langen Kontext. In Q8 benötigt es etwa 32 GB und passt auf keine einzelne Karte mit 32 GB.
Reichen 32 GB RAM aus, um einen LLM ohne Grafikkarte zu betreiben?+
Ja, für Modelle mit 7 bis 14 Milliarden Parametern in Q4, die 5 bis 9 GB belegen. Ein Modell mit 32 Milliarden Parametern in Q4 (etwa 19 bis 20 GB) passt ebenfalls in den Speicher, generiert aber langsam, da die Geschwindigkeit von der RAM-Bandbreite abhängt. Der Leitfaden zu LLMs ohne GPU stellt die Modelle nach RAM-Kapazität detailliert vor.
Welches Netzteil sollte man für eine RTX 5090 wählen?+
NVIDIA gibt eine erforderliche Systemleistung von 1.000 W an, mit vier 8-poligen PCIe-Steckern über den mitgelieferten Adapter oder einem PCIe-Gen-5-Kabel mit 600 W. Wählen Sie ein hochwertiges Netzteil mit mindestens 1.000 W, möglichst mit diesem Kabel als nativem Netzteilkabel, und vermeiden Sie es, das Kabel mit zusätzlichen Adaptern zu verlängern.
Wo finden Sie die aktuellen Preise für Grafikkarten für KI?+
Die Website erfasst regelmäßig den niedrigsten Preis für Grafikkarten für lokale KI sowie den Preis pro Gigabyte VRAM. Diese Seite nennt keine Preise, denn sie ändern sich wöchentlich. Sehen Sie auf der Preisseite nach, bevor Sie zwischen einer Grafikkarte mit 32 GB und zwei gebrauchten Karten mit je 24 GB abwägen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.