Welcher LLM auf einer RTX 5090 (32 GB)? ?
Eine RTX 5090 bietet 32 GB GDDR7-VRAM und eine Bandbreite von 1.792 GB/s: Sie hält dichte Modelle mit 27 bis 32 Milliarden Parametern (Qwen 3.5 27B, Qwen3 32B) und Mixture-of-Experts-Modelle mit 30 bis 35 Milliarden Parametern auch mit langem Kontext im VRAM. Bei einem dichten 27B-Modell erzeugt sie etwa 60 Tokens pro Sekunde. Ein 70B-Modell (43 GB in Q4) passt nicht auf eine einzelne Karte.
Mit 32 GB kann die RTX 5090 Modelle im VRAM ausführen, die sich auf Karten mit 24 GB nicht mit langem Kontext nutzen lassen. Dieser Leitfaden nennt die Modelle, die tatsächlich in den Speicher passen, mit ihrer genauen Dateigröße, den von Hardware Corner gemessenen Durchsatzraten, den Auswirkungen des FP4-Formats, dem Kontextbudget und den Grenzen der Stromversorgung. Sie erfahren auch, wann sich der Aufpreis einer 5090 gegenüber einer 4090 oder 3090 lohnt.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 5090 für ein lokales LLM: Was mit 32 GB möglich ist
Für ein lokales LLM liegt der Wert einer RTX 5090 in ihren 32 GB GDDR7 und ihrer Speicherbandbreite von 1 792 GB/s: Sie hält Modelle mit 27 bis 35 Milliarden Parametern auch mit langem Kontext vollständig im VRAM, während Karten mit 24 GB diesen Modellen zu wenig Spielraum lassen. Laut der Ollama-Bibliothek benötigen die Modellgewichte von Qwen 3.5 27B 17 GB, von Qwen 3.8 27B 18 GB, von Qwen3 32B und Gemma 4 31B jeweils 20 GB sowie von Qwen 3.5 35B und Nemotron 3 Nano 30B jeweils 24 GB. Hardware Corner misst bei dichten Modellen mit 27 bis 32 Milliarden Parametern und einem Kontext von 4 000 Tokens etwa 59 bis 61 Tokens pro Sekunde und bei einem Expertenmodell mit 35 Milliarden Parametern mehr als 160. Ein 70B-Modell (43 GB für Llama 3.3 in Q4) passt weiterhin nicht auf eine einzelne Karte.
- Speicher
- 32 GB GDDR7 auf einem 512-Bit-Bus, gemäß NVIDIA; 1.792 GB/s Bandbreite, gemäß Hardware Corner.
- Berechnung
- 21.760 CUDA-Kerne und Tensor Cores der 5. Generation, laut NVIDIA. Compute Capability 12.0, von Ollama mit Treiberversion 550 oder neuer unterstützt.
- Verbrauch
- 575 W Leistungsaufnahme der Grafikkarte und ein erforderliches Systemnetzteil mit 1.000 W laut NVIDIA, mit einem PCIe-Gen-5-Kabel für 600 W oder einem mitgelieferten Adapter.
#Modelle, die in 32 GB passen
Die angegebenen Größen der Modellgewichte entsprechen den Dateien in der Ollama-Bibliothek, die am 29. September 2026 abgerufen wurden. Die Reserve ist das, was von 32 GB übrig bleibt, bevor Kontext, Cache und Puffer der Inferenz-Engine berücksichtigt werden.
| Modell | Ollama-Datei | Bruttomarge | Hinweis |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 18 GB | 128k Kontext ohne Beschränkung |
| Qwen 3.5 27B | 17 GB | 15 GB | Dichtes Modell, Text und Bild |
| Qwen 3.8 27B | 18 GB | 14 GB | Dichtes Modell, neuere Generation |
| Qwen3 32B / Gemma 4 31B | 20 GB | 12 GB | Obergrenze für dichte Modelle, die sich komfortabel betreiben lassen |
| Qwen 3.5 35B / Nemotron 3 Nano 30B | 24 GB | 8 GB | Passen mit Kontext nicht in 24 GB |
| Llama 3.3 70B | 43 GB | 11 GB fehlen | Passt nicht |
| gpt-oss 120B | 65 GB | 33 GB fehlen | Außer Reichweite |
Die 32 GB vergrößern vor allem den Spielraum: Bei einem dichten 27B-Modell bleiben 14 bis 15 GB für den Kontext frei, gegenüber 6 bis 7 GB auf einer Karte mit 24 GB, und ein Modell mit 24 GB an Gewichten lässt sich weiterhin laden, wobei 8 GB Spielraum bleiben. Dadurch werden die weiter unten mit Zahlen belegten 128k-Kontexte möglich.
#Gemessene Durchsatzraten: Was die 5090 gegenüber anderen Grafikkarten bietet
Die folgenden Zahlen stammen von Hardware Corner, wo mit llama.cpp und Kontextgrößen von 4k bis 256k getestet wird. Es handelt sich nicht um Messungen von QuelLLM.
| Modell (Q4_K, oder MXFP4 für Qwen 3.5 35B) | Kontext 4k | Kontext 32k | 128k Kontext |
|---|---|---|---|
| Qwen3 14B | 123,8 | 82,4 | 37,2 |
| gpt-oss 20B | 298,2 | 215,1 | 112,0 |
| Qwen3 30B A3B | 226,1 | 143,1 | 76,8 |
| Qwen 3.5 27B | 58,8 | 53,8 | 44,1 |
| Gemma 4 31B | 61,1 | 55,4 | 43,4 |
| Qwen3 32B | 61,4 | 43,8 | nicht gemessen |
| Qwen 3.5 35B (MXFP4) | 165,2 | 143,2 | 118,2 |
Die Generierung wird durch die Bandbreite begrenzt: Die theoretische Obergrenze entspricht ungefähr der Bandbreite geteilt durch die Größe der Modellgewichte. Für Qwen 3.5 27B (17 GB) ergibt 1.792 ÷ 17 einen Wert von 105 Tokens pro Sekunde; der Messwert von 58,8 erreicht davon 56 %. Für Qwen3 32B (20 GB) liegt die Obergrenze bei 90 und der Messwert bei 61,4, also 68 %. Ein dichtes Modell mit 27 bis 32 Milliarden Parametern erreicht auf einer 5090 somit rund 60 Tokens pro Sekunde.
Bei Qwen 3.5 27B generiert die 5090 1,76-mal so schnell wie die 3090 (58,8 gegenüber 33,5 laut zwei Seiten von Hardware Corner), während die Speicherbandbreite 1,91-mal so hoch ist (1.792 gegenüber 936 GB/s). In der llama.cpp-Rangliste erreicht die 5090 bei Llama 2 7B Q4_0 etwa 290 bis 300 Tokens pro Sekunde, gegenüber etwa 160 bei einer 3090.
#5090 gegenüber 4090 und 3090: der gemessene Abstand
| Karte | Speicher | Relativer Generationsprozess |
|---|---|---|
| RTX 5090 | 32 GB | 100 % |
| RTX 4090 | 24 GB | 77 % |
| RTX 3090 Ti | 24 GB | 55 % |
| RTX 3090 | 24 GB | 51 % |
#Kontext und KV-Cache: die 32 GB richtig einplanen
Ollama legt den Standardkontext anhand des Grafikspeichers fest: Die Dokumentation nennt 32k Tokens bei 24 bis 48 GiB VRAM und empfiehlt mindestens 64.000 Tokens für Agenten, Webrecherche und Code-Tools. Die 5090 fällt in die 32k-Kategorie, die großzügiger bemessen ist als die 4k bei Karten mit weniger als 24 GiB. Ein größerer Kontext benötigt mehr Speicher für den KV-Cache, der die Attention-Schlüssel und -Werte jedes gelesenen Tokens speichert.
Der wichtigste Hebel ist die Quantisierung des Caches: Laut der FAQ von Ollama benötigt q8_0 etwa halb so viel Speicher wie f16, bei einem sehr geringen Genauigkeitsverlust. Voraussetzung ist Flash Attention, das Ollama automatisch aktiviert, wenn die Karte und das Modell es unterstützen. Faustregel: Der nach dem Laden des Modells verbleibende Speicher abzüglich 1 bis 2 GB für Puffer ergibt das Speicherbudget für den Cache. Mit Qwen 3.5 27B (17 GB) bleiben mehr als 13 GB für den Kontext, was die Messung von Hardware Corner bei 128k bestätigt. Prüfen Sie das Ergebnis mit ollama ps.
#FP4, NVFP4, MXFP4: Was Blackwell wirklich verändert
Blackwell führt das Format NVFP4 ein: laut NVIDIA ein 4-Bit-Gleitkommaformat mit einem Skalierungsfaktor pro Block von 16 Werten statt 32 bei MXFP4, also einer feineren Skalierung. Hardware Corner gibt an, dass die 5090 NVFP4 hardwareseitig beschleunigt. Q4_K_M hingegen ist eine blockweise Quantisierung von llama.cpp: Die beiden stehen auf dem Papier nicht im Gegensatz zueinander, sondern sind unterschiedliche Dateiformate, und ein Modell liegt nur dann in dem einen oder anderen Format vor, wenn jemand es konvertiert hat.
In der Praxis zeigt die Zeile zu Qwen 3.5 35B in MXFP4 in der obigen Tabelle, was ein 4-Bit-Gleitkommaformat auf dieser Karte leistet: 165 Tokens pro Sekunde bei 4k und 24 GB Modellgewichten. Die Unterstützung von NVFP4 durch die Tools (llama.cpp, Ollama, vLLM) entwickelt sich schnell weiter: Prüfen Sie die installierte Version und die Modellbeschreibung, bevor Sie eine Datei auswählen, und behalten Sie Q4_K_M als bewährte Option bei.
#Ollama auf einer RTX 5090 installieren
- 01Treiber prüfenFühren Sie nvidia-smi in einem Terminal aus: Der Treiber muss in Version 550 oder höher vorliegen (551.61 unter Windows), und als Gesamtspeicher müssen etwa 32 GB angezeigt werden.
- 02Ollama installierenInstallieren Sie Ollama von der offiziellen Website. Die lokale API lauscht auf http://localhost:11434.
- 03Ein Modell startenFühren Sie ollama run qwen3.5:27b aus: Der Download von 17 GB erfolgt nur einmal. Für ein größeres Mixture-of-Experts-Modell probieren Sie ollama run qwen3.5:35b (24 GB) aus.
- 04Verteilung prüfenIn einem zweiten Terminal führen Sie ollama ps aus: Die Spalte Prozessor sollte 100 % GPU anzeigen.
- 05Kontext anpassenLegen Sie die Kontextlänge mit OLLAMA_CONTEXT_LENGTH fest und führen Sie anschließend ollama ps erneut aus. Falls die Speicherreserve nicht ausreicht, setzen Sie beim Start OLLAMA_FLASH_ATTENTION auf 1 und OLLAMA_KV_CACHE_TYPE auf q8_0.
#Stromversorgung, Wärme und Fine-tuning
NVIDIA gibt eine Grafikleistungsaufnahme von 575 W, ein Systemnetzteil mit 1.000 W, eine maximale GPU-Temperatur von 90 °C und ein PCIe-Gen-5-Kabel für 600 W an: Die 5090 ist die anspruchsvollste Karte im Vergleich. Prüfen Sie vor der Installation das Kabel und seinen Stecker und planen Sie ein gut belüftetes Gehäuse ein. Ein Leistungslimit senkt den Stromverbrauch bei nur geringem Geschwindigkeitsverlust, da das LLM vor allem den Speicher beansprucht (siehe die Messung der auf 250 W begrenzten 3090 im zugehörigen Leitfaden).
Für das Fine-Tuning nennt Unsloth folgende Mindestanforderungen an den VRAM bei 4-Bit-QLoRA: 22 GB für ein Modell mit 27 Milliarden Parametern, 26 GB für 32 Milliarden, 30 GB für 40 Milliarden und 41 GB für 70 Milliarden. Die 5090 ermöglicht damit das Fine-Tuning von Modellen bis zu 40B mit QLoRA, einer Batch-Größe von 1 und kurzem Kontext, aber nicht von einem 70B-Modell.
#Fazit: 5090, 4090 oder 3090 je nach Anwendung
| Situation | Entscheidung | Begründung mit Zahlen |
|---|---|---|
| Sie möchten ein dichtes Modell mit 27B bis 32B und langem Kontext nutzen | 5090 | 32 GB: 12 bis 15 GB Reserve, 44 Tokens/s bei 128k mit Qwen 3.5 27B |
| Sie möchten ein Mixture-of-Experts-Modell mit 30 bis 35 Milliarden Parametern einsetzen | 5090 | 24 GB Modellgewichte: mit Kontext zu viel für eine Grafikkarte mit 24 GB |
| Sie bleiben bei Modellen mit 8 bis 14 Milliarden Parametern | Keine 5090 | Die 3090 oder eine Karte mit 16 GB erledigt die Aufgabe |
| Sie besitzen bereits eine 4090 | Behalten, sofern Sie keine 32 GB benötigen | Generierung mit 77 % der Leistung der 5090 |
| Sie wollen ein 70B-Modell | Zwei Grafikkarten oder ein Rechner mit gemeinsamem Speicher | 43 GB Modellgewichte in Q4 |
Die 5090 kommt vor allem dann als Ersatz für eine 4090 infrage, wenn deren Speicherkapazität nicht ausreicht: Laut Hardware Corner beträgt der Geschwindigkeitsgewinn etwa 30 %, während die 32 GB das Laden von Modellen und Kontexten ermöglichen, die nicht in 24 GB passen. Die aktuellen Preise finden Sie in unserer Preisübersicht, für die zweimal pro Woche der niedrigste Preis jeder Karte erfasst wird.
- Quelle: NVIDIA, Spezifikationen der RTX 5090
- Quelle: Hardware Corner, Benchmarks für LLM auf RTX 5090
- Quelle: NVIDIA, Präsentation des Formats NVFP4
- Quelle: Ollama-Dokumentation, Kontextlänge
- Quelle: Unsloth, für Fine-Tuning erforderlicher VRAM
#Häufig gestellte Fragen
Welches LLM sollte man auf einer RTX 5090 installieren?+
Kann eine RTX 5090 ein 70B-Modell ausführen?+
Ist die RTX 5090 deutlich schneller als die 4090 für LLMs?+
Unterstützt die RTX 5090 FP4 und NVFP4?+
Welche Stromversorgung für eine RTX 5090?+
Kann man ein Modell auf einer RTX 5090 per Fine-Tuning anpassen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.