Welches LLM auf RTX 4090 (24 GB) ?
Die RTX 4090 (Oktober 2022) bleibt 2026 die Referenz für lokale KI auf Hardware für den Massenmarkt: 24 GB GDDR6X-VRAM, 1008 GB/s Bandbreite und 16.384 CUDA-Kerne der Ada-Lovelace-Architektur. Sie betreibt Qwen 3.5 9B mit mehr als 90 Tokens/s, Qwen 3.8 27B Q4 problemlos und sogar noch Llama 70B Q4 mit geringfügigem Offloading. Mit einem Gebrauchtpreis von inzwischen 1700–2000 € (ehemalige LHR-Bestände) bietet sie für die reine LLM-Nutzung ein besseres Verhältnis von Leistung zu Preis als eine neue 5080. Dieser Leitfaden stellt alle darauf lauffähigen Modelle im Detail vor und nennt Größenordnungen für den Durchsatz.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Die RTX 4090 im Jahr 2026, immer noch Königin
- Architektur
- Ada Lovelace (AD102), gefertigt im TSMC-4N-Verfahren. 76 Milliarden Transistoren.
- VRAM
- 24 GB GDDR6X mit 21 Gbps, Busbreite 384 Bit. Bandbreite 1008 GB/s.
- CUDA-Kerne
- 16.384. Tensor Cores der 4. Generation mit nativer FP8-Unterstützung. RT Cores der 3. Generation.
- TDP
- 450 W. Ein 850-W-Netzteil wird empfohlen.
- Preis 2026
- 1700–2000 € gebraucht in gutem Zustand.
#1. Modelle für 24 GB
| Modell | Quant | VRAM | Tokens/sec | Nutzung |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | Chat ohne Wartezeit |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | Chat + RAG FR |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | Professioneller Code-Assistent |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | Hochwertiges logisches Schlussfolgern |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | Vielseitiger Sweet Spot |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | Fortgeschrittenes logisches Denken |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | Komplexer Code über mehrere Dateien hinweg |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | 2 GB in den Arbeitsspeicher auslagern, nutzbar |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | Vollständig im VRAM, geringere Qualität |
#2. Installation & CUDA
- 01NVIDIA-Treiber 550+CUDA 12.4+. Für eine neue 4090 erledigt GeForce Experience die Aufgabe. Linux: nvidia-driver-565 oder neuer.
- 02OllamaStandard-Installer von ollama.com. Automatische Erkennung der CUDA-GPU.
- 03Erster Modelltest mit 24 GBollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. Benchmarks in Tokens/Sek.
| Modell | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Ada-Optimierungen
- Flash Attention 2
- Standardmäßig aktiv. FA3 kommt in zukünftigen Versionen von llama.cpp.
- KV-Cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Ermöglicht bei einem 14B-Modell einen Kontext von 32k mit etwa 15 GB Speicherbedarf, sodass 9 GB für andere Prozesse übrig bleiben.
- Leistungsgrenze
- nvidia-smi -pl 350 (ab 350 W). LLM: 2 % weniger Geschwindigkeit, 25 % weniger Wärme und Lärm. Für den nachhaltigen 24/7-Betrieb geeignete Konfiguration.
- FP8 über TensorRT-LLM
- Ada unterstützt FP8 nativ. Mit TensorRT-LLM lässt sich bei Qwen 3.5 9B ein um 40 % höherer Batch-Durchsatz erreichen. Besonders nützlich beim Serving für mehrere Benutzer.
#5. 4090 vs 5090 vs 3090
| Kriterium | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| Bandbreite | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Preis 2026 | ≈ 5 700 € (28/09/2026) | ~1800 € gebraucht | ~750 € gebraucht |
#Gebrauchtkauf 2026: eine kluge Entscheidung?
- Kaufen Sie eine 4090 gebraucht, wenn
- Budget von 1.500–2.000 €, intensive LLM-Nutzung, kein Bedarf an der allerneuesten Generation. 24 GB VRAM = ein gewichtiges Argument.
- Wählen Sie eine RTX 5090, wenn
- Budget ≥ 5.700 €, regelmäßiger Einsatz von 70B-Modellen, Bedarf an nativer FP4-Unterstützung, Teamserver. 32 GB machen den Unterschied.
- Wählen Sie eine RTX 3090, wenn
- Budget ≤ 1000 €, ausschließlich LLM-Nutzung, Geschwindigkeit zweitrangig. Gleiche VRAM-Kapazität zum halben Preis.
- Bevorzugen Sie eine RTX 5070 Ti, wenn
- Budget ~1.400 €, Nutzung von Modellen bis maximal 14B. Neu mit Garantie, GDDR7, FP4-Unterstützung.
#Häufig gestellte Fragen
Kann die RTX 4090 Llama 3.3 70B lokal ausführen?+
Wie viele Tokens pro Sekunde für Qwen 3.5 9B auf einer RTX 4090?+
RTX 4090 gebraucht oder RTX 5080 neu?+
Wird die RTX 4090 beim Betrieb von LLMs heiß und verbraucht sie viel Energie?+
Kann man LoRA-Fine-tuning auf einer RTX 4090 durchführen?+
Unterstützt die RTX 4090 FP8?+
Welches Netzteil für die RTX 4090?+
Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.