Mittelstufe 12 Min.RTX 40

Welches LLM auf RTX 4090 (24 GB) ?

Die RTX 4090 (Oktober 2022) bleibt 2026 die Referenz für lokale KI auf Hardware für den Massenmarkt: 24 GB GDDR6X-VRAM, 1008 GB/s Bandbreite und 16.384 CUDA-Kerne der Ada-Lovelace-Architektur. Sie betreibt Qwen 3.5 9B mit mehr als 90 Tokens/s, Qwen 3.8 27B Q4 problemlos und sogar noch Llama 70B Q4 mit geringfügigem Offloading. Mit einem Gebrauchtpreis von inzwischen 1700–2000 € (ehemalige LHR-Bestände) bietet sie für die reine LLM-Nutzung ein besseres Verhältnis von Leistung zu Preis als eine neue 5080. Dieser Leitfaden stellt alle darauf lauffähigen Modelle im Detail vor und nennt Größenordnungen für den Durchsatz.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Die RTX 4090 im Jahr 2026, immer noch Königin

Architektur
Ada Lovelace (AD102), gefertigt im TSMC-4N-Verfahren. 76 Milliarden Transistoren.
VRAM
24 GB GDDR6X mit 21 Gbps, Busbreite 384 Bit. Bandbreite 1008 GB/s.
CUDA-Kerne
16.384. Tensor Cores der 4. Generation mit nativer FP8-Unterstützung. RT Cores der 3. Generation.
TDP
450 W. Ein 850-W-Netzteil wird empfohlen.
Preis 2026
1700–2000 € gebraucht in gutem Zustand.
→
Warum immer noch relevant im Jahr 2026
24 GB = magischer Schwellenwert, der Llama 3.3 70B Q2_K (26 GB mit 2 GB Offload) freigibt, Qwen 3.8 27B in Q8, Qwen3-Coder 30B-A3B. Die 5080 (16 GB neu) kann dies nicht erreichen, die 5090 (32 GB neu, ≈ 5 700 €) kostet etwa 3× so viel. Im reinen Verhältnis VRAM/€ übertrifft die gebrauchte 4090.

#1. Modelle für 24 GB

LLM-Modelle — RTX 4090 24 GB
ModellQuantVRAMTokens/secNutzung
gpt-oss 20BQ4_K_M13 GB117-143Chat ohne Wartezeit
Devstral Small 2 24BQ4_K_M14 GB36-44Chat + RAG FR
Qwen 3.6 27BQ4_K_M16 GB29-35Professioneller Code-Assistent
Qwen 3.8 27BQ4_K_M16 GB20-24Hochwertiges logisches Schlussfolgern
Mistral Small 24BQ6_K20 GB32-38Vielseitiger Sweet Spot
GLM 4.7 FlashQ4_K_M19 GB90-110Fortgeschrittenes logisches Denken
Granite 4.1 30B InstructQ4_K_M17 GB27-33Komplexer Code über mehrere Dateien hinweg
Gemma 4 26B-A4B MoEQ5_K_M19 GB54-662 GB in den Arbeitsspeicher auslagern, nutzbar
Gemma 4 31BQ5_K_M22 GB27-33Vollständig im VRAM, geringere Qualität
i
Llama 70B: Welche Quantisierung ist vorzuziehen?
Q4_K_M (42 GB): umfangreiche Auslagerung in den RAM, ~6 Tokens/s, wenig komfortabel. Q2_K (26 GB): 2 GB in den RAM auszulagern, ~10 Tokens/s, ordentliche Qualität. IQ2_XS (21 GB): vollständig im VRAM, ~20 Tokens/s, aber deutlich schlechtere Qualität. Für den komfortablen lokalen Betrieb eines 70B-Modells sollten Sie eine 5090 (32 GB) oder einen Mac Studio anstreben.

#2. Installation & CUDA

  1. 01
    NVIDIA-Treiber 550+
    CUDA 12.4+. Für eine neue 4090 erledigt GeForce Experience die Aufgabe. Linux: nvidia-driver-565 oder neuer.
  2. 02
    Ollama
    Standard-Installer von ollama.com. Automatische Erkennung der CUDA-GPU.
  3. 03
    Erster Modelltest mit 24 GB
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Vollständige Linux-Installation
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. Benchmarks in Tokens/Sek.

RTX 4090 24 GB — Größenordnung der Tokens pro Sekunde
ModellQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s—

#4. Ada-Optimierungen

Flash Attention 2
Standardmäßig aktiv. FA3 kommt in zukünftigen Versionen von llama.cpp.
KV-Cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Ermöglicht bei einem 14B-Modell einen Kontext von 32k mit etwa 15 GB Speicherbedarf, sodass 9 GB für andere Prozesse übrig bleiben.
Leistungsgrenze
nvidia-smi -pl 350 (ab 350 W). LLM: 2 % weniger Geschwindigkeit, 25 % weniger Wärme und Lärm. Für den nachhaltigen 24/7-Betrieb geeignete Konfiguration.
FP8 über TensorRT-LLM
Ada unterstützt FP8 nativ. Mit TensorRT-LLM lässt sich bei Qwen 3.5 9B ein um 40 % höherer Batch-Durchsatz erreichen. Besonders nützlich beim Serving für mehrere Benutzer.

#5. 4090 vs 5090 vs 3090

Die drei NVIDIA-Flaggschiffmodelle für Endverbraucher
KriteriumRTX 5090RTX 4090RTX 3090
VRAM32 GB GDDR724 GB GDDR6X24 GB GDDR6X
Bandbreite1792 GB/s1008 GB/s936 GB/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Preis 2026≈ 5 700 € (28/09/2026)~1800 € gebraucht~750 € gebraucht
→
Das beste Preis-Leistungs-Verhältnis für 24 GB: eine gebrauchte 3090
Für 750 € statt 1.800 € bietet die 3090 dieselben 24 GB VRAM. Bei der reinen Geschwindigkeit ist sie etwa 30 % langsamer. Wenn VRAM Ihre Priorität ist (24–32B-Modelle, QLoRA 14B+) und nicht die maximale Geschwindigkeit, bietet eine gebrauchte 3090 für LLMs weiterhin das beste Preis-Leistungs-Verhältnis in der gesamten Geschichte von NVIDIA.

#Gebrauchtkauf 2026: eine kluge Entscheidung?

Kaufen Sie eine 4090 gebraucht, wenn
Budget von 1.500–2.000 €, intensive LLM-Nutzung, kein Bedarf an der allerneuesten Generation. 24 GB VRAM = ein gewichtiges Argument.
Wählen Sie eine RTX 5090, wenn
Budget ≥ 5.700 €, regelmäßiger Einsatz von 70B-Modellen, Bedarf an nativer FP4-Unterstützung, Teamserver. 32 GB machen den Unterschied.
Wählen Sie eine RTX 3090, wenn
Budget ≤ 1000 €, ausschließlich LLM-Nutzung, Geschwindigkeit zweitrangig. Gleiche VRAM-Kapazität zum halben Preis.
Bevorzugen Sie eine RTX 5070 Ti, wenn
Budget ~1.400 €, Nutzung von Modellen bis maximal 14B. Neu mit Garantie, GDDR7, FP4-Unterstützung.

#Häufig gestellte Fragen

Kann die RTX 4090 Llama 3.3 70B lokal ausführen?+
Ja, aber mit Kompromissen. Q4_K_M (42 GB): umfangreiches Offloading → 6–8 tok/s (unbrauchbar). Q2_K (26 GB): 2 GB im RAM → 10–12 tok/s (akzeptabel). IQ2_XS (21 GB): vollständig im VRAM → 20 tok/s, aber mit Qualitätseinbußen. Für die komfortable Nutzung eines wirklich großen Modells sollten Sie eine 5090 (32 GB) bevorzugen — oder bei einem Qwen 3.8 27B bleiben, das vollständig in den VRAM passt.
Wie viele Tokens pro Sekunde für Qwen 3.5 9B auf einer RTX 4090?+
Etwa 90 Tokens pro Sekunde in Q4_K_M, 62 Tok/s in Q8_0. Für jede Chat-Anwendung mehr als ausreichend, zusätzlich mit einem Kontextfenster von 256k und den Bildverarbeitungsfähigkeiten des Modells.
RTX 4090 gebraucht oder RTX 5080 neu?+
4090 gebraucht (1.800 €): 24 GB VRAM, bei 7B-Modellen 10 % langsamer als eine 5080, ermöglicht aber 70B mit Offloading und 32B in Q6. 5080 neu (≈ 1.500 bis 1.850 €): 16 GB, schneller bei kleinen Modellen, 3 Jahre Garantie, FP4-Unterstützung. Für den reinen LLM-Einsatz gewinnt die 4090 dank ihres VRAM. Für Leistung und Garantie: die 5080.
Wird die RTX 4090 beim Betrieb von LLMs heiß und verbraucht sie viel Energie?+
Weniger als beim Spielen. Bei anhaltender Inferenz mit Qwen 3.5 9B: 250–320 W (gegenüber 450 W TDP), GPU bei 65–72 °C. Ein Gehäuse mit ordentlicher Luftzirkulation reicht aus. Für den 24/7-Betrieb reduziert Undervolting auf 350 W Wärme und Geräuschentwicklung ohne nennenswerte Leistungseinbußen bei LLMs.
Kann man LoRA-Fine-tuning auf einer RTX 4090 durchführen?+
Ja, ausgezeichnet. LoRA auf Qwen 3.5 9B: 12 GB, komfortabel mit Batch 4, Kontext 4096. QLoRA auf Mistral Small 24B: ca. 18 GB, möglich. QLoRA auf einem 70B: eng, aber machbar mit unsloth und Batch 1. Für klassische LoRA auf 70B benötigt man 2× 4090 oder eine 5090.
Unterstützt die RTX 4090 FP8?+
Ja, die Tensor Cores der 4. Generation Ada Lovelace unterstützen FP8 nativ. Diese werden von TensorRT-LLM (Gewinn +30-40 % gegenüber FP16), vLLM (0.5+), teilweise von llama.cpp genutzt. Bei Ollama für den Alltag bleibt es Q4-Q8. Bei Batch-Serving lohnt sich FP8.
Welches Netzteil für die RTX 4090?+
Ein hochwertiges Netzteil mit mindestens 850 W (ATX 3.0 empfohlen, aber nicht zwingend erforderlich). Bei LLM-Nutzung liegt der durchschnittliche Verbrauch bei 250–320 W, beim Spielen oder in Benchmarks bei 450 W. Mit einer High-End-CPU (9950X, 14900K) bieten 1000 W mehr Reserve.

Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.