Beste GPU für lokale KI unter 2000 € im Jahr 2026
Wählen Sie den Beste GPU für KI unter 2000 Euro bedeutet vor allem, zwischen verfügbarem VRAM, Speicherbandbreite und Kompatibilität mit Open-Source-Inferenzframeworks abzuwägen. Im Jahr 2026 nehmen die RTX 4090, die RTX 5090 und die RX 7900 XTX in diesem Segment sehr unterschiedliche Positionen ein, jeweils mit eigenen Kompromissen beim Ausführen lokaler LLMs. Dieser Artikel erläutert die wichtigsten Spezifikationen jeder GPU, die je nach Konfiguration nutzbaren Modelle aus dem Katalog und die erwartete Leistung je nach Quantisierung und beantwortet die häufigsten Fragen vor dem Kauf.
Warum VRAM die entscheidende Kennzahl für lokale LLM ist
Im Gegensatz zu Spielen oder 3D-Rendern hängt die lokale Ausführung eines LLM maßgeblich von der Video-Speicherkapazität. Der VRAM bestimmt, welche Quantisierung nutzbar ist und in welchem Umfang das Modell in den System-RAM ausgelagert werden muss.
Die gängigsten Quantisierungen mit llama.cpp, der maßgeblichen Inferenz-Engine für lokale Inferenz, sind:
- Q4_K_M : vorherrschender Kompromiss zwischen Qualität und Größe, etwa 4,5 Bit pro Parameter
- Q5_K_M : leichte Verbesserung der Qualität, etwa 5,5 Bits pro Parameter
- Q8_0 : annähernd native Genauigkeit, etwa 8 Bit pro Parameter
- FP16 : 16 Bit pro Parameter, reserviert für Konfigurationen mit mehreren GPUs und mehreren Hunderten GB VRAM
Um die Auswirkungen der Quantisierung vollständig zu verstehen, lesen Sie den Leitfaden zur Quantisierung von LLM der Website.
Als Orientierung bezüglich der im Katalog quelllm.fr :
- Qwen 2.5 72B Instruct — ~42 GB in Q4, 72 Milliarden Parameter: übersteigt die VRAM-Kapazität einer einzelnen GPU für unter 2.000 €
- Llama 4 Scout 109B — ~65 GB in Q4, 109B Parameter: Ein massiver Offload auf die CPU ist erforderlich
- gpt-oss 120B — ~70 GB in Q4, 117 Milliarden Parameter: derselbe Befund
Die direkte Folge: Mit einer einzelnen GPU für unter 2.000 € laufen alle Modelle im Katalog (mindestens 71 Milliarden Parameter) im teilweiser Offload-Modus in den System-RAM, wodurch die Tokens pro Sekunde proportional zur ausgelagerten Menge abnehmen.
Die 2026 für unter 2.000 € verfügbaren GPUs
Die folgenden Grafikkarten sind in diesem Preisbereich für lokale LLM-Inferenz relevant (in Frankreich Mitte 2026 beobachtete Preise, die je nach Händler und Marktschwankungen zu überprüfen sind):
NVIDIA GeForce RTX 4090 - VRAM : 24 GB GDDR6X - Speicherbandbreite : 1.008 GB/s - Richtpreis : 1 400–1 700 € - Kompatibilität : natives CUDA, llama.cpp, vLLM, Ollama, ExLlamaV2 - Stärke : größtes Ökosystem, umfangreiche Community-Dokumentation
NVIDIA GeForce RTX 5090 - VRAM : 32 GB GDDR7 - Speicherbandbreite : geschätzt ~1 790 GB/s - Richtpreis : 1.900–2.200 € je nach Händler (an der Grenze des Zielbudgets) - Kompatibilität : native CUDA-Unterstützung, Blackwell-Architektur in neueren Versionen von llama.cpp unterstützt - Stärke : 8 GB mehr als bei der RTX 4090, weniger CPU-Offload bei 70B-Modellen
AMD Radeon RX 7900 XTX - VRAM : 24 GB GDDR6 - Speicherbandbreite : 960 GB/s - Richtpreis : 800–1 050 € - Kompatibilität : ROCm 6.x, llama.cpp über HIP-Backend, Ollama - Stärke : bestes Verhältnis von VRAM zu Preis in diesem Segment, nutzbar, wenn Ihr Softwarestack ROCm unterstützt
NVIDIA GeForce RTX 3090 (Secondhandmarkt) - VRAM : 24 GB GDDR6X - Richtpreis : 600–850 € - Stärke : gleiche VRAM-Kapazität wie die RTX 4090 zu reduziertem Preis - Schwäche : geringfügig geringere Bandbreite (~936 GB/s), ältere Architektur (Ampere)
NVIDIA GeForce RTX 5080 - VRAM : 16 GB GDDR7 - Richtpreis : 900–1 100 € - Schwäche : 16 GB sind für 70B-Modelle selbst in Q3_K_M unzureichend — nicht empfohlen für die LLMs aus dem Katalog
Für einen ausführlichen Vergleich der beiden führenden Anbieter in diesem Segment siehe die Seite RTX 4090 gegen RTX 5090 für LLM.
RTX 4090 gegen RTX 5090: die Analyse für LLMs
Die RTX 5090 bietet zusätzliche 8 GB VRAM und eine deutlich erhöhte Bandbreite. Für LLMs bedeutet das drei konkrete Vorteile:
Reduzierung des CPU-Offloads : Mit 32 GB VRAM lagern Sie bei einem 70B-Modell in Q4 (~42 GB erforderlich) weniger Schichten in den System-RAM aus. Bei Q3_K_M sinkt der Speicherbedarf eines 72B-Modells auf etwa 30–32 GB (geschätzt), was je nach Implementierung eine Ausführung vollständig im VRAM ermöglichen kann.
Mehr Tokens pro Sekunde : weniger Offloading bedeutet einen geringeren Engpass auf dem PCIe-Bus (begrenzt auf ~32 GB/s bei PCIe 5.0 x16, gegenüber 1.008 GB/s für die interne Bandbreite der RTX 4090). Der Unterschied macht sich unmittelbar bei der Inferenzgeschwindigkeit bemerkbar.
Zusätzliche Kosten : je nach Händler zwischen 400 und 700 € mehr. Wenn der Preis der RTX 5090 unter 2.000 € fällt, rechtfertigen die 32 GB den Aufpreis. Andernfalls bleibt die RTX 4090 die sinnvollste Wahl.
Die RX 7900 XTX verdient eine besondere Erwähnung für Budgets unter 1.050 €: 24 GB VRAM mit stetig verbesserter ROCm-Unterstützung. Die Kompatibilität ist über alle Tools hinweg noch nicht so reibungslos wie bei CUDA (insbesondere bei vLLM), aber llama.cpp über HIP funktioniert für die übliche lokale Inferenz zuverlässig.
Die offiziellen Spezifikationen der RTX-50-Serie finden Sie auf der NVIDIA-Produktseite.
Modelle, die mit einer GPU für unter 2.000 € genutzt werden können (einschließlich Offloading)
Folgendes ist mit Modellen aus dem Katalog quelllm.fr, mit einer GPU mit 24–32 GB VRAM in Kombination mit 64–128 GB DDR5-System-RAM:
70B-Modelle — die Referenzklasse mit partiellem Offloading
- Qwen 2.5 72B Instruct — 72 Milliarden Parameter, Qwen-Lizenz, ~42 GB Q4. Bei 24 GB VRAM werden etwa 18 GB in den Arbeitsspeicher ausgelagert. Geschätzte Geschwindigkeit: 4–9 Tokens pro Sekunde, abhängig von der RAM-Bandbreite und der Anzahl der ausgelagerten Schichten.
- Llama 3.1 70B LatamGPT SFT — 71B Parameter, Lizenz Llama 3.1 Community, ~41 GB Q4. Ähnliche Anforderungen, leicht kompakter.
- Qwen3-Coder-Next 80B-A3B — 80 Milliarden Parameter, ~48 GB Q4, Lizenz Apache 2.0. Erfordert mehr Offload, aber geeignet für Codegenerierungsaufgaben.
- Hunyuan-A13B Instruct — 80B Parameter, ~48 GB Q4, Tencent-Hunyuan-Lizenz. MoE-Architektur mit 13B aktiven Parametern — die effektive Rechenlast ist geringer, obwohl der Speicherbedarf gleich bleibt.
Was mit einer einzigen GPU weiterhin außer Reichweite bleibt
- DeepSeek R1 671B — ~400 GB Q4: benötigt mindestens 10 GPU dieser Klasse parallel oder einen dedizierten NVLink-Server.
- Llama 4 Maverick 400B — ~240 GB in Q4: mit einer einzelnen GPU nicht machbar.
- Qwen 3 235B-A22B — ~142 GB in Q4: auf einer einzelnen GPU nicht nutzbar, aber der Vergleich Qwen 3 235B vs Llama 4 Scout erläutert die Unterschiede für Mehr-GPU-Konfigurationen.
Um die nach Ihrem verfügbaren VRAM gefilterten Modelle zu finden, verwenden Sie direkt den Konfigurator quelllm.fr.
Erwartete Leistung: Tokens pro Sekunde je nach GPU
Die Zahlen unten sind geschätzt auf Grundlage der Community-Benchmarks, die in den Issues und Diskussionen des Repositorys zusammengetragen wurden llama.cpp auf GitHub und dem Open LLM Leaderboard von Hugging Face. Sie variieren je nach System-RAM, Version der Inferenz-Engine und PCIe-Konfiguration.
Für ein 70B-Modell in Q4_K_M (etwa 42 GB), mit teilweisem Offloading:
- RTX 5090 (32 GB) : geschätzt 10–18 Tokens/sec, minimaler Offload (~10 GB auf CPU)
- RTX 4090 (24 GB) : geschätzt 4–9 Tokens/s, etwa 18 GB in schnellen DDR5-Arbeitsspeicher ausgelagert
- RX 7900 XTX (24 GB) : geschätzt 3–7 Tokens pro Sekunde über ROCm/HIP, je nach Treiberversion zu bestätigen
- RTX 3090 (24 GB) : geschätzt 3–6 Tokens/s, bei der Bandbreite etwas im Rückstand
Für ein 70B-Modell in Q3_K_M (geschätzt ~30–32 GB), nahe an der Speichergrenze der RTX 5090:
- RTX 5090 (32 GB) : geschätzt 20–30 Token/s, wenn das Modell vollständig in den VRAM passt
Diese Zahlen verdeutlichen die entscheidende Bedeutung der interne Speicherbandbreite : Der Verzicht auf CPU-Offloading steigert die Inferenzgeschwindigkeit gegenüber einer teilweisen Auslagerung auf das Zwei- bis Vierfache.
Modelllicenzierung: Was sich je nach Nutzung ändert
Der verfügbare VRAM bestimmt, welche Modelle nutzbar sind und somit welche Lizenzen für Ihre Bereitstellung gelten. Hier noch einmal die Lizenzen der Modelle der Klasse 70–120B aus dem Katalog:
- Apache 2.0 — freie kommerzielle Nutzung, Weiterverbreitung erlaubt: Mixtral 8x22B Instruct (~82 GB Q4), Qwen3-Coder-Next 80B-A3B (~48 GB Q4), gpt-oss 120B (~70 GB Q4)
- MIT — sehr permissive Lizenz, freie kommerzielle Nutzung: dots.llm1 Instruct (~85 GB Q4), Mistral Medium 3.5 128B (~74 GB Q4, modifizierte MIT-Lizenz)
- Llama Community – kommerzieller Einsatz unter Bedingungen (MAU < 700 M für die betroffenen Einheiten) : Llama 4 Scout 109B (~65 GB Q4)
- Qwen License — kommerzielle Nutzung gemäß den Bedingungen von Alibaba erlaubt: Qwen 2.5 72B Instruct (~42 GB Q4)
Prüfen Sie bei jedem kommerziell ausgerichteten Projekt vor der Bereitstellung stets die genauen Bedingungen auf der jeweiligen Modellseite. Die Lizenzen Apache 2.0 und MIT bieten maximale Flexibilität.
FAQ
Q: Kann ein 70B-Modell auf einer RTX 4090 ausgeführt werden?
Ja, mit teilweiser Auslagerung in den System-RAM. Die RTX 4090 verfügt über 24 GB VRAM; ein Modell wie Qwen 2.5 72B Instruct, das etwa 42 GB in Q4 benötigt, lagert etwa 18 GB in den DDR5-Arbeitsspeicher aus. Die Inferenzgeschwindigkeit liegt bei etwa 4–9 Tokens pro Sekunde (geschätzt), was für eine interaktive Nutzung ohne Echtzeitanforderungen weiterhin brauchbar ist, sofern mindestens 64 GB System-RAM und eine CPU mit ausreichender Speicherbandbreite vorhanden sind.
F: Passt die RTX 5090 in Frankreich in ein Budget von 2.000 €?
Sie liegt an der Budgetgrenze: Mitte 2026 kostet sie je nach Händler zwischen 1.900 und 2.200 €. Wenn Sie sie für unter 2.000 € finden, reduzieren ihre 32 GB VRAM und ihre gegenüber der RTX 4090 höhere Bandbreite das CPU-Offloading bei 70B-Modellen deutlich, was die Inferenzgeschwindigkeit verbessert. Andernfalls bleibt die RTX 4090 die erschwinglichste Wahl und diejenige, die vom Ökosystem lokaler Tools am besten unterstützt wird.
F: AMD RX 7900 XTX oder NVIDIA RTX 4090 für lokale LLMs?
Die RX 7900 XTX bietet 24 GB VRAM für 800–1.050 €, also 600–700 € weniger als die RTX 4090. Gegenüber CUDA ist das ROCm-Ökosystem weniger reif: vLLM und einige Backends erfordern eine manuelle Konfiguration, und die Leistung über HIP bleibt in der Praxis unter CUDA. Für llama.cpp und Ollama im Standardbetrieb funktioniert die RX 7900 XTX ordnungsgemäß. Für komplexere Stack-Konfigurationen oder Anwendungsbereitstellungen vereinfacht die RTX 4090 die Umsetzung.
F: Wie viel System-RAM sollte zusätzlich zur GPU eingeplant werden?
Für den Offload von Modellen mit 70B in Q4, 64 GB DDR5-RAM stellen einen vernünftigen Mindestwert dar. 128 GB lassen Spielraum für das Betriebssystem und andere gleichzeitig laufende Prozesse. Die Bandbreite des Arbeitsspeichers (hoch getakteter DDR5-Speicher im Dual-Channel-Betrieb) beeinflusst die Inferenzgeschwindigkeit beim Offload direkt: DDR5-6000 im Dual-Channel-Betrieb bietet einen spürbaren Vorteil gegenüber DDR4-3200.
F: Kann die RTX 5080 (16 GB) die Modelle aus dem Katalog ausführen?
Nein. 16 GB VRAM reichen für keines der Modelle im Katalog aus (mindestens 71 Milliarden Parameter). Selbst in Q3_K_M benötigt ein Modell mit 70 Milliarden Parametern etwa 30–32 GB (geschätzt). Die RTX 5080 eignet sich für Modelle mit 7–34 Milliarden Parametern, die in diesem auf große LLMs ausgerichteten Katalog nicht enthalten sind. Lesen Sie unseren Leitfaden zu High-End-GPUs für LLMs für umfangreiche Multi-GPU-Konfigurationen.
F: Verschlechtert die Q4-Quantisierung die Qualität der Antworten erheblich?
Die Quantisierung Q4_K_M bewahrt bei den meisten Aufgaben des Textverständnisses und der Textgenerierung die wesentlichen Fähigkeiten eines Modells im Vergleich zu FP16. Die deutlichsten Qualitätseinbußen treten bei komplexem mathematischem Schlussfolgern und Aufgaben auf, die präzisen Code erfordern; hier sind Q5_K_M oder Q8_0 vorzuziehen, sofern der VRAM ausreicht. Quantisierungen mit Q3 oder niedriger zeigen deutlichere Verluste und sollten Fällen vorbehalten bleiben, in denen der VRAM der entscheidende begrenzende Faktor ist.
Fazit
Im Jahr 2026 wird der Beste GPU für KI unter 2000 Euro ist die RTX 4090 wegen ihrer ausgereiften Softwareunterstützung, ihrer 24 GB GDDR6X-VRAM und ihres reibungslosen CUDA-Ökosystems. Wenn Ihr Budget die Obergrenze erreicht und die RTX 5090 für unter 2.000 € verfügbar ist, rechtfertigen die 32 GB den Aufpreis durch weniger CPU-Offload. Die RX 7900 XTX bleibt die überzeugendste Alternative für unter 1.050 €. Um Modelle zu finden, die mit Ihrer genauen Konfiguration kompatibel sind, verwenden Sie den Konfigurator quelllm.fr oder durchsuchen Sie den gesamten Katalog der 249 indexierten LLM.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.