Beste GPU für lokale KI unter 1000 € im Jahr 2026
Die Wahl der besten GPU für KI unter 1.000 Euro ist zu einer zentralen Frage für alle geworden, die LLMs lokal ausführen möchten, ohne von einem Cloud-Abonnement abhängig zu sein. Im Jahr 2026 bietet der Grafikkartenmarkt mehrere überzeugende Optionen in dieser Preisklasse. Wer jedoch auswählt, ohne die Grenzen von VRAM und Quantisierung zu verstehen, entscheidet praktisch nach dem Zufallsprinzip. Die Verbreitung von Open-Weight-Modellen und ausgereifte Inferenzwerkzeuge wie llama.cpp haben die lokale Inferenz für alle zugänglich gemacht – vorausgesetzt, man wählt die passende Grafikkarte. Dieser Artikel stellt die unter 1.000 € verfügbaren GPUs, ihre tatsächliche Leistung in Tokens pro Sekunde, ihre Softwarekompatibilität und die Modelle vor, die sich mit diesem Budget realistisch ausführen lassen.
VRAM: das entscheidende Kriterium für die lokale Inferenz
Bevor Sie GPUs vergleichen, müssen Sie verstehen, warum der Grafikspeicher (VRAM) der begrenzende Faktor für die lokale Ausführung von LLMs ist.
Ein in den Speicher geladenes LLM belegt Speicherplatz, dessen Umfang von der Anzahl der Parameter und dem gewählten Quantisierungsformat abhängt:
- FP16 (16 Bit) : ~2 GB pro Milliarde Parameter
- Q8 (8 Bit) : ca. 1 GB pro Milliarde Parameter
- Q5 (5 Bits) : ~0,65 GB pro Milliarde Parameter
- Q4 (4 Bit) : ~0,5 GB pro Milliarde Parameter (mit einem geringen, messbaren Qualitätsverlust)
Zur Veranschaulichung: Das Qwen 2.5 72B Instructbenötigt mit seinen 72 Milliarden Parametern etwa 42 GB in Q4 gemäß den Spezifikationen des Katalogs von quelllm.fr. Der Llama 4 Scout 109B, ein MoE-Modell von Meta mit 109 Milliarden angegebenen Parametern, kommt dank seiner Sparse-Architektur in Q4 auf ~65 GB — das übersteigt weiterhin die Kapazität einer einzelnen Consumer-Grafikkarte, unabhängig von der Preisklasse.
Die GGUF-Quantisierung über llama.cpp ist heute der De-facto-Standard für lokale Inferenz sowohl auf NVIDIA-GPUs (CUDA) als auch auf AMD-GPUs (ROCm). Sie ermöglicht außerdem, einen Teil des Modells in den System-RAM auszulagern, allerdings auf Kosten eines deutlich geringeren Durchsatzes in Tokens pro Sekunde. Weitere Informationen zu den Abwägungen zwischen den Formaten Q4, Q5 und Q8 finden Sie in unserem Leitfaden zur Quantisierung von LLM.
Übersicht der GPUs unter 1.000 € im Jahr 2026
Folgende Grafikkarten sind derzeit innerhalb dieses Budgets erhältlich (geschätzte Preise inklusive Mehrwertsteuer auf dem französischen Markt, Mitte 2026):
RTX 4070 Ti Super – 16 GB VRAM - Geschätzter Neupreis : 680–750 € - Speicherbandbreite : 672 GB/s - Architektur : Ada Lovelace, CUDA 12.x - Eignet sich für : Modelle bis zu ~13B in Q5/Q8 oder ~30B in Q4 mit partiellem Offloading
RTX 4080 Super — 16 GB VRAM - Geschätzter Neupreis : 850–950 € - Speicherbandbreite : 736 GB/s - Architektur : Ada Lovelace - Vorteil : ca. 10 % höherer Durchsatz als bei der 4070 Ti Super bei gleichen Arbeitslasten
RX 7900 XTX — 24 GB VRAM - Geschätzter Neupreis : 850–950 € - Speicherbandbreite : 960 GB/s - Architektur : RDNA 3, ROCm 6.x - Schlüsselvorteil : 24 GB ermöglichen es, größere Modelle vollständig in den VRAM zu laden
RTX 3090 (Secondhand-Markt) — 24 GB VRAM - Geschätzter Gebrauchtpreis : 420–580 € - Speicherbandbreite : 936 GB/s - Architektur : Ampere, CUDA 11/12 - Preis-Leistungs-Verhältnis : die beste Wahl in dieser Auswahl für reine LLM-Inferenz, mit derselben VRAM-Kapazität wie die RX 7900 XTX und oft zum halben Preis
RTX 3090 Ti (Secondhand-Markt) — 24 GB VRAM - Geschätzter Gebrauchtpreis : 550–700 € - Speicherbandbreite : 1.008 GB/s – Hinweis : leicht schneller als die 3090, aber selten im Secondhand-Markt verfügbar
Bei LLM-Workloads hat der VRAM ist wichtiger als die reine TFLOPS-Leistung. Eine gebrauchte RTX 3090 zu 500 € übertrifft in der Praxis eine neue RTX 4070 Ti Super, sobald die Modelle über 13B Parameter verfügen, dank ihrer 24 GB im Vergleich zu 16 GB.
Leistung in Tokens pro Sekunde: realistische Schätzungen
Die folgenden Zahlen sind Schätzungen basierend auf den von der Gemeinschaft veröffentlichten Benchmark-Daten aus dem Hugging Face Open LLM Leaderboard und den Berichten der llama.cpp-Community. Sie variieren je nach llama.cpp-Version, Treiber und Systemkonfiguration.
- RTX 3090 / 24 GB — 7B-Modell in Q4 : geschätzt 80–120 Tokens pro Sekunde
- RTX 3090 / 24 GB — 13B-Modell in Q4 : geschätzt 45–70 Tokens/s
- RTX 3090 / 24 GB — 30B-Modell in Q4 : geschätzt 15–25 Tokens/sec (vollständig in VRAM)
- RTX 4070 Ti Super / 16 GB — 7B-Modell in Q4 : geschätzt 90–130 Tokens/sec
- RTX 4070 Ti Super / 16 GB – 13B-Modell in Q4 : geschätzt 50–75 Tokens pro Sekunde
- RX 7900 XTX / 24 GB — Modell 13B in Q4 : geschätzt 50–80 Tokens/s (ROCm kann je nach Version Schwankungen von 10–20 % verursachen)
Sobald ein Modell den verfügbaren VRAM übersteigt und eine Auslagerung auf die CPU erzwingt, kann der Durchsatz je nach Größe des Systemspeichers und Geschwindigkeit des PCIe-Busses auf 5–15 Tokens pro Sekunde sinken, was den produktiven Einsatz erschwert.
Softwarekompatibilität: CUDA, ROCm und das Inferenz-Ökosystem
NVIDIA (CUDA) bleibt die am besten unterstützte Plattform für lokale LLM-Inferenz:
- llama.cpp mit CUDA-Backend : stabil, maximale Leistung, Unterstützung aller Quantisierungsformate
- Frontend-Ökosystem : LM Studio, Open WebUI und die meisten Tools für die breite Öffentlichkeit setzen vorrangig auf CUDA
- Drivers : reif, umfangreiche Dokumentation, regelmäßige Aktualisierungen
AMD (ROCm) hat sich seit Version 6.0 erheblich verbessert:
- ROCm-Backend von llama.cpp : funktionsfähig, bei bestimmten fortgeschrittenen Formaten (IQ3, IQ4) manchmal 10–20 % langsamer als eine NVIDIA-GPU derselben Generation; je nach Version zu bestätigen
- Praktischer Vorteil : die RX 7900 XTX bietet 24 GB VRAM zu einem Preis, der unter dem von einer RTX 4080 Super liegt, wodurch sie trotz des weniger reifen Ökosystems eine sinnvolle Wahl darstellt
Welche Infrastruktur die Modelle im Katalog erfordern
Eines muss klar gesagt werden: kein im Katalog von quelllm.fr aufgeführtes Modell (der Katalog beginnt bei 71 Milliarden Parametern) passt vollständig in den VRAM einer einzelnen GPU für unter 1.000 €. Der Qwen 2.5 72B Instruct erfordert ~42 GB in Q4; der DeepSeek R1 671B benötigt etwa 400 GB.
Das bedeutet nicht, dass diese Modelle mit einem bescheidenen Budget unzugänglich sind, hat aber folgende Konsequenzen:
- CPU/RAM-Offloading : über llama.cpp möglich, aber der Durchsatz sinkt auf geschätzte 5–15 Tokens/s — nützlich zum Testen, nicht für den produktiven Einsatz
- Multi-GPU-Konfiguration : Zwei gebrauchte RTX 3090 (~800–1.000 € insgesamt) bieten zusammen 48 GB VRAM, sodass Qwen 2.5 72B Instruct (~42 GB Q4) vollständig in den VRAM geladen werden kann – siehe unseren Vergleich RTX 3090 vs RTX 4090 für die Details zur Konfiguration
Für Projekte rund um die großen Modelle aus dem Katalog stöbern Sie in unserem Bereich beste LLM pro Modellfamilie die die Optionen nach den Anforderungen an die Infrastruktur einordnet.
Urteil nach Nutzerprofil
Einsteigerprofil / knappes Budget (Budget < 600 €) Wählen Sie eine gebrauchte RTX 3090. 24 GB VRAM, solide Ampere-Leistung, unschlagbarer Preis auf dem Gebrauchtmarkt. Prüfen Sie vor dem Kauf den thermischen Zustand (Wärmeleitpaste, Lüfter) und stellen Sie sicher, dass die Karte nicht über längere Zeit intensiv für Mining genutzt wurde.
Mittleres Profil / neue Hardware empfohlen (600–800 €) La RTX 4070 Ti Super ist die vielseitigste Wahl: 16 GB VRAM, aktuelle Architektur, besserer langfristiger Support, moderater Stromverbrauch (285 W TDP). Wichtigste Einschränkung: Große Modelle (30B+) lassen sich ohne umfangreiches Offloading nicht ausführen.
Für Fortgeschrittene / VRAM maximieren (800–1.000 €) La RX 7900 XTX (24 GB, ~900 €) oder die RTX 4080 Super (16 GB, ~900 €), je nach Ihrer Priorität: möglichst viel VRAM oder reiner Durchsatz und Softwarekompatibilität. Bei LLMs hat die RX 7900 XTX dank ihrer 24 GB die Nase vorn, obwohl das ROCm-Ökosystem weniger etabliert ist als CUDA.
FAQ
F: Reicht eine GPU mit 16 GB aus, um 2026 LLM lokal zu betreiben?
Mit 16 GB lassen sich Modelle bis etwa 30B in Q4 mit etwas CPU-Offload betreiben oder Modelle bis etwa 13B in Q5/Q8 ohne Offload und mit einem komfortablen Durchsatz. Für Modelle aus dem Katalog von quelllm.fr (71B+) reichen 16 GB ohne eine Multi-GPU-Konfiguration nicht aus. Das ist ein guter Einstieg in die lokale Inferenz, wird aber zu einer echten Grenze, sobald die Anforderungen steigen.
F: Ist es für den Betrieb von LLMs besser, neu oder gebraucht zu kaufen?
Für die LLM-Inferenz bieten gebrauchte Ampere-GPUs (RTX 3090, 3090 Ti) dank ihrer 24 GB VRAM ein schwer zu überbietendes Preis-Leistungs-Verhältnis. Das Hauptrisiko ist mechanischer Verschleiß durch intensives Mining. Kaufen Sie bei Verkäufern mit nachvollziehbarer Verkaufshistorie, testen Sie die Stabilität unter Last mit einem GPU-Stresstest-Tool und prüfen Sie, ob eine noch bestehende Herstellergarantie gilt.
Q: Ist die RX 7900 XTX tatsächlich nutzbar für LLM mit ROCm?
Ja. Seit ROCm 6.x und den neueren Versionen von llama.cpp ist die RX 7900 XTX für lokale Inferenz voll funktionsfähig. Bei einigen fortgeschrittenen Quantisierungsformaten liegt die Leistung leicht unter der einer NVIDIA-GPU derselben Generation (je nach Version noch zu bestätigen), aber bei Modellen mit mehr als 13 Milliarden Parametern gleicht der Vorteil von 24 GB VRAM dies mehr als aus.
F: Wie viel VRAM benötigt man, um ein 70B-Modell zu betreiben?
Ein Modell mit ~72 Milliarden Parametern benötigt etwa 42 GB bei Q4 — dies ist der Wert für den Qwen 2.5 72B Instruct im Katalog von quelllm.fr. Rechnen Sie bei Q5 mit etwa 50 GB und bei FP16 mit etwa 144 GB. Dafür sind mindestens zwei Consumer-GPUs mit jeweils 24 GB oder eine professionelle GPU erforderlich, die das Budget übersteigt.
F: Kann man LoRA-Fine-Tuning mit einer GPU für unter 1.000 € durchführen?
Das PEFT/LoRA-Fine-Tuning, beschrieben in den Referenzarbeiten auf arXiv:2106.09685, ist mit 16–24 GB VRAM für Modelle mit 7B bis 13B Parametern möglich. Das vollständige Fine-Tuning (Full Fine-Tuning) eines 7B-Modells in FP16 benötigt einschließlich der Gradienten etwa 30–40 GB, was die Kapazität einer einzelnen GPU für unter 1.000 € übersteigt. Für die größeren Modelle im Katalog bleibt lokales Fine-Tuning mit einer Konfiguration aus einer einzelnen GPU für den Massenmarkt außer Reichweite.
F: Was ist der konkrete Unterschied zwischen Inferenz vollständig im VRAM und Inferenz mit CPU-Offload?
Wenn sich ein Modell vollständig im VRAM befindet, wird der Durchsatz durch die Speicherbandbreite der GPU begrenzt (z. B. 936 GB/s auf einer RTX 3090) und liegt je nach Modellgröße typischerweise bei 20–120 Tokens pro Sekunde. Bei CPU-Offloading wird der Durchsatz durch den PCIe-Bus begrenzt (~32 GB/s in der Praxis bei PCIe 4.0 x16), wodurch er um den Faktor 10 bis 30 sinken kann. Offloading ist zum Experimentieren nützlich; für einen kontinuierlichen produktiven Einsatz ist es nicht geeignet.
Fazit
Wählen Sie den beste GPU für KI unter 1000 Euro 2026 reduziert sich auf einen klaren Entscheidungsprozess: 16 GB VRAM für gängige Modelle mit einer neuen Karte und Garantie oder 24 GB bei einer gebrauchten RTX 3090 für ein schwer zu überholendes Qualitäts-Preis-Verhältnis. Großere open-weight Modelle aus dem Katalog erfordern mehr Infrastruktur, aber kleinere, kompaktere Modelle bleiben auf diesem Budget zugänglich und leistungsfähig. Verwenden Sie unsere Konfigurator um die für Ihre GPU geeigneten LLM zu ermitteln, oder erkunden Sie direkt den Katalog quelllm.fr mit seinen 249 Modellen, die sich nach erforderlichem VRAM und Lizenz filtern lassen.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.