Beste GPU für lokale KI unter 500 € im Jahr 2026

Die Wahl der besten GPU für KI unter 500 Euro erfordert 2026 die Abwägung klarer technischer Kriterien in einem sich ständig wandelnden Hardwareangebot. Wenn Sie ein Sprachmodell (LLM) direkt auf Ihrem Rechner ausführen möchten, ohne von einem Cloud-Dienst abhängig zu sein, ist die Wahl der richtigen preisgünstigen Grafikkarte für KI entscheidend: Die GPU bestimmt die Inferenzgeschwindigkeit, die kompatiblen Modelle und die gesamte Nutzungserfahrung. Dieser Artikel stellt die für weniger als 500 € erhältlichen GPUs vor, erläutert, wie sich die Quantisierungsstufen auf den VRAM-Bedarf auswirken, und zeigt, welche Modelle aus dem Katalog quelllm.fr Sie mit diesem Budget tatsächlich nutzen können.

VRAM, Speicherbandbreite und TDP: Die drei Säulen für die Auswahl eines GPUs für LLMs

Drei Kennzahlen sind maßgeblich für die Auswahl einer GPU für die lokale LLM-Inferenz.

VRAM (Video-Speicher) : Das ist die wichtigste Einschränkung. Ein LLM muss vollständig oder nahezu vollständig in den VRAM passen, um eine umfangreiche Auslagerung in den System-RAM zu vermeiden, die den Durchsatz auf wenige Tokens pro Sekunde reduziert. Je aggressiver die Quantisierung (Q2, Q3), desto weniger VRAM wird benötigt, allerdings auf Kosten einer schrittweisen Verschlechterung der Antwortqualität.

Speicherbandbreite : Sie bestimmt die Generierungsgeschwindigkeit. Für jedes erzeugte Token liest die GPU sämtliche Modellgewichte erneut. Eine GPU mit 900 GB/s ist daher bei gleicher VRAM-Kapazität deutlich schneller als eine GPU mit 300 GB/s. Dies ist der wichtigste Engpass bei der LLM-Inferenz, der oft zugunsten der bloßen VRAM-Kapazität vernachlässigt wird.

TDP (Stromverbrauch) : Bei gleichem Anschaffungsbudget erhöhen GPUs mit hoher Leistungsaufnahme (RTX 3090, 350 W) auf Dauer die Stromrechnung. Eine RTX 4060 Ti mit 165 W ist im Betrieb günstiger, auch wenn ihre Bandbreite geringer ist.

Um zu verstehen, wie diese Parameter in einer vollständigen Konfiguration zusammenwirken, lesen Sie unseren Hardware-Konfigurationsanleitung für lokale LLM.

Die GPUs unter 500 €, die sich 2026 am besten für LLMs eignen

NVIDIA GeForce RTX 3090 (Secondhand-Markt)

NVIDIA GeForce RTX 4060 Ti 16 GB

AMD Radeon RX 7900 GRE 16 GB

NVIDIA GeForce RTX 4070 12 GB

NVIDIA GeForce RTX 4070 Super 12 GB

Einen detaillierten Vergleich der beiden NVIDIA-Modelle in dieser Preisklasse finden Sie auf unserer Seite RTX 3090 im Vergleich zu RTX 4070 für lokale LLM.

Quantisierung: von FP16 bis Q2 — was sich beim VRAM-Bedarf ändert

Die Quantisierung ist der zentrale Mechanismus, mit dem große Modelle in begrenzten Grafikspeicher passen. Sie reduziert die numerische Präzision jedes Gewichts im Netzwerk. Für ein Modell mit 70 Milliarden Parametern liegt der VRAM-Bedarf je nach Format ungefähr in folgender Größenordnung:

Das Projekt llama.cpp steuert das hybride Laden in GPU-Speicher und RAM über den Parameter --n-gpu-layers, wodurch sich eine GPU mit begrenztem VRAM nutzen lässt, indem die darüber hinausgehenden Schichten in den Arbeitsspeicher ausgelagert werden. Die GGUF-Dokumentation auf Hugging Face erläutert die Nomenklatur der quantisierten Formate und die verfügbaren Umwandlungswerkzeuge für jede Modellfamilie.

Weitere Informationen zur Wahl der richtigen Quantisierungsstufe für Ihren Anwendungsfall finden Sie in unserem Praxisleitfaden zur Quantisierung von LLMs.

Welche Modelle aus dem Katalog sind mit diesem Budget nutzbar?

Der Katalog quelllm.fr listet Modelle auf, deren VRAM-Bedarf in Q4 bei Architekturen mit 70–72 Milliarden Parametern bei etwa 40 GB beginnt. Mit einer GPU für unter 500 € sind zwei Wege möglich:

Pfad 1 — 24 GB VRAM, Quantisierung Q2 (RTX 3090 gebraucht)

Mit Q2-Quantisierung belegt ein 70–72B-Modell etwa 18–22 GB VRAM (geschätzt). Das gesamte Modell passt in den VRAM einer RTX 3090, ohne Auslagerung in den Arbeitsspeicher, wodurch der Durchsatz maximiert wird — geschätzt zwischen 3 und 8 Tokens pro Sekunde, je nach Modell und Implementierung:

Pfad 2 — 16 GB VRAM, teilweiser Offload GPU+RAM (RTX 4060 Ti oder RX 7900 GRE)

Llama.cpp lädt die ersten Schichten in den VRAM und den Rest in den System-RAM. Der Durchsatz sinkt (geschätzt 1–4 Tokens pro Sekunde für ein 70B-Modell), bleibt aber für nicht interaktive Aufgaben praktikabel: Zusammenfassung von Dokumenten, Extraktion von Entitäten, stapelweise Generierung von Inhalten, Annotation von Datensätzen.

Für Modelle mit Mixture-of-Experts-Architektur wie LLaVA-OneVision 72B (72 B, Apache 2.0, LMMs-Lab) müssen sämtliche Modellgewichte im Speicher verfügbar bleiben, auch wenn bei jedem Durchlauf nur ein Bruchteil der Experten aktiv ist — mit den aktuellen Implementierungen von llama.cpp wird nicht automatisch VRAM eingespart.

Modelle über 80 B – wie Mixtral 8x22B Instruct (~82 GB in Q4, Apache 2.0, Mistral AI) — lassen sich auf einem System mit einer einzelnen GPU für unter 500 € ohne umfangreiche Auslagerung in den Arbeitsspeicher nicht betreiben, was die Leistung und den praktischen Nutzen einer solchen Konfiguration erheblich verringert.

Praktische Anwendungsfälle entsprechend Ihrer Konfiguration

Dokumentzusammenfassung und Dokumentextraktion (16 GB + RAM-Offload)

Ein 70B-Modell in Q3 mit partiellem Offloading verarbeitet ein Dokument mit 4.000 Tokens in mehreren Minuten. Dieser Durchsatz ist für Workflows ohne Echtzeitanforderungen akzeptabel: laufende Dokumentenrecherche, Extraktion strukturierter Daten, Textklassifizierung, halbautomatische Annotation.

Code-Assistenz (24 GB, Q2 vollständig auf der GPU)

Un Qwen 2.5 72B Instruct in Q2 auf einer RTX 3090 erreicht einen ausreichenden Durchsatz für eine Interaktion annähernd in Echtzeit. Für Codevervollständigung, die Erklärung von Funktionen oder die Prüfung von Geschäftslogik sind 5–8 Tokens pro Sekunde (geschätzt) im Alltag praktikabel, ohne von einem Cloud-Dienst abhängig zu sein.

Lokale Bildanalyse (24 GB, Q2)

Qwen 2.5 VL 72B in Q2 auf einer RTX 3090 ermöglicht die Analyse von Screenshots, Diagrammen oder eingescannten Dokumenten, ohne Daten an einen externen Dienst zu senden. Die Latenz wird im Vergleich zu einer High-End-GPU hoch sein, aber die gesamte Verarbeitung bleibt lokal und privat.

Um die technischen Spezifikationen jedes GPUs vor dem Kauf zu überprüfen, die offizielle Seite zur RTX 4060 Ti auf der NVIDIA-Website dient als Referenz für herstellerzertifizierte Daten.

FAQ

F: Welche GPU sollte man für LLMs bei einem Budget unter 500 € bevorzugen?

Die gebrauchte RTX 3090 (24 GB, ~350 €) bietet für LLMs das beste Verhältnis von VRAM zu Preis. Ihre Bandbreite von 936 GB/s ist die höchste in dieser Auswahl. Wenn die Zuverlässigkeit einer neuen Karte wichtiger ist als die VRAM-Kapazität, ist die RTX 4060 Ti 16 GB (~330 €) eine solide Wahl mit einem halb so hohen Stromverbrauch. Die RX 7900 GRE von AMD ist mit ihrer Bandbreite von 576 GB/s eine sinnvolle Alternative unter Linux.

Q: Kann man ein LLM mit 70 B tatsächlich auf 16 GB VRAM laufen lassen?

Ja, aber mit eingeschränkter Leistung. Llama.cpp ermöglicht es, einen Teil der Schichten in den System-RAM auszulagern. Mit 16 GB VRAM und 32 GB DDR4-/DDR5-RAM lässt sich ein 70B-Modell in Q3 mit etwa 1–4 Token/s betreiben (geschätzt). Dieser Durchsatz ist für eine Interaktion in Echtzeit zu langsam, eignet sich aber für asynchrone Verarbeitung, Prototyping oder die stapelweise Generierung von Inhalten.

F: Was bedeuten die angezeigten VRAM-Werte Q4 im Katalog quelllm.fr?

Diese Werte entsprechen der GPU-Speichergröße, die erforderlich ist, um ein Modell im Format Q4 (4 Bit pro Gewicht) vollständig zu laden. Dies ist die am häufigsten verwendete Quantisierung als Referenz, da sie einen guten Kompromiss zwischen Qualität und Größe bietet. Bei Q8 verdoppelt sich die benötigte VRAM annähernd; bei FP16 vervierfacht sie sich; bei Q2 halbiert sich die VRAM (geschätzt). Diese Berechnungen sind nur Annäherungen – die tatsächliche Größe variiert je nach Architektur und Quantisierungstool.

F: Ist eine gebrauchte RTX 3090 für diesen Einsatz zuverlässig?

Die RTX 3090 ist eine robuste Grafikkarte, wurde aber häufig zuvor für intensive Workloads eingesetzt (3D-Rendering, wissenschaftliche Berechnungen oder sogar Mining). Vor dem Kauf empfiehlt es sich, den VRAM mit GPU-Z zu überprüfen und die Temperaturen in den ersten Stunden unter Last zu überwachen. Bevorzugen Sie Verkäufer, die eine Garantie von mindestens 30 Tagen anbieten, und testen Sie die Karte sofort nach Erhalt. Die Community llama.cpp auf GitHub dokumentiert die bekannten Stabilitätsprobleme nach GPU-Generation.

F: Funktioniert die RX 7900 GRE von AMD unter Windows gut für LLMs?

AMDs ROCm-Unterstützung unter Windows ist weniger ausgereift als unter Linux. Nutzer berichten von Inkompatibilitäten mit bestimmten Versionen von llama.cpp oder von Konfigurationen, die manuelle Treiberanpassungen erfordern. Unter Linux ist die Kompatibilität mit RDNA-3-GPUs solide und deckt die gängigen GGUF-Formate ab. Wenn Sie Windows nutzen, lässt sich eine NVIDIA-Karte mit CUDA ohne zusätzliche Konfiguration einfacher einsetzen.

F: Ist es besser, 12 GB mit hoher Bandbreite oder 16 GB mit geringerer Bandbreite zu wählen?

Für LLMs gilt: Wenn das Modell in beide Konfigurationen passt, ist die Bandbreite für die Generierungsgeschwindigkeit wichtiger als die VRAM-Kapazität. Eine RTX 4070 (12 GB, ~504 GB/s) erzeugt Tokens schneller als eine RTX 4060 Ti (16 GB, ~288 GB/s), wenn das Modell in 12 GB passt. Sobald das Modell mehr als 12 GB benötigt – was bereits bei 70B-Modellen in Q2 der Fall ist –, wird eine GPU mit 16 GB trotz ihrer geringeren Bandbreite notwendig.

Fazit

Wählen Sie den Beste GPU für KI unter 500 Euro bedeutet 2026 vor allem, zwischen verfügbarem VRAM und Speicherbandbreite abzuwägen. Die gebrauchte RTX 3090 mit 24 GB bleibt die Referenz, um 70B-Modelle in Q2-Quantisierung vollständig im VRAM auszuführen, während sich die RTX 4060 Ti mit 16 GB für gemischte GPU+RAM-Konfigurationen eignet. Erkunden Sie den Konfigurator quelllm.fr um die für Ihr Hardware-Setup passenden Modelle zu identifizieren, oder erkunden Sie direkt den komplettes Katalog der 249 erfassten Open-Weights-Modelle mit ihrem VRAM-Bedarf je Quantisierungsstufe.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.