Welche GPU für einen lokalen LLM? RTX 4070 bis 5090, Mac (2026)
Für einen lokalen LLM ist Kriterium Nr. 1 die VRAM (nicht die Gaming-Leistung), dann die Tokens pro Sekunde und schließlich der Energieverbrauch. Eine gebrauchte RTX 3090 (24 GB VRAM) kann bei der lokalen KI-Verarbeitung eine neue RTX 4070 übergehen, dank ihrer größeren Speicherkapazität, trotz einer älteren Architektur.
Die GPU ist die Komponente, die Ihre Erfahrung mit lokaler KI am stärksten verändert. Doch Sie suchen nicht dieselbe GPU wie ein Gamer: Für ein LLM zählt zuerst der VRAM, dann die Anzahl der Tokens pro Sekunde und schließlich der Stromverbrauch. Dieser Leitfaden bringt Klarheit in die Angebote für 2026 (NVIDIA, AMD, Apple Silicon, Intel Arc), stellt konkrete Konfigurationen für verschiedene Budgets vor und erklärt, warum eine gebrauchte RTX 3090 eine neue 4070 übertreffen kann.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: Mac mini M5 Pro (24 GB / 512 GB).
Warum diese Wahl? Unsere vollständige Übersicht zu Mac mini M5 Pro (24 GB / 512 GB) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt WelchesLLM einen Gewinn aus qualifizierten Käufen.
#Der VRAM, die unangefochtene Königin
Ein LLM muss vollständig in den VRAM passen, um mit voller Geschwindigkeit zu laufen. Sobald Teile davon in den System-RAM ausgelagert werden, bricht die Geschwindigkeit um den Faktor 10 ein. Die Größe der Modelle, die Sie ausführen können, wird daher vom VRAM bestimmt, NICHT von der reinen Rechenleistung der GPU.
- 8 GB
- Qwen 3.5 9B (6,6 GB). Komfortabel nutzbar, bei langem Kontext durch den Speicher begrenzt. Einstiegsklasse.
- 12 GB
- Qwen 3.5 9B in Q8 (11 GB) läuft komfortabel, ein 24B-Modell in Q4 passt ebenfalls. Der Sweet Spot beim Preis-Leistungs-Verhältnis.
- 16 GB
- ein 24B-Modell (Devstral, Mistral Small), das komfortabel läuft, gpt-oss 20B oder ein 27B-Modell in Q4, das in den Speicher passt. Ein sehr guter Kompromiss.
- 24 GB
- Qwen 3.8 27B (18 GB), das problemlos hineinpasst, MoE-Modelle fürs Programmieren mit 30B-A3B, ein 35B-Modell in Q4.
- 48 GB +
- 70B in Q4 komfortabel, LoRA-Fine-Tuning möglich, mehrere Modelle parallel.
#Den eigenen Bedarf bestimmen
- Gelegentliche Chats, einfache Aufgaben
- Qwen 3.5 9B = ~7 GB VRAM reichen aus. RTX 4060 Ti 16 GB, RTX 3060 12 GB, Arc A770 16 GB.
- Dev (Autocomplete + Chat)
- Qwen2.5-Coder 7B base für die FIM-Autovervollständigung + Devstral 24B für den Chat, beide im Tandem. 16–20 GB empfohlen.
- Professionelles RAG, lange Dokumente
- Ein Kontext von 32k+ benötigt zusätzlich 4–6 GB VRAM. Streben Sie mindestens 16 GB an.
- Fine-Tuning, Experimente
- Mindestens 24 GB (RTX 3090/4090). Für ein echtes vollständiges Fine-Tuning eines 7B-Modells sollten Sie 48 GB anpeilen (A6000, RTX 6000 Ada).
- Ein Team mit 10 Personen versorgen
- Eine einzelne RTX 4090 oder A6000 oder 2× RTX 4090 mit Tensorparallelität für ein 70B-Modell.
#NVIDIA — die Optionen 2026
- RTX 3060 mit 12 GB (~250 €)
- Die günstige Option. CUDA, 12 GB VRAM, ordentliche Leistung für 7B und 13B in Q4. Empfohlene Einstiegskarte.
- RTX 4060 Ti 16 GB (~450 €)
- Ideal für LLMs: 16 GB VRAM, geringer Stromverbrauch (160 W). Bei der reinen Leistung schwächer als eine 3090, aber sparsamer.
- RTX 4070 Super 12 GB (~600 €)
- Hervorragende Rechenleistung, aber die 12 GB setzen Grenzen. Gut, wenn Sie auch spielen.
- RTX 3090 mit 24 GB (~700 € gebraucht)
- ⭐ Das beste VRAM-Preis-Verhältnis auf dem Markt. Schon seit 2 Jahren auf dem Markt, aber die 24 GB wirken Wunder. Hoher Stromverbrauch (350 W).
- RTX 4090 24 GB (gebraucht, Preis variabel)
- Die beste Consumer-GPU 2023–2025. Leistung + 24 GB. 2026 nur selten auf Lager, RTX 5090 bevorzugen.
- RTX 5080 16 GB / 5090 32 GB (≈ 1 500 bis 1 850 € / ≈ 5 700 € Ende September 2026)
- Generationsjahr 2025. 5090 = 32 GB VRAM, der Traum der LLM-Nutzer.
- RTX A6000 48 GB (Profikarte, ca. 4.500 €)
- 48 GB VRAM für 70B-Modelle in Q6 oder das Fine-Tuning eines 13B-Modells. Für Profis, bei denen sich die Investition amortisiert.
#AMD — Aufholjagd mit ROCm
- RX 7600 XT 16 GB (~350 €)
- AMD-Einstiegsklasse. 16 GB VRAM zum Preis einer 3060. Offizielle ROCm-Unterstützung.
- RX 7800 XT 16 GB (~550 €)
- Leistung auf dem Niveau einer 4070, stabiles ROCm, hervorragendes Preis-Leistungs-Verhältnis.
- RX 7900 XTX 24 GB (~900 €)
- 24 GB für viel weniger als eine gebrauchte 3090. Für Personen, die die Komplexität von ROCm akzeptieren.
- RX 9070 XT 16 GB (≈ 1 070 € Ende September 2026)
- Neue Generation RDNA 4 (2025). Die ROCm-Unterstützung bleibt noch zu bewerten.
#Apple Silicon — Sonderfall
Macs der M-Serie haben keine dedizierte GPU, sondern einen gemeinsamen Speicher: Die GPU kann auf den gesamten RAM zugreifen. Ein Mac mit 64 GB kann einem LLM 48 GB zuweisen – genug, um ein 70B-Modell auszuführen.
- Mac mini M6 16 GB (1.049 €)
- Das nutzbare Minimum (der Mac mini M4 wird nicht mehr neu verkauft). Ein 7B-Modell läuft gut. Sehr geringer Stromverbrauch (20 W bei der Inferenz).
- Mac mini M5 Pro 24 GB (1.999 €, bei Apple mit 48–64 GB konfigurierbar)
- Ausgezeichnetes Preis-Leistungs-Verhältnis für LLMs (ersetzt den M4 Pro). Bei 48 GB sind etwa 36 GB der GPU zugewiesen: Ein 32B-Modell in Q6 passt bequem hinein.
- MacBook Pro M4 Max 64 GB (~4000 €)
- Laptop + 70B-LLM in Q4. In der Bedienung einem Desktop-PC mit RTX 4090 gleichwertig, dazu mobil.
- Mac Studio M5 Ultra 96 GB (ab 6.599 €, Apple-Preis Ende September 2026)
- Die Top-Lösung. Von 96 GB sind etwa 72 GB für LLMs nutzbar, bei Versionen mit mehr Speicher entsprechend mehr. Kann die derzeit größten Open-Weight-Modelle in Q8 oder mehrere Qwen 3.8 27B parallel ausführen.
#Intel Arc — Außenseiter mit Bastelaufwand
- Arc A770 16 GB (~300 €)
- 16 GB VRAM für 300 €. Die reine Leistung liegt unter der vergleichbarer NVIDIA-/AMD-Karten, aber das Verhältnis von VRAM zu Preis ist unschlagbar.
- Arc B580 12 GB (≈ 430 € Ende September 2026)
- Neue Generation Battlemage. Signifikante Leistungsverbesserungen. Perspektivisch vielversprechend.
#Konkrete Budgets
- 300 € – nur zum Start
- Eine gebrauchte RTX 3060 mit 12 GB oder eine Arc A770 mit 16 GB. Damit können Sie Modelle mit 7B bis 13B problemlos betreiben.
- 700 € — der Sweet Spot
- Gebrauchte RTX 3090 mit 24 GB. Das beste Verhältnis von VRAM zu Preis in Euro. Darauf laufen beliebige 32B-Modelle sowie 70B-Modelle in Q4.
- 1500 € — Komfort für Profis
- Eine neue RTX 5070 Ti mit 16 GB (≈ 1.250 bis 1.400 €) zum Einbau in einen PC, der bereits 64 GB RAM hat.
- 3000 € — LLM-Workstation
- Vollständiger PC mit RTX 5080 16 GB (ca. 1.500 bis 1.850 € pro Karte) ODER Mac Studio M5 Max 36 GB (2.999 €). Für die Laden eines 70B: Mini-PC Ryzen AI Max+ 395 128 GB (ca. 3.300 €, bis zu 4.000 € je nach Modell). Konsistent für einen Entwickler, der das täglich macht.
- 6 600 € und mehr — die absolute Spitzenklasse
- Mac Studio M5 Ultra (96 GB und mehr, ab 6.599 €) ODER PC mit 2× RTX 5090 (≈ 11.400 € für beide Karten, Ende September 2026). LLM-Server für kleine Teams.
#Neu oder gebraucht kaufen?
- Neu
- Garantie, neueste Generation, langfristige Treiberunterstützung. Für eine professionelle Investition, die sich über 3–5 Jahre amortisieren lässt.
- Gebrauchtkauf (RTX 3090, 4090)
- 30–40 % Ersparnis. Für LLMs genutzte Karten wurden nicht so stark beansprucht wie Mining-Karten (die meisten waren nur wenige Stunden unter Last).
- Prüfungen bei Gebrauchtkarten
- 24-Stunden-Burn-in bei der Inferenz, Temperaturüberwachung (die Temperatur darf 80 °C nicht überschreiten), keine erneuerten Wärmeleitpads, möglichst mit Originalrechnung.
- Kauf für den professionellen Einsatz
- RTX A6000 oder L40 neu. 3-Jahres-Garantie, professioneller Preis, identische Leistung wie im Massenmarkt. Für wen die Investition amortisiert.
Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.