Welcher PC für die lokale KI? Unsere Auswahl je nach Budget
Um ein KI-Modell auszuführen lokal (Llama, Qwen, Mistral, gpt-oss…), richtet sich die Wahl eines Rechners zunächst nach seinem Speicher, die die Größe der Modelle festlegt, und dann je nach Bandbreite, die ihre Geschwindigkeit bestimmt. Hier finden Sie unsere Auswahl für jedes Budget mit den Modellen, die tatsächlich auf den jeweiligen Geräten laufen.
Aktualisiert am 09/10/2026 · Richtpreise, die bei unseren Händlern im September 2026 festgestellt wurden und sich schnell ändern
- Unter 1.000 €
- 1 200 – 1 500 €
- 2 000 – 2 500 €
- 3 000 – 3 500 €
- Fertig montierter Tower-PC
- Laptop
- Darüber hinaus
- Fragen
Unsere Auswahl auf einen Blick
| Budget | Unsere Wahl | Speicher für Modelle | Bis zu (Q4) | Wo kaufen |
|---|---|---|---|---|
| Unter 1.000 € | RTX 5060 Ti 16 GB Grafikkarte · ≈ 820 € | 16 GB | 14B problemlos | |
| 1 200 – 1 500 € | RTX 5070 Ti 16 GB Grafikkarte · ≈ 1.300 – 1.400 € | 16 GB, 2× höhere Bandbreite | 14 B, schneller | |
| 2 000 – 2 500 € | Mac mini M5 Pro 24 GB / 512 GB Komplettrechner · ≈ 2.000 € | ≈ 16 GB (von 24) | 14B | |
| 2 000 – 2 500 € | Mini-PC GMKtec EVO-X2 64 GB (Ryzen AI Max+ 395) Komplettsystem | 64 GB | 30B problemlos | GMKtec: offizieller europäischer Shop (Website auf Französisch), Lieferung nach Frankreich in durchschnittlich 5 bis 8 Tagen. |
| 3 000 – 3 500 € | Mac Studio M5 Max 96 GB (GPU mit 32 Kernen) Workstation · ≈ 3.000 € | ≈ 72 GB (von 96) | 70B | |
| 3 300 – 4 000 € | Mini-PC Minisforum MS-S1 Max 128 GB / 2 TB (Ryzen AI Max+ 395) Komplettsystem | 128 GB | gpt-oss 120B | |
| 3 600 – 4 600 € | Fertig montierter PC Comete IA (RTX 5070 Ti 16 GB) Fertig montierter Tower-PC · ≈ 3.650 € | 16 GB (+ 32 GB RAM) | 14B problemlos | |
| 3 600 – 4 600 € | Fertig montierter PC Meteora IA (RTX 5080, 64 GB RAM) Fertig montierter Tower-PC | 16 GB (+ 64 GB RAM) | 14B; MoE 30B teilweise in RAM | |
| Laptop | Laptop RTX 5080 16 GB Laptop · ab ca. 2.500 € | 16 GB | 14B problemlos | |
| Laptop | MacBook Pro M5 Max 36 GB Mobil · ab 4.199 € (Apple-Preis) | ≈ 27 GB (von 36) | 30B-Klasse |
Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie; dies beeinflusst diese unabhängig erstellten Empfehlungen nicht. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
Zunächst: Wie groß soll das Modell sein, das Sie ausführen möchten?
| Größe | Beispiele | Speicherbedarf bei Q4 | Mindestkonfiguration |
|---|---|---|---|
| 7-8B | Llama 3.1 8B | ≈ 6 GB | Karte mit 8 GB oder Prozessor (langsam) |
| 12-14B | Gemma 3 12B, Qwen 3 14B | 7-9 GB | Grafikkarte mit 12–16 GB, Mac mit 24 GB |
| 20-24B | gpt-oss 20B, Mistral Small 3.2 24B | 13-14 GB | Karte mit 16 GB (knapp) |
| 27-32B | Gemma 3 27B, Qwen 3 32B, Qwen 3 30B-A3B | 16-19 GB | Grafikkarte mit 24–32 GB, vereinheitlichter Speicher ab 36 GB |
| 70-72B | Llama 3.3 70B Instruct, Qwen 2.5 72B Instruct | 40-42 GB | 64 bis 128 GB Unified Memory |
| 120B (MoE) | gpt-oss 120B | ≈ 70 GB | 96–128 GB gemeinsam genutzter Speicher |
Ein Modell MoE (Mixture of Experts) aktiviert bei jedem Wort nur einen Teil seiner Parameter: Es läuft viel schneller als ein dichtes Modell gleicher Größe, benötigt zum Laden aber genauso viel Speicher. Wissen Sie bereits, welches Modell Sie möchten? Der Konfigurator prüft, ob das Modell in den Speicher eines Rechners passt.
Die Falle: Mehr Speicher bedeutet nicht automatisch mehr Geschwindigkeit
| Rechner | Bandbreite |
|---|---|
| RTX 5080 (16 GB) | 960 GB/s |
| RTX 5070 Ti (16 GB) | 896 GB/s |
| Radeon RX 9070 XT (16 GB) | 644 GB/s |
| Apple M5 Max (36-128 GB) | 460 bis 614 GB/s |
| RTX 5060 Ti (16 GB) | 448 GB/s |
| Mac mini M5 Pro (24-64 GB) | 307 GB/s |
| NVIDIA DGX Spark (128 GB) | 273 GB/s |
| Ryzen AI Max+ 395 (64-128 GB) | ≈ 212 GB/s |
Tatsächliche Messung: Auf einem MacBook Pro M5 Max mit 128 GB liefert gpt-oss 120B (MoE) 79,1 Tokens/s und ist damit schneller als ein dichtes 27B-Modell (36,6 Tokens/s im GGUF-Format), weil es nur einen kleinen Teil seiner Parameter aktiviert. Den vollständigen Test ansehen.
Unter 1.000 €: eine Karte mit 16 GB für Ihren PC
RTX 5060 Ti 16 GB
Grafikkarte zum Einbau in einen vorhandenen PC
- Speicher16 GB dedizierter GDDR7-Speicher
- Bandbreite448 GB/s
- Richtpreis≈ 820 €
- Bis zu14B-Modelle problemlos, 24B-Modelle mit starker Quantisierung
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertEine dedizierte Grafikkarte bleibt bei gleicher Modellgröße die schnellste Lösung pro Euro. Für diese Karte wurde noch keine Messung von QuelLLM veröffentlicht.
✓ Die günstigste Option für mehr als 8 GB VRAM · CUDA: kompatibel mit Ollama, LM Studio, llama.cpp und vLLM
✗ Auf 16 GB begrenzt: kein komfortabler Betrieb von 32B-Modellen · Setzt einen aktuellen PC mit kompatiblem Netzteil und Gehäuse voraus
Anleitung: Welche LLMs auf einer RTX 5060 Ti? →Welcher LLM mit 16 GB VRAM →
AlternativeRadeon RX 9070 XT 16 GB (≈ 960 – 1 070 €) — Auch 16 GB, höhere Bandbreite (644 GB/s); im Softwarebereich bleibt ROCm weniger reif als CUDA: überprüfen Sie Ihre Tools. Unsere Produktübersicht →
Gar keine Grafikkarte? Ein kleines Modell mit 3 bis 8 Milliarden Parametern läuft auch auf dem Prozessor, allerdings langsam: siehe unser Leitfaden für LLM ohne GPU.
1.200 bis 1.500 €: die schnellste Karte mit 16 GB
RTX 5070 Ti 16 GB
Grafikkarte zum Einbau in einen vorhandenen PC
- Speicher16 GB dedizierter GDDR7-Speicher
- Bandbreite896 GB/s (doppelt so viel wie die 5060 Ti)
- Richtpreis≈ 1 300 – 1 400 €
- Bis zuDieselben Modelle wie auf der 5060 Ti (16 GB), mit deutlich schnellerer Generierung
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertDie Generationsgeschwindigkeit eines dichten Modells hängt von der Bandbreite ab: Mit 896 GB/s erreicht die 5070 Ti das Doppelte der 5060 Ti (448 GB/s) bei gleicher Speichergröße.
✓ Das beste Verhältnis von Geschwindigkeit zu Preis bei 16 GB · CUDA: Alle Tools und das LoRA-Fine-Tuning funktionieren
✗ Weiterhin 16 GB: dieselbe Obergrenze für die Modellgröße wie bei der 5060 Ti · Preis nur für die Grafikkarte, ohne den restlichen PC
Leitfaden: Welche LLM auf einer RTX 5070 Ti? →GPU für die lokale KI wählen →
AlternativeRTX 5080 16 GB (≈ 1 700 – 1 850 €) — 960 GB/s, also gerade einmal 7 % mehr Bandbreite als die 5070 Ti bei einem deutlich höheren Preis: Der Speicher bleibt bei 16 GB.
2.000 bis 2.500 €: ein vollständiges und leises System
Mac mini M5 Pro 24 GB / 512 GB
Komplettrechner, macOS
- Speicher24 GB vereinheitlichter Speicher, davon ≈ 16 GB für die GPU nutzbar
- Bandbreite307 GB/s
- Richtpreis≈ 2 000 €
- Bis zu14B-Modelle mit komfortablen Reserven
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertAuf dem Mac beschleunigt MLX häufig die Generierung: +86 % gemessen bei einem 27B-Modell (M5 Max, Test eines Lesers mit unserem Protokoll).
✓ Kompakt, leise, geringer Stromverbrauch · MLX, Ollama und LM Studio für Apple Silicon optimiert
✗ 24 GB werden bei Modellen über 14B schnell zum begrenzenden Faktor · Kein CUDA; Speicher nach dem Kauf nicht erweiterbar
Mini-PC GMKtec EVO-X2 64 GB (Ryzen AI Max+ 395)
Komplettrechner, Windows oder Linux
- Speicher64 GB gemeinsamer Speicher für CPU und GPU
- Bandbreite≈ 212 GB/s
- Bis zu30B-Klasse problemlos; ein 70B-Modell in Q4 passt in den Speicher, bleibt aber langsam
Was darauf läuft (erforderlicher Speicher in Q4)
SchätzungSehr schnell bei MoE-Modellen (Qwen 3 30B-A3B: geschätzte 50 bis 100 Tokens/s); bei einem dichten 70B-Modell sinkt die Geschwindigkeit auf 3–5 Tokens/s (Schätzungen aus unserem Datenblatt, keine Messung).
✓ 2,7-mal so viel Speicher wie beim Mac mini zu einem ähnlichen Preis · Ideal für MoE-Modelle mit 30B
✗ Weder CUDA noch macOS: AMD-Tools prüfen · Begrenzte Bandbreite für große dichte Modelle
GMKtec: offizieller europäischer Shop (Website auf Französisch), Lieferung nach Frankreich in durchschnittlich 5 bis 8 Tagen.
3.000 bis 3.500 €: 96 bis 128 GB für Modelle mit 70B
Mac Studio M5 Max 96 GB (GPU mit 32 Kernen)
Kompakte Workstation, macOS · bei Materiel.net erhältliche Konfiguration (Art.-Nr. MHL64ZD/A)
- Speicher96 GB gemeinsamer Speicher, davon etwa 72 GB für die GPU nutzbar
- Bandbreite460 GB/s
- Richtpreis≈ 3 000 €
- Bis zu70B-Modelle in Q4; für gpt-oss 120B (70 GB) reicht es kaum
Was darauf läuft (erforderlicher Speicher in Q4)
Vergleichbare MessungAuf einem MacBook Pro M5 Max mit 128 GB (40 Kerne, 614 GB/s): Qwen 3.8 27B erreicht 36,6 Tokens/s mit GGUF und 68 mit MLX. Rechnen Sie bei 32 Kernen (460 GB/s) mit etwas weniger.
✓ Die schnellste Maschine mit 96–128 GB in diesem Budget · Leise, MLX-Ökosystem
✗ Kein CUDA · Nicht erweiterbarer Speicher: Wählen Sie gleich beim Kauf die richtige Konfiguration
Mini-PC Minisforum MS-S1 Max 128 GB / 2 TB (Ryzen AI Max+ 395)
Komplettrechner, Windows oder Linux · zwei 10-GbE-Ports, PCIe-x16-Steckplatz
- Speicher128 GB vereinheitlichter Speicher, gemeinsam von CPU und GPU genutzt
- Bandbreite≈ 212 GB/s
- Bis zuBis zu gpt-oss 120B (MoE); 70B in Q4 ladbar
Was darauf läuft (erforderlicher Speicher in Q4)
SchätzungEin dichtes 70B-Modell läuft mit 3–5 Tokens/s, MoE-Modelle sind deutlich schneller (Schätzungen aus unserer Übersicht zum Ryzen AI Max, keine Messung).
✓ Ein Drittel mehr Speicher als der Mac Studio mit 96 GB · Lädt die größten Modelle für den breiten Anwenderkreis (gpt-oss 120B)
✗ Halb so viel Bandbreite wie beim Mac Studio · Weder CUDA noch macOS
3.600 bis 4.600 €: ein kompletter Tower-PC, zusammengebaut und getestet
Fertig montierter PC Comete IA (RTX 5070 Ti 16 GB)
Von Materiel.net zusammengebauter und getesteter Tower-PC · Ryzen 7 9800X3D, 2-TB-SSD, Windows 11
- Speicher16 GB VRAM + 32 GB DDR5-RAM
- Bandbreite896 GB/s (Grafikkarte)
- Richtpreis≈ 3 650 €
- Bis zu14B-Modelle laufen problemlos, genau wie mit der Karte allein
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertDieselbe Karte wie in der Preisklasse von 1.200–1.500 €: Sie bezahlen vor allem für einen kompletten, zusammengebauten und getesteten Rechner.
✓ Sofort einsatzbereit, ohne Zusammenbau · Prozessor und SSD der Spitzenklasse für Ihre übrigen Anwendungen
✗ Weiterhin nur 16 GB VRAM · Deutlich teurer als eine einzelne Karte, wenn Sie bereits einen PC besitzen
Fertig montierter PC Meteora IA (RTX 5080, 64 GB RAM)
Von Materiel.net zusammengebauter und getesteter Tower-PC · Ryzen 7 9800X3D, 2-TB-SSD, Windows 11
- Speicher16 GB VRAM + 64 GB DDR5-RAM
- Bandbreite960 GB/s (Grafikkarte)
- Bis zu14B passen problemlos auf die Karte; darüber wird ein Teil des Modells in den Arbeitsspeicher ausgelagert, wodurch die Ausführung deutlich langsamer wird
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertMit 64 GB RAM lässt sich ein MoE-Modell wie Qwen 3 30B-A3B teilweise in den Arbeitsspeicher statt auf die Grafikkarte laden, allerdings mit deutlich verringerter Geschwindigkeit.
✓ Schnellste Karte mit 16 GB + 64 GB RAM · Einsatzbereit, kein Zusammenbau nötig
✗ 16 GB VRAM: kein schneller Betrieb eines 32B-Modells · Zum gleichen Preis kann ein Mini-PC oder ein Mac mit gemeinsamem Arbeitsspeicher größere Modelle laden
Unterwegs: Laptop mit RTX 5080 oder MacBook Pro M5 Max?
Laptop RTX 5080 16 GB
Windows-Laptop
- Speicher16 GB dedizierter GDDR7-Speicher
- Bandbreite≈ 700 bis 900 GB/s je nach Gehäuse
- Richtpreisab ca. 2.500 €
- Bis zu14B-Modelle passen problemlos, bei 24B wird es knapp.
Was darauf läuft (erforderlicher Speicher in Q4)
OrientierungswertDasselbe Prinzip wie bei einer Desktop-Grafikkarte mit 16 GB, durch den thermischen Leistungsrahmen des Laptops etwas eingeschränkt.
✓ CUDA unterwegs · Der günstigste KI-Laptop mit 16 GB VRAM
✗ Lärm und Wärmeentwicklung bei längerer Generierung · Obergrenze von 16 GB
MacBook Pro M5 Max 36 GB
macOS-Laptop
- Speicher36 GB Unified Memory, davon ≈ 27 GB für die GPU nutzbar
- Bandbreite460 GB/s
- Richtpreisab 4.199 € (Apple-Preis)
- Bis zu30B-Klasse in Q4
Was darauf läuft (erforderlicher Speicher in Q4)
MessungIn der Version mit 128 GB (40 Kerne, am Stromnetz): gpt-oss 120B mit 79,1 Tokens/s und Qwen 3.8 27B mit 68 Tokens/s unter MLX (Test eines Lesers nach unserem Protokoll, 16.09.2026).
✓ Der einzige Laptop mit dem M5 Max-Chip · Leise, Akkulaufzeit
✗ Teuer für 36 GB: 64–128 GB sind über Apples individuelle Konfiguration erhältlich · Kein CUDA
DGX Spark, RTX 5090, Mac Studio M5 Ultra: Sollte man auf leistungsstärkere Hardware setzen?
| Rechner | Speicher · Bandbreite | Richtpreis | Unser Urteil |
|---|---|---|---|
| NVIDIA DGX Spark | 128 GB · 273 GB/s | ≈ 6 100 – 6 600 € | Für das NVIDIA-Ökosystem und das Training. Bei der Generierung bleibt die Bandbreite (273 GB/s) unter der eines Mac Studio M5 Max und liegt nur knapp über der eines Mini-PCs mit 128 GB, der halb so viel kostet. Derselbe GB10-Chip, schneller geliefert: der MSI EdgeXpert (128 GB). |
| RTX 5090 | 32 GB GDDR7 | hoch | Die schnellste Grafikkarte für Endverbraucher: 32 GB, um ein 30B-Modell vollständig zu laden. Nur für große Budgets und einen PC, der sie mit ausreichend Strom versorgen kann. |
| Mac Studio M5 Ultra | 96 bis 512 GB · bis zu 1,2 TB/s | ab 6.599 € | Für sehr große Modelle (120B und mehr, riesige MoE-Modelle) bei guter Geschwindigkeit. |
Wo Sie sie findenMSI EdgeXpert (GB10-Chip des DGX Spark, 128 GB)
RTX 5090 32 GB (Karte allein)
Mac, NVIDIA-PC oder AMD-Mini-PC: Was sich auf der Softwareseite ändert
| Plattform | Werkzeuge | Gut zu wissen |
|---|---|---|
| PC mit NVIDIA-Grafikkarte (CUDA) | Ollama, LM Studio, llama.cpp, vLLM | Alles funktioniert, einschließlich des Trainings (LoRA). Die einfachste Lösung. |
| Mac mit Apple Silicon | Ollama, LM Studio, llama.cpp, MLX | MLX beschleunigt häufig die Generierung (+86 % gemessen auf einem 27B). Kein CUDA. |
| Ryzen-AI-Max-Mini-PC, Radeon-Grafikkarte | Ollama, LM Studio, llama.cpp (Vulkan oder ROCm) | Kompatibilität je nach Tool zu überprüfen; ROCm ist weniger reif als CUDA. |
Häufige Fragen
Welcher PC ist am besten für die lokale KI im Jahr 2026?
Das hängt von der Größe der angestrebten Modelle ab. Bis 14B reicht eine Grafikkarte mit 16 GB (RTX 5060 Ti oder RTX 5070 Ti für mehr Geschwindigkeit) in einem vorhandenen PC. Als Komplettgerät kommt ein Mac mini M5 Pro (14B) oder ein Ryzen-AI-Max+-395-Mini-PC mit 64 GB (30B) infrage. Für 70B-Modelle sind 64 bis 128 GB vereinheitlichter Speicher nötig: ein Mac Studio M5 Max oder ein Mini-PC mit 128 GB.
Welche Grafikkarte für lokale KI wählen?
Streben Sie mindestens 16 GB VRAM an: die RTX 5060 Ti 16 GB für ein kleines Budget, die RTX 5070 Ti für die Geschwindigkeit (896 GB/s), die Radeon RX 9070 XT, wenn Ihnen die AMD-Tools zusagen. Vermeiden Sie die 8-GB-Versionen. Details in unser Leitfaden zur Auswahl Ihrer GPU.
Welchen Mini-PC sollte man für KI wählen?
Ein Mini-PC mit einheitlichem Speicher: Ryzen AI Max+ 395 mit 64 GB (GMKtec EVO-X2) oder 128 GB (GMKtec EVO-X2 128 GB, Minisforum MS-S1 Max), oder ein Mac mini M5 Pro, wenn Sie macOS möchten. Ein klassischer Mini-PC ohne viel gemeinsam genutzten Speicher kann nur kleine Modelle ausführen.
Braucht man eine Grafikkarte oder einen Mini-PC mit gemeinsamem Speicher?
Die Grafikkarte ist schneller (448 bis 960 GB/s), im Consumer-Bereich aber auf 16 GB begrenzt. Der gemeinsame Speicher (64 bis 128 GB) kann wesentlich größere Modelle laden, die damit jedoch langsamer Text generieren (212 bis 614 GB/s je nach Rechner). Wählen Sie entsprechend der angestrebten Modellgröße.
Wie viel kostet ein PC, auf dem ein LLM lokal läuft?
Etwa 750 bis 850 € für eine 16-GB-Grafikkarte zum Einbau in einen vorhandenen PC, 2.000 € für einen kompletten Rechner, der Modelle mit 14 bis 30 Milliarden Parametern ausführt, und 3.000 bis 3.500 € für Modelle mit 70 Milliarden Parametern und mehr.
Kann ein LLM ohne Grafikkarte laufen?
Ja, kleine Modelle mit 3 bis 8 Milliarden Parametern laufen mit 16 GB RAM auf dem Prozessor, allerdings langsam. Siehe unser Leitfaden für LLM ohne GPU.
Mac oder PC für die lokale KI?
Der Mac bietet viel Unified Memory, einen leisen Betrieb und MLX (+86 % Geschwindigkeit, gemessen an einem 27B-Modell), aber kein CUDA. Ein NVIDIA-PC bietet mehr Geschwindigkeit pro Euro und ist mit allem kompatibel, einschließlich Training. Ein AMD-Mini-PC bietet den meisten Speicher fürs Geld; die Tools müssen jedoch geprüft werden.
Welche Nachteile hat ein Mini-PC für die KI?
Eine mäßige Bandbreite (etwa 212 GB/s beim Ryzen AI Max+ 395): Ein dichtes 70B-Modell läuft darauf nach unseren Schätzungen mit 3–5 Tokens/s. Kein CUDA, und der Speicher lässt sich nach dem Kauf nicht erweitern.