Startseite›KI-Hardware›Welcher PC für lokale KI?

Welcher PC für die lokale KI? Unsere Auswahl je nach Budget

Um ein KI-Modell auszuführen lokal (Llama, Qwen, Mistral, gpt-oss…), richtet sich die Wahl eines Rechners zunächst nach seinem Speicher, die die Größe der Modelle festlegt, und dann je nach Bandbreite, die ihre Geschwindigkeit bestimmt. Hier finden Sie unsere Auswahl für jedes Budget mit den Modellen, die tatsächlich auf den jeweiligen Geräten laufen.

Aktualisiert am 09/10/2026 · Richtpreise, die bei unseren Händlern im September 2026 festgestellt wurden und sich schnell ändern

Von Mohamed Meguedmi · Modellgrößen aus unser Katalog · unsere Methode

Kurz gesagt: unter 1.000 €, fügen Sie einen 16-GB-Grafikkarte (RTX 5060 Ti) auf Ihrem PC; etwa 1.300 €, die RTX 5070 Ti ist bei gleicher Speicherkapazität doppelt so schnell; für rund 2.000 € ein kompletter Rechner: Mac mini M5 Pro oder mini-PC Ryzen AI Max+ 395 64 GB ; etwa 3.000–3.500 €, 96 bis 128 GB gemeinsamer Speicher für Modelle mit 70B Parametern. Oberhalb dieses Preisbereichs generiert eine Workstation wie der DGX Spark (273 GB/s, ≈ 6.100 bis 6.600 €) langsamer als ein deutlich günstigerer Mac Studio M5 Max.

Unsere Auswahl auf einen Blick

BudgetUnsere WahlSpeicher für ModelleBis zu (Q4)Wo kaufen
Unter 1.000 €RTX 5060 Ti 16 GB
Grafikkarte · ≈ 820 €
16 GB14B problemlos
1 200 – 1 500 €RTX 5070 Ti 16 GB
Grafikkarte · ≈ 1.300 – 1.400 €
16 GB, 2× höhere Bandbreite14 B, schneller
2 000 – 2 500 €Mac mini M5 Pro 24 GB / 512 GB
Komplettrechner · ≈ 2.000 €
≈ 16 GB (von 24)14B
2 000 – 2 500 €Mini-PC GMKtec EVO-X2 64 GB (Ryzen AI Max+ 395)
Komplettsystem
64 GB30B problemlos

GMKtec: offizieller europäischer Shop (Website auf Französisch), Lieferung nach Frankreich in durchschnittlich 5 bis 8 Tagen.

3 000 – 3 500 €Mac Studio M5 Max 96 GB (GPU mit 32 Kernen)
Workstation · ≈ 3.000 €
≈ 72 GB (von 96)70B
3 300 – 4 000 €Mini-PC Minisforum MS-S1 Max 128 GB / 2 TB (Ryzen AI Max+ 395)
Komplettsystem
128 GBgpt-oss 120B
3 600 – 4 600 €Fertig montierter PC Comete IA (RTX 5070 Ti 16 GB)
Fertig montierter Tower-PC · ≈ 3.650 €
16 GB (+ 32 GB RAM)14B problemlos
3 600 – 4 600 €Fertig montierter PC Meteora IA (RTX 5080, 64 GB RAM)
Fertig montierter Tower-PC
16 GB (+ 64 GB RAM)14B; MoE 30B teilweise in RAM
LaptopLaptop RTX 5080 16 GB
Laptop · ab ca. 2.500 €
16 GB14B problemlos
LaptopMacBook Pro M5 Max 36 GB
Mobil · ab 4.199 € (Apple-Preis)
≈ 27 GB (von 36)30B-Klasse

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie; dies beeinflusst diese unabhängig erstellten Empfehlungen nicht. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Zunächst: Wie groß soll das Modell sein, das Sie ausführen möchten?

Der Arbeitsspeicher des Rechners muss das gesamte Modell aufnehmen können, zusätzlich zu 1 bis 2 GB für den Kontext. Die Tabelle zeigt den benötigten Speicher bei Q4, die am häufigsten verwendete Quantisierung. Auf einem Mac sollten Sie davon ausgehen, dass etwa 75 % des vereinheitlichten Speichers ist von der GPU nutzbar, bei den Basiskonfigurationen etwas weniger (≈ 16 GB von 24).
GrößeBeispieleSpeicherbedarf bei Q4Mindestkonfiguration
7-8BLlama 3.1 8B≈ 6 GBKarte mit 8 GB oder Prozessor (langsam)
12-14BGemma 3 12B, Qwen 3 14B7-9 GBGrafikkarte mit 12–16 GB, Mac mit 24 GB
20-24Bgpt-oss 20B, Mistral Small 3.2 24B13-14 GBKarte mit 16 GB (knapp)
27-32BGemma 3 27B, Qwen 3 32B, Qwen 3 30B-A3B16-19 GBGrafikkarte mit 24–32 GB, vereinheitlichter Speicher ab 36 GB
70-72BLlama 3.3 70B Instruct, Qwen 2.5 72B Instruct40-42 GB64 bis 128 GB Unified Memory
120B (MoE)gpt-oss 120B≈ 70 GB96–128 GB gemeinsam genutzter Speicher

Ein Modell MoE (Mixture of Experts) aktiviert bei jedem Wort nur einen Teil seiner Parameter: Es läuft viel schneller als ein dichtes Modell gleicher Größe, benötigt zum Laden aber genauso viel Speicher. Wissen Sie bereits, welches Modell Sie möchten? Der Konfigurator prüft, ob das Modell in den Speicher eines Rechners passt.

Die Falle: Mehr Speicher bedeutet nicht automatisch mehr Geschwindigkeit

Bei einem dichten Modell hängt die Generierungsgeschwindigkeit hauptsächlich von der Speicherbandbreite : Bei jedem Wort liest der Rechner das gesamte Modell erneut ein. Eine Grafikkarte mit 16 GB ist daher schneller als eine Workstation mit 128 GB … bei Modellen, die in ihre 16 GB passen.
RechnerBandbreite
RTX 5080 (16 GB)960 GB/s
RTX 5070 Ti (16 GB)896 GB/s
Radeon RX 9070 XT (16 GB)644 GB/s
Apple M5 Max (36-128 GB)460 bis 614 GB/s
RTX 5060 Ti (16 GB)448 GB/s
Mac mini M5 Pro (24-64 GB)307 GB/s
NVIDIA DGX Spark (128 GB)273 GB/s
Ryzen AI Max+ 395 (64-128 GB)≈ 212 GB/s

Tatsächliche Messung: Auf einem MacBook Pro M5 Max mit 128 GB liefert gpt-oss 120B (MoE) 79,1 Tokens/s und ist damit schneller als ein dichtes 27B-Modell (36,6 Tokens/s im GGUF-Format), weil es nur einen kleinen Teil seiner Parameter aktiviert. Den vollständigen Test ansehen.

Unter 1.000 €: eine Karte mit 16 GB für Ihren PC

Sie haben bereits einen Desktop-PC? Das Hinzufügen einer RTX 5060 Ti 16 GB ist der günstigste Weg zum Betrieb von Modellen mit bis zu 14 Milliarden Parameter problemlos auszuführen, und ein 24B-Modell mit starker Quantisierung. Vermeiden Sie die 8-GB-Version: 14B-Modelle passen dort nicht mehr hinein.

RTX 5060 Ti 16 GB

Grafikkarte zum Einbau in einen vorhandenen PC

  • Speicher16 GB dedizierter GDDR7-Speicher
  • Bandbreite448 GB/s
  • Richtpreis≈ 820 €
  • Bis zu14B-Modelle problemlos, 24B-Modelle mit starker Quantisierung

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertEine dedizierte Grafikkarte bleibt bei gleicher Modellgröße die schnellste Lösung pro Euro. Für diese Karte wurde noch keine Messung von QuelLLM veröffentlicht.

✓ Die günstigste Option für mehr als 8 GB VRAM · CUDA: kompatibel mit Ollama, LM Studio, llama.cpp und vLLM

✗ Auf 16 GB begrenzt: kein komfortabler Betrieb von 32B-Modellen · Setzt einen aktuellen PC mit kompatiblem Netzteil und Gehäuse voraus

AlternativeRadeon RX 9070 XT 16 GB (≈ 960 – 1 070 €) — Auch 16 GB, höhere Bandbreite (644 GB/s); im Softwarebereich bleibt ROCm weniger reif als CUDA: überprüfen Sie Ihre Tools. Unsere Produktübersicht →

Gar keine Grafikkarte? Ein kleines Modell mit 3 bis 8 Milliarden Parametern läuft auch auf dem Prozessor, allerdings langsam: siehe unser Leitfaden für LLM ohne GPU.

1.200 bis 1.500 €: die schnellste Karte mit 16 GB

La RTX 5070 Ti behält 16 GB Speicher, aber doppelte Bandbreite (896 GB/s gegenüber 448 GB/s): dieselben Modelle, aber mit deutlich schnellerer Generierung. Das ist eine gute Wahl für Programmierung oder RAG im Alltag.

RTX 5070 Ti 16 GB

Grafikkarte zum Einbau in einen vorhandenen PC

  • Speicher16 GB dedizierter GDDR7-Speicher
  • Bandbreite896 GB/s (doppelt so viel wie die 5060 Ti)
  • Richtpreis≈ 1 300 – 1 400 €
  • Bis zuDieselben Modelle wie auf der 5060 Ti (16 GB), mit deutlich schnellerer Generierung

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertDie Generationsgeschwindigkeit eines dichten Modells hängt von der Bandbreite ab: Mit 896 GB/s erreicht die 5070 Ti das Doppelte der 5060 Ti (448 GB/s) bei gleicher Speichergröße.

✓ Das beste Verhältnis von Geschwindigkeit zu Preis bei 16 GB · CUDA: Alle Tools und das LoRA-Fine-Tuning funktionieren

✗ Weiterhin 16 GB: dieselbe Obergrenze für die Modellgröße wie bei der 5060 Ti · Preis nur für die Grafikkarte, ohne den restlichen PC

AlternativeRTX 5080 16 GB (≈ 1 700 – 1 850 €) — 960 GB/s, also gerade einmal 7 % mehr Bandbreite als die 5070 Ti bei einem deutlich höheren Preis: Der Speicher bleibt bei 16 GB.

2.000 bis 2.500 €: ein vollständiges und leises System

Kein PC zum Aufrüsten vorhanden? Zwei Komplettsysteme kommen in diesem Budgetrahmen infrage: der Mac mini M5 Pro 24 GB für macOS und einen leisen Betrieb oder ein Mini-PC Ryzen AI Max+ 395 mit 64 GB für 2,7-mal so viel Speicher und Modelle mit 30B.

Mac mini M5 Pro 24 GB / 512 GB

Komplettrechner, macOS

  • Speicher24 GB vereinheitlichter Speicher, davon ≈ 16 GB für die GPU nutzbar
  • Bandbreite307 GB/s
  • Richtpreis≈ 2 000 €
  • Bis zu14B-Modelle mit komfortablen Reserven

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertAuf dem Mac beschleunigt MLX häufig die Generierung: +86 % gemessen bei einem 27B-Modell (M5 Max, Test eines Lesers mit unserem Protokoll).

✓ Kompakt, leise, geringer Stromverbrauch · MLX, Ollama und LM Studio für Apple Silicon optimiert

✗ 24 GB werden bei Modellen über 14B schnell zum begrenzenden Faktor · Kein CUDA; Speicher nach dem Kauf nicht erweiterbar

Mini-PC GMKtec EVO-X2 64 GB (Ryzen AI Max+ 395)

Komplettrechner, Windows oder Linux

  • Speicher64 GB gemeinsamer Speicher für CPU und GPU
  • Bandbreite≈ 212 GB/s
  • Bis zu30B-Klasse problemlos; ein 70B-Modell in Q4 passt in den Speicher, bleibt aber langsam

Was darauf läuft (erforderlicher Speicher in Q4)

SchätzungSehr schnell bei MoE-Modellen (Qwen 3 30B-A3B: geschätzte 50 bis 100 Tokens/s); bei einem dichten 70B-Modell sinkt die Geschwindigkeit auf 3–5 Tokens/s (Schätzungen aus unserem Datenblatt, keine Messung).

✓ 2,7-mal so viel Speicher wie beim Mac mini zu einem ähnlichen Preis · Ideal für MoE-Modelle mit 30B

✗ Weder CUDA noch macOS: AMD-Tools prüfen · Begrenzte Bandbreite für große dichte Modelle

GMKtec: offizieller europäischer Shop (Website auf Französisch), Lieferung nach Frankreich in durchschnittlich 5 bis 8 Tagen.

3.000 bis 3.500 €: 96 bis 128 GB für Modelle mit 70B

Für ein 70B-Modell (Llama 3.3, Qwen 2.5 72B) oder ein großes MoE wie gpt-oss 120B benötigt man 64 bis 128 GB vereinheitlichter Arbeitsspeicher. Der Mac Studio M5 Max 96 GB erzeugt schneller; ein Mini-PC Ryzen AI Max+ 395 mit 128 GB lädt größere Modelle: der Minisforum MS-S1 Max auf Amazon oder der GMKtec EVO-X2 128 GB im offiziellen GMKtec-Shop.

Mac Studio M5 Max 96 GB (GPU mit 32 Kernen)

Kompakte Workstation, macOS · bei Materiel.net erhältliche Konfiguration (Art.-Nr. MHL64ZD/A)

  • Speicher96 GB gemeinsamer Speicher, davon etwa 72 GB für die GPU nutzbar
  • Bandbreite460 GB/s
  • Richtpreis≈ 3 000 €
  • Bis zu70B-Modelle in Q4; für gpt-oss 120B (70 GB) reicht es kaum

Was darauf läuft (erforderlicher Speicher in Q4)

Vergleichbare MessungAuf einem MacBook Pro M5 Max mit 128 GB (40 Kerne, 614 GB/s): Qwen 3.8 27B erreicht 36,6 Tokens/s mit GGUF und 68 mit MLX. Rechnen Sie bei 32 Kernen (460 GB/s) mit etwas weniger.

✓ Die schnellste Maschine mit 96–128 GB in diesem Budget · Leise, MLX-Ökosystem

✗ Kein CUDA · Nicht erweiterbarer Speicher: Wählen Sie gleich beim Kauf die richtige Konfiguration

Mini-PC Minisforum MS-S1 Max 128 GB / 2 TB (Ryzen AI Max+ 395)

Komplettrechner, Windows oder Linux · zwei 10-GbE-Ports, PCIe-x16-Steckplatz

  • Speicher128 GB vereinheitlichter Speicher, gemeinsam von CPU und GPU genutzt
  • Bandbreite≈ 212 GB/s
  • Bis zuBis zu gpt-oss 120B (MoE); 70B in Q4 ladbar

Was darauf läuft (erforderlicher Speicher in Q4)

SchätzungEin dichtes 70B-Modell läuft mit 3–5 Tokens/s, MoE-Modelle sind deutlich schneller (Schätzungen aus unserer Übersicht zum Ryzen AI Max, keine Messung).

✓ Ein Drittel mehr Speicher als der Mac Studio mit 96 GB · Lädt die größten Modelle für den breiten Anwenderkreis (gpt-oss 120B)

✗ Halb so viel Bandbreite wie beim Mac Studio · Weder CUDA noch macOS

3.600 bis 4.600 €: ein kompletter Tower-PC, zusammengebaut und getestet

Sie bevorzugen einen sofort einsatzbereiten Desktop-Tower statt einer Grafikkarte, die Sie selbst einbauen müssen? Materiel.net baut speziell für KI ausgelegte PCs zusammen: der Comete IA (RTX 5070 Ti) und der Meteora IA (RTX 5080, 64 GB RAM). Sie behalten 16 GB VRAM : die gleiche Modellgröße wie eine Karte allein, ohne Montage.

Fertig montierter PC Comete IA (RTX 5070 Ti 16 GB)

Von Materiel.net zusammengebauter und getesteter Tower-PC · Ryzen 7 9800X3D, 2-TB-SSD, Windows 11

  • Speicher16 GB VRAM + 32 GB DDR5-RAM
  • Bandbreite896 GB/s (Grafikkarte)
  • Richtpreis≈ 3 650 €
  • Bis zu14B-Modelle laufen problemlos, genau wie mit der Karte allein

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertDieselbe Karte wie in der Preisklasse von 1.200–1.500 €: Sie bezahlen vor allem für einen kompletten, zusammengebauten und getesteten Rechner.

✓ Sofort einsatzbereit, ohne Zusammenbau · Prozessor und SSD der Spitzenklasse für Ihre übrigen Anwendungen

✗ Weiterhin nur 16 GB VRAM · Deutlich teurer als eine einzelne Karte, wenn Sie bereits einen PC besitzen

Fertig montierter PC Meteora IA (RTX 5080, 64 GB RAM)

Von Materiel.net zusammengebauter und getesteter Tower-PC · Ryzen 7 9800X3D, 2-TB-SSD, Windows 11

  • Speicher16 GB VRAM + 64 GB DDR5-RAM
  • Bandbreite960 GB/s (Grafikkarte)
  • Bis zu14B passen problemlos auf die Karte; darüber wird ein Teil des Modells in den Arbeitsspeicher ausgelagert, wodurch die Ausführung deutlich langsamer wird

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertMit 64 GB RAM lässt sich ein MoE-Modell wie Qwen 3 30B-A3B teilweise in den Arbeitsspeicher statt auf die Grafikkarte laden, allerdings mit deutlich verringerter Geschwindigkeit.

✓ Schnellste Karte mit 16 GB + 64 GB RAM · Einsatzbereit, kein Zusammenbau nötig

✗ 16 GB VRAM: kein schneller Betrieb eines 32B-Modells · Zum gleichen Preis kann ein Mini-PC oder ein Mac mit gemeinsamem Arbeitsspeicher größere Modelle laden

Unterwegs: Laptop mit RTX 5080 oder MacBook Pro M5 Max?

Un Laptop RTX 5080 16 GB behält CUDA und die Geschwindigkeit einer dedizierten Grafikkarte bei, bleibt aber auf 16 GB beschränkt. Das MacBook Pro M5 Max bietet mehr Speicher und einen lautlosen Betrieb, aber der eigentliche Sprung (70B, 120B) gelingt erst mit seinen deutlich teureren Konfigurationen mit 64–128 GB.

Laptop RTX 5080 16 GB

Windows-Laptop

  • Speicher16 GB dedizierter GDDR7-Speicher
  • Bandbreite≈ 700 bis 900 GB/s je nach Gehäuse
  • Richtpreisab ca. 2.500 €
  • Bis zu14B-Modelle passen problemlos, bei 24B wird es knapp.

Was darauf läuft (erforderlicher Speicher in Q4)

OrientierungswertDasselbe Prinzip wie bei einer Desktop-Grafikkarte mit 16 GB, durch den thermischen Leistungsrahmen des Laptops etwas eingeschränkt.

✓ CUDA unterwegs · Der günstigste KI-Laptop mit 16 GB VRAM

✗ Lärm und Wärmeentwicklung bei längerer Generierung · Obergrenze von 16 GB

MacBook Pro M5 Max 36 GB

macOS-Laptop

  • Speicher36 GB Unified Memory, davon ≈ 27 GB für die GPU nutzbar
  • Bandbreite460 GB/s
  • Richtpreisab 4.199 € (Apple-Preis)
  • Bis zu30B-Klasse in Q4

Was darauf läuft (erforderlicher Speicher in Q4)

MessungIn der Version mit 128 GB (40 Kerne, am Stromnetz): gpt-oss 120B mit 79,1 Tokens/s und Qwen 3.8 27B mit 68 Tokens/s unter MLX (Test eines Lesers nach unserem Protokoll, 16.09.2026).

✓ Der einzige Laptop mit dem M5 Max-Chip · Leise, Akkulaufzeit

✗ Teuer für 36 GB: 64–128 GB sind über Apples individuelle Konfiguration erhältlich · Kein CUDA

DGX Spark, RTX 5090, Mac Studio M5 Ultra: Sollte man auf leistungsstärkere Hardware setzen?

Selten für den privaten Gebrauch. Diese Geräte haben jeweils einen bestimmten Nutzen, bieten derzeit aber nicht das beste Verhältnis zwischen Preis und Generierungsgeschwindigkeit.
RechnerSpeicher · BandbreiteRichtpreisUnser Urteil
NVIDIA DGX Spark128 GB · 273 GB/s≈ 6 100 – 6 600 €Für das NVIDIA-Ökosystem und das Training. Bei der Generierung bleibt die Bandbreite (273 GB/s) unter der eines Mac Studio M5 Max und liegt nur knapp über der eines Mini-PCs mit 128 GB, der halb so viel kostet. Derselbe GB10-Chip, schneller geliefert: der MSI EdgeXpert (128 GB).
RTX 509032 GB GDDR7hochDie schnellste Grafikkarte für Endverbraucher: 32 GB, um ein 30B-Modell vollständig zu laden. Nur für große Budgets und einen PC, der sie mit ausreichend Strom versorgen kann.
Mac Studio M5 Ultra96 bis 512 GB · bis zu 1,2 TB/sab 6.599 €Für sehr große Modelle (120B und mehr, riesige MoE-Modelle) bei guter Geschwindigkeit.

Wo Sie sie findenMSI EdgeXpert (GB10-Chip des DGX Spark, 128 GB)

RTX 5090 32 GB (Karte allein)

Mac, NVIDIA-PC oder AMD-Mini-PC: Was sich auf der Softwareseite ändert

PlattformWerkzeugeGut zu wissen
PC mit NVIDIA-Grafikkarte (CUDA)Ollama, LM Studio, llama.cpp, vLLMAlles funktioniert, einschließlich des Trainings (LoRA). Die einfachste Lösung.
Mac mit Apple SiliconOllama, LM Studio, llama.cpp, MLXMLX beschleunigt häufig die Generierung (+86 % gemessen auf einem 27B). Kein CUDA.
Ryzen-AI-Max-Mini-PC, Radeon-GrafikkarteOllama, LM Studio, llama.cpp (Vulkan oder ROCm)Kompatibilität je nach Tool zu überprüfen; ROCm ist weniger reif als CUDA.

Häufige Fragen

Welcher PC ist am besten für die lokale KI im Jahr 2026?

Das hängt von der Größe der angestrebten Modelle ab. Bis 14B reicht eine Grafikkarte mit 16 GB (RTX 5060 Ti oder RTX 5070 Ti für mehr Geschwindigkeit) in einem vorhandenen PC. Als Komplettgerät kommt ein Mac mini M5 Pro (14B) oder ein Ryzen-AI-Max+-395-Mini-PC mit 64 GB (30B) infrage. Für 70B-Modelle sind 64 bis 128 GB vereinheitlichter Speicher nötig: ein Mac Studio M5 Max oder ein Mini-PC mit 128 GB.

Welche Grafikkarte für lokale KI wählen?

Streben Sie mindestens 16 GB VRAM an: die RTX 5060 Ti 16 GB für ein kleines Budget, die RTX 5070 Ti für die Geschwindigkeit (896 GB/s), die Radeon RX 9070 XT, wenn Ihnen die AMD-Tools zusagen. Vermeiden Sie die 8-GB-Versionen. Details in unser Leitfaden zur Auswahl Ihrer GPU.

Welchen Mini-PC sollte man für KI wählen?

Ein Mini-PC mit einheitlichem Speicher: Ryzen AI Max+ 395 mit 64 GB (GMKtec EVO-X2) oder 128 GB (GMKtec EVO-X2 128 GB, Minisforum MS-S1 Max), oder ein Mac mini M5 Pro, wenn Sie macOS möchten. Ein klassischer Mini-PC ohne viel gemeinsam genutzten Speicher kann nur kleine Modelle ausführen.

Braucht man eine Grafikkarte oder einen Mini-PC mit gemeinsamem Speicher?

Die Grafikkarte ist schneller (448 bis 960 GB/s), im Consumer-Bereich aber auf 16 GB begrenzt. Der gemeinsame Speicher (64 bis 128 GB) kann wesentlich größere Modelle laden, die damit jedoch langsamer Text generieren (212 bis 614 GB/s je nach Rechner). Wählen Sie entsprechend der angestrebten Modellgröße.

Wie viel kostet ein PC, auf dem ein LLM lokal läuft?

Etwa 750 bis 850 € für eine 16-GB-Grafikkarte zum Einbau in einen vorhandenen PC, 2.000 € für einen kompletten Rechner, der Modelle mit 14 bis 30 Milliarden Parametern ausführt, und 3.000 bis 3.500 € für Modelle mit 70 Milliarden Parametern und mehr.

Kann ein LLM ohne Grafikkarte laufen?

Ja, kleine Modelle mit 3 bis 8 Milliarden Parametern laufen mit 16 GB RAM auf dem Prozessor, allerdings langsam. Siehe unser Leitfaden für LLM ohne GPU.

Mac oder PC für die lokale KI?

Der Mac bietet viel Unified Memory, einen leisen Betrieb und MLX (+86 % Geschwindigkeit, gemessen an einem 27B-Modell), aber kein CUDA. Ein NVIDIA-PC bietet mehr Geschwindigkeit pro Euro und ist mit allem kompatibel, einschließlich Training. Ein AMD-Mini-PC bietet den meisten Speicher fürs Geld; die Tools müssen jedoch geprüft werden.

Welche Nachteile hat ein Mini-PC für die KI?

Eine mäßige Bandbreite (etwa 212 GB/s beim Ryzen AI Max+ 395): Ein dichtes 70B-Modell läuft darauf nach unseren Schätzungen mit 3–5 Tokens/s. Kein CUDA, und der Speicher lässt sich nach dem Kauf nicht erweitern.

Weiterführende Informationen