◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Budgetguide · aktualisiert 2026

Den eigenen lokalen LLM-Stack aufbauen nach Budget

Die günstigste Kombination aus Hardware und Modell, mit der Qwen 3, Gemma 3 und die destillierten Modelle von DeepSeek R1 im Jahr 2026 tatsächlich mit einer brauchbaren Geschwindigkeit laufen.

Welche Maschine passt zu meinem Budget?

Geben Sie Ihr Budget und Ihre Priorität ein: Das Tool schlägt passende Rechner vor, zeigt, was darauf läuft, und nennt ihre diese Woche überprüften Preise.

Wie man diesen Leitfaden liest

Legen Sie zwei Variablen fest: Budget et Hauptanwendung. Alles andere — Quantisierung, Laufzeitumgebung, Kontextlänge — ergibt sich daraus. Gehen Sie vom VRAM aus, wählen Sie das größte Modell, das in Q4_K_M bei 8K Kontextlänge noch mit etwas Reserve hineinpasst, und wählen Sie dann die Laufzeitumgebung.

Faustregel: Ein Modell im GGUF-Format mit Q4_K_M-Quantisierung belegt etwa (paramètres × 0,6) Go VRAM, plus etwa 1,5 GB KV-Cache bei 8K. Ein 14B benötigt daher etwa 10 GB, was erklärt, warum die RTX 3060 mit 12 GB als gebrauchte Grafikkarte weiterhin eine Referenz im Preis-Leistungsverhältnis bleibt.

Wählen Sie Ihre Budgetstufe

StufeBudgetReferenzkonfigurationVRAM / gemeinsamer SpeicherIdeales Modell (Q4_K_M)
Eingabe400-550 €Gebrauchter Mini-PC mit Ryzen 7 5700U, 16 GB DDR40 GB GPU / 16 GB RAMQwen3 4B
Preis-Leistung850-1 000 €Ryzen 5 7600 + RTX 3060 12 GB gebraucht + 32 GB DDR512 GBQwen 3 14B oder Qwen 2.5 Coder 14B
Leistung1 400-1 600 €Ryzen 7 7700 + RTX 3090 24 GB gebraucht + 64 GB DDR524 GBQwen3-Coder 30B-A3B oder DeepSeek-R1-Distill-Qwen-32B
Leise≈ 2 000 €Apple Mac mini M5 Pro 24 GB (neu)≈ 16 GB nutzbarer SpeicherQwen 3 14B

Unverbindliche Preisangaben für den Gebrauchtmarkt in Frankreich und der EU Mitte 2026 – die Gebrauchtpreise schwanken. Prüfen Sie vor dem Kauf die aktuellen Preise.

Stufe 2 — der Sieger für 900 €

Dies ist die Budgetstufe, die wir den meisten Lesern empfehlen. Eine gebrauchte RTX 3060 mit 12 GB kostet auf dem Gebrauchtmarkt etwa 200–240 €, und 12 GB VRAM sind genau die ideale Größe für Modelle der 14B-Klasse.

Modell (Q4_K_M)Verwendeter VRAMTokens/s (Schätzung)Ideal für
Qwen 3 8B~6 GB~50Chat, RAG
Qwen 2.5 Coder 14B~10 GB~28Code-Completion, Refactoring
Gemma 3 12B~8 GB~34Mehrsprachig, dokumentbasierte Fragenbeantwortung
DeepSeek-R1-Distill-Qwen-14B~10 GB~28Schrittweises Schlussfolgern

Schätzung, keine Messung von QuelLLM: etwa 70 % der theoretischen Obergrenze (Speicherbandbreite der RTX 3060, 360 GB/s, geteilt durch die Modellgröße). Die Obergrenze für ein 8B-Modell in Q4 liegt bei etwa 72 Tokens/s, die für ein 14B-Modell bei etwa 40.

Runtime: Ollama, llama.cpp oder vLLM?

Einzelentwickler → standardmäßig Ollama. Teams ab 3 Personen → vLLM hinter einem kleinen FastAPI-Proxy.

Stromverbrauch, Geräuschentwicklung und Gesamtkosten

ConfigLeerlauf (W)Leistung (W)kWh/Jahr (4 Stunden pro Tag unter Last)Kosten pro Jahr @ 0,20 €/kWh
Einsteiger-Mini-PC8355110,20 €
3060 Wert4522032164,20 €
Leistung der 309050360526105,10 €
Mac mini (Pro-Prozessor)6659519,00 €

Die Leistungsangaben sind grobe Größenordnungen. Berechnung: Leistung unter Last × 4 h × 365 Tage; die Maschine ist in der übrigen Zeit ausgeschaltet. Bleibt sie im Leerlauf eingeschaltet, addieren Sie die Leerlaufleistung × 20 h × 365.

Selbst bei der stromhungrigsten Konfiguration entstehen bei diesem Nutzungsrhythmus etwa 105 € Stromkosten pro Jahr. Das entspricht etwas mehr als fünf Monaten eines Abonnements für 20 €/Monat.

Fazit

ProfilEmpfohlene StufeWarum
Neugierig, nur ChatEinstieg 400 €Qwen3 4B auf CPU läuft schneller als die Lesevorgänge
Einzelner Entwickler, tägliches CodingWert: 900 €Ein 14B-Modell für Code mit ~28 tok/s bietet das ausgewogene Preis-Leistungs-Verhältnis
Schlussfolgern, Agenten, mehrere ModelleLeistung 1.500 €24 GB ermöglichen Modelle der Klasse 32B
Ruhe und keinerlei WartungStille ≈ 2.000 €Der Mac mini verbraucht im Leerlauf nur wenige Watt

Häufige Fragen

Reichen 8 GB VRAM im Jahr 2026 für eine sinnvolle Nutzung aus?

Nur knapp. Sie können Qwen3 8B Q4_K_M mit einem 4K-Kontext auf einer RTX 3050 mit 8 GB oder einer RX 6600 betreiben, aber dann fehlt der Spielraum für 14B-Modelle, die lokale Inferenz wirklich interessant machen. Nach Möglichkeit 12 GB anpeilen.

Sollten Sie eine AMD-Karte statt einer NVIDIA-Karte kaufen?

Für reine Inferenz funktionieren Radeon-Karten mit RDNA3 und RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) gut mit dem Vulkan-Backend von llama.cpp und mit ROCm. Bei gleicher Speicherkapazität kosten sie oft weniger, aber Sie verlieren einen Teil des CUDA-Ökosystems: eingeschränkteres vLLM sowie flash-attn und die meisten Fine-Tuning-Tools.

Kann man mit diesen Budgets fine-tunen?

LoRA-Fine-Tuning von 7B-Modellen funktioniert mit Unsloth auf einer Grafikkarte mit 12 GB Speicher. Ein Modell mit 14B oder mehr benötigt realistischerweise 24 GB. Vollständiges Fine-Tuning von Modellen mit mehr als 1B übersteigt das, was Consumer-Hardware im Jahr 2026 leisten kann.

Wie schneidet der gemeinsame Arbeitsspeicher (Unified Memory) eines Macs im Vergleich zu dediziertem VRAM ab?

Seine Bandbreite bleibt deutlich unter der eines hochleistungsfähigen Grafikchips: 307 GB/s auf einem Mac mini M5 Pro gegenüber 936 GB/s auf einer RTX 3090. Bei einem Modell, das auf der Karte läuft, erzeugt der Mac daher etwa 2 bis 3 Mal weniger Tokens pro Sekunde. Er gewinnt in Bezug auf Stromverbrauch, Speicherkapazität und die gleichzeitige Ausführung mehrerer Modelle; er verliert hingegen in Bezug auf Tokens pro Euro.

Mehr kostenlose Tools