Budgetguide · aktualisiert 2026
Den eigenen lokalen LLM-Stack aufbauen nach Budget
Die günstigste Kombination aus Hardware und Modell, mit der Qwen 3, Gemma 3 und die destillierten Modelle von DeepSeek R1 im Jahr 2026 tatsächlich mit einer brauchbaren Geschwindigkeit laufen.
Welche Maschine passt zu meinem Budget?
Geben Sie Ihr Budget und Ihre Priorität ein: Das Tool schlägt passende Rechner vor, zeigt, was darauf läuft, und nennt ihre diese Woche überprüften Preise.
Wie man diesen Leitfaden liest
Legen Sie zwei Variablen fest: Budget et Hauptanwendung. Alles andere — Quantisierung, Laufzeitumgebung, Kontextlänge — ergibt sich daraus. Gehen Sie vom VRAM aus, wählen Sie das größte Modell, das in Q4_K_M bei 8K Kontextlänge noch mit etwas Reserve hineinpasst, und wählen Sie dann die Laufzeitumgebung.
Faustregel: Ein Modell im GGUF-Format mit Q4_K_M-Quantisierung belegt etwa (paramètres × 0,6) Go VRAM, plus etwa 1,5 GB KV-Cache bei 8K. Ein 14B benötigt daher etwa 10 GB, was erklärt, warum die RTX 3060 mit 12 GB als gebrauchte Grafikkarte weiterhin eine Referenz im Preis-Leistungsverhältnis bleibt.
Wählen Sie Ihre Budgetstufe
| Stufe | Budget | Referenzkonfiguration | VRAM / gemeinsamer Speicher | Ideales Modell (Q4_K_M) |
|---|---|---|---|---|
| Eingabe | 400-550 € | Gebrauchter Mini-PC mit Ryzen 7 5700U, 16 GB DDR4 | 0 GB GPU / 16 GB RAM | Qwen3 4B |
| Preis-Leistung | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 GB gebraucht + 32 GB DDR5 | 12 GB | Qwen 3 14B oder Qwen 2.5 Coder 14B |
| Leistung | 1 400-1 600 € | Ryzen 7 7700 + RTX 3090 24 GB gebraucht + 64 GB DDR5 | 24 GB | Qwen3-Coder 30B-A3B oder DeepSeek-R1-Distill-Qwen-32B |
| Leise | ≈ 2 000 € | Apple Mac mini M5 Pro 24 GB (neu) | ≈ 16 GB nutzbarer Speicher | Qwen 3 14B |
Unverbindliche Preisangaben für den Gebrauchtmarkt in Frankreich und der EU Mitte 2026 – die Gebrauchtpreise schwanken. Prüfen Sie vor dem Kauf die aktuellen Preise.
Stufe 2 — der Sieger für 900 €
Dies ist die Budgetstufe, die wir den meisten Lesern empfehlen. Eine gebrauchte RTX 3060 mit 12 GB kostet auf dem Gebrauchtmarkt etwa 200–240 €, und 12 GB VRAM sind genau die ideale Größe für Modelle der 14B-Klasse.
| Modell (Q4_K_M) | Verwendeter VRAM | Tokens/s (Schätzung) | Ideal für |
|---|---|---|---|
| Qwen 3 8B | ~6 GB | ~50 | Chat, RAG |
| Qwen 2.5 Coder 14B | ~10 GB | ~28 | Code-Completion, Refactoring |
| Gemma 3 12B | ~8 GB | ~34 | Mehrsprachig, dokumentbasierte Fragenbeantwortung |
| DeepSeek-R1-Distill-Qwen-14B | ~10 GB | ~28 | Schrittweises Schlussfolgern |
Schätzung, keine Messung von QuelLLM: etwa 70 % der theoretischen Obergrenze (Speicherbandbreite der RTX 3060, 360 GB/s, geteilt durch die Modellgröße). Die Obergrenze für ein 8B-Modell in Q4 liegt bei etwa 72 Tokens/s, die für ein 14B-Modell bei etwa 40.
Runtime: Ollama, llama.cpp oder vLLM?
- Ollama — das Beste für einen einzelnen Benutzer auf einem lokalen Rechner. Lädt automatisch die GGUF-Dateien herunter, bietet eine OpenAI-kompatible API an und integriert sich in Open WebUI mit einem einzigen Befehl.
- llama.cpp — die beste Wahl, wenn es darum geht, aus einer CPU oder gemeinsam genutztem Speicher jedes mögliche Token pro Sekunde herauszuholen. Technisch anspruchsvollere CLI, bessere Portabilität.
- vLLM — die beste Wahl, um mehrere Nutzer oder Agenten parallel zu bedienen, dank PagedAttention und kontinuierlichem Batching.
Einzelentwickler → standardmäßig Ollama. Teams ab 3 Personen → vLLM hinter einem kleinen FastAPI-Proxy.
Stromverbrauch, Geräuschentwicklung und Gesamtkosten
| Config | Leerlauf (W) | Leistung (W) | kWh/Jahr (4 Stunden pro Tag unter Last) | Kosten pro Jahr @ 0,20 €/kWh |
|---|---|---|---|---|
| Einsteiger-Mini-PC | 8 | 35 | 51 | 10,20 € |
| 3060 Wert | 45 | 220 | 321 | 64,20 € |
| Leistung der 3090 | 50 | 360 | 526 | 105,10 € |
| Mac mini (Pro-Prozessor) | 6 | 65 | 95 | 19,00 € |
Die Leistungsangaben sind grobe Größenordnungen. Berechnung: Leistung unter Last × 4 h × 365 Tage; die Maschine ist in der übrigen Zeit ausgeschaltet. Bleibt sie im Leerlauf eingeschaltet, addieren Sie die Leerlaufleistung × 20 h × 365.
Selbst bei der stromhungrigsten Konfiguration entstehen bei diesem Nutzungsrhythmus etwa 105 € Stromkosten pro Jahr. Das entspricht etwas mehr als fünf Monaten eines Abonnements für 20 €/Monat.
Fazit
| Profil | Empfohlene Stufe | Warum |
|---|---|---|
| Neugierig, nur Chat | Einstieg 400 € | Qwen3 4B auf CPU läuft schneller als die Lesevorgänge |
| Einzelner Entwickler, tägliches Coding | Wert: 900 € | Ein 14B-Modell für Code mit ~28 tok/s bietet das ausgewogene Preis-Leistungs-Verhältnis |
| Schlussfolgern, Agenten, mehrere Modelle | Leistung 1.500 € | 24 GB ermöglichen Modelle der Klasse 32B |
| Ruhe und keinerlei Wartung | Stille ≈ 2.000 € | Der Mac mini verbraucht im Leerlauf nur wenige Watt |
Häufige Fragen
Reichen 8 GB VRAM im Jahr 2026 für eine sinnvolle Nutzung aus?
Nur knapp. Sie können Qwen3 8B Q4_K_M mit einem 4K-Kontext auf einer RTX 3050 mit 8 GB oder einer RX 6600 betreiben, aber dann fehlt der Spielraum für 14B-Modelle, die lokale Inferenz wirklich interessant machen. Nach Möglichkeit 12 GB anpeilen.
Sollten Sie eine AMD-Karte statt einer NVIDIA-Karte kaufen?
Für reine Inferenz funktionieren Radeon-Karten mit RDNA3 und RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) gut mit dem Vulkan-Backend von llama.cpp und mit ROCm. Bei gleicher Speicherkapazität kosten sie oft weniger, aber Sie verlieren einen Teil des CUDA-Ökosystems: eingeschränkteres vLLM sowie flash-attn und die meisten Fine-Tuning-Tools.
Kann man mit diesen Budgets fine-tunen?
LoRA-Fine-Tuning von 7B-Modellen funktioniert mit Unsloth auf einer Grafikkarte mit 12 GB Speicher. Ein Modell mit 14B oder mehr benötigt realistischerweise 24 GB. Vollständiges Fine-Tuning von Modellen mit mehr als 1B übersteigt das, was Consumer-Hardware im Jahr 2026 leisten kann.
Wie schneidet der gemeinsame Arbeitsspeicher (Unified Memory) eines Macs im Vergleich zu dediziertem VRAM ab?
Seine Bandbreite bleibt deutlich unter der eines hochleistungsfähigen Grafikchips: 307 GB/s auf einem Mac mini M5 Pro gegenüber 936 GB/s auf einer RTX 3090. Bei einem Modell, das auf der Karte läuft, erzeugt der Mac daher etwa 2 bis 3 Mal weniger Tokens pro Sekunde. Er gewinnt in Bezug auf Stromverbrauch, Speicherkapazität und die gleichzeitige Ausführung mehrerer Modelle; er verliert hingegen in Bezug auf Tokens pro Euro.