Tool · sofortige Berechnung
VRAM-Rechner für LLM
Wie viel GPU-Speicher benötigt ein lokales LLM wirklich? Modellgewichte + KV-Cache + Overhead: eine ehrliche Schätzung.
Die Faustformel: VRAM ≈ Parameter (Mrd.) × Bytes pro Gewicht + KV-Cache + ~20 % Overhead. Bei Q4 sind das etwa 0,55–0,6 GB pro Milliarde Parameter, bei FP16 2 GB pro Milliarde. Ein längerer Kontext lässt den KV-Cache weit über die 20 % hinaus wachsen.
Schätzung = Speicherbedarf der Modellgewichte × (1 + 0,2 × Kontext/8K). Faustformel für dichte Modelle; MoE-Modelle (Mixture of Experts) aktivieren weniger Gewichte pro Token und können besser laufen, als ihre Größe vermuten lässt. Reservieren Sie stets 1–2 GB für das Betriebssystem und die Bildschirmausgabe.
Benötigter VRAM nach Modellgröße (8K-Kontext)
| Größe | Q4_K_M | Q8_0 | FP16 | Passt auf (Q4) |
|---|---|---|---|---|
| 7B | 4,9 GB | 9,0 GB | 16,8 GB | Karten mit 8 GB (RTX 3050, 4060) |
| 9B | 6,3 GB | 11,6 GB | 21,6 GB | Karten mit 8–12 GB |
| 14B | 9,7 GB | 18,0 GB | 33,6 GB | Karten mit 12-16 GB |
| 27B | 18,8 GB | 34,7 GB | 64,8 GB | Karten mit 24 GB (RTX 3090/4090) |
| 32B | 22,3 GB | 41,1 GB | 76,8 GB | Karten mit 24 GB, kurzer Kontext |
| 70B | 48,7 GB | 89,9 GB | 168,0 GB | 48 GB+ oder zwei GPUs mit je 24 GB |
Die Werte enthalten 20 % Reserve für KV-Cache und Overhead bei einem 8K-Kontext und sind auf eine Nachkommastelle in GB gerundet.
Jetzt das Modell auswählen
Das verfügbare Speicherbudget zu kennen, ist erst der halbe Weg. Der Hardware-Konfigurator ordnet Ihrem konkreten GPU- oder Mac-Modell passende LLM zu. Die Rangliste der lokalen LLM bewertet alle lokal ausführbaren Modelle. Mit den Ranglisten nach Hardwareklasse kommen Sie direkt ans Ziel: bestes LLM für 8 GB VRAM, RTX 4090, Mac mit 16 GB. Sie schwanken zwischen Cloud und lokalem Betrieb? Rechnen Sie die Kosten mit dem Kostenrechner durch.
Häufige Fragen
Wie viel VRAM pro Milliarde Parameter?
Pro Milliarde Parameter benötigen Sie etwa 2 GB bei FP16, 1,1 GB bei Q8 und 0,55–0,6 GB bei Q4-Quantisierung. Rechnen Sie bei einem Standardkontext von 8K etwa 20 % für KV-Cache und Overhead hinzu, bei einem längeren Kontext entsprechend mehr.
Reichen 8 GB VRAM für ein lokales LLM aus?
Ja. Bei Q4 passt ein 8–9B-Modell (etwa 5–6 GB Modellgewichte) vollständig auf eine GPU mit 8 GB, mit Reserve für den Kontext. Sehen Sie sich unsere Rangliste der besten LLM für 8 GB VRAM an.
Kann eine GPU mit 24 GB (RTX 3090/4090) ein 32B-Modell ausführen?
Ja. Bei Q4 benötigt ein dichtes 32B-Modell etwa 20–22 GB und passt damit bei kurzem Kontext auf eine Karte mit 24 GB. Bei langem Kontext ist ein 27B-Modell die sicherere Wahl.
Zählt der vereinheitlichte Speicher eines Macs als VRAM?
Macs mit Apple Silicon nutzen einen gemeinsamen, vereinheitlichten Speicherpool für CPU und GPU. Ein Mac mit 32 GB kann daher größere Modelle laden als eine dedizierte GPU mit 16 GB – reservieren Sie jedoch 8–10 GB für macOS selbst.