◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Tool · sofortige Berechnung

VRAM-Rechner für LLM

Wie viel GPU-Speicher benötigt ein lokales LLM wirklich? Modellgewichte + KV-Cache + Overhead: eine ehrliche Schätzung.

Die Faustformel: VRAM ≈ Parameter (Mrd.) × Bytes pro Gewicht + KV-Cache + ~20 % Overhead. Bei Q4 sind das etwa 0,55–0,6 GB pro Milliarde Parameter, bei FP16 2 GB pro Milliarde. Ein längerer Kontext lässt den KV-Cache weit über die 20 % hinaus wachsen.

Schätzung = Speicherbedarf der Modellgewichte × (1 + 0,2 × Kontext/8K). Faustformel für dichte Modelle; MoE-Modelle (Mixture of Experts) aktivieren weniger Gewichte pro Token und können besser laufen, als ihre Größe vermuten lässt. Reservieren Sie stets 1–2 GB für das Betriebssystem und die Bildschirmausgabe.

Benötigter VRAM nach Modellgröße (8K-Kontext)

GrößeQ4_K_MQ8_0FP16Passt auf (Q4)
7B4,9 GB9,0 GB16,8 GBKarten mit 8 GB (RTX 3050, 4060)
9B6,3 GB11,6 GB21,6 GBKarten mit 8–12 GB
14B9,7 GB18,0 GB33,6 GBKarten mit 12-16 GB
27B18,8 GB34,7 GB64,8 GBKarten mit 24 GB (RTX 3090/4090)
32B22,3 GB41,1 GB76,8 GBKarten mit 24 GB, kurzer Kontext
70B48,7 GB89,9 GB168,0 GB48 GB+ oder zwei GPUs mit je 24 GB

Die Werte enthalten 20 % Reserve für KV-Cache und Overhead bei einem 8K-Kontext und sind auf eine Nachkommastelle in GB gerundet.

Jetzt das Modell auswählen

Das verfügbare Speicherbudget zu kennen, ist erst der halbe Weg. Der Hardware-Konfigurator ordnet Ihrem konkreten GPU- oder Mac-Modell passende LLM zu. Die Rangliste der lokalen LLM bewertet alle lokal ausführbaren Modelle. Mit den Ranglisten nach Hardwareklasse kommen Sie direkt ans Ziel: bestes LLM für 8 GB VRAM, RTX 4090, Mac mit 16 GB. Sie schwanken zwischen Cloud und lokalem Betrieb? Rechnen Sie die Kosten mit dem Kostenrechner durch.

Häufige Fragen

Wie viel VRAM pro Milliarde Parameter?

Pro Milliarde Parameter benötigen Sie etwa 2 GB bei FP16, 1,1 GB bei Q8 und 0,55–0,6 GB bei Q4-Quantisierung. Rechnen Sie bei einem Standardkontext von 8K etwa 20 % für KV-Cache und Overhead hinzu, bei einem längeren Kontext entsprechend mehr.

Reichen 8 GB VRAM für ein lokales LLM aus?

Ja. Bei Q4 passt ein 8–9B-Modell (etwa 5–6 GB Modellgewichte) vollständig auf eine GPU mit 8 GB, mit Reserve für den Kontext. Sehen Sie sich unsere Rangliste der besten LLM für 8 GB VRAM an.

Kann eine GPU mit 24 GB (RTX 3090/4090) ein 32B-Modell ausführen?

Ja. Bei Q4 benötigt ein dichtes 32B-Modell etwa 20–22 GB und passt damit bei kurzem Kontext auf eine Karte mit 24 GB. Bei langem Kontext ist ein 27B-Modell die sicherere Wahl.

Zählt der vereinheitlichte Speicher eines Macs als VRAM?

Macs mit Apple Silicon nutzen einen gemeinsamen, vereinheitlichten Speicherpool für CPU und GPU. Ein Mac mit 32 GB kann daher größere Modelle laden als eine dedizierte GPU mit 16 GB – reservieren Sie jedoch 8–10 GB für macOS selbst.

Mehr kostenlose Tools