Methodik · Aktualisierung 2026
Empfehlungsassistent für Quantisierung
Ein Leitfaden, der Ihrem exakten VRAM-Budget die optimale GGUF-, GPTQ- oder AWQ-Quantisierung zuordnet — ohne Herumprobieren, ohne Speicherverschwendung.
Grundformel: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. Der Multiplikator 1,2 berücksichtigt den KV-Cache und den Aktivierungsüberhead bei einem Kontext von 8K.
Welche Quantisierung eignet sich für meinen Rechner?
Geben Sie Ihre Speichergröße an: Das Tool listet die Modelle aus dem Katalog auf, die in den Speicher passen, jeweils mit der bestmöglichen Quantisierung.
Laden des Katalogs…
Die Auswahl in 30 Sekunden
Suchen Sie unten nach Ihrer verfügbaren VRAM-Kapazität und lesen Sie dann ab, welches größte Modell mit welcher Quantisierung bei einem 8K-Kontext hineinpasst. Übliche GGUF-Dateigrößen (Standardeinstellungen von llama.cpp/Ollama, KV-Cache in FP16); die letzte Spalte zeigt den verbleibenden Spielraum für den Wechsel auf einen 16K-Kontext.
| VRAM | Typische GPU | Empfohlenes Modell + empfohlene Quantisierung | 16K-Marge |
|---|---|---|---|
| 6 GB | RTX 3060 Laptop (6 GB), RTX 4050 Laptop | Qwen 3 4B Q5_K_M, oder Qwen 3 8B Q3_K_M | Genau — zurück zur Q4_K_S |
| 8 GB | RTX 3050 8 GB, RTX 4060, RTX 5060 | Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_M | OK bei Q4_K_M |
| 12 GB | RTX 3060 12 GB, RTX 4070, RTX 5070 | Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M | Nur für ein 14B |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080 | Qwen 3 14B Q6_K, Mistral Small 3.2 24B Q4_K_M (knapp) | Gut für ein 14B-Modell |
| 24 GB | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3 32B Q4_K_M, Qwen3-Coder 30B-A3B Q4_K_M, Gemma 3 27B Q4_K_M | Knapp für ein dichtes 32B-Modell; ausreichend Spielraum für 27B |
| 32 GB | RTX 5090 | Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K | Nur für den 32B in Q6_K |
| 48 GB | RTX 6000 Ada, 2× RTX 3090/4090 | Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S | Nur kurzer Kontext (8K) |
| 80 GB | H100 80 GB, A100 80 GB | gpt-oss 120B (MXFP4), Llama 3.3 70B Q8_0 (kurzer Kontext) | Genug Spielraum für gpt-oss 120B |
Die Berechnung hinter der Empfehlung
Die Quantisierung komprimiert jedes Gewicht von FP16 (16 Bit) auf 2 bis 8 Bit. Ein 7B-Modell in Q4_K_M verwendet im Durchschnitt ~4,85 Bit pro Gewicht, also 7.000.000.000 × 4,85 / 8 ≈ 4,2 GB. Mit dem KV-Cache, der mit der Kontextlänge wächst, kommt ein Modell mit gruppierter Attention (Mistral 7B, Qwen, Llama 3) bei 8K Kontext auf etwa 5,5 GB. Bei langem Kontext fällt der KV-Cache wesentlich stärker ins Gewicht, als es der Multiplikator ×1,2 berücksichtigt.
Referenzwerte für Bits pro Gewicht
| Quant | Effektive Bits pro Gewicht | VRAM (8B) | VRAM (32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16,0 GB | 64,0 GB | 140,0 GB |
| Q8_0 | 8,5 | 8,5 GB | 34,0 GB | 74,4 GB |
| Q6_K | 6,6 | 6,6 GB | 26,4 GB | 57,8 GB |
| Q5_K_M | 5,7 | 5,7 GB | 22,8 GB | 49,9 GB |
| Q4_K_M | 4,83 | 4,83 GB | 19,3 GB | 42,3 GB |
| Q4_K_S | 4,58 | 4,58 GB | 18,3 GB | 40,1 GB |
| Q3_K_M | 3,9 | 3,9 GB | 15,6 GB | 34,1 GB |
| Q2_K | 3,35 | 3,35 GB | 13,4 GB | 29,3 GB |
Qualitätsverlust: Was die Zahlen tatsächlich sagen
Die mit den k-Quants von llama.cpp veröffentlichte Perplexität bleibt die Referenzmessgröße (PR #1684, LLaMA 7B, FP16 = 5,9066). Je kleiner die Abweichung, desto ähnlicher verhält sich das quantisierte Modell dem Original. Der starke Leistungseinbruch zwischen Q4_K_M und Q3_K_M ist deutlich, und der Zugewinn von Q5 zu Q6 ist minimal.
| Quant | Perplexität (LLaMA 7B) | Abweichung im Vergleich zu FP16 | Fazit |
|---|---|---|---|
| Q8_0 | — | vernachlässigbar | Nicht unterscheidbar |
| Q6_K | 5,9110 | +0,07 % | Fast ohne Verlust |
| Q5_K_M | 5,9208 | +0,24 % | Ausgezeichnet |
| Q4_K_M | 5,9601 | +0,91 % | Gleichgewichtspunkt |
| Q4_K_S | 6,0215 | +1,95 % | Akzeptabel |
| Q3_K_M | 6,1503 | +4,13 % | Wahrnehmbar |
| Q2_K | 6,7764 | +14,7 % | Letzter Ausweg |
Messungen aus 2023 zu LLaMA 7B: Neuere Modelle, die auf viel mehr Daten trainiert wurden, sind oft etwas empfindlicher gegenüber der Quantisierung. Die Größenordnung bleibt gültig.
Bei gleichem Speicherbudget schneidet ein größeres Modell in Q4_K_M im Allgemeinen besser ab als ein kleineres Modell in Q8_0. Im Zweifelsfall erhöhen Sie die Parameterzahl, nicht die Bitzahl.
GGUF, GPTQ oder AWQ: das richtige Format, nicht nur die richtige Bitanzahl
GGUF (llama.cpp / Ollama / LM Studio): die Standardwahl für Einzelbenutzer-Inferenz, CPU-Offloading und Apple Silicon. GPTQ : 4 Bit, rein GPU-basierte Inferenz mit vLLM/TGI. AWQ : 4 Bit, GPU-Only — die schnellste Option im Jahr 2026 für die Batch-Inferenz auf RTX 4090, RTX 5090, H100/H200.
| Anwendungsfälle | Bestes Format | Warum |
|---|---|---|
| Einzelbenutzerbetrieb, Arbeitsplatzrechner, im Stil von ChatGPT | GGUF Q4_K_M | CPU-Offload, teilweise Auslagerung der Schichten auf die GPU, läuft überall |
| Apple Silicon (M1-M5) | GGUF Q4_K_M oder MLX mit 4 Bit | Metal-Kernels, vereinheitlichter Speicher |
| Batch-API, >4 Benutzer gleichzeitig | AWQ 4 Bit auf vLLM | Bester Durchsatz bei großer Batchgröße |
| Ältere Ampere-Generation (A100, RTX 3090) | GPTQ 4 Bit oder AWQ | Beide funktionieren; für den eigenen Anwendungsfall benchmarken |
Häufige Fragen
Ist Q4_K_M wirklich der optimale Kompromiss oder nur beliebt?
Ja. Bei den Perplexitätsmessungen mit den k-Quantis von llama.cpp (LLaMA 7B) weicht Q4_K_M nur um etwa 0,9 % vom FP16 ab und benötigt dabei fast 30 % weniger Speicher. Q5_K_M sinkt auf 0,2 % Abweichung und verbraucht etwa 17 % mehr Speicher – selten rentabel, außer bei freier Marge.
Wie viel VRAM benötigt ein 70B-Modell?
Mit Q4_K_M benötigen die Modellgewichte etwa 42 GB, hinzu kommen für Llama 3.3 70B bei einem Kontext von 8K etwa 2 bis 3 GB KV-Cache (dank gruppierter Attention). Das passt mit einem kurzen Kontext auf eine Karte mit 48 GB (RTX 6000 Ada) oder zwei Karten mit jeweils 24 GB (2×RTX 3090/4090). Mit Q2_K sinkt der Speicherbedarf der Modellgewichte auf etwa 26 GB, die Qualität nimmt jedoch deutlich ab.
GGUF, GPTQ oder AWQ: Welches Format wählen?
GGUF für die Nutzung durch eine einzelne Person auf einem Arbeitsplatzrechner oder auf Apple Silicon. AWQ für API-Dienste mit Batch-Verarbeitung auf Ada-, Hopper- oder Blackwell-GPUs. GPTQ bleibt eine ältere Option, die auf Ampere weiterhin funktioniert, 2026 aber selten die schnellste ist.
Verringert die Quantisierung des KV-Caches die Qualität?
Die Quantisierung des KV-Caches auf Q8_0 halbiert seine Größe bei einem Qualitätsverlust, der im Allgemeinen als vernachlässigbar gilt. Bei Q4_0 wird der Qualitätsverlust messbar: Diese Variante nur dann verwenden, wenn sich ein langer Kontext anders nicht im Speicher unterbringen lässt.
Sind MoE-Modelle wie DeepSeek V3 anders?
Ja. Der Speicherbedarf richtet sich nach der Gesamtzahl der Parameter, daher benötigt ein MoE mit 671B auch in Q4 weiterhin Hunderte von GB. Die Geschwindigkeit hingegen hängt von den aktiven Parametern ab (37B bei DeepSeek V3). Unterhalb von Q4 nimmt der Qualitätsverlust schnell zu; dynamische Quantisierungen (zum Beispiel die von Unsloth für DeepSeek R1) zeigen jedoch, dass ein sehr großes MoE-Modell bei 2 Bit noch nutzbar bleiben kann.
Wie kann man überprüfen, ob eine Quantisierung tatsächlich in den VRAM passt?
Führen Sie während der Generierung von 500 Tokens nvidia-smi -l 1 aus. Wenn die VRAM-Auslastung steigt und sich dann stabilisiert, ist alles in Ordnung. Wenn sie einen Höchstwert erreicht und die Tokens pro Sekunde einbrechen, wird ein Teil des Modells in den System-RAM ausgelagert – wählen Sie eine niedrigere Quantisierungsstufe oder verkürzen Sie den Kontext.
Möchten Sie noch weiter gehen? Der VRAM-Rechner berechnet den genauen Speicherbedarf Ihres Modells, und unser Leitfaden Q4 im Vergleich zu Q5 und Q8 erläutert die Qualitätsprüfungen.