Welcher LLM für 6 GB VRAM? ?
Mit 6 GB VRAM passt ein Modell mit 4 Milliarden Parametern in Q4 oder Q5 problemlos in den Speicher, auch mit einem Kontext von mehreren Tausend Tokens. Ein 7–8B-Modell in Q4 (4,6 bis 5,2 GB) lässt sich noch laden, allerdings ohne Spielraum: Der Kontext und der vom Treiber reservierte Speicher führen dazu, dass Teile des Modells auf die CPU ausgelagert werden. Ein weiterer überraschender Punkt: Bei Karten mit 6 GB bestimmt die Speicherbandbreite die Geschwindigkeit, nicht die Speicherkapazität, und diese Bandbreite kann je nach Karte um den Faktor zwei variieren.
6 GB ist die Speicherklasse der GTX 1660, der RTX 2060 und der RTX 3050 6 GB. Das reicht für einen echten lokalen Assistenten, sofern Sie das richtige Modell wählen und auch den Speicherbedarf berücksichtigen, der über den des Modells hinausgeht. Diese Seite erklärt, welche Modelle in den Speicher passen, welche 6-GB-Karte schneller ist als eine andere, wie Sie prüfen, ob ein Modell vollständig auf der Karte bleibt, und was 12 GB ändern würden.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Für den Umstieg auf 16 GB VRAM: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#Was 6 GB ermöglichen: die vollständige Speicherberechnung
Der VRAM enthält nicht nur die Gewichte. Er nimmt auch den Kontext-Cache auf, der mit dem Gespräch wächst, die Rechenpuffer der Engine und unter Windows einen Teil der Daten für die Bildschirmausgabe und den Browser. Auf einer Karte mit 6 GB kann man mit einem Budget von etwa 5 bis 5,5 GB für das Modell und seinen Cache rechnen; den Rest beansprucht das System. Als Richtwerte für die Gewichte in Q4 verwendet die Website: 3B ≈ 2 GB, 7–8B ≈ 5 GB.
| Modell | Q4-Gewichte | Verbleibender Spielraum bei 5,5 GB | Fazit |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,3 GB | Sehr viel Speicherreserve, kurze und schnelle Antworten |
| Qwen 3.5 4B | 2,3 GB | 3,2 GB | Komfortabel nutzbar, Kontextfenster mit mehreren Tausend Tokens |
| Phi-4 Mini 3.8B | 3 GB | 2,5 GB | Komfortabel |
| Granite 4.2 8B | 4,6 GB | 0,9 GB | Knapp: sehr kurzer Kontext |
| Qwen 3 8B (Ollama) | 5,2 GB | 0,3 GB | Überschreitet die VRAM-Kapazität, sobald der Kontext länger wird |
| Qwen 3.5 9B | 6 GB | negativ | Passt nicht |
Die Größen stammen aus dem QuelLLM-Katalog und der Ollama-Bibliothek. Die Spalte „Spielraum“ enthält eine Schätzung: Sie geht von 5,5 GB nutzbarem Speicher aus, was von Ihrem System und Ihren Anwendungen abhängt. Ein 8B-Modell ist daher auf dem Papier möglich, lässt Ihnen aber weniger als ein Gigabyte für den Cache: Die Kontexteinstellung entscheidet, ob der Betrieb flüssig läuft oder Schichten auf den Prozessor ausgelagert werden.
#Drei Karten mit 6 GB, drei Geschwindigkeiten: die Bandbreite
Die Generierungsgeschwindigkeit wird durch die Speicherbandbreite geteilt durch die Größe der bei jedem Token gelesenen Modellgewichte begrenzt. Zwei Karten mit 6 GB sind daher nicht gleichwertig. Laut der Wikipedia-Tabelle zur GeForce-20-Generation bietet die RTX 2060 6 GB eine Bandbreite von 336 GB/s über einen 192-Bit-Bus. Die neuere RTX 3050 6 GB hat dagegen nur einen 96-Bit-Bus (NVIDIA) und laut derselben Enzyklopädie eine Bandbreite von 168 GB/s: die Hälfte.
| Karte mit 6 GB | Bandbreite | 2,3-GB-Modell (4B Q4) | Modell mit 4,6 GB (8B Q4) |
|---|---|---|---|
| RTX 2060 6 GB | 336 GB/s | etwa 146 t/s | etwa 73 Tokens/s |
| RTX 3050 6 GB | 168 GB/s | etwa 73 Tokens/s | etwa 37 t/s |
Diese Grenzen werden niemals erreicht, und wir haben keine Messwerte für diese Karten: der tatsächliche Prozentsatz hängt vom Motor, vom Kontext und von der Karte ab. Doch der Verhältnis von 2 zu 1 hält. Bei lokaler KI ist eine gebrauchte RTX 2060 also schneller als eine neue RTX 3050 6 GB, trotz ihres Alters, und die neue Karte hat nur die energieeffiziente und die neueren Funktionen im Vorteil. Bei den GTX 1660 gilt die Variante: überprüfen Sie die genaue Ausführung, da Speicher und Bus je nach Modell variieren.
- Welcher LLM auf einer RTX 2060?
- Welches LLM auf RTX 3050?
- Welches LLM läuft auf einer GTX 1650 / 1660?
- Welcher LLM läuft auf einer GTX 1060?
#Das richtige Modell für jeden Anwendungsfall mit 6 GB
- Chat, Fragen, Texterstellung
- Ein Modell mit 3 bis 4 Milliarden Parametern wie Qwen 3.5 4B oder Phi-4 Mini: korrekte und schnelle Antworten, ausreichend Platz für den Kontext. Für eine bessere Qualität im Französischen probieren Sie das 8B-Modell in Q4 mit reduziertem Kontext aus.
- Code
- Ein kleines Code-Modell mit 3 bis 7 Milliarden Parametern für die Autovervollständigung, ein universelles 4B-Modell für Erklärungen. Erwarten Sie bei dieser Größe keinen zuverlässigen Code-Agenten.
- RAG und Dokumente
- Ein 4B-Modell und ein leichtgewichtiges Embedding-Modell: Alles passt in den Speicher. Der Kontext ist der begrenzende Faktor: Senden Sie kurze Auszüge.
- Vision und Audio
- Es gibt leichte multimodale Modelle, aber der Bildencoder benötigt zusätzlich zum Modell Speicher: Testen Sie ein Modell mit 2 bis 4 Milliarden Parametern.
Eine häufige Falle: MoE-Modelle wie Qwen3-Coder 30B-A3B aktivieren nur 3 Milliarden Parameter, was den Eindruck erweckt, sie würden in 6 GB passen. Das stimmt nicht: Alle Experten müssen im Speicher liegen, und die Datei ist 19 GB groß. Die einzige Möglichkeit, sie zu nutzen, besteht darin, die Experten auf die CPU auszulagern. Das erfordert viel Arbeitsspeicher und geht stark zulasten der Geschwindigkeit. Der Leitfaden zu MoE erklärt das Prinzip.
#Hybridbetrieb mit GPU und Prozessor: nützlich, aber keine Zauberei
Wenn ein Modell nicht vollständig in den Grafikspeicher passt, können Ollama und llama.cpp einen Teil der Schichten auf den Prozessor auslagern. Dadurch lässt sich ein 9B-Modell mit 6 GB Grafikspeicher laden, aber die Geschwindigkeit sinkt stufenweise: Die im Arbeitsspeicher verbliebenen Schichten werden mit der Geschwindigkeit des Systemspeichers gelesen, die nur einen Bruchteil der Geschwindigkeit des Grafikspeichers beträgt. Für MoE-Modelle bietet llama.cpp die Option --n-cpu-moe, die die Experten bestimmter Schichten auf dem Prozessor belässt und die am häufigsten beanspruchten Teile auf der Grafikkarte hält. Ein Nutzer des llama.cpp-Repositorys berichtet von etwa 20 Tokens pro Sekunde mit gpt-oss-20b und allen Experten auf dem Prozessor auf einem Rechner mit DDR4-3200 im Dual-Channel-Betrieb, wobei der Großteil des VRAM frei wird.
Dieser Erfahrungsbericht zeigt, dass der Ansatz funktioniert, nicht, dass er für Ihren Rechner geeignet ist. Für ein Modell dieser Größe benötigt er 32 GB RAM, und sein Durchsatz hängt von der Bandbreite dieses Speichers ab. Für den alltäglichen Einsatz mit 6 GB bleibt ein vollständig auf der Grafikkarte geladenes 4B-Modell einfacher und schneller.
#Fünf Einstellungen, auf die es bei 6 GB ankommt
- 01Kontext begrenzenDie FAQ von Ollama nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich anpassen lässt. Erhöhen Sie es bei 6 GB Speicher schrittweise (6.000, 8.000) und überwachen Sie den Speicherverbrauch: Jede Erhöhung vergrößert den Cache.
- 02K/V-Cache quantisierenBei aktiviertem Flash Attention halbiert OLLAMA_KV_CACHE_TYPE=q8_0 laut der Ollama-FAQ den Speicherbedarf des Caches gegenüber f16 ungefähr. Das ist der erste Ansatz, um mehr Speicherreserve zu schaffen.
- 03Alles schließen, was VRAM verbrauchtEin Browser mit Hardwarebeschleunigung, ein Spiel, eine Videoschnittsoftware: Alle benötigen Speicher. Bei 6 GB sollte jeweils nur eine Anwendung die GPU nutzen.
- 04Mit ollama ps prüfenDie Spalte „Processor“ zeigt an, wo das Modell geladen wurde: 100 % GPU ist das Ziel. Jede Aufteilung zwischen CPU und GPU weist darauf hin, dass das Modell nicht vollständig in den GPU-Speicher passt, und bedeutet eine geringere Geschwindigkeit.
- 05Die Quantisierung auswählenQ4_K_M ist ein guter Kompromiss; bei einem 4B-Modell können Sie auf Q5 oder Q6 gehen, um die Qualität zu verbessern, da genügend Spielraum vorhanden ist. Der Leitfaden zur Quantisierung erläutert die Unterschiede im Detail.
Diese Variablen werden in der Umgebung des Ollama-Dienstes definiert (systemd unter Linux, Systemvariablen unter Windows, launchctl unter macOS). Der Leitfaden zur Behebung von GPU-Fehlern in Ollama erläutert im Detail, was Sie prüfen sollten, wenn sich ein Modell nicht auf die Grafikkarte laden lässt.
#Diagnose: Warum die Generierung auf einer Karte mit 6 GB langsamer wird
Bei einer Grafikkarte mit 6 GB hat eine plötzliche Verlangsamung fast immer dieselbe Ursache: Ein Teil des Modells oder des Caches wurde aus dem Grafikkartenspeicher ausgelagert. Die folgende Tabelle ordnet das beobachtete Symptom der wahrscheinlichen Ursache und der Maßnahme zu, die Sie zuerst ausprobieren sollten.
| Symptom | Wahrscheinliche Ursache | Zum Ausprobieren |
|---|---|---|
| Anfangs flüssige Antworten, nach einigen Gesprächsrunden sehr langsam | Der Kontextcache hat den VRAM gefüllt, und einige Schichten werden auf den Prozessor ausgelagert | Kontext reduzieren, Cache in q8_0 quantisieren, Konversation neu starten |
| Das Modell wird geladen, aber ollama ps zeigt eine CPU/GPU-Verteilung an | Das Modell und sein Kontext benötigen mehr Speicher, als verfügbar ist | Ein kleineres Modell oder eine leichtere Quantisierung wählen |
| Die Geschwindigkeit halbiert sich, nachdem ein Browser oder ein Spiel geöffnet wurde | Diese Anwendungen verbrauchen VRAM | Die Hardwarebeschleunigung des Browsers deaktivieren, die GPU nur für eine Aufgabe gleichzeitig nutzen |
| Speicherfehlermeldung beim Laden | Der Treiber reserviert Speicher, und das Modell passt nicht hinein | Treiber prüfen, GPU freigeben, ein 4B-Modell ausprobieren |
| Enttäuschender Durchsatz auf einer aktuellen Grafikkarte mit schmalem Speicherbus | Die Bandbreite ist gering (RTX 3050 6 GB: Bus von 96 Bit) | Ein kleineres Modell wählen, statt auf eine Softwareverbesserung zu warten |
Ein letzter Punkt zur Qualität: Je kleiner ein Modell ist, desto mehr Fehler macht es bei Aufgaben, die präzises Wissen oder längere Schlussfolgerungsketten erfordern. Mit 6 GB nutzen Sie das Modell besser für das, was es gut kann (umformulieren, einen bereitgestellten Text zusammenfassen, anhand von Auszügen antworten, die Sie ihm geben, klassifizieren, Felder extrahieren), als für die Beantwortung von Faktenfragen aus dem Gedächtnis. Den Ausgangstext in der Unterhaltung bereitzustellen, statt sich darauf zu verlassen, was das Modell „weiß“, liefert mit einem kleinen Modell die besten Ergebnisse und funktioniert auch mit einem kurzen Kontext.
#Auf 8 oder 12 GB aufrüsten: Was jede Speicherstufe ermöglicht
Der lohnendste Sprung ist der Wechsel von 6 auf 12 GB. Bei 12 GB passt ein 8–9B-Modell in Q4 (5 bis 6 GB) mit langem Kontext in den Speicher, und ein 14B-Modell in Q4 (etwa 9 GB) wird möglich. Bei 8 GB passt ein 8B-Modell endlich mit Spielraum hinein, ein 14B-Modell bleibt jedoch außer Reichweite. Suchen Sie auf dieser Seite nicht nach einem Preis: Die Preise ändern sich jede Woche, und die Preisbeobachtung der Website erfasst den niedrigsten Preis für jede Karte.
| VRAM | Modelle, die sich problemlos nutzen lassen | Was sich ändert |
|---|---|---|
| 6 GB | 3-4B, 8B mit kurzen Kontexten | Ein ordentlicher lokaler Assistent |
| 8 GB | 8B mit mittelgroßem Kontext | Mehr Spielraum, Q5 möglich |
| 12 GB | 8-9B mit langem Kontext, 14B in Q4 | Wirklich komfortabel für Chat und RAG |
| 16 GB | 14B in Q5, 24B in Q3–Q4 passen gerade noch | Modelle mit höherer Qualität |
- Preisverfolgung für Grafikkarten im Bereich der lokalen KI
- Welches LLM für 8 GB VRAM
- Welches LLM für 12 GB VRAM
- Quelle: Ollama-Bibliothek, Qwen3
- Quelle: Offizielle Ollama-FAQ
- Quelle: llama.cpp-Diskussion zu gpt-oss und --n-cpu-moe
#Häufig gestellte Fragen
Welcher LLM eignet sich am besten für 6 GB VRAM?+
Welche Geschwindigkeit kann man bei 6 GB VRAM erwarten?+
Kann man Qwen 3.5 9B mit 6 GB betreiben?+
RTX 2060 6 GB oder RTX 3050 6 GB für die lokale KI?+
Reichen 6 GB für lokales RAG aus?+
Kann ein 30B-MoE auf 6 GB laufen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.