Einsteiger 11 Min.Nach VRAM

Welcher LLM für 6 GB VRAM? ?

Direkte Antwort

Mit 6 GB VRAM passt ein Modell mit 4 Milliarden Parametern in Q4 oder Q5 problemlos in den Speicher, auch mit einem Kontext von mehreren Tausend Tokens. Ein 7–8B-Modell in Q4 (4,6 bis 5,2 GB) lässt sich noch laden, allerdings ohne Spielraum: Der Kontext und der vom Treiber reservierte Speicher führen dazu, dass Teile des Modells auf die CPU ausgelagert werden. Ein weiterer überraschender Punkt: Bei Karten mit 6 GB bestimmt die Speicherbandbreite die Geschwindigkeit, nicht die Speicherkapazität, und diese Bandbreite kann je nach Karte um den Faktor zwei variieren.

6 GB ist die Speicherklasse der GTX 1660, der RTX 2060 und der RTX 3050 6 GB. Das reicht für einen echten lokalen Assistenten, sofern Sie das richtige Modell wählen und auch den Speicherbedarf berücksichtigen, der über den des Modells hinausgeht. Diese Seite erklärt, welche Modelle in den Speicher passen, welche 6-GB-Karte schneller ist als eine andere, wie Sie prüfen, ob ein Modell vollständig auf der Karte bleibt, und was 12 GB ändern würden.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für den Umstieg auf 16 GB VRAM: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Was 6 GB ermöglichen: die vollständige Speicherberechnung

Der VRAM enthält nicht nur die Gewichte. Er nimmt auch den Kontext-Cache auf, der mit dem Gespräch wächst, die Rechenpuffer der Engine und unter Windows einen Teil der Daten für die Bildschirmausgabe und den Browser. Auf einer Karte mit 6 GB kann man mit einem Budget von etwa 5 bis 5,5 GB für das Modell und seinen Cache rechnen; den Rest beansprucht das System. Als Richtwerte für die Gewichte in Q4 verwendet die Website: 3B ≈ 2 GB, 7–8B ≈ 5 GB.

Was in 6 GB passt (Modellgewichte in Q4, ohne Kontext)
ModellQ4-GewichteVerbleibender Spielraum bei 5,5 GBFazit
Gemma 4 2B1,2 GB4,3 GBSehr viel Speicherreserve, kurze und schnelle Antworten
Qwen 3.5 4B2,3 GB3,2 GBKomfortabel nutzbar, Kontextfenster mit mehreren Tausend Tokens
Phi-4 Mini 3.8B3 GB2,5 GBKomfortabel
Granite 4.2 8B4,6 GB0,9 GBKnapp: sehr kurzer Kontext
Qwen 3 8B (Ollama)5,2 GB0,3 GBÜberschreitet die VRAM-Kapazität, sobald der Kontext länger wird
Qwen 3.5 9B6 GBnegativPasst nicht

Die Größen stammen aus dem QuelLLM-Katalog und der Ollama-Bibliothek. Die Spalte „Spielraum“ enthält eine Schätzung: Sie geht von 5,5 GB nutzbarem Speicher aus, was von Ihrem System und Ihren Anwendungen abhängt. Ein 8B-Modell ist daher auf dem Papier möglich, lässt Ihnen aber weniger als ein Gigabyte für den Cache: Die Kontexteinstellung entscheidet, ob der Betrieb flüssig läuft oder Schichten auf den Prozessor ausgelagert werden.

#Drei Karten mit 6 GB, drei Geschwindigkeiten: die Bandbreite

Die Generierungsgeschwindigkeit wird durch die Speicherbandbreite geteilt durch die Größe der bei jedem Token gelesenen Modellgewichte begrenzt. Zwei Karten mit 6 GB sind daher nicht gleichwertig. Laut der Wikipedia-Tabelle zur GeForce-20-Generation bietet die RTX 2060 6 GB eine Bandbreite von 336 GB/s über einen 192-Bit-Bus. Die neuere RTX 3050 6 GB hat dagegen nur einen 96-Bit-Bus (NVIDIA) und laut derselben Enzyklopädie eine Bandbreite von 168 GB/s: die Hälfte.

Theoretische Obergrenze der Generierungsgeschwindigkeit je Grafikkarte (Bandbreite ÷ Größe der Modellgewichte)
Karte mit 6 GBBandbreite2,3-GB-Modell (4B Q4)Modell mit 4,6 GB (8B Q4)
RTX 2060 6 GB336 GB/setwa 146 t/setwa 73 Tokens/s
RTX 3050 6 GB168 GB/setwa 73 Tokens/setwa 37 t/s

Diese Grenzen werden niemals erreicht, und wir haben keine Messwerte für diese Karten: der tatsächliche Prozentsatz hängt vom Motor, vom Kontext und von der Karte ab. Doch der Verhältnis von 2 zu 1 hält. Bei lokaler KI ist eine gebrauchte RTX 2060 also schneller als eine neue RTX 3050 6 GB, trotz ihres Alters, und die neue Karte hat nur die energieeffiziente und die neueren Funktionen im Vorteil. Bei den GTX 1660 gilt die Variante: überprüfen Sie die genaue Ausführung, da Speicher und Bus je nach Modell variieren.

#Das richtige Modell für jeden Anwendungsfall mit 6 GB

Chat, Fragen, Texterstellung
Ein Modell mit 3 bis 4 Milliarden Parametern wie Qwen 3.5 4B oder Phi-4 Mini: korrekte und schnelle Antworten, ausreichend Platz für den Kontext. Für eine bessere Qualität im Französischen probieren Sie das 8B-Modell in Q4 mit reduziertem Kontext aus.
Code
Ein kleines Code-Modell mit 3 bis 7 Milliarden Parametern für die Autovervollständigung, ein universelles 4B-Modell für Erklärungen. Erwarten Sie bei dieser Größe keinen zuverlässigen Code-Agenten.
RAG und Dokumente
Ein 4B-Modell und ein leichtgewichtiges Embedding-Modell: Alles passt in den Speicher. Der Kontext ist der begrenzende Faktor: Senden Sie kurze Auszüge.
Vision und Audio
Es gibt leichte multimodale Modelle, aber der Bildencoder benötigt zusätzlich zum Modell Speicher: Testen Sie ein Modell mit 2 bis 4 Milliarden Parametern.

Eine häufige Falle: MoE-Modelle wie Qwen3-Coder 30B-A3B aktivieren nur 3 Milliarden Parameter, was den Eindruck erweckt, sie würden in 6 GB passen. Das stimmt nicht: Alle Experten müssen im Speicher liegen, und die Datei ist 19 GB groß. Die einzige Möglichkeit, sie zu nutzen, besteht darin, die Experten auf die CPU auszulagern. Das erfordert viel Arbeitsspeicher und geht stark zulasten der Geschwindigkeit. Der Leitfaden zu MoE erklärt das Prinzip.

#Hybridbetrieb mit GPU und Prozessor: nützlich, aber keine Zauberei

Wenn ein Modell nicht vollständig in den Grafikspeicher passt, können Ollama und llama.cpp einen Teil der Schichten auf den Prozessor auslagern. Dadurch lässt sich ein 9B-Modell mit 6 GB Grafikspeicher laden, aber die Geschwindigkeit sinkt stufenweise: Die im Arbeitsspeicher verbliebenen Schichten werden mit der Geschwindigkeit des Systemspeichers gelesen, die nur einen Bruchteil der Geschwindigkeit des Grafikspeichers beträgt. Für MoE-Modelle bietet llama.cpp die Option --n-cpu-moe, die die Experten bestimmter Schichten auf dem Prozessor belässt und die am häufigsten beanspruchten Teile auf der Grafikkarte hält. Ein Nutzer des llama.cpp-Repositorys berichtet von etwa 20 Tokens pro Sekunde mit gpt-oss-20b und allen Experten auf dem Prozessor auf einem Rechner mit DDR4-3200 im Dual-Channel-Betrieb, wobei der Großteil des VRAM frei wird.

Dieser Erfahrungsbericht zeigt, dass der Ansatz funktioniert, nicht, dass er für Ihren Rechner geeignet ist. Für ein Modell dieser Größe benötigt er 32 GB RAM, und sein Durchsatz hängt von der Bandbreite dieses Speichers ab. Für den alltäglichen Einsatz mit 6 GB bleibt ein vollständig auf der Grafikkarte geladenes 4B-Modell einfacher und schneller.

#Fünf Einstellungen, auf die es bei 6 GB ankommt

  1. 01
    Kontext begrenzen
    Die FAQ von Ollama nennt ein standardmäßiges Kontextfenster von 4.096 Tokens, das sich anpassen lässt. Erhöhen Sie es bei 6 GB Speicher schrittweise (6.000, 8.000) und überwachen Sie den Speicherverbrauch: Jede Erhöhung vergrößert den Cache.
  2. 02
    K/V-Cache quantisieren
    Bei aktiviertem Flash Attention halbiert OLLAMA_KV_CACHE_TYPE=q8_0 laut der Ollama-FAQ den Speicherbedarf des Caches gegenüber f16 ungefähr. Das ist der erste Ansatz, um mehr Speicherreserve zu schaffen.
  3. 03
    Alles schließen, was VRAM verbraucht
    Ein Browser mit Hardwarebeschleunigung, ein Spiel, eine Videoschnittsoftware: Alle benötigen Speicher. Bei 6 GB sollte jeweils nur eine Anwendung die GPU nutzen.
  4. 04
    Mit ollama ps prüfen
    Die Spalte „Processor“ zeigt an, wo das Modell geladen wurde: 100 % GPU ist das Ziel. Jede Aufteilung zwischen CPU und GPU weist darauf hin, dass das Modell nicht vollständig in den GPU-Speicher passt, und bedeutet eine geringere Geschwindigkeit.
  5. 05
    Die Quantisierung auswählen
    Q4_K_M ist ein guter Kompromiss; bei einem 4B-Modell können Sie auf Q5 oder Q6 gehen, um die Qualität zu verbessern, da genügend Spielraum vorhanden ist. Der Leitfaden zur Quantisierung erläutert die Unterschiede im Detail.
Einstellungen für eine Grafikkarte mit 6 GB (festlegen, dann Ollama neu starten)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

Diese Variablen werden in der Umgebung des Ollama-Dienstes definiert (systemd unter Linux, Systemvariablen unter Windows, launchctl unter macOS). Der Leitfaden zur Behebung von GPU-Fehlern in Ollama erläutert im Detail, was Sie prüfen sollten, wenn sich ein Modell nicht auf die Grafikkarte laden lässt.

#Diagnose: Warum die Generierung auf einer Karte mit 6 GB langsamer wird

Bei einer Grafikkarte mit 6 GB hat eine plötzliche Verlangsamung fast immer dieselbe Ursache: Ein Teil des Modells oder des Caches wurde aus dem Grafikkartenspeicher ausgelagert. Die folgende Tabelle ordnet das beobachtete Symptom der wahrscheinlichen Ursache und der Maßnahme zu, die Sie zuerst ausprobieren sollten.

Häufige Symptome und Lösungen
SymptomWahrscheinliche UrsacheZum Ausprobieren
Anfangs flüssige Antworten, nach einigen Gesprächsrunden sehr langsamDer Kontextcache hat den VRAM gefüllt, und einige Schichten werden auf den Prozessor ausgelagertKontext reduzieren, Cache in q8_0 quantisieren, Konversation neu starten
Das Modell wird geladen, aber ollama ps zeigt eine CPU/GPU-Verteilung anDas Modell und sein Kontext benötigen mehr Speicher, als verfügbar istEin kleineres Modell oder eine leichtere Quantisierung wählen
Die Geschwindigkeit halbiert sich, nachdem ein Browser oder ein Spiel geöffnet wurdeDiese Anwendungen verbrauchen VRAMDie Hardwarebeschleunigung des Browsers deaktivieren, die GPU nur für eine Aufgabe gleichzeitig nutzen
Speicherfehlermeldung beim LadenDer Treiber reserviert Speicher, und das Modell passt nicht hineinTreiber prüfen, GPU freigeben, ein 4B-Modell ausprobieren
Enttäuschender Durchsatz auf einer aktuellen Grafikkarte mit schmalem SpeicherbusDie Bandbreite ist gering (RTX 3050 6 GB: Bus von 96 Bit)Ein kleineres Modell wählen, statt auf eine Softwareverbesserung zu warten

Ein letzter Punkt zur Qualität: Je kleiner ein Modell ist, desto mehr Fehler macht es bei Aufgaben, die präzises Wissen oder längere Schlussfolgerungsketten erfordern. Mit 6 GB nutzen Sie das Modell besser für das, was es gut kann (umformulieren, einen bereitgestellten Text zusammenfassen, anhand von Auszügen antworten, die Sie ihm geben, klassifizieren, Felder extrahieren), als für die Beantwortung von Faktenfragen aus dem Gedächtnis. Den Ausgangstext in der Unterhaltung bereitzustellen, statt sich darauf zu verlassen, was das Modell „weiß“, liefert mit einem kleinen Modell die besten Ergebnisse und funktioniert auch mit einem kurzen Kontext.

#Auf 8 oder 12 GB aufrüsten: Was jede Speicherstufe ermöglicht

Der lohnendste Sprung ist der Wechsel von 6 auf 12 GB. Bei 12 GB passt ein 8–9B-Modell in Q4 (5 bis 6 GB) mit langem Kontext in den Speicher, und ein 14B-Modell in Q4 (etwa 9 GB) wird möglich. Bei 8 GB passt ein 8B-Modell endlich mit Spielraum hinein, ein 14B-Modell bleibt jedoch außer Reichweite. Suchen Sie auf dieser Seite nicht nach einem Preis: Die Preise ändern sich jede Woche, und die Preisbeobachtung der Website erfasst den niedrigsten Preis für jede Karte.

Was die einzelnen VRAM-Stufen ermöglichen
VRAMModelle, die sich problemlos nutzen lassenWas sich ändert
6 GB3-4B, 8B mit kurzen KontextenEin ordentlicher lokaler Assistent
8 GB8B mit mittelgroßem KontextMehr Spielraum, Q5 möglich
12 GB8-9B mit langem Kontext, 14B in Q4Wirklich komfortabel für Chat und RAG
16 GB14B in Q5, 24B in Q3–Q4 passen gerade nochModelle mit höherer Qualität

#Häufig gestellte Fragen

FAQ
Welcher LLM eignet sich am besten für 6 GB VRAM?+
Ein Modell mit 3 bis 4 Milliarden Parametern in Q4 oder Q5, etwa Qwen 3.5 4B (2,3 GB) oder Phi-4 Mini: Es passt auch mit einer komfortablen Kontextlänge in den Speicher. Ein 8B-Modell in Q4 (Granite 4.2 8B, 4,6 GB) ist mit einem sehr kurzen Kontext möglich, allerdings mit dem Risiko, dass Teile auf die CPU ausgelagert werden.
Welche Geschwindigkeit kann man bei 6 GB VRAM erwarten?+
Sie hängt vor allem von der Bandbreite der Grafikkarte ab: 336 GB/s bei einer RTX 2060, 168 GB/s bei einer RTX 3050 mit 6 GB. Ein 2,3 GB großes Modell hat auf der ersten Karte eine theoretische Obergrenze von 146 Tokens/s und auf der zweiten von 73 Tokens/s; die tatsächlichen Durchsatzraten sind niedriger. Wir haben keine Messung, die wir anführen können.
Kann man Qwen 3.5 9B mit 6 GB betreiben?+
Nicht vollständig: Im QuelLLM-Katalog belegt es in Q4 etwa 6 GB, also den gesamten Speicher der Karte, ohne Platz für den Cache. Bei einem Hybridbetrieb mit GPU und Prozessor lässt es sich laden, wird aber langsam. Ein 4B- oder 8B-Modell mit kurzem Kontext ist die bessere Wahl.
RTX 2060 6 GB oder RTX 3050 6 GB für die lokale KI?+
Die RTX 2060: Ihre Bandbreite von 336 GB/s ist doppelt so hoch wie die der RTX 3050 6 GB (168 GB/s), und diese Bandbreite bestimmt die Generierungsgeschwindigkeit. Die RTX 3050 6 GB hat nur beim Stromverbrauch und bei der Architekturgeneration Vorteile, nicht beim Durchsatz.
Reichen 6 GB für lokales RAG aus?+
Ja, für ein einfaches RAG: Ein leichtes Embedding-Modell und ein 4B-Modell passen gemeinsam in den Speicher. Der begrenzende Faktor ist die Kontextlänge, die mit der Anzahl der an das Modell gesendeten Textauszüge wächst. Beschränken Sie sich auf wenige kurze Textauszüge und quantisieren Sie den K/V-Cache.
Kann ein 30B-MoE auf 6 GB laufen?+
Nur wenn die Experten auf der CPU bleiben; dafür ist dann viel Arbeitsspeicher erforderlich: Die Datei von Qwen3-Coder 30B-A3B ist 19 GB groß. Trotz seiner 3 Milliarden aktiven Parameter passt das Modell nicht in den Speicher der Grafikkarte. Dies ist eine Lösung für Fortgeschrittene, keine Standardkonfiguration.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.