Einsteiger 11 Min.RTX 30

Welcher LLM auf einer RTX 3060 mit 8 GB? ?

Direkte Antwort

Die RTX 3060 8 GB führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 aus, wie Granite 4.2 8B (4,6 GB) oder Qwen 3.5 9B (6 GB), aber keine 12B-Modelle. Ihre Besonderheit: ein 128-Bit-Bus und 240 GB/s gegenüber 192 Bit und 360 GB/s bei der 3060 12 GB, wodurch sie bei der Generierung deutlich langsamer ist. Die öffentliche Tabelle von llama.cpp gibt für die 12-GB-Version mit einem 7B-Modell 75,6 Tokens/s an.

Unter dem Namen RTX 3060 verkaufte NVIDIA zwei Grafikkarten: die ursprüngliche 12-GB-Version und eine Ende 2022 erschienene 8-GB-Version mit schmalerem Speicherbus. Dieser Leitfaden erklärt, was das für lokale KI bedeutet, welche Modelle in die 8-GB-Version passen, wie Sie die beiden Versionen beim Kauf auseinanderhalten und welche Geschwindigkeit zu erwarten ist. Dabei unterscheidet er zwischen gemessenen und nicht gemessenen Werten.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#RTX 3060 8 GB: Was sich gegenüber der 12-GB-Version ändert

Die RTX 3060 mit 8 GB führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 aus: Granite 4.2 8B benötigt laut QuelLLM-Katalog 4,6 GB und Qwen 3.5 9B 6 GB. Für Gemma 4 12B (7 GB in Q4) bietet sie nicht genügend Spielraum. Sie unterscheidet sich in zwei Punkten von der 3060 mit 12 GB: 4 GB weniger Speicher und ein 128-Bit-Bus statt eines 192-Bit-Busses. Laut der Fachpresse, die die Spezifikationen bei der Markteinführung dokumentiert hat, reduziert der schmale Bus die Bandbreite auf 240 GB/s, also 33 % weniger als die 360 GB/s der 12-GB-Version. Für lokale KI fällt das ins Gewicht: Die Textgenerierung hängt vor allem von der Speicherbandbreite ab. Für die 8-GB-Version gibt es keine öffentlichen Messwerte, aber ihre Generierungsrate lässt sich bei einem Modell mit 7 Milliarden Parametern in Q4_0 auf etwa 50 Tokens pro Sekunde schätzen, gegenüber gemessenen 75,6 Tokens pro Sekunde auf der 12-GB-Version.

Chip
Derselbe GA106-Chip wie bei der 3060 mit 12 GB und dieselbe Leistungsaufnahme der Grafikkarte von 170 W.
Speicher
8 GB GDDR6 auf einem 128-Bit-Bus, also 240 GB/s, im Vergleich zu 12 GB, 192 Bit und 360 GB/s.
Konsequenz
Genauso viele Rechenkerne, aber weniger Speicherkapazität und Bandbreite: Der Speicher, nicht die Rechenleistung, begrenzt die lokale KI.

#Mit 8 GB kompatible Modelle

Modelle für eine RTX 3060 mit 8 GB (Modellgrößen laut QuelLLM-Katalog)
ModellGewichte in Q4Modellgröße in Q8Mit 8 GB
Qwen 3.5 4B2,3 GB4,3 GBQ8 möglich, komfortabler Kontext
Granite 4.2 8B4,6 GB9 GBQ4 passt problemlos; Q8 passt nicht in den Speicher
Qwen 3.5 9B6 GB10 GBQ4 mit moderatem Kontext
Gemma 4 12B7 GB13 GBPasst mit Kontext nicht in den Speicher

Die Speicherkapazität entspricht der einer 3070 oder einer 3060 Ti, zwei schnelleren Karten mit 8 GB. Es gelten dieselben Regeln: höchstens 6 GB für die Modellgewichte anpeilen, ein Gigabyte für den Treiber und den Kontext freihalten und prüfen, ob das Modell vollständig im Grafikspeicher liegt. Der Befehl ollama ps zeigt dazu 100% GPU an, wenn alles auf der Karte geladen ist. Erscheint ein CPU-Prozentanteil, wird ein Teil des Modells außerhalb des Grafikspeichers ausgeführt, und die Geschwindigkeit bricht ein.

#Geschwindigkeit: Warum der Speicherbus den Ausschlag gibt

Die von der Community gepflegte Tabelle von llama.cpp (Llama 2 7B in Q4_0, Datei mit 3,56 GiB) enthält die 3060 mit 8 GB nicht, macht aber verständlich, welchen Unterschied der Speicherbus bewirkt. Sie nennt 75,6 Tokens pro Sekunde für die 3060 mit 12 GB (192-Bit-Bus), 92,2 für die 3060 Ti mit 8 GB (256 Bit) und 63,9 für eine RTX 4060 Ti mit 8 GB, deren Bus nur 128 Bit breit ist. Bei gleicher Kapazität richtet sich die Reihenfolge mit einigen Einschränkungen nach der Busbreite: Eine neuere Karte mit schmalem Bus kann hinter einer älteren mit breitem Bus zurückbleiben.

Generierung mit Llama 2 7B Q4_0: Der Bus macht den Unterschied
KarteSpeicherBusGenerierung (Tok/s)Status
RTX 3060 Ti8 GB256 Bit92,2Veröffentlichte Messung
RTX 3060 12 GB12 GB192 Bit75,6Veröffentlichte Messung
RTX 4060 Ti 8 GB8 GB128 Bit63,9Veröffentlichte Messung
RTX 3060 8 GB8 GB128 Bitum die 47 bis 50Schätzung, nicht gemessen

Die Schätzung der letzten Zeile bezieht sich auf einen Durchsatz von 240 GB/s und erreicht einen gemessenen Leistungsfaktor von 12 GB, der etwa 80 % der möglichen Bandbreite erreicht. Es handelt sich um eine Prognose, die so dargestellt werden muss. Auf Grundlage eines Dreisatzes in Bezug auf die Dateigröße ergibt sich etwa 40 Tokens pro Sekunde für Granite 4.2 8B (4,6 GB) und dreißig für Qwen 3.5 9B (6 GB), also theoretische Höchstwerte. Dieser Durchsatz bleibt in Diskussionen lesbar, aber er stellt die 8 GB etwa ein Drittel unter der 12 GB und mehr als 40 % unter der 3060 Ti.

#Fallstricke vermeiden

Zwei Karten unter einem einzigen Namen
NVIDIA führt die RTX 3060 mit 12 GB oder 8 GB und einer Busbreite von 192 oder 128 Bit auf. Der Name allein sagt nichts aus: Bestehen Sie darauf, dass die Speicherkapazität in der Anzeige angegeben ist.
Prüfung bei der Installation
Führen Sie nvidia-smi aus: Die 12-GB-Variante zeigt laut den Aufzeichnungen von llama.cpp etwa 12.287 MiB an, die 8-GB-Variante etwa 7.800 MiB, ähnlich wie die benachbarte 3060 Ti.
Preis entsprechend der 12 GB-Version
Einige Verkäufer zeigen den gleichen Preis für beide Versionen. Vergleichen Sie mit dem wöchentlichen Überblick auf der Website anstelle eines festen Preises.
Unrealistische Erwartungen an die 12B
Gemma 4 12B und Modelle dieser Größe passen zusammen mit dem Kontext nicht in den Speicher; die Obergrenze liegt bei 9B in Q4.
Den Namen und den Gesamtspeicher der Karte auslesen
nvidia-smi --query-gpu=name,memory.total --format=csv

Die zweite Prüfung gilt auch für einen übernommenen PC: Die Herstellerbeschreibung oder der Name der Grafikkarte in Windows reichen nicht immer aus, um die Versionen zu unterscheiden, während die von nvidia-smi ausgegebene Gesamtspeichergröße eindeutig ist.

#Die Berechnung hinter der Schätzung

Der Prinzip ist einfach: Um einen Token zu erzeugen, liest die Grafikkarte den wesentlichen Teil der Modellgewichte neu. Die maximale Anzahl an Tokens pro Sekunde beträgt daher etwa die Bandbreite geteilt durch die Dateigröße. Die Testdatei hat eine Größe von 3,56 GiB, also etwa 3,82 GB. Für die 3060 12 GB ergibt sich ein Höchstwert von 94 Tokens pro Sekunde, wenn 360 GB/s durch 3,82 geteilt werden, und die veröffentlichte Messung erreicht 80 %. Für die 8 GB ergibt sich ein Höchstwert von etwa 63 Tokens pro Sekunde, wenn 240 GB/s geteilt werden; bei gleicher Effizienz ergibt sich eine fünfundfünfzig.

Von der theoretischen Obergrenze zur Schätzung
KarteBandbreiteLimit (GB/s ÷ 3,82 GB)Ergebnis
RTX 3060 12 GB360 GB/setwa 94 Tok/s75,6 Tok/s gemessen (etwa 80 %)
RTX 3060 8 GB240 GB/setwa 63 Tok/setwa 50 Tok/s geschätzt

Diese Methode hat eine Einschränkung: Der Ausschöpfungsgrad variiert von Karte zu Karte, wie andere Karten derselben Tabelle zeigen, bei denen das Verhältnis des Messwerts zum theoretischen Maximum zwischen 67 % und 85 % liegt. Gehen Sie daher von einer Bandbreite statt von einem exakten Wert aus. Beachten Sie außerdem, dass die veröffentlichten Ergebnisse vom Treiber, vom System und vom Kartenhersteller abhängen, selbst bei identischem Chip. Messen Sie auf Ihrer eigenen Hardware, wenn die Geschwindigkeit für einen Kauf ausschlaggebend ist.

#Wie sich das in der Praxis auswirkt

Rechnen Sie den Durchsatz in Wartezeit um. Bei etwa 40 Tokens pro Sekunde dauert eine Antwort mit 500 Tokens, also etwa einer Seite Erklärung, rund zwölf Sekunden; auf einer 3060 mit 12 GB würde dieselbe Antwort etwa acht Sekunden benötigen, ebenfalls als theoretische Schätzung. Bei einem Gespräch ist der Unterschied erträglich: Der Text erscheint schneller, als Sie ihn lesen. Belastend wird er in zwei Fällen: bei Agenten, die viele Modellaufrufe nacheinander ausführen, und bei der Stapelverarbeitung zahlreicher Dokumente, bei der sich die Zeitunterschiede summieren.

Die Kapazität von 8 GB setzt eine deutlichere Grenze als die Geschwindigkeit. Sie zwingt zur Wahl zwischen einem langen Kontext und einem größeren Modell, während eine Karte mit 12 GB beides ermöglicht. Wenn Sie lediglich kurze Fragen an ein 8B-Modell stellen, reicht die 8-GB-Karte aus. Wenn Sie das Modell mit Ihren Dokumenten verbinden möchten, sollten Sie mehr Speicher anpeilen.

  1. 01
    Das Inserat prüfen
    Achten Sie auf die Angabe 8 GB oder 12 GB im Titel, in der Beschreibung oder auf den Fotos der Verpackung. Fehlt diese Angabe, fragen Sie den Verkäufer danach.
  2. 02
    Einen Screenshot anfordern
    Verlangen Sie einen Screenshot von nvidia-smi oder dem Tool GPU-Z, der den gesamten Speicher und die Busbreite zeigt.
  3. 03
    Bei der Abholung testen
    Führen Sie vor Ort nvidia-smi aus: etwa 12.287 MiB für die 12-GB-Version und etwa 7.800 MiB für die 8-GB-Version.
  4. 04
    Ein Modell ausführen
    Laden Sie mit Ollama ein 8B-Modell in Q4 und überprüfen Sie mit ollama ps, dass es zu 100 % auf der GPU läuft, bevor Sie den Kauf abschließen.

#Kontext: 8 GB sinnvoll nutzen

Bei 8 GB ist der Kontextcache die eigentliche Grenze. Laut der Dokumentation von Ollama lässt sich der K/V-Cache quantisieren, wenn Flash Attention aktiviert ist: Setzen Sie zuerst OLLAMA_FLASH_ATTENTION=1 und dann OLLAMA_KV_CACHE_TYPE=q8_0, bevor Sie den Server starten. Mit einem 128-Bit-Bus hat die Karte bereits Schwierigkeiten mit der Geschwindigkeit; deshalb sollte man sie nicht zusätzlich mit einem übermäßig großen Kontext belasten. Ein Kontext von einigen Tausend Tokens mit einem 8B-Modell in Q4 ist ein guter Kompromiss.

Linux: Ollama mit quantisiertem K/V-Cache starten
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Was soll man stattdessen wählen?

Alternativen mit vergleichbarem Budget
KarteSpeicherGenerierung (Tok/s)Was geboten wird
RTX 3060 12 GB12 GB75,6 (Messwert)Ermöglicht 12B-Modelle, schneller als die 8-GB-Version
RTX 3060 Ti8 GB92,2 (Messwert)Gleiche Speicherkapazität, aber viel schneller
RTX 4060 Ti 8 GB8 GB63,9 (Messwert)Neuer, aber mit 128-Bit-Bus wie die 3060 mit 8 GB

Die Wahl hängt von Ihrem Bedarf ab: Für mehr Speicherkapazität die 3060 mit 12 GB; für mehr Geschwindigkeit bei Modellen mit 8 Milliarden Parametern die 3060 Ti. Die Gebrauchtpreise ändern sich jede Woche: Die Preisbeobachtung der Website erfasst den jeweils niedrigsten Preis der Grafikkarten für lokale KI.

#Fazit 2026

Behalten Sie sie, wenn
Sie ist bereits in Ihrem PC verbaut und Sie möchten ein 8B- oder 9B-Modell in Q4 für Chats oder Unterstützung beim Programmieren nutzen, ohne Anforderungen an die Geschwindigkeit.
Nicht für KI kaufen
Eine 3060 mit 12 GB bietet mehr, oft zu einem ähnlichen Preis. Kaufen Sie die 8-GB-Version nur, wenn sie deutlich günstiger ist.
Prüfen Sie immer die Version
Bestehen Sie darauf, dass die Speicherkapazität im Angebot angegeben ist, und überprüfen Sie sie nach Erhalt mit nvidia-smi.

#Häufig gestellte Fragen

Häufig gestellte Fragen
Wie unterscheidet man die RTX 3060 8 GB von der 12 GB?+
Prüfen Sie die Speicherangabe auf der Verpackung oder in der Anzeige und führen Sie dann nvidia-smi aus: Der Gesamtspeicher liegt bei etwa 12 000 MiB für die 12-GB-Version (12 287 MiB von llama.cpp erfasst) und bei etwa 8 000 MiB für die 8-GB-Version. NVIDIA unterscheidet auch die Speicherbusse: 192 Bit für die 12-GB-Version, 128 Bit für die 8-GB-Version.
Wie viele Tokens pro Sekunde auf einer RTX 3060 8 GB?+
Es gibt keine öffentlich verfügbaren Messungen. Die 12-GB-Version erzeugt laut der Tabelle von llama.cpp mit einem 7B-Modell in Q4_0 75,6 Tokens pro Sekunde; mit 240 GB/s statt 360 GB/s dürfte die 8-GB-Version im selben Test nach einer theoretischen Schätzung etwa 47 bis 50 Tokens pro Sekunde erreichen.
RTX 3060 8 GB oder RTX 4060 8 GB für ein LLM?+
Beide haben 8 GB und einen 128-Bit-Bus. Für die RTX 4060 Ti mit 8 GB, eine weitere Karte mit einem 128-Bit-Bus, sind in der öffentlichen llama.cpp-Tabelle 63,9 Tokens pro Sekunde gemessen worden. Wählen Sie nach Preis und Stromverbrauch: Bei gleicher Kapazität und Busbreite wird die Geschwindigkeit in derselben Größenordnung liegen.
Kann die RTX 3060 8 GB Gemma 4 12B ausführen?+
Nur mit Mühe. Der Katalog gibt für die Modellgewichte in Q4 eine Größe von 7 GB an, sodass kaum ein Gigabyte für den Kontext und das System übrig bleibt. Das Modell wird dann zwischen der Grafikkarte und dem Arbeitsspeicher aufgeteilt, was ollama ps anzeigt, und die Geschwindigkeit bricht ein. Bevorzugen Sie Qwen 3.5 9B (6 GB) oder Granite 4.2 8B (4,6 GB).
Funktioniert Ollama auf einer RTX 3060 mit 8 GB?+
Ja. Ollama führt die RTX 3060 unter den Karten mit Compute Capability 8.6 auf und benötigt einen Treiber der Version 550 oder neuer. Prüfen Sie nach dem ersten Laden mit ollama ps, ob die Angabe „100% GPU“ erscheint: Das ist ein Zeichen dafür, dass das Modell vollständig in die 8 GB passt.
Ist eine RTX 3060 mit 12 GB besser?+
Für lokale KI ja, in fast allen Fällen: Laut der öffentlichen llama.cpp-Tabelle erreicht sie 75,6 Tokens pro Sekunde, verfügt über 4 GB mehr Speicher und ermöglicht den Einsatz von Modellen mit 12 Milliarden Parametern. Die 8-GB-Version lohnt sich nur, wenn sie bereits eingebaut oder deutlich günstiger ist.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.