Welcher LLM auf einer RTX 3060 mit 8 GB? ?
Die RTX 3060 8 GB führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 aus, wie Granite 4.2 8B (4,6 GB) oder Qwen 3.5 9B (6 GB), aber keine 12B-Modelle. Ihre Besonderheit: ein 128-Bit-Bus und 240 GB/s gegenüber 192 Bit und 360 GB/s bei der 3060 12 GB, wodurch sie bei der Generierung deutlich langsamer ist. Die öffentliche Tabelle von llama.cpp gibt für die 12-GB-Version mit einem 7B-Modell 75,6 Tokens/s an.
Unter dem Namen RTX 3060 verkaufte NVIDIA zwei Grafikkarten: die ursprüngliche 12-GB-Version und eine Ende 2022 erschienene 8-GB-Version mit schmalerem Speicherbus. Dieser Leitfaden erklärt, was das für lokale KI bedeutet, welche Modelle in die 8-GB-Version passen, wie Sie die beiden Versionen beim Kauf auseinanderhalten und welche Geschwindigkeit zu erwarten ist. Dabei unterscheidet er zwischen gemessenen und nicht gemessenen Werten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RTX 3060 8 GB: Was sich gegenüber der 12-GB-Version ändert
Die RTX 3060 mit 8 GB führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 aus: Granite 4.2 8B benötigt laut QuelLLM-Katalog 4,6 GB und Qwen 3.5 9B 6 GB. Für Gemma 4 12B (7 GB in Q4) bietet sie nicht genügend Spielraum. Sie unterscheidet sich in zwei Punkten von der 3060 mit 12 GB: 4 GB weniger Speicher und ein 128-Bit-Bus statt eines 192-Bit-Busses. Laut der Fachpresse, die die Spezifikationen bei der Markteinführung dokumentiert hat, reduziert der schmale Bus die Bandbreite auf 240 GB/s, also 33 % weniger als die 360 GB/s der 12-GB-Version. Für lokale KI fällt das ins Gewicht: Die Textgenerierung hängt vor allem von der Speicherbandbreite ab. Für die 8-GB-Version gibt es keine öffentlichen Messwerte, aber ihre Generierungsrate lässt sich bei einem Modell mit 7 Milliarden Parametern in Q4_0 auf etwa 50 Tokens pro Sekunde schätzen, gegenüber gemessenen 75,6 Tokens pro Sekunde auf der 12-GB-Version.
- Chip
- Derselbe GA106-Chip wie bei der 3060 mit 12 GB und dieselbe Leistungsaufnahme der Grafikkarte von 170 W.
- Speicher
- 8 GB GDDR6 auf einem 128-Bit-Bus, also 240 GB/s, im Vergleich zu 12 GB, 192 Bit und 360 GB/s.
- Konsequenz
- Genauso viele Rechenkerne, aber weniger Speicherkapazität und Bandbreite: Der Speicher, nicht die Rechenleistung, begrenzt die lokale KI.
#Mit 8 GB kompatible Modelle
| Modell | Gewichte in Q4 | Modellgröße in Q8 | Mit 8 GB |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | 4,3 GB | Q8 möglich, komfortabler Kontext |
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 passt problemlos; Q8 passt nicht in den Speicher |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 mit moderatem Kontext |
| Gemma 4 12B | 7 GB | 13 GB | Passt mit Kontext nicht in den Speicher |
Die Speicherkapazität entspricht der einer 3070 oder einer 3060 Ti, zwei schnelleren Karten mit 8 GB. Es gelten dieselben Regeln: höchstens 6 GB für die Modellgewichte anpeilen, ein Gigabyte für den Treiber und den Kontext freihalten und prüfen, ob das Modell vollständig im Grafikspeicher liegt. Der Befehl ollama ps zeigt dazu 100% GPU an, wenn alles auf der Karte geladen ist. Erscheint ein CPU-Prozentanteil, wird ein Teil des Modells außerhalb des Grafikspeichers ausgeführt, und die Geschwindigkeit bricht ein.
#Geschwindigkeit: Warum der Speicherbus den Ausschlag gibt
Die von der Community gepflegte Tabelle von llama.cpp (Llama 2 7B in Q4_0, Datei mit 3,56 GiB) enthält die 3060 mit 8 GB nicht, macht aber verständlich, welchen Unterschied der Speicherbus bewirkt. Sie nennt 75,6 Tokens pro Sekunde für die 3060 mit 12 GB (192-Bit-Bus), 92,2 für die 3060 Ti mit 8 GB (256 Bit) und 63,9 für eine RTX 4060 Ti mit 8 GB, deren Bus nur 128 Bit breit ist. Bei gleicher Kapazität richtet sich die Reihenfolge mit einigen Einschränkungen nach der Busbreite: Eine neuere Karte mit schmalem Bus kann hinter einer älteren mit breitem Bus zurückbleiben.
| Karte | Speicher | Bus | Generierung (Tok/s) | Status |
|---|---|---|---|---|
| RTX 3060 Ti | 8 GB | 256 Bit | 92,2 | Veröffentlichte Messung |
| RTX 3060 12 GB | 12 GB | 192 Bit | 75,6 | Veröffentlichte Messung |
| RTX 4060 Ti 8 GB | 8 GB | 128 Bit | 63,9 | Veröffentlichte Messung |
| RTX 3060 8 GB | 8 GB | 128 Bit | um die 47 bis 50 | Schätzung, nicht gemessen |
Die Schätzung der letzten Zeile bezieht sich auf einen Durchsatz von 240 GB/s und erreicht einen gemessenen Leistungsfaktor von 12 GB, der etwa 80 % der möglichen Bandbreite erreicht. Es handelt sich um eine Prognose, die so dargestellt werden muss. Auf Grundlage eines Dreisatzes in Bezug auf die Dateigröße ergibt sich etwa 40 Tokens pro Sekunde für Granite 4.2 8B (4,6 GB) und dreißig für Qwen 3.5 9B (6 GB), also theoretische Höchstwerte. Dieser Durchsatz bleibt in Diskussionen lesbar, aber er stellt die 8 GB etwa ein Drittel unter der 12 GB und mehr als 40 % unter der 3060 Ti.
#Fallstricke vermeiden
- Zwei Karten unter einem einzigen Namen
- NVIDIA führt die RTX 3060 mit 12 GB oder 8 GB und einer Busbreite von 192 oder 128 Bit auf. Der Name allein sagt nichts aus: Bestehen Sie darauf, dass die Speicherkapazität in der Anzeige angegeben ist.
- Prüfung bei der Installation
- Führen Sie nvidia-smi aus: Die 12-GB-Variante zeigt laut den Aufzeichnungen von llama.cpp etwa 12.287 MiB an, die 8-GB-Variante etwa 7.800 MiB, ähnlich wie die benachbarte 3060 Ti.
- Preis entsprechend der 12 GB-Version
- Einige Verkäufer zeigen den gleichen Preis für beide Versionen. Vergleichen Sie mit dem wöchentlichen Überblick auf der Website anstelle eines festen Preises.
- Unrealistische Erwartungen an die 12B
- Gemma 4 12B und Modelle dieser Größe passen zusammen mit dem Kontext nicht in den Speicher; die Obergrenze liegt bei 9B in Q4.
Die zweite Prüfung gilt auch für einen übernommenen PC: Die Herstellerbeschreibung oder der Name der Grafikkarte in Windows reichen nicht immer aus, um die Versionen zu unterscheiden, während die von nvidia-smi ausgegebene Gesamtspeichergröße eindeutig ist.
#Die Berechnung hinter der Schätzung
Der Prinzip ist einfach: Um einen Token zu erzeugen, liest die Grafikkarte den wesentlichen Teil der Modellgewichte neu. Die maximale Anzahl an Tokens pro Sekunde beträgt daher etwa die Bandbreite geteilt durch die Dateigröße. Die Testdatei hat eine Größe von 3,56 GiB, also etwa 3,82 GB. Für die 3060 12 GB ergibt sich ein Höchstwert von 94 Tokens pro Sekunde, wenn 360 GB/s durch 3,82 geteilt werden, und die veröffentlichte Messung erreicht 80 %. Für die 8 GB ergibt sich ein Höchstwert von etwa 63 Tokens pro Sekunde, wenn 240 GB/s geteilt werden; bei gleicher Effizienz ergibt sich eine fünfundfünfzig.
| Karte | Bandbreite | Limit (GB/s ÷ 3,82 GB) | Ergebnis |
|---|---|---|---|
| RTX 3060 12 GB | 360 GB/s | etwa 94 Tok/s | 75,6 Tok/s gemessen (etwa 80 %) |
| RTX 3060 8 GB | 240 GB/s | etwa 63 Tok/s | etwa 50 Tok/s geschätzt |
Diese Methode hat eine Einschränkung: Der Ausschöpfungsgrad variiert von Karte zu Karte, wie andere Karten derselben Tabelle zeigen, bei denen das Verhältnis des Messwerts zum theoretischen Maximum zwischen 67 % und 85 % liegt. Gehen Sie daher von einer Bandbreite statt von einem exakten Wert aus. Beachten Sie außerdem, dass die veröffentlichten Ergebnisse vom Treiber, vom System und vom Kartenhersteller abhängen, selbst bei identischem Chip. Messen Sie auf Ihrer eigenen Hardware, wenn die Geschwindigkeit für einen Kauf ausschlaggebend ist.
#Wie sich das in der Praxis auswirkt
Rechnen Sie den Durchsatz in Wartezeit um. Bei etwa 40 Tokens pro Sekunde dauert eine Antwort mit 500 Tokens, also etwa einer Seite Erklärung, rund zwölf Sekunden; auf einer 3060 mit 12 GB würde dieselbe Antwort etwa acht Sekunden benötigen, ebenfalls als theoretische Schätzung. Bei einem Gespräch ist der Unterschied erträglich: Der Text erscheint schneller, als Sie ihn lesen. Belastend wird er in zwei Fällen: bei Agenten, die viele Modellaufrufe nacheinander ausführen, und bei der Stapelverarbeitung zahlreicher Dokumente, bei der sich die Zeitunterschiede summieren.
Die Kapazität von 8 GB setzt eine deutlichere Grenze als die Geschwindigkeit. Sie zwingt zur Wahl zwischen einem langen Kontext und einem größeren Modell, während eine Karte mit 12 GB beides ermöglicht. Wenn Sie lediglich kurze Fragen an ein 8B-Modell stellen, reicht die 8-GB-Karte aus. Wenn Sie das Modell mit Ihren Dokumenten verbinden möchten, sollten Sie mehr Speicher anpeilen.
- 01Das Inserat prüfenAchten Sie auf die Angabe 8 GB oder 12 GB im Titel, in der Beschreibung oder auf den Fotos der Verpackung. Fehlt diese Angabe, fragen Sie den Verkäufer danach.
- 02Einen Screenshot anfordernVerlangen Sie einen Screenshot von nvidia-smi oder dem Tool GPU-Z, der den gesamten Speicher und die Busbreite zeigt.
- 03Bei der Abholung testenFühren Sie vor Ort nvidia-smi aus: etwa 12.287 MiB für die 12-GB-Version und etwa 7.800 MiB für die 8-GB-Version.
- 04Ein Modell ausführenLaden Sie mit Ollama ein 8B-Modell in Q4 und überprüfen Sie mit ollama ps, dass es zu 100 % auf der GPU läuft, bevor Sie den Kauf abschließen.
#Kontext: 8 GB sinnvoll nutzen
Bei 8 GB ist der Kontextcache die eigentliche Grenze. Laut der Dokumentation von Ollama lässt sich der K/V-Cache quantisieren, wenn Flash Attention aktiviert ist: Setzen Sie zuerst OLLAMA_FLASH_ATTENTION=1 und dann OLLAMA_KV_CACHE_TYPE=q8_0, bevor Sie den Server starten. Mit einem 128-Bit-Bus hat die Karte bereits Schwierigkeiten mit der Geschwindigkeit; deshalb sollte man sie nicht zusätzlich mit einem übermäßig großen Kontext belasten. Ein Kontext von einigen Tausend Tokens mit einem 8B-Modell in Q4 ist ein guter Kompromiss.
#Was soll man stattdessen wählen?
| Karte | Speicher | Generierung (Tok/s) | Was geboten wird |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 (Messwert) | Ermöglicht 12B-Modelle, schneller als die 8-GB-Version |
| RTX 3060 Ti | 8 GB | 92,2 (Messwert) | Gleiche Speicherkapazität, aber viel schneller |
| RTX 4060 Ti 8 GB | 8 GB | 63,9 (Messwert) | Neuer, aber mit 128-Bit-Bus wie die 3060 mit 8 GB |
Die Wahl hängt von Ihrem Bedarf ab: Für mehr Speicherkapazität die 3060 mit 12 GB; für mehr Geschwindigkeit bei Modellen mit 8 Milliarden Parametern die 3060 Ti. Die Gebrauchtpreise ändern sich jede Woche: Die Preisbeobachtung der Website erfasst den jeweils niedrigsten Preis der Grafikkarten für lokale KI.
- Preise für Grafikkarten für lokale KI (wöchentliche Preisbeobachtung)
- Welches LLM läuft auf der RTX 3060 mit 12 GB?
- Welches LLM auf RTX 3060 Ti (8 GB)?
#Fazit 2026
- Behalten Sie sie, wenn
- Sie ist bereits in Ihrem PC verbaut und Sie möchten ein 8B- oder 9B-Modell in Q4 für Chats oder Unterstützung beim Programmieren nutzen, ohne Anforderungen an die Geschwindigkeit.
- Nicht für KI kaufen
- Eine 3060 mit 12 GB bietet mehr, oft zu einem ähnlichen Preis. Kaufen Sie die 8-GB-Version nur, wenn sie deutlich günstiger ist.
- Prüfen Sie immer die Version
- Bestehen Sie darauf, dass die Speicherkapazität im Angebot angegeben ist, und überprüfen Sie sie nach Erhalt mit nvidia-smi.
#Häufig gestellte Fragen
Wie unterscheidet man die RTX 3060 8 GB von der 12 GB?+
Wie viele Tokens pro Sekunde auf einer RTX 3060 8 GB?+
RTX 3060 8 GB oder RTX 4060 8 GB für ein LLM?+
Kann die RTX 3060 8 GB Gemma 4 12B ausführen?+
Funktioniert Ollama auf einer RTX 3060 mit 8 GB?+
Ist eine RTX 3060 mit 12 GB besser?+
- Quelle: Leistungstabelle von llama.cpp unter CUDA
- Quelle: NVIDIA-Produktseite zur RTX 3060
- Quelle: Tom's Hardware, RTX 3060 8 GB
- Quelle: FAQ von Ollama (ollama ps, K/V-Cache)
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.