Welches LLM auf einer RTX 2060 / 2060 Super (6–8 GB) ?
Ja, eine RTX 2060 kann einen lokalen LLM ausführen: Mit 6 GB passt ein Modell mit 3 bis 4 Milliarden Parametern in Q4 problemlos in den Speicher; mit 8 GB (2060 Super) passt ein 8B-Modell in Q4 (4,6 bis 5,2 GB) bei moderater Kontextlänge hinein; die 12-GB-Variante von Ende 2021 bietet Platz für ein 14B-Modell. Die im Januar 2019 eingeführte 2060 wird weiterhin von Ollama und CUDA unterstützt. Ihre eigentliche Grenze ist der Speicher, nicht das Alter.
Unter diesem Namen gibt es drei Karten: die RTX 2060 vom Januar 2019 (6 GB), die 2060 Super vom Juli 2019 (8 GB) und eine 2060 vom Dezember 2021 mit 12 GB. Für lokale KI sind sie keineswegs gleichwertig. Diese Seite stellt die technischen Daten jeder Karte vor, zeigt, was heute darauf läuft, was die Geschwindigkeitsberechnung aussagt und wann ein Wechsel sinnvoll ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 2060, RTX 2060 Super, RTX 2060 12 GB: drei Karten, drei Anwendungsfälle
Die RTX 2060 erschien am 15. Januar 2019, die 2060 Super am 9. Juli 2019 und eine Variante der 2060 mit 12 GB am 7. Dezember 2021, laut der Tabelle zur GeForce-20-Serie auf Wikipedia. Alle basieren auf dem Turing-Chip TU106. Für ein LLM kommt es eher auf den Speicher (Kapazität, Bus, Bandbreite) als auf die CUDA-Kerne an.
| Karte | Erscheinungsdatum | CUDA-Kerne | Speicher | Bandbreite | Leistung |
|---|---|---|---|---|---|
| RTX 2060 | 15. Januar 2019 | 1 920 | 6 GB, 192-Bit-Bus | 336 GB/s | 160 W |
| RTX 2060 Super | 9. Juli 2019 | 2 176 | 8 GB, 256-Bit-Bus | 448 GB/s | 175 W |
| RTX 2060 12 GB | 7. Dezember 2021 | 2 176 | 12 GB | in dieser Tabelle nicht angegeben | 185 W |
Die 2060 Super bietet 448 GB/s Bandbreite gegenüber 336 GB/s bei der ursprünglichen 2060: Beim selben Modell generiert sie etwa ein Drittel schneller. Die 12-GB-Variante ist selten und kam spät auf den Markt, ist aber für lokale KI mit Abstand die interessanteste: Sie ist die einzige der drei, auf der ein 14B-Modell in Q4 (etwa 9 GB) mit Speicherreserve Platz findet. Prüfen Sie daher vor jedem Kauf die genaue Speicherkapazität der Karte: Der Name allein verrät sie nicht.
#Was auf jeder Variante läuft
Es gilt dieselbe Regel wie bei jeder anderen Karte: die Modellgewichte in Q4 (Richtwerte dieser Website: 3B ≈ 2 GB, 7–8B ≈ 5 GB, 14B ≈ 9 GB) plus der Kontextcache und etwa 0,5 GB, die vom System und der Inferenz-Engine reserviert werden. Die Tabelle nennt außerdem die theoretische Obergrenze der Generierungsgeschwindigkeit: die Bandbreite geteilt durch die Größe der Modellgewichte. Wir haben keine Durchsatzmessungen für diese Karten und führen auch keine an.
| Modell (Q4) | Modellgröße | 2060 6 GB (336 GB/s) | 2060 Super 8 GB (448 GB/s) | 2060 12 GB |
|---|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Ja, Grenze etwa 280 t/s | Ja, etwa 370 Tokens/s | Ja |
| Qwen 3.5 4B | 2,3 GB | Ja, etwa 146 t/s | Ja, etwa 195 t/s | Ja |
| Granite 4.2 8B | 4,6 GB | Passt gerade noch, sehr kurzer Kontext, etwa 73 t/s | Ja, etwa 97 t/s | Ja |
| Qwen3 8B (Ollama) | 5,2 GB | Nicht zuverlässig | Ja, mittlerer Kontext, etwa 86 T/s | Ja |
| Qwen 3.5 9B | 6 GB | Nein | Passt knapp, etwa 75 t/s | Ja |
| Qwen3 14B (Ollama) | 9,3 GB | Nein | Nein | Ja, kurzer Kontext |
Diese Obergrenzen werden in der Praxis nie erreicht; sie dienen dazu, Grafikkarten miteinander zu vergleichen und einzuschätzen, ob ein Modell interaktiv nutzbar sein wird. Ein doppelt so großes Modell generiert etwa halb so schnell. Für Gespräche ist alles, was in der Praxis mehr als etwa zehn Tokens pro Sekunde erreicht, angenehm zu lesen.
#Turing im Jahr 2026: weiterhin unterstützt
Das Alter der Karte ist weniger besorgniserregend, als man denkt. Laut der Dokumentation unterstützt Ollama NVIDIA-GPUs mit einer Compute Capability von 5.0 oder höher mit einem Treiber der Version 550 oder neuer und führt die RTX 2060 in der Compute-Capability-Klasse 7.5 auf. Die Versionshinweise zu CUDA 13 geben ihrerseits an, dass die Unterstützung für Maxwell, Pascal und Volta in bestimmten Bibliotheken entfernt wurde: Turing ist die älteste Generation, die dort weiterhin unterstützt wird. Langfristig spricht das für die 2060 gegenüber den GTX-10-Karten, auch wenn Ollama Compute Capabilities von 5.0 bis 6.2 mit einem Treiber der Version 570 oder neuer weiterhin unterstützt: Das Risiko besteht darin, dass künftige Funktionen nur auf neuere Architekturen ausgerichtet sind.
Nicht die Rechenleistung begrenzt die Textgenerierung auf dieser Karte, sondern die Speicherbandbreite: Zahlen Sie daher keinen Aufpreis allein für die Tensor Cores. Die eigentliche Voraussetzung ist der Treiber: Eine aktuelle Installation verhindert die meisten Fehler bei der GPU-Erkennung.
#Den Speicherbedarf für Ihre Karte berechnen
Die Rechnung lässt sich in drei Zeilen aufstellen: Speicher der Grafikkarte minus etwa 0,5 GB, die für das System und die Engine reserviert sind, minus Speicherbedarf des Modells ergibt den verbleibenden Platz für den Kontextcache. Wie viel Speicher der Cache pro Token benötigt, hängt von der Modellarchitektur ab; der Rechner auf der Website gibt diesen Bedarf für ein bestimmtes Modell an, und die Quantisierung des Caches mit q8_0 halbiert ihn ungefähr.
| Karte | Verfügbar (Speicher − 0,5 GB) | mit Granite 4.2 8B (4,6 GB) | Mit Qwen3 8B (5,2 GB) | Mit Qwen3 14B (9,3 GB) |
|---|---|---|---|---|
| RTX 2060 6 GB | 5,5 GB | 0,9 GB | 0,3 GB | Passt nicht |
| RTX 2060 Super 8 GB | 7,5 GB | 2,9 GB | 2,3 GB | Passt nicht |
| RTX 2060 12 GB | 11,5 GB | 6,9 GB | 6,3 GB | 2,2 GB |
Diese Tabelle erklärt, warum dieselbe Modellfamilie auf der Super angenehm läuft, auf der 6-GB-Version aber mühsam: Bei weniger als einem Gigabyte freiem Spielraum reichen einige Tausend Kontexttokens aus, damit Teile des Modells auf die CPU ausgelagert werden. Sie zeigt auch, dass ein 14B-Modell auf 12 GB tatsächlich läuft, der Spielraum aber knapp ist: 2,2 GB bleiben für den Kontext, was ein kurzes Kontextfenster erfordert.
#Tipps für die Versionen mit 6 GB und 8 GB
Für die Karte mit 6 GB erläutert der Leitfaden „Welches LLM für 6 GB VRAM?“ das vollständige Speicherbudget; kurz gesagt: Wählen Sie ein 4B-Modell oder ein 8B-Modell mit kurzem Kontext. Bei der Super mit 8 GB wird der Kontext zur ersten Einstellung, die Sie im Blick behalten sollten.
- 01Einen aktuellen Treiber installierenAktualisieren Sie den NVIDIA-Treiber auf Version 550 oder neuer, wie es Ollama erfordert, und installieren Sie dann Ollama für Ihr System.
- 02Die Modellgröße wählen6 GB: ein 4B oder ein 8B mit kurzem Kontext. 8 GB: ein 8B in Q4 mit einem Kontext von 4 000 bis 8 000 Tokens. 12 GB: ein 14B in Q4, kurzer Kontext.
- 03Den Kontextcache reduzierenAktivieren Sie Flash Attention und die Quantisierung des Caches mit q8_0: Laut der FAQ von Ollama halbiert sie den Speicherbedarf des Caches gegenüber f16 ungefähr.
- 04Mit ollama ps prüfenDie Spalte Processor muss 100 % GPU anzeigen. Eine Aufteilung zwischen CPU und GPU zeigt an, dass das Modell nicht vollständig in den GPU-Speicher passt, wodurch die Geschwindigkeit sinkt.
- 05Ressourcenintensive Anwendungen schließenEin Browser mit Hardwarebeschleunigung oder ein Spiel belegt VRAM, den das Modell nicht nutzen kann.
Die FAQ von Ollama schlägt auch eine aggressivere q4_0-Quantisierung des Caches vor, die den Speicherbedarf weiter reduziert, allerdings möglicherweise auf Kosten der Qualität. Testen Sie sie für Ihren Anwendungsfall, bevor Sie sie dauerhaft beibehalten.
#Das, was man mit einer 2060 tatsächlich erreichen kann
- Chat und Schreiben
- Ein 4B- oder 8B-Modell liefert im Alltag korrekte Antworten; bei diesem Einsatz hält die Karte ihre Versprechen am besten.
- RAG und Dokumente
- Ein kleines 4B-Modell und ein Embedding-Modell passen in den Speicher; begrenzen Sie die Anzahl der übermittelten Textauszüge.
- Code
- Autovervollständigung mit einem kleinen Code-Modell; kein zuverlässiger Agent bei dieser Größe.
- Was die Grafikkarte überfordert
- Große Kontexte, rechenintensive Bildverarbeitung, Modelle mit 14B auf 6 oder 8 GB und alle Agenten, die Tools mit langen Prompts nacheinander nutzen.
Die 2060 ist auch eine Karte mit 160 bis 185 W: Unter Dauerlast wird sie heiß und laut wie jede Karte ihrer Kategorie. Der Leitfaden zum Wärmemanagement erklärt, wie Sie die Leistungsaufnahme für einen Server begrenzen, der den ganzen Tag läuft.
#Fazit und wann ein Wechsel sinnvoll ist
Eine bereits installierte RTX 2060 müssen Sie nicht ersetzen, wenn Sie sie für Chats, Textzusammenfassungen und leichtes RAG nutzen. Wenn Sie eine Karte kaufen, hat der Speicher Vorrang vor allem anderen: Die Variante mit 12 GB oder die 2060 Super mit 8 GB sind der Version mit 6 GB vorzuziehen. Die Preise ändern sich jede Woche und stehen nicht auf dieser Seite; die Preisbeobachtung der Website erfasst den niedrigsten Preis für jede Karte.
| Karte | Was geboten wird | Welche Kompromisse sie erfordert |
|---|---|---|
| RTX 2060 6 GB | Der Einstieg: Modelle mit 3–4 Milliarden Parametern | Wenig Spielraum; 8B nur mit sehr kurzem Kontext |
| RTX 2060 Super 8 GB | 8B in Q4 problemlos nutzbar | 448 GB/s, schneller als die 3060 12 GB |
| RTX 3060 12 GB | 12 GB: 14B in Q4 und langer Kontext | 360 GB/s: langsamer als die 2060 Super bei demselben Modell, das auf beide Karten passt |
| RTX 3050 6 GB | Energieeffizienz | 168 GB/s, halb so schnell wie die 2060 mit 6 GB |
Dieser Vergleich korrigiert eine weitverbreitete Vorstellung: Die RTX 3060 12 GB ist bei der Textgenerierung nicht schneller als die 2060 Super. Ihre Bandbreite beträgt laut Wikipedia 360 GB/s, gegenüber 448 GB/s bei der 2060 Super. Ihr Vorteil liegt in der Speicherkapazität: Mit 12 GB lassen sich Modelle laden, für die die Super nicht genug Speicher hat. Wählen Sie nach dem angestrebten Modell, nicht nach einer pauschalen Prozentangabe zur Geschwindigkeit.
Wenn Sie eine gebrauchte Grafikkarte kaufen, prüfen Sie drei Dinge, bevor Sie sie behalten. Überprüfen Sie mit nvidia-smi die angezeigte Gesamtspeicherkapazität: Der Name der Karte reicht nicht aus, um die Varianten mit 6, 8 und 12 GB zu unterscheiden. Lassen Sie etwa zwanzig Minuten lang kontinuierlich generieren und überwachen Sie die Temperatur und den Kerntakt: Eine Karte, die stark langsamer wird, muss gereinigt werden oder benötigt neue Wärmeleitpaste. Testen Sie schließlich ein tatsächliches Modell mit der angestrebten Kontextlänge und prüfen Sie mit ollama ps, ob es vollständig auf der Karte bleibt.
- Welches LLM für RTX 3060 12 GB
- Welcher LLM auf RTX 2070 / 2070 Super
- Welches LLM auf RTX 3050?
- Preisverfolgung für Grafikkarten im Bereich der lokalen KI
- Quelle: Wikipedia, GeForce-20-Serie
- Quelle: Ollama, unterstützte Hardware
- Quelle: Offizielle Ollama-FAQ
#Häufig gestellte Fragen
Kann die RTX 2060 einen LLM laufen lassen?+
Wie lautet der Erscheinungstermin der RTX 2060?+
RTX 2060 oder RTX 2060 Super für ein LLM?+
Passt ein modernes 8B-LLM in den Speicher einer RTX 2060 Super?+
Lohnt sich die RTX 2060 6 GB noch für lokale KI?+
Ist die RTX 3060 12 GB schneller als die 2060 Super?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.