Welcher LLM auf einer GTX 1060 (6 GB) ?
Ja, eine GTX 1060 mit 6 GB kann auch 2026 noch ein lokales LLM ausführen, sofern Sie Modelle mit 2 bis 8 Milliarden Parametern in Q4 wählen und Geduld mitbringen. Der öffentliche Benchmark von llama.cpp misst bei einem 7B-Modell in Q4_0 27,79 Tokens/s: für Chats gut mitlesbar, für Agenten oder lange Dokumente zu langsam. Die 6 GB sind die eigentliche Obergrenze, und die Karte ist inzwischen auf Treiber angewiesen, deren Lebenszyklus sich dem Ende nähert.
Die GTX 1060 kam im Juli 2016 auf den Markt: Sie ist eine Pascal-Karte mit 6 GB GDDR5 und einem 192-Bit-Speicherbus und war die verbreitetste Einstiegskarte in Gaming-PCs des vergangenen Jahrzehnts. Dieser Leitfaden erklärt, was sie heute ausführen kann, welche Durchsatzraten andere dabei gemessen haben, was über den Grafikspeicher hinaus in den Arbeitsspeicher ausgelagert wird und wann es vernünftiger wird, die Karte zu ersetzen, als es weiter mit ihr zu versuchen.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Die GTX 1060 6 GB im Jahr 2026
Die GTX 1060 6 GB lässt sich unter drei Bedingungen für ein lokales LLM nutzen: Die Q4-Gewichte des Modells bleiben unter etwa 4,5 GB, der Kontext ist kurz, und Sie akzeptieren einen Durchsatz von ungefähr 25 bis 30 Tokens/s bei einem 7B-Modell. Die öffentliche Leistungsrangliste von llama.cpp unter CUDA nennt für Llama 2 7B in Q4_0 (3,56 GiB) eine Generierungsgeschwindigkeit von 27,79 Tokens/s. Der Text erscheint damit etwas schneller, als man ihn liest. Bei mehr als 8 Milliarden Parametern oder sobald Sie einen langen Kontext anfordern, reichen die 6 GB nicht mehr aus, und das Modell wird teilweise in den Arbeitsspeicher ausgelagert, wodurch der Durchsatz stark einbricht.
- Architektur
- Pascal GP106, veröffentlicht am 19. Juli 2016, 1.280 CUDA-Kerne (Konfiguration 1280:80:48)
- Speicher
- 6 GB GDDR5 an einem 192-Bit-Bus, also 192 GB/s bei einer Speicherdatenrate von 8 Gbit/s; es gibt auch eine Variante mit 9 Gbit/s, die 216 GB/s erreicht.
- Software
- Compute Capability 6.1: wird weiterhin von Ollama erkannt, aber mit einem Treiber 570 oder neuer.
- Das, was fehlt
- Keine Tensor Cores: Die Vorteile neuerer Grafikkarten bei Matrixberechnungen kommen hier nicht zum Tragen.
#Welche GTX 1060 haben Sie: 3 GB, 5 GB, 6 GB
Die Bezeichnung GTX 1060 umfasst mehrere unterschiedliche Karten, und das Datenblatt der Karte zählt mehr als ihre Bezeichnung. Nur die 6-GB-Version ist wirklich für LLMs geeignet; die 3-GB-Version hat nicht einmal dieselben Kerne.
| Variante | CUDA-Kerne | Speicher | Bus |
|---|---|---|---|
| GTX 1060 3 GB | 1 152 | 3 GB | 192 Bit |
| GTX 1060 5 GB (China, Ende 2017) | 1 280 (40 ROP) | 5 GB | 160 Bit |
| GTX 1060 6 GB | 1 280 | 6 GB | 192 Bit |
| GTX 1060 6 GB GDDR5X (2018) | recycelter GP104 | 6 GB | 192 Bit |
Bei der 3-GB-Version lässt ein 3B-Modell in Q4 (etwa 2 GB Modellgewichte) kaum 1 GB für den KV-Cache und das System übrig: Das ist ein Spielzeug. Bei der 5-GB-Version ist der Spielraum geringer als bei der 6-GB-Version. Wenn Sie beim Kauf unsicher sind, wählen Sie keine der beiden.
#Was wirklich auf 6 GB läuft
Die hilfreiche Frage lautet nicht „Welches Modell passt in 6 GB?“, sondern „Welches passt mitsamt Kontext und mit einer Reserve für das System?“. Als Richtwerte nennt die Website: Ein 7–8B-Modell in Q4 benötigt etwa 5 GB, ein 3B-Modell etwa 2 GB und ein 14B-Modell etwa 9 GB, jeweils allein für die Gewichte. Hinzu kommen der KV-Cache, der mit der Länge der Unterhaltung wächst, und der vom Treiber reservierte Speicher. Die folgende Tabelle stellt die Größe der Gewichte in Q4 (QuelLLM-Katalog) der theoretischen Obergrenze der Generierungsgeschwindigkeit auf dieser Karte gegenüber.
| Modell (Q4) | Modellgröße | Verbleibender Spielraum bei 6 GB | Theoretisches Maximum |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,8 GB | 160 Tokens/s |
| Granite 4.1 3B | 2 GB | 4 GB | 96 Tokens/s |
| Phi-4 Mini 3,8B | 3 GB | 3 GB | 64 Tokens/s |
| Granite 4.2 8B | 4,6 GB | 1,4 GB | 42 Tokens pro Sekunde |
| Qwen3.5 9B | 6 GB | keine | passt nicht vollständig in den GPU-Speicher |
| Gemma 4 12B / Phi-4 14B | 7 bis 9 GB | negativ | passt nicht vollständig in den GPU-Speicher |
Die theoretische Obergrenze ist optimistisch: Für die Generierung eines Tokens müssen alle aktiven Gewichte erneut gelesen werden. Deshalb kann der Durchsatz die Bandbreite geteilt durch die Modellgröße nicht überschreiten. Der tatsächliche Durchsatz liegt niedriger, wie der folgende Abschnitt zeigt.
In der Praxis liegt der komfortable Bereich zwischen 3 und 4 Milliarden Parametern: Ein Modell dieser Größe lässt mindestens 3 GB für den Kontext frei, passt problemlos in den GPU-Speicher und antwortet ohne spürbare Wartezeit. Modelle mit 7–8 Milliarden Parametern sind für kurze Gespräche weiterhin möglich, aber schon ein einziges in den Chat eingefügtes Dokument reicht aus, um den Grafikkartenspeicher vollständig auszulasten. Für die Verarbeitung langer Dateien ist andere Hardware die bessere Wahl.
#Was die öffentlichen Benchmarks messen
Keine der Durchsatzangaben in diesem Leitfaden beruht auf einer Messung von QuelLLM. Die einzigen genannten Zahlen stammen aus einem öffentlichen Benchmark: der Diskussion „Performance of llama.cpp on Nvidia CUDA“ im llama.cpp-Repository, in der alle Mitwirkenden llama-bench mit demselben Modell ausführen, Llama 2 7B in Q4_0. Sie nennt für diese Karte 416,85 Tokens/s bei der Promptverarbeitung (pp512) und 27,79 Tokens/s bei der Generierung (tg128).
| Karte | Bandbreite | Generation (tg128) | Anteil des Grenzwerts |
|---|---|---|---|
| GTX 1060 6 GB | 192 GB/s | 27,79 Tokens/s | 55 % |
| GTX 1070 Ti 8 GB | 256 GB/s | 37,82 Tokens/s | 56 % |
| GTX 1660 6 GB | 192 GB/s | 41,35 Tokens/s | 82 % |
| GTX 1080 Ti 11 GB | 484 GB/s | 62,49 tokens/s | 49 % |
Daraus ergeben sich zwei Erkenntnisse. Erstens erreicht die 1060 etwas mehr als die Hälfte ihres theoretischen Höchstwerts. Zweitens liefert die GTX 1660 bei derselben Bandbreite von 192 GB/s 41,35 Tokens/s: Die Turing-Architektur nutzt denselben Speicher deutlich besser. Bei gleicher Bandbreite ist eine Pascal-Karte daher etwa ein Drittel langsamer als eine Turing-Karte. Für ein Granite 4.2 8B in Q4 (4,6 GB) ergibt die Schätzung durch einfache Proportionalität (27,79 × 3,82 ÷ 4,6) etwa 23 Tokens/s: Das ist eine Berechnung, keine Messung, und die Geschwindigkeitseinbuße durch den Kontext kommt noch hinzu.
#Bei 6 GB kommt es auf den Kontext an, nicht auf das Modell
Ollama verwendet standardmäßig ein Kontextfenster von 4.096 Tokens, das sich mit der Variablen OLLAMA_CONTEXT_LENGTH ändern lässt. Je größer das Fenster ist, desto mehr Speicher belegt der KV-Cache, und bei 6 GB bleibt wenig Spielraum. Ein Granite 4.2 8B in Q4 lässt etwa 1,4 GB für den Cache und das System frei. Der Wechsel von 4.096 auf 32.768 Tokens vergrößert den KV-Cache um den Faktor acht: Auf dieser Karte wird die Grenze lange vor dem vom Modell angegebenen maximalen Kontextfenster erreicht.
So bleibt das Modell auf der GPU: Den Kontext kurz halten, ein kleineres Modell statt einer aggressiveren Quantisierung wählen und mit dem Befehl ollama ps prüfen, ob die Spalte PROCESSOR 100 % GPU anzeigt. Eine Aufteilung zwischen CPU und GPU zeigt, dass das Modell nicht vollständig in den Grafikspeicher passt: Der Durchsatz bricht dann ein, weil der Arbeitsspeicher deutlich langsamer ist als der GDDR5-Speicher der Grafikkarte.
Die Quantisierung des KV-Caches, die sich mit Flash Attention aktivieren lässt, reduziert den Speicherbedarf weiter: Der dazugehörige Leitfaden erläutert die Einsparung im Detail. Das Prinzip bleibt auf jeder Karte dasselbe: Wenn Modell und Kontext nicht gemeinsam in den Speicher passen, reduzieren Sie eines von beiden.
#Treiber und CUDA: Verfallsdatum von Pascal
Die GTX 1060 funktioniert noch, aber ihre Softwareunterstützung nimmt ab. Die Ollama-Dokumentation stellt klar, dass Karten mit Compute Capability 5.0 bis 6.2 einen NVIDIA-Treiber ab Version 570 benötigen, und die GTX 1060 steht auf der Liste der erkannten Karten. Die Versionshinweise von NVIDIA zu CUDA 13 geben an, dass die Unterstützung für Architekturen vor Turing (Maxwell, Volta und Pascal) eingestellt wird: Die neuen CUDA-Werkzeuge unterstützen Ihre Karte nicht mehr.
Bei den Treibern fasst Wikipedia die Lage so zusammen: NVIDIA hat im Dezember 2025 den Game-Ready-Support für Maxwell, Pascal und Volta eingestellt. Der Treiberzweig 580 ist der letzte, der diese Architekturen unterstützt, und Sicherheitsupdates sind bis Oktober 2028 vorgesehen. Konkret wird die Karte keine weiteren Optimierungen oder Anpassungen für die Kompatibilität mit künftigen Softwareversionen erhalten.
| Komponente | Situation für die GTX 1060 |
|---|---|
| Ollama | Unterstützt mit einem Treiber 570 oder höher (offizielle Kompatibilitätsliste) |
| Aktuelles CUDA Toolkit | Pascal-Unterstützung ab CUDA 13 entfernt: CUDA-12-Builds verwenden |
| NVIDIA-Treiber | Treiberzweig 580, letzte Sicherheitsupdates bis Oktober 2028 |
| Neue Engines und neue Optimierungen | Steigendes Risiko von Inkompatibilitäten: bei jeder Aktualisierung prüfen |
#In vier Schritten installieren und überprüfen
- 01Treiber prüfenFühren Sie nvidia-smi aus: Die Treiberversion muss 570 oder höher sein. Installieren Sie sowohl unter Windows als auch unter Linux den Treiberzweig 580, wenn Ihre Version darunter liegt.
- 02Ollama installierenFolgen Sie der Installationsanleitung für Ihr Betriebssystem und laden Sie anschließend ein kleines Modell (2 bis 4 GB) herunter, bevor Sie ein 8B-Modell ausprobieren.
- 03Platzierung prüfenStarten Sie eine Konversation und führen Sie dann in einem zweiten Terminal ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.
- 04AnpassenWenn die Generierungsrate sehr niedrig ist oder die CPU zum Einsatz kommt, reduzieren Sie den Kontext oder wechseln Sie zu einem kleineren Modell.
- Schritt-für-Schritt-Installation von Ollama
- Ollama-Probleme beheben: GPU nicht erkannt, langsame Ausführung
#Urteil: beibehalten, kaufen oder ersetzen
Wenn die Karte bereits in Ihrem PC steckt, lohnt es sich, sie einen Abend lang auszuprobieren: Sie eignet sich gut für kurze Chats, Umformulierungen, Übersetzungen oder einen kleinen lokalen Assistenten mit 3 bis 4 Milliarden Parametern. Wenn Sie erwägen, sie für KI zu kaufen, lautet die Antwort nein: Bei gleicher Speicherkapazität bietet eine Turing-Karte oder eine Karte einer neueren Generation bei identischer Speicherbandbreite höhere Durchsatzraten, eine bessere Softwarekompatibilität und deutlich längeren Support.
| Ihre Situation | Empfehlung |
|---|---|
| Sie besitzen bereits die Karte und möchten es ausprobieren | Ja: Modelle mit 2 bis 4 GB, kurzer Kontext |
| Sie möchten ein 8B-Modell mit 8.000 Kontexttokens komfortabel nutzen | Nein: Auf eine Karte mit mindestens 8 GB wechseln |
| Sie möchten Modelle mit 12 bis 14 Milliarden Parametern | Nein: 12 GB oder mehr anstreben |
| Sie zögern, eine gebrauchte zu kaufen | Nein: Turing- und Ampere-Karten der Einstiegsklasse vergleichen |
Um einen Vergleich anzustellen, ohne hier auf Preise einzugehen, die sich jede Woche ändern, konsultieren Sie die Grafikkartenpreisseite dieser Website und den Leitfaden zu Modellen für 6 GB VRAM. Dort sehen Sie, was andere Grafikkarten mit dieser Speicherkapazität ermöglichen.
- GPU-Preise für KI vergleichen
- Welche Modelle für 6 GB VRAM, unabhängig von der Karte
- Welches LLM auf RTX 3050?
- VRAM: Wie viel ist für die KI erforderlich?
- Quelle: Ollama-Dokumentation, unterstützte NVIDIA-Hardware
- Quelle: Öffentlicher llama.cpp-Benchmark auf CUDA
- Quelle: Versionshinweise des CUDA Toolkits
- Quelle: GeForce 10-Serie, Spezifikationen und Ende des Supports
Kann die GTX 1060 mit 6 GB ein 8B-Modell ausführen?+
GTX 1060 mit 3 GB oder 6 GB für ein LLM?+
Wie viele Tokens pro Sekunde auf einer GTX 1060?+
Funktioniert Ollama noch auf einer GTX 1060 im Jahr 2026?+
Sollte man für KI eine gebrauchte GTX 1060 kaufen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.