Einsteiger 11 Min.GTX 10

Welcher LLM auf einer GTX 1060 (6 GB) ?

Direkte Antwort

Ja, eine GTX 1060 mit 6 GB kann auch 2026 noch ein lokales LLM ausführen, sofern Sie Modelle mit 2 bis 8 Milliarden Parametern in Q4 wählen und Geduld mitbringen. Der öffentliche Benchmark von llama.cpp misst bei einem 7B-Modell in Q4_0 27,79 Tokens/s: für Chats gut mitlesbar, für Agenten oder lange Dokumente zu langsam. Die 6 GB sind die eigentliche Obergrenze, und die Karte ist inzwischen auf Treiber angewiesen, deren Lebenszyklus sich dem Ende nähert.

Die GTX 1060 kam im Juli 2016 auf den Markt: Sie ist eine Pascal-Karte mit 6 GB GDDR5 und einem 192-Bit-Speicherbus und war die verbreitetste Einstiegskarte in Gaming-PCs des vergangenen Jahrzehnts. Dieser Leitfaden erklärt, was sie heute ausführen kann, welche Durchsatzraten andere dabei gemessen haben, was über den Grafikspeicher hinaus in den Arbeitsspeicher ausgelagert wird und wann es vernünftiger wird, die Karte zu ersetzen, als es weiter mit ihr zu versuchen.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Die GTX 1060 6 GB im Jahr 2026

Die GTX 1060 6 GB lässt sich unter drei Bedingungen für ein lokales LLM nutzen: Die Q4-Gewichte des Modells bleiben unter etwa 4,5 GB, der Kontext ist kurz, und Sie akzeptieren einen Durchsatz von ungefähr 25 bis 30 Tokens/s bei einem 7B-Modell. Die öffentliche Leistungsrangliste von llama.cpp unter CUDA nennt für Llama 2 7B in Q4_0 (3,56 GiB) eine Generierungsgeschwindigkeit von 27,79 Tokens/s. Der Text erscheint damit etwas schneller, als man ihn liest. Bei mehr als 8 Milliarden Parametern oder sobald Sie einen langen Kontext anfordern, reichen die 6 GB nicht mehr aus, und das Modell wird teilweise in den Arbeitsspeicher ausgelagert, wodurch der Durchsatz stark einbricht.

Architektur
Pascal GP106, veröffentlicht am 19. Juli 2016, 1.280 CUDA-Kerne (Konfiguration 1280:80:48)
Speicher
6 GB GDDR5 an einem 192-Bit-Bus, also 192 GB/s bei einer Speicherdatenrate von 8 Gbit/s; es gibt auch eine Variante mit 9 Gbit/s, die 216 GB/s erreicht.
Software
Compute Capability 6.1: wird weiterhin von Ollama erkannt, aber mit einem Treiber 570 oder neuer.
Das, was fehlt
Keine Tensor Cores: Die Vorteile neuerer Grafikkarten bei Matrixberechnungen kommen hier nicht zum Tragen.

#Welche GTX 1060 haben Sie: 3 GB, 5 GB, 6 GB

Die Bezeichnung GTX 1060 umfasst mehrere unterschiedliche Karten, und das Datenblatt der Karte zählt mehr als ihre Bezeichnung. Nur die 6-GB-Version ist wirklich für LLMs geeignet; die 3-GB-Version hat nicht einmal dieselben Kerne.

Die Varianten der GTX 1060 (nach der GeForce-10-Tabelle auf Wikipedia)
VarianteCUDA-KerneSpeicherBus
GTX 1060 3 GB1 1523 GB192 Bit
GTX 1060 5 GB (China, Ende 2017)1 280 (40 ROP)5 GB160 Bit
GTX 1060 6 GB1 2806 GB192 Bit
GTX 1060 6 GB GDDR5X (2018)recycelter GP1046 GB192 Bit

Bei der 3-GB-Version lässt ein 3B-Modell in Q4 (etwa 2 GB Modellgewichte) kaum 1 GB für den KV-Cache und das System übrig: Das ist ein Spielzeug. Bei der 5-GB-Version ist der Spielraum geringer als bei der 6-GB-Version. Wenn Sie beim Kauf unsicher sind, wählen Sie keine der beiden.

#Was wirklich auf 6 GB läuft

Die hilfreiche Frage lautet nicht „Welches Modell passt in 6 GB?“, sondern „Welches passt mitsamt Kontext und mit einer Reserve für das System?“. Als Richtwerte nennt die Website: Ein 7–8B-Modell in Q4 benötigt etwa 5 GB, ein 3B-Modell etwa 2 GB und ein 14B-Modell etwa 9 GB, jeweils allein für die Gewichte. Hinzu kommen der KV-Cache, der mit der Länge der Unterhaltung wächst, und der vom Treiber reservierte Speicher. Die folgende Tabelle stellt die Größe der Gewichte in Q4 (QuelLLM-Katalog) der theoretischen Obergrenze der Generierungsgeschwindigkeit auf dieser Karte gegenüber.

Modelle und 192 GB/s Bandbreite (theoretische Obergrenze = Bandbreite ÷ Modellgröße, niemals ein Messwert)
Modell (Q4)ModellgrößeVerbleibender Spielraum bei 6 GBTheoretisches Maximum
Gemma 4 2B1,2 GB4,8 GB160 Tokens/s
Granite 4.1 3B2 GB4 GB96 Tokens/s
Phi-4 Mini 3,8B3 GB3 GB64 Tokens/s
Granite 4.2 8B4,6 GB1,4 GB42 Tokens pro Sekunde
Qwen3.5 9B6 GBkeinepasst nicht vollständig in den GPU-Speicher
Gemma 4 12B / Phi-4 14B7 bis 9 GBnegativpasst nicht vollständig in den GPU-Speicher

Die theoretische Obergrenze ist optimistisch: Für die Generierung eines Tokens müssen alle aktiven Gewichte erneut gelesen werden. Deshalb kann der Durchsatz die Bandbreite geteilt durch die Modellgröße nicht überschreiten. Der tatsächliche Durchsatz liegt niedriger, wie der folgende Abschnitt zeigt.

In der Praxis liegt der komfortable Bereich zwischen 3 und 4 Milliarden Parametern: Ein Modell dieser Größe lässt mindestens 3 GB für den Kontext frei, passt problemlos in den GPU-Speicher und antwortet ohne spürbare Wartezeit. Modelle mit 7–8 Milliarden Parametern sind für kurze Gespräche weiterhin möglich, aber schon ein einziges in den Chat eingefügtes Dokument reicht aus, um den Grafikkartenspeicher vollständig auszulasten. Für die Verarbeitung langer Dateien ist andere Hardware die bessere Wahl.

#Was die öffentlichen Benchmarks messen

Keine der Durchsatzangaben in diesem Leitfaden beruht auf einer Messung von QuelLLM. Die einzigen genannten Zahlen stammen aus einem öffentlichen Benchmark: der Diskussion „Performance of llama.cpp on Nvidia CUDA“ im llama.cpp-Repository, in der alle Mitwirkenden llama-bench mit demselben Modell ausführen, Llama 2 7B in Q4_0. Sie nennt für diese Karte 416,85 Tokens/s bei der Promptverarbeitung (pp512) und 27,79 Tokens/s bei der Generierung (tg128).

llama.cpp-CUDA-Benchmark, Llama 2 7B Q4_0 (3,56 GiB), ohne Flash Attention
KarteBandbreiteGeneration (tg128)Anteil des Grenzwerts
GTX 1060 6 GB192 GB/s27,79 Tokens/s55 %
GTX 1070 Ti 8 GB256 GB/s37,82 Tokens/s56 %
GTX 1660 6 GB192 GB/s41,35 Tokens/s82 %
GTX 1080 Ti 11 GB484 GB/s62,49 tokens/s49 %

Daraus ergeben sich zwei Erkenntnisse. Erstens erreicht die 1060 etwas mehr als die Hälfte ihres theoretischen Höchstwerts. Zweitens liefert die GTX 1660 bei derselben Bandbreite von 192 GB/s 41,35 Tokens/s: Die Turing-Architektur nutzt denselben Speicher deutlich besser. Bei gleicher Bandbreite ist eine Pascal-Karte daher etwa ein Drittel langsamer als eine Turing-Karte. Für ein Granite 4.2 8B in Q4 (4,6 GB) ergibt die Schätzung durch einfache Proportionalität (27,79 × 3,82 ÷ 4,6) etwa 23 Tokens/s: Das ist eine Berechnung, keine Messung, und die Geschwindigkeitseinbuße durch den Kontext kommt noch hinzu.

i
Warum der Promptverarbeitung ebenfalls Bedeutung zukommt
Der Benchmark meldet 416,85 Tokens/s bei der Verarbeitung des Prompts auf der 1060. Ein Prompt mit 2.000 Tokens (eine lange E-Mail, eine Dokumentationsseite) benötigt daher etwa fünf Sekunden, bevor das erste Wort der Antwort erscheint. Diese Wartezeit werden Sie in der Praxis spüren, sobald Sie ein Dokument einfügen.

#Bei 6 GB kommt es auf den Kontext an, nicht auf das Modell

Ollama verwendet standardmäßig ein Kontextfenster von 4.096 Tokens, das sich mit der Variablen OLLAMA_CONTEXT_LENGTH ändern lässt. Je größer das Fenster ist, desto mehr Speicher belegt der KV-Cache, und bei 6 GB bleibt wenig Spielraum. Ein Granite 4.2 8B in Q4 lässt etwa 1,4 GB für den Cache und das System frei. Der Wechsel von 4.096 auf 32.768 Tokens vergrößert den KV-Cache um den Faktor acht: Auf dieser Karte wird die Grenze lange vor dem vom Modell angegebenen maximalen Kontextfenster erreicht.

So bleibt das Modell auf der GPU: Den Kontext kurz halten, ein kleineres Modell statt einer aggressiveren Quantisierung wählen und mit dem Befehl ollama ps prüfen, ob die Spalte PROCESSOR 100 % GPU anzeigt. Eine Aufteilung zwischen CPU und GPU zeigt, dass das Modell nicht vollständig in den Grafikspeicher passt: Der Durchsatz bricht dann ein, weil der Arbeitsspeicher deutlich langsamer ist als der GDDR5-Speicher der Grafikkarte.

Prüfen, ob das Modell in den GPU-Speicher passt
ollama ps

Die Quantisierung des KV-Caches, die sich mit Flash Attention aktivieren lässt, reduziert den Speicherbedarf weiter: Der dazugehörige Leitfaden erläutert die Einsparung im Detail. Das Prinzip bleibt auf jeder Karte dasselbe: Wenn Modell und Kontext nicht gemeinsam in den Speicher passen, reduzieren Sie eines von beiden.

#Treiber und CUDA: Verfallsdatum von Pascal

Die GTX 1060 funktioniert noch, aber ihre Softwareunterstützung nimmt ab. Die Ollama-Dokumentation stellt klar, dass Karten mit Compute Capability 5.0 bis 6.2 einen NVIDIA-Treiber ab Version 570 benötigen, und die GTX 1060 steht auf der Liste der erkannten Karten. Die Versionshinweise von NVIDIA zu CUDA 13 geben an, dass die Unterstützung für Architekturen vor Turing (Maxwell, Volta und Pascal) eingestellt wird: Die neuen CUDA-Werkzeuge unterstützen Ihre Karte nicht mehr.

Bei den Treibern fasst Wikipedia die Lage so zusammen: NVIDIA hat im Dezember 2025 den Game-Ready-Support für Maxwell, Pascal und Volta eingestellt. Der Treiberzweig 580 ist der letzte, der diese Architekturen unterstützt, und Sicherheitsupdates sind bis Oktober 2028 vorgesehen. Konkret wird die Karte keine weiteren Optimierungen oder Anpassungen für die Kompatibilität mit künftigen Softwareversionen erhalten.

Was dies für die LLM-Verwendung bedeutet
KomponenteSituation für die GTX 1060
OllamaUnterstützt mit einem Treiber 570 oder höher (offizielle Kompatibilitätsliste)
Aktuelles CUDA ToolkitPascal-Unterstützung ab CUDA 13 entfernt: CUDA-12-Builds verwenden
NVIDIA-TreiberTreiberzweig 580, letzte Sicherheitsupdates bis Oktober 2028
Neue Engines und neue OptimierungenSteigendes Risiko von Inkompatibilitäten: bei jeder Aktualisierung prüfen
!
Aktualisieren Sie nicht blind
Wenn Ihre Installation funktioniert, notieren Sie vor jeder Aktualisierung die Versionen des Treibers und von Ollama und halten Sie die vorherige Version griffbereit. Ein aktuelles, für CUDA 13 kompiliertes Tool erkennt die Karte möglicherweise nicht mehr.

#In vier Schritten installieren und überprüfen

  1. 01
    Treiber prüfen
    Führen Sie nvidia-smi aus: Die Treiberversion muss 570 oder höher sein. Installieren Sie sowohl unter Windows als auch unter Linux den Treiberzweig 580, wenn Ihre Version darunter liegt.
  2. 02
    Ollama installieren
    Folgen Sie der Installationsanleitung für Ihr Betriebssystem und laden Sie anschließend ein kleines Modell (2 bis 4 GB) herunter, bevor Sie ein 8B-Modell ausprobieren.
  3. 03
    Platzierung prüfen
    Starten Sie eine Konversation und führen Sie dann in einem zweiten Terminal ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.
  4. 04
    Anpassen
    Wenn die Generierungsrate sehr niedrig ist oder die CPU zum Einsatz kommt, reduzieren Sie den Kontext oder wechseln Sie zu einem kleineren Modell.

#Urteil: beibehalten, kaufen oder ersetzen

Wenn die Karte bereits in Ihrem PC steckt, lohnt es sich, sie einen Abend lang auszuprobieren: Sie eignet sich gut für kurze Chats, Umformulierungen, Übersetzungen oder einen kleinen lokalen Assistenten mit 3 bis 4 Milliarden Parametern. Wenn Sie erwägen, sie für KI zu kaufen, lautet die Antwort nein: Bei gleicher Speicherkapazität bietet eine Turing-Karte oder eine Karte einer neueren Generation bei identischer Speicherbandbreite höhere Durchsatzraten, eine bessere Softwarekompatibilität und deutlich längeren Support.

Entscheidung je nach Ihrer Situation
Ihre SituationEmpfehlung
Sie besitzen bereits die Karte und möchten es ausprobierenJa: Modelle mit 2 bis 4 GB, kurzer Kontext
Sie möchten ein 8B-Modell mit 8.000 Kontexttokens komfortabel nutzenNein: Auf eine Karte mit mindestens 8 GB wechseln
Sie möchten Modelle mit 12 bis 14 Milliarden ParameternNein: 12 GB oder mehr anstreben
Sie zögern, eine gebrauchte zu kaufenNein: Turing- und Ampere-Karten der Einstiegsklasse vergleichen

Um einen Vergleich anzustellen, ohne hier auf Preise einzugehen, die sich jede Woche ändern, konsultieren Sie die Grafikkartenpreisseite dieser Website und den Leitfaden zu Modellen für 6 GB VRAM. Dort sehen Sie, was andere Grafikkarten mit dieser Speicherkapazität ermöglichen.

FAQ
Kann die GTX 1060 mit 6 GB ein 8B-Modell ausführen?+
Ja, in Q4: Granite 4.2 8B benötigt etwa 4,6 GB und lässt 1,4 GB für den Kontext und das System frei. Der Durchsatz wird unter den 27,79 Tokens/s liegen, die im llama.cpp-Benchmark mit einem 7B-Modell in Q4_0 gemessen wurden, und der Kontext muss kurz bleiben. Ein Modell mit 3 bis 4 Milliarden Parametern lässt sich komfortabler betreiben.
GTX 1060 mit 3 GB oder 6 GB für ein LLM?+
Nur die 6-GB-Version. Die 3-GB-Version hat weniger CUDA-Kerne (1.152 gegenüber 1.280) und nur 3 GB Speicher: Ein 3B-Modell in Q4 passt dort samt Kontext gerade noch hinein. Sie eignet sich für ein kleines Modell mit 1 bis 2 Milliarden Parametern, nicht für einen ernstzunehmenden Chat-Assistenten.
Wie viele Tokens pro Sekunde auf einer GTX 1060?+
Der öffentliche llama.cpp-Benchmark misst 27,79 Tokens/s bei der Generierung mit einem 7B-Modell in Q4_0 und 416,85 Tokens/s bei der Verarbeitung des Prompts. Diese Zahlen hängen vom Treiber, vom System und von der Version von llama.cpp ab: Sie vermitteln eine Größenordnung, sind aber keine Garantie.
Funktioniert Ollama noch auf einer GTX 1060 im Jahr 2026?+
Ja: Die GTX 1060 steht auf der Liste der unterstützten Karten und hat eine Compute Capability von 6.1. Die Dokumentation setzt jedoch für Karten mit einer Compute Capability von 5.0 bis 6.2 einen NVIDIA-Treiber der Version 570 oder neuer voraus. Prüfen Sie Ihre Version mit nvidia-smi, bevor Sie die Installation durchführen.
Sollte man für KI eine gebrauchte GTX 1060 kaufen?+
Nein, außer für einen Versuch mit sehr kleinem Budget. Turing und neuere Architekturen holen mehr aus derselben Bandbreite heraus, und CUDA 13 unterstützt Pascal nicht mehr als Zielarchitektur. Bei vergleichbarem Budget bietet eine Turing- oder Ampere-Karte mit 8 GB mehr Spielraum und längerfristige Softwareunterstützung.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.