Einsteiger 11 Min.GTX 16

Welcher LLM auf GTX 1650 / 1660 / Super / Ti? ?

Direkte Antwort

Eine GTX 1660 (6 GB) kann ein lokales LLM mit 7 bis 8 Milliarden Parametern in Q4 ausführen: Der öffentliche llama.cpp-Benchmark misst 41,35 tokens/s bei der Generierung auf einem 7B Q4_0, aber nur 148,91 tokens/s beim Lesen des Prompts. Die 1660 Super und Ti mit schnellerem Speicher sollten schneller sein. Die GTX 1650, begrenzt auf 4 GB, beschränkt sich auf Modelle mit 2 bis 3 Milliarden Parametern. Alle werden von CUDA 13 unterstützt.

Die 2019 eingeführte GTX-16-Serie basiert auf der Turing-Architektur und hat weder Tensor Cores noch Ray-Tracing-Kerne. Anders als die GTX-10-Serie ist sie vom Ende der Pascal-Unterstützung nicht betroffen. Dieser Leitfaden vergleicht die vier Karten anhand dessen, was für ein LLM zählt: Speicher und Speicherbandbreite. Er stützt sich auf öffentlich zugängliche Messungen und weist auf einen Fallstrick hin: Eine ordentliche Generierung bedeutet nicht, dass lange Prompts schnell eingelesen werden.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Die GTX 16-Serie für ein LLM: Was man sich merken sollte

Für ein LLM lässt sich die GTX-16-Serie anhand des Speichers einordnen: 4 GB für die GTX 1650, 6 GB für die GTX 1660, 1660 Super und 1660 Ti. Die Generierungsgeschwindigkeit richtet sich nach der Bandbreite, die vom Einfachen bis zum Dreifachen reicht: 128 GB/s für die 1650 mit GDDR5, 192 GB/s für die 1660, 288 GB/s für die 1660 Ti und 336 GB/s für die 1660 Super. Bei gleicher Kapazität von 6 GB ist die 1660 Super daher die schnellste der Serie und die ursprüngliche 1660 die langsamste.

Bandbreite und Speicher der GTX 16 (Wikipedia, GeForce 16 Series)
KarteSpeicherBandbreiteCUDA-Kerne
GTX 1650 (GDDR5)4 GB, GDDR5, 128 Bit128 GB/s896
GTX 1650 (GDDR6, April 2020)GDDR6192 GB/s896
GTX 16606 GB, GDDR5, 192 Bit192 GB/s1 408
GTX 1660 Super6 GB, GDDR6336 GB/snicht detailliert
GTX 1660 Ti6 GB, GDDR6288 GB/s1 536

Die Serie hat weder Tensor Cores noch RT Cores: Wikipedia erläutert, dass sie auf der Turing-Architektur der RTX-20-Serie basiert, diese beiden Arten von Recheneinheiten jedoch weglässt und die dedizierten Integer-Kerne beibehält. Bei ganzzahlig quantisierten Modellen wirkt sich das Fehlen von Tensor Cores nur wenig auf die Generierung aus.

#Turing ohne Tensor Cores: was sich im Vergleich zu Pascal ändert

Die Stärke der Serie liegt in FP16. Für eine GTX 1660 gibt Wikipedia 8.617 GFLOPS bei halber Genauigkeit gegenüber 4.309 bei einfacher Genauigkeit an: FP16 ist doppelt so schnell wie FP32, während es auf einer GTX 10 für den Verbrauchermarkt deutlich langsamer als FP32 ist, wie der Leitfaden zur GTX 1080 Ti zeigt. Das erklärt, warum die 1660 bei gleicher Bandbreite von 192 GB/s eine GTX 1060 bei der Generierung deutlich übertrifft und warum CUDA 13 ihre Unterstützung nicht eingestellt hat.

Das Gegenbeispiel zeigt sich bei der Verarbeitung des Prompts. Der llama.cpp-Benchmark ergibt für die 1660 bei der Promptverarbeitung 148,91 Tokens pro Sekunde, gegenüber 416,85 bei der GTX 1060: Eine neuere Karte kann einen langen Text fast dreimal langsamer lesen. Der Benchmark nennt keine genaue Ursache; das Ergebnis stammt von einem einzigen Mitwirkenden und ist als grober Orientierungswert zu verstehen. Dennoch reicht es aus, die Begeisterung für lange Dokumente zu dämpfen.

llama.cpp-CUDA-Testlauf, Llama 2 7B Q4_0: eine 1660 im Vergleich zu benachbarten Grafikkartenmodellen
KarteBandbreitePrompt (pp512)Generation (tg128)
GTX 1060 6 GB (Pascal)192 GB/s416,85 Tokens/s27,79 Tokens/s
GTX 1660 6 GB (Turing)192 GB/s148,91 Tokens pro Sekunde41,35 Tokens/s
Quadro T1000 4 GB128 GB/s79,44 Tokens pro Sekunde27,82 Tokens pro Sekunde
!
Ein einziger Beitrag, eine einzige Grafikkarte
Jede Zeile der Benchmark-Sammlung stammt von einem Mitwirkenden mit seinem jeweiligen Treiber und System. Der Vergleich einer 1660 mit einer 1060 in dieser Sammlung liefert eine Größenordnung, keine allgemeingültige Regel. Wenn die Prompt-Verarbeitung für Sie wichtig ist, testen Sie Ihre Karte mit llama-bench.

#Die vier Varianten nacheinander

GTX 1650 (4 GB)
Der Teststand enthält keine 1650, aber eine Quadro T1000 mit 4 GB, einem 128-Bit-Speicherbus und derselben Speicherbandbreite: Darauf läuft ein 7B-Modell in Q4_0 mit 27,82 Tokens/s bei minimalem Kontext. Damit ist die Grenze erreicht: Bei 4 GB ist ein Modell mit 2 bis 3 Milliarden Parametern die bessere Wahl.
GTX 1660 (6 GB GDDR5)
Die Karte im Testsystem: 41,35 Tokens/s bei der Generierung. Die langsamste der Karten mit 6 GB, aber ausreichend für Chats in Q4.
GTX 1660 Ti (6 GB GDDR6)
288 GB/s: 50 % mehr Bandbreite als die 1660, daher ist eine Steigerung des Durchsatzes in ähnlicher Größenordnung zu erwarten – durch Messungen noch zu bestätigen.
GTX 1660 Super (6 GB GDDR6)
336 GB/s: die beste Karte der Serie für ein LLM, mit 75 % mehr Bandbreite als die 1660.

Diese Extrapolationen beruhen ausschließlich auf der Bandbreite. Legt man dieselbe Ausnutzung des theoretischen Höchstwerts wie bei der 1660 zugrunde (82 %), würde eine 1660 Ti mit demselben 7B-Modell in Q4_0 etwa 62 Tokens/s erzeugen und eine 1660 Super etwa 72. Das sind Hochrechnungen, die durch eine Messung auf Ihrer Karte bestätigt werden müssen, keinesfalls Messergebnisse.

Vorsicht beim Kauf: Es gibt zwei Varianten der GTX 1650. Die ursprüngliche Version von 2019 verwendet GDDR5 mit einem 128-Bit-Speicherbus und erreicht damit 128 GB/s; eine Revision vom April 2020 setzt auf GDDR6 mit 12 Gbit/s und 192 GB/s. Für ein LLM bedeutet das bei gleichem Modell einen potenziell um 50 % höheren Durchsatz. Prüfen Sie vor dem Kauf einer gebrauchten 1650, ob im Angebot GDDR5 oder GDDR6 angegeben ist, oder sehen Sie sich die Angaben in GPU-Z an.

#Der Kontext bei 4 und 6 GB: der echte Grenzwert

Ollama startet mit einem Kontextfenster von 4.096 Tokens, das über OLLAMA_CONTEXT_LENGTH angepasst werden kann. Der KV-Cache wächst mit jedem Token der Unterhaltung: Eine Verdopplung des Kontextfensters verdoppelt den Cache. Bei 6 GB ist mit einem Granite 4.2 8B in Q4 die Reserve von etwa 1,4 GB schnell aufgebraucht; bei 4 GB lässt ein 3B-Modell 2 GB frei – eine komfortablere Reserve als bei einem 8B-Modell auf 6 GB.

Die praktische Regel: Statt einer aggressiveren Quantisierung reduzieren Sie die Modellgröße oder den Kontext. Ein 3B-Modell mit langem Kontext liefert auf diesen Karten bessere Ergebnisse als ein 8B-Modell, das auf den Prozessor ausweicht. Prüfen Sie immer mit ollama ps, ob das Modell zu 100 % auf der GPU bleibt: Ein Ausweichen auf den Prozessor senkt die Durchsatzrate, da der Arbeitsspeicher deutlich langsamer ist als der Speicher der Karte.

Welche Anwendung für welche Karte?
NutzungGTX 1650 (4 GB)GTX 1660 / Super / Ti (6 GB)
Kurze Chats, Übersetzung, UmformulierungModell mit 2 bis 3 Milliarden Parametern8B in Q4, kurzer Kontext
Codevervollständigung im EditorModell mit 2 bis 3 Milliarden Parametern, begrenzte QualitätEin Modell mit 7–8 Milliarden Parametern ist möglich
Lange Dokumente zusammenfassenNicht empfohlenLangsam: Prompt-Verarbeitung mit 148,91 Tokens/s auf der 1660
Suche in eigenen Dokumenten (RAG)3B-Modell, kurze AuszügeModell mit 3–8B, kurze Auszüge

#Was in den Speicher passt: 4 GB gegenüber 6 GB

Die Richtwerte der Website setzen ein 3B-Modell in Q4 bei etwa 2 GB und ein 7–8B-Modell bei etwa 5 GB an; der KV-Cache kommt zusätzlich hinzu. Bei 6 GB bleiben mit einem Granite 4.2 8B in Q4 etwa 1,4 GB übrig: ausreichend für einen Kontext von einigen Tausend Tokens, aber nicht mehr. Bei 4 GB ist ein 3B-Modell das vernünftige Maximum.

Was in 4 GB und in 6 GB passt (Modellgewichte in Q4, QuelLLM-Katalog)
Modell (Q4)ModellgrößeBei 4 GBBei 6 GB
Gemma 4 2B1,2 GBGut geeignetGut geeignet
Granite 4.1 3B2 GBGut geeignetGut geeignet
Phi-4 Mini 3,8B3 GBKnappGut geeignet
Granite 4.2 8B4,6 GBPasst nicht1,4 GB Spielraum
Qwen3.5 9B6 GBPasst nichtPasst mit Kontext nicht mehr in den Speicher

Beschränken Sie sich auf der 1650 auf Modelle mit 2 bis 4 Milliarden Parametern; dieser Größenbereich eignet sich auch für Entwürfe, Übersetzungen oder Klassifizierung. Auf den 1660-Karten liegt die Grenze bei einem 8B-Modell in Q4: Es bleibt für Chats nutzbar, lässt aber wenig Platz für einen langen Kontext.

#Software-Unterstützung: ein klarer Vorteil gegenüber den GTX 10

Ollama erfordert für neuere Karten einen NVIDIA-Treiber ab Version 550, für Karten mit Compute Capability 5.0 bis 6.2 hingegen Version 570 (einschließlich Pascal). Die offizielle Liste von Ollama führt die GTX 1650 Ti sowie die RTX-20-Serie mit Compute Capability 7.5 auf. Die übrigen GTX-16-Karten nutzen dieselbe Turing-Architektur, werden aber nicht einzeln in der Liste genannt: bei der Installation überprüfen.

Bei CUDA geht aus den Versionshinweisen zu Version 13 hervor, dass die eingestellte Unterstützung Architekturen vor Turing betrifft (Maxwell, Volta und Pascal): Turing und damit die GTX-16-Serie werden weiterhin unterstützt. Beim Gebrauchtkauf ist das das wichtigste Argument für eine GTX 16 statt einer GTX 10 zu einem ähnlichen Preis.

Softwareunterstützung im Vergleich
PunktGTX 16 (Turing)GTX 10 (Pascal)
Von Ollama benötigter Treiber550 oder neuer570 oder neuer
CUDA 13UnterstütztEntfernt
Flash Attention in llama.cppVerfügbarVerfügbar

#Installieren und einstellen

  1. 01
    Treiber prüfen
    Führen Sie nvidia-smi aus: Die Version muss über 550 liegen.
  2. 02
    Ollama installieren
    Folgen Sie der Installationsanleitung für Ihr Betriebssystem und laden Sie anschließend ein Modell herunter, das zu Ihrem verfügbaren Speicher passt.
  3. 03
    Platzierung prüfen
    Führen Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen. Wird ein Teil auf der CPU ausgeführt, deutet das auf eine Auslagerung aus dem GPU-Speicher hin.
  4. 04
    Kontext begrenzen
    Ollama startet mit 4.096 Tokens. Bei 4 oder 6 GB erhöhen Sie diesen Wert nur, wenn Sie geprüft haben, dass noch Speicherplatz frei ist.

Flash Attention ist nicht auf Karten mit Tensor Cores beschränkt: llama.cpp führt es sowohl auf der GTX 1660 als auch auf einer Pascal-Karte aus. Der Benchmark ergibt mit Flash Attention 154,45 Tokens/s bei der Prompt-Verarbeitung und 41,43 bei der Generierung, gegenüber 148,91 und 41,35 ohne. Der Gewinn ist gering, aber der Speicherbedarf für den Kontext sinkt, was bei 6 GB nützlich ist. Ollama aktiviert Flash Attention automatisch, wenn die Karte es unterstützt.

#Fazit: Welche GTX 16 wählen und wann auf etwas anderes umsteigen?

Entscheidung je nach Ihrer Situation
Ihre SituationEmpfehlung
Sie besitzen eine 1660 Super oder 1660 TiDas Beste der Serie: 8B in Q4, flüssiger Chat
Sie haben eine 1660Ausreichend für Chats; langsame Verarbeitung der Prompts
Sie haben eine 1650 (4 GB)Nur Modelle mit 2 bis 4 Milliarden Parametern
Sie möchten lange Dokumente lesenEine Grafikkarte der Ampere-Generation oder einer neueren Generation liest den Prompt viel schneller
Sie möchten ein Modell mit 12 Milliarden Parametern oder mehrWechsel der Leistungsklasse: Ziel 12 GB oder mehr

Ein letzter Punkt zur Einordnung: Diese Karten sind nicht für anspruchsvolle Arbeitslasten ausgelegt, aber ihre thermische Auslegungsleistung bleibt niedrig (120 W für die GTX 1660 laut Wikipedia). Für einen lokalen Assistenten, der einige Fragen pro Tag beantwortet, ist das ein echter Vorteil gegenüber einer Karte mit 250 W.

Bei vergleichbarem Budget für einen Gebrauchtkauf ist die 1660 Super eine bessere Wahl als eine GTX 1060 oder 1070: gleiche Speicherkapazität, schnellerer Speicher, längere Softwareunterstützung. Für einen Neukauf oder die regelmäßige Nutzung bieten eine RTX 3050 oder eine RTX 2060 zusätzlich Tensor Cores und je nach Version mehr Speicher. Die Preise ändern sich jede Woche: Sehen Sie auf der Preisseite der Website nach.

FAQ
Kann ein LLM auf einer GTX 1660 laufen?+
Ja. Der öffentliche Benchmark von llama.cpp misst bei einem 7B-Modell in Q4_0 auf einer GTX 1660 mit 6 GB eine Generierungsgeschwindigkeit von 41,35 Tokens/s, was für den Chat ausreicht. Das Einlesen des Prompts ist langsamer (148,91 Tokens/s), daher entstehen bei langen Dokumenten Wartezeiten. Ein 8B-Modell in Q4 ist die vernünftige Grenze.
Welche GTX 16 sollte man für ein LLM wählen?+
Die GTX 1660 Super: 6 GB und 336 GB/s Bandbreite, die beste der Serie für die Generierung. Die 1660 Ti (288 GB/s) folgt, dann die 1660 (192 GB/s). Wählen Sie die 1650 nur, wenn Sie Modelle mit 2 bis 3 Milliarden Parametern nutzen möchten.
Kann die GTX 1650 mit 4 GB ein 7B-Modell ausführen?+
Gerade so. Im Benchmark ist eine Quadro T1000 mit 4 GB vertreten, die ein 7B-Modell in Q4_0 mit 27,82 Tokens/s bei minimalem Kontext ausführt. In der Praxis kommt eine 1650 besser mit Modellen mit 2 bis 3 Milliarden Parametern zurecht, die Platz für den Kontext lassen.
Unterstützen GTX-16-Grafikkarten Flash Attention?+
Ja. Der llama.cpp-Benchmark misst auf einer GTX 1660 mit Flash Attention 154,45 Tokens/s bei der Prompt-Verarbeitung und 41,43 Tokens/s bei der Generierung, gegenüber 148,91 und 41,35 ohne Flash Attention. Der Geschwindigkeitsgewinn ist gering, aber Flash Attention reduziert den Speicherbedarf des Kontexts. Auch ohne Tensor Cores funktioniert Flash Attention also.
Ist eine GTX 1660 Super für KI besser als eine GTX 1060?+
Ja. Bei gleicher Speicherkapazität von 6 GB bietet die 1660 Super 336 GB/s gegenüber 192 GB/s, und Turing nutzt seinen Speicher besser: Eine 1660 erreicht im Test 41,35 Tokens/s gegenüber 27,79 bei einer 1060. Turing wird außerdem weiterhin von CUDA 13 unterstützt, im Gegensatz zu Pascal.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.