Welcher LLM auf GTX 1650 / 1660 / Super / Ti? ?
Eine GTX 1660 (6 GB) kann ein lokales LLM mit 7 bis 8 Milliarden Parametern in Q4 ausführen: Der öffentliche llama.cpp-Benchmark misst 41,35 tokens/s bei der Generierung auf einem 7B Q4_0, aber nur 148,91 tokens/s beim Lesen des Prompts. Die 1660 Super und Ti mit schnellerem Speicher sollten schneller sein. Die GTX 1650, begrenzt auf 4 GB, beschränkt sich auf Modelle mit 2 bis 3 Milliarden Parametern. Alle werden von CUDA 13 unterstützt.
Die 2019 eingeführte GTX-16-Serie basiert auf der Turing-Architektur und hat weder Tensor Cores noch Ray-Tracing-Kerne. Anders als die GTX-10-Serie ist sie vom Ende der Pascal-Unterstützung nicht betroffen. Dieser Leitfaden vergleicht die vier Karten anhand dessen, was für ein LLM zählt: Speicher und Speicherbandbreite. Er stützt sich auf öffentlich zugängliche Messungen und weist auf einen Fallstrick hin: Eine ordentliche Generierung bedeutet nicht, dass lange Prompts schnell eingelesen werden.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#Die GTX 16-Serie für ein LLM: Was man sich merken sollte
Für ein LLM lässt sich die GTX-16-Serie anhand des Speichers einordnen: 4 GB für die GTX 1650, 6 GB für die GTX 1660, 1660 Super und 1660 Ti. Die Generierungsgeschwindigkeit richtet sich nach der Bandbreite, die vom Einfachen bis zum Dreifachen reicht: 128 GB/s für die 1650 mit GDDR5, 192 GB/s für die 1660, 288 GB/s für die 1660 Ti und 336 GB/s für die 1660 Super. Bei gleicher Kapazität von 6 GB ist die 1660 Super daher die schnellste der Serie und die ursprüngliche 1660 die langsamste.
| Karte | Speicher | Bandbreite | CUDA-Kerne |
|---|---|---|---|
| GTX 1650 (GDDR5) | 4 GB, GDDR5, 128 Bit | 128 GB/s | 896 |
| GTX 1650 (GDDR6, April 2020) | GDDR6 | 192 GB/s | 896 |
| GTX 1660 | 6 GB, GDDR5, 192 Bit | 192 GB/s | 1 408 |
| GTX 1660 Super | 6 GB, GDDR6 | 336 GB/s | nicht detailliert |
| GTX 1660 Ti | 6 GB, GDDR6 | 288 GB/s | 1 536 |
Die Serie hat weder Tensor Cores noch RT Cores: Wikipedia erläutert, dass sie auf der Turing-Architektur der RTX-20-Serie basiert, diese beiden Arten von Recheneinheiten jedoch weglässt und die dedizierten Integer-Kerne beibehält. Bei ganzzahlig quantisierten Modellen wirkt sich das Fehlen von Tensor Cores nur wenig auf die Generierung aus.
#Turing ohne Tensor Cores: was sich im Vergleich zu Pascal ändert
Die Stärke der Serie liegt in FP16. Für eine GTX 1660 gibt Wikipedia 8.617 GFLOPS bei halber Genauigkeit gegenüber 4.309 bei einfacher Genauigkeit an: FP16 ist doppelt so schnell wie FP32, während es auf einer GTX 10 für den Verbrauchermarkt deutlich langsamer als FP32 ist, wie der Leitfaden zur GTX 1080 Ti zeigt. Das erklärt, warum die 1660 bei gleicher Bandbreite von 192 GB/s eine GTX 1060 bei der Generierung deutlich übertrifft und warum CUDA 13 ihre Unterstützung nicht eingestellt hat.
Das Gegenbeispiel zeigt sich bei der Verarbeitung des Prompts. Der llama.cpp-Benchmark ergibt für die 1660 bei der Promptverarbeitung 148,91 Tokens pro Sekunde, gegenüber 416,85 bei der GTX 1060: Eine neuere Karte kann einen langen Text fast dreimal langsamer lesen. Der Benchmark nennt keine genaue Ursache; das Ergebnis stammt von einem einzigen Mitwirkenden und ist als grober Orientierungswert zu verstehen. Dennoch reicht es aus, die Begeisterung für lange Dokumente zu dämpfen.
| Karte | Bandbreite | Prompt (pp512) | Generation (tg128) |
|---|---|---|---|
| GTX 1060 6 GB (Pascal) | 192 GB/s | 416,85 Tokens/s | 27,79 Tokens/s |
| GTX 1660 6 GB (Turing) | 192 GB/s | 148,91 Tokens pro Sekunde | 41,35 Tokens/s |
| Quadro T1000 4 GB | 128 GB/s | 79,44 Tokens pro Sekunde | 27,82 Tokens pro Sekunde |
#Die vier Varianten nacheinander
- GTX 1650 (4 GB)
- Der Teststand enthält keine 1650, aber eine Quadro T1000 mit 4 GB, einem 128-Bit-Speicherbus und derselben Speicherbandbreite: Darauf läuft ein 7B-Modell in Q4_0 mit 27,82 Tokens/s bei minimalem Kontext. Damit ist die Grenze erreicht: Bei 4 GB ist ein Modell mit 2 bis 3 Milliarden Parametern die bessere Wahl.
- GTX 1660 (6 GB GDDR5)
- Die Karte im Testsystem: 41,35 Tokens/s bei der Generierung. Die langsamste der Karten mit 6 GB, aber ausreichend für Chats in Q4.
- GTX 1660 Ti (6 GB GDDR6)
- 288 GB/s: 50 % mehr Bandbreite als die 1660, daher ist eine Steigerung des Durchsatzes in ähnlicher Größenordnung zu erwarten – durch Messungen noch zu bestätigen.
- GTX 1660 Super (6 GB GDDR6)
- 336 GB/s: die beste Karte der Serie für ein LLM, mit 75 % mehr Bandbreite als die 1660.
Diese Extrapolationen beruhen ausschließlich auf der Bandbreite. Legt man dieselbe Ausnutzung des theoretischen Höchstwerts wie bei der 1660 zugrunde (82 %), würde eine 1660 Ti mit demselben 7B-Modell in Q4_0 etwa 62 Tokens/s erzeugen und eine 1660 Super etwa 72. Das sind Hochrechnungen, die durch eine Messung auf Ihrer Karte bestätigt werden müssen, keinesfalls Messergebnisse.
Vorsicht beim Kauf: Es gibt zwei Varianten der GTX 1650. Die ursprüngliche Version von 2019 verwendet GDDR5 mit einem 128-Bit-Speicherbus und erreicht damit 128 GB/s; eine Revision vom April 2020 setzt auf GDDR6 mit 12 Gbit/s und 192 GB/s. Für ein LLM bedeutet das bei gleichem Modell einen potenziell um 50 % höheren Durchsatz. Prüfen Sie vor dem Kauf einer gebrauchten 1650, ob im Angebot GDDR5 oder GDDR6 angegeben ist, oder sehen Sie sich die Angaben in GPU-Z an.
#Der Kontext bei 4 und 6 GB: der echte Grenzwert
Ollama startet mit einem Kontextfenster von 4.096 Tokens, das über OLLAMA_CONTEXT_LENGTH angepasst werden kann. Der KV-Cache wächst mit jedem Token der Unterhaltung: Eine Verdopplung des Kontextfensters verdoppelt den Cache. Bei 6 GB ist mit einem Granite 4.2 8B in Q4 die Reserve von etwa 1,4 GB schnell aufgebraucht; bei 4 GB lässt ein 3B-Modell 2 GB frei – eine komfortablere Reserve als bei einem 8B-Modell auf 6 GB.
Die praktische Regel: Statt einer aggressiveren Quantisierung reduzieren Sie die Modellgröße oder den Kontext. Ein 3B-Modell mit langem Kontext liefert auf diesen Karten bessere Ergebnisse als ein 8B-Modell, das auf den Prozessor ausweicht. Prüfen Sie immer mit ollama ps, ob das Modell zu 100 % auf der GPU bleibt: Ein Ausweichen auf den Prozessor senkt die Durchsatzrate, da der Arbeitsspeicher deutlich langsamer ist als der Speicher der Karte.
| Nutzung | GTX 1650 (4 GB) | GTX 1660 / Super / Ti (6 GB) |
|---|---|---|
| Kurze Chats, Übersetzung, Umformulierung | Modell mit 2 bis 3 Milliarden Parametern | 8B in Q4, kurzer Kontext |
| Codevervollständigung im Editor | Modell mit 2 bis 3 Milliarden Parametern, begrenzte Qualität | Ein Modell mit 7–8 Milliarden Parametern ist möglich |
| Lange Dokumente zusammenfassen | Nicht empfohlen | Langsam: Prompt-Verarbeitung mit 148,91 Tokens/s auf der 1660 |
| Suche in eigenen Dokumenten (RAG) | 3B-Modell, kurze Auszüge | Modell mit 3–8B, kurze Auszüge |
#Was in den Speicher passt: 4 GB gegenüber 6 GB
Die Richtwerte der Website setzen ein 3B-Modell in Q4 bei etwa 2 GB und ein 7–8B-Modell bei etwa 5 GB an; der KV-Cache kommt zusätzlich hinzu. Bei 6 GB bleiben mit einem Granite 4.2 8B in Q4 etwa 1,4 GB übrig: ausreichend für einen Kontext von einigen Tausend Tokens, aber nicht mehr. Bei 4 GB ist ein 3B-Modell das vernünftige Maximum.
| Modell (Q4) | Modellgröße | Bei 4 GB | Bei 6 GB |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Gut geeignet | Gut geeignet |
| Granite 4.1 3B | 2 GB | Gut geeignet | Gut geeignet |
| Phi-4 Mini 3,8B | 3 GB | Knapp | Gut geeignet |
| Granite 4.2 8B | 4,6 GB | Passt nicht | 1,4 GB Spielraum |
| Qwen3.5 9B | 6 GB | Passt nicht | Passt mit Kontext nicht mehr in den Speicher |
Beschränken Sie sich auf der 1650 auf Modelle mit 2 bis 4 Milliarden Parametern; dieser Größenbereich eignet sich auch für Entwürfe, Übersetzungen oder Klassifizierung. Auf den 1660-Karten liegt die Grenze bei einem 8B-Modell in Q4: Es bleibt für Chats nutzbar, lässt aber wenig Platz für einen langen Kontext.
#Software-Unterstützung: ein klarer Vorteil gegenüber den GTX 10
Ollama erfordert für neuere Karten einen NVIDIA-Treiber ab Version 550, für Karten mit Compute Capability 5.0 bis 6.2 hingegen Version 570 (einschließlich Pascal). Die offizielle Liste von Ollama führt die GTX 1650 Ti sowie die RTX-20-Serie mit Compute Capability 7.5 auf. Die übrigen GTX-16-Karten nutzen dieselbe Turing-Architektur, werden aber nicht einzeln in der Liste genannt: bei der Installation überprüfen.
Bei CUDA geht aus den Versionshinweisen zu Version 13 hervor, dass die eingestellte Unterstützung Architekturen vor Turing betrifft (Maxwell, Volta und Pascal): Turing und damit die GTX-16-Serie werden weiterhin unterstützt. Beim Gebrauchtkauf ist das das wichtigste Argument für eine GTX 16 statt einer GTX 10 zu einem ähnlichen Preis.
| Punkt | GTX 16 (Turing) | GTX 10 (Pascal) |
|---|---|---|
| Von Ollama benötigter Treiber | 550 oder neuer | 570 oder neuer |
| CUDA 13 | Unterstützt | Entfernt |
| Flash Attention in llama.cpp | Verfügbar | Verfügbar |
#Installieren und einstellen
- 01Treiber prüfenFühren Sie nvidia-smi aus: Die Version muss über 550 liegen.
- 02Ollama installierenFolgen Sie der Installationsanleitung für Ihr Betriebssystem und laden Sie anschließend ein Modell herunter, das zu Ihrem verfügbaren Speicher passt.
- 03Platzierung prüfenFühren Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen. Wird ein Teil auf der CPU ausgeführt, deutet das auf eine Auslagerung aus dem GPU-Speicher hin.
- 04Kontext begrenzenOllama startet mit 4.096 Tokens. Bei 4 oder 6 GB erhöhen Sie diesen Wert nur, wenn Sie geprüft haben, dass noch Speicherplatz frei ist.
Flash Attention ist nicht auf Karten mit Tensor Cores beschränkt: llama.cpp führt es sowohl auf der GTX 1660 als auch auf einer Pascal-Karte aus. Der Benchmark ergibt mit Flash Attention 154,45 Tokens/s bei der Prompt-Verarbeitung und 41,43 bei der Generierung, gegenüber 148,91 und 41,35 ohne. Der Gewinn ist gering, aber der Speicherbedarf für den Kontext sinkt, was bei 6 GB nützlich ist. Ollama aktiviert Flash Attention automatisch, wenn die Karte es unterstützt.
- Schritt-für-Schritt-Installation von Ollama
- Ollama-Probleme beheben: GPU nicht erkannt, langsame Ausführung
- KV-Cache quantisieren, um VRAM zu sparen
#Fazit: Welche GTX 16 wählen und wann auf etwas anderes umsteigen?
| Ihre Situation | Empfehlung |
|---|---|
| Sie besitzen eine 1660 Super oder 1660 Ti | Das Beste der Serie: 8B in Q4, flüssiger Chat |
| Sie haben eine 1660 | Ausreichend für Chats; langsame Verarbeitung der Prompts |
| Sie haben eine 1650 (4 GB) | Nur Modelle mit 2 bis 4 Milliarden Parametern |
| Sie möchten lange Dokumente lesen | Eine Grafikkarte der Ampere-Generation oder einer neueren Generation liest den Prompt viel schneller |
| Sie möchten ein Modell mit 12 Milliarden Parametern oder mehr | Wechsel der Leistungsklasse: Ziel 12 GB oder mehr |
Ein letzter Punkt zur Einordnung: Diese Karten sind nicht für anspruchsvolle Arbeitslasten ausgelegt, aber ihre thermische Auslegungsleistung bleibt niedrig (120 W für die GTX 1660 laut Wikipedia). Für einen lokalen Assistenten, der einige Fragen pro Tag beantwortet, ist das ein echter Vorteil gegenüber einer Karte mit 250 W.
Bei vergleichbarem Budget für einen Gebrauchtkauf ist die 1660 Super eine bessere Wahl als eine GTX 1060 oder 1070: gleiche Speicherkapazität, schnellerer Speicher, längere Softwareunterstützung. Für einen Neukauf oder die regelmäßige Nutzung bieten eine RTX 3050 oder eine RTX 2060 zusätzlich Tensor Cores und je nach Version mehr Speicher. Die Preise ändern sich jede Woche: Sehen Sie auf der Preisseite der Website nach.
- Welches LLM auf RTX 3050?
- Welcher LLM für die RTX 2060 / 2060 Super?
- Welche Modelle für 6 GB VRAM, unabhängig von der Karte
- GPU-Preise für KI vergleichen
- Quelle: Öffentlicher llama.cpp-Benchmark auf CUDA
- Quelle: Ollama-Dokumentation, unterstützte NVIDIA-Hardware
- Quelle: GeForce 16 Serie, Spezifikationen
- Quelle: Versionshinweise des CUDA Toolkits
Kann ein LLM auf einer GTX 1660 laufen?+
Welche GTX 16 sollte man für ein LLM wählen?+
Kann die GTX 1650 mit 4 GB ein 7B-Modell ausführen?+
Unterstützen GTX-16-Grafikkarten Flash Attention?+
Ist eine GTX 1660 Super für KI besser als eine GTX 1060?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.