Welcher LLM auf RTX 2080 / 2080 Super (8 GB)? ?
Eine RTX 2080 oder 2080 Super (8 GB GDDR6) führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 problemlos aus, etwa Granite 4.2 8B (4,6 GB) oder Qwen 3.5 9B (6 GB). Für diese beiden Karten gibt es keine öffentlich verfügbaren Messungen, doch ihr 256-Bit-Bus bringt sie auf das Niveau der 2070 Super, mit etwa 88 Tokens/s bei einem 7B-Modell. Die Grenze bleibt die Speicherkapazität von 8 GB.
Die RTX 2080 (September 2018) und die RTX 2080 Super (Juli 2019) waren High-End-Karten; 2026 ist ihr Vorteil für lokale KI begrenzt, da sie nur 8 GB VRAM haben. Dieser Leitfaden trennt dokumentierte Angaben von Schätzungen, vergleicht diese Karten mit Alternativen mit 12 GB und erklärt, wie Sie prüfen können, ob ein Modell tatsächlich in den Speicher passt.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RTX 2080 und 2080 Super: welche Modelle darauf laufen
Auf einer RTX 2080 oder einer 2080 Super passt ein Modell mit 7 bis 9 Milliarden Parametern in Q4 vollständig in den Grafikspeicher und läuft schnell. Laut dem QuelLLM-Katalog benötigt Granite 4.2 8B in Q4 4,6 GB und Qwen 3.5 9B 6 GB. Damit bleibt Spielraum für einen Kontext von einigen Tausend Tokens. Gemma 4 12B (7 GB in Q4) stößt an die Grenze von 8 GB und überschreitet sie, sobald das Gespräch länger wird. Keine dieser beiden Karten ist in der öffentlichen Leistungstabelle von llama.cpp aufgeführt; ihre Leistung lässt sich dennoch einordnen, da sie denselben 256-Bit-Bus wie die 2070 Super haben, für die mit einem Modell mit 7 Milliarden Parametern in Q4_0 88 Tokens pro Sekunde gemessen wurden. Die 2080 Super mit ihrem schnelleren Speicher dürfte etwas besser abschneiden. Zusammengefasst: schnell, aber durch ihre 8 GB begrenzt.
- RTX 2080
- September 2018, 2.944 CUDA-Kerne, 8 GB GDDR6, 256-Bit-Bus, entsprechend 448 GB/s bei 14 Gbit/s.
- RTX 2080 Super
- Juli 2019, 3.072 CUDA-Kerne, 8 GB GDDR6 mit 15,5 Gbit/s, also 496 GB/s, etwa 11 % mehr als die 2080.
- Für ein LLM
- Die Generierung hängt vor allem von der Bandbreite ab: Die Super hat einen kleinen Vorteil, die Kapazität ändert sich nicht.
#Kompatible Modelle: Was in 8 GB passt
| Modell | Gewichte in Q4 | Was man bei 8 GB erwarten kann |
|---|---|---|
| Granite 4.2 8B | 4,6 GB | Komfortabel nutzbar, Kontextfenster mit mehreren Tausend Tokens |
| Qwen 3.5 9B | 6 GB | Passt in Q4 in den Speicher; moderater Kontext, passen Sie den K/V-Cache bei Bedarf an |
| Gemma 4 12B | 7 GB | Zu knapp: Für Cache und System reicht der Speicher nicht mehr |
| Qwen 3.5 9B in Q8 | 10 GB | Passt nicht in den Speicher: benötigt mehr als 8 GB |
Die Rechnung ist bei allen Modellen dieselbe: Modellgewichte plus Kontext-Cache plus etwa ein Gigabyte Reserve für den Treiber und den Bildschirm. Wenn Ihr Bildschirm an diese Karte angeschlossen ist, ist ihm bereits ein Teil des Speichers vorbehalten. Bei 8 GB ist es eine sichere Faustregel, höchstens 6 GB für die Modellgewichte einzuplanen. Für einen längeren Kontext bringt die Quantisierung des K/V-Caches am meisten.
#Prüfen, ob ein Modell wirklich in den Speicher der Karte passt
Viele Geschwindigkeitseinbußen entstehen, wenn ein Modell nicht vollständig in den VRAM passt: Ollama verlagert dann einen Teil auf den Prozessor, und der Durchsatz sinkt ohne Fehlermeldung. Die Dokumentation von Ollama erklärt, wie sich das erkennen lässt: Der Befehl ollama ps zeigt in der Spalte Processor an, in welchen Speicher das Modell geladen wurde. Die Angabe 100% GPU bedeutet, dass das Modell vollständig auf der Grafikkarte liegt, während ein Verhältnis wie 48%/52% CPU/GPU einen auf RAM und VRAM verteilten Ladevorgang anzeigt.
- 01Modell ladenStarten Sie das Modell mit ollama run, gefolgt vom Namen des Modells, und senden Sie anschließend einen ersten Prompt.
- 02Die Verteilung ablesenIn einem anderen Terminal geben Sie ollama ps ein. Notieren Sie die Spalte Processor und die angegebene Größe.
- 03Gegebenenfalls korrigierenWenn das Modell nicht zu 100 % auf der GPU liegt, verringern Sie den Kontext, wählen Sie eine leichtere Quantisierung oder wechseln Sie zu einem kleineren Modell. Die Quantisierung des K/V-Caches hilft ebenfalls; die Dokumentation erklärt, dass dies Flash Attention erfordert.
- KV-Cache quantisieren: VRAM sparen (langer Kontext)
- Ollama-Fehlerbehebung: GPU nicht erkannt, langsamer Betrieb, Speicherfehler
#Geschwindigkeit: Was gemessen wird und was geschätzt wird
Die gemeinschaftlich erstellte Tabelle von llama.cpp (Llama 2 7B in Q4_0, Dateigröße 3,56 GiB) enthält die 2070 Super, die 2080 Ti, die 3060 mit 12 GB und die 4060 Ti mit 8 GB, aber weder die 2080 noch die 2080 Super. Die Tabelle weist darauf hin, dass die Ergebnisse je nach Treiber, System und Grafikkarte variieren, selbst bei identischem Chip. Im Folgenden sehen Sie zunächst die Messwerte und anschließend, welche Schlussfolgerungen sich vernünftigerweise daraus ziehen lassen.
| Karte | Speicher | Bus | Generierung | Status |
|---|---|---|---|---|
| RTX 2070 Super | 8 GB | 256 Bit | 88,1 | Veröffentlichte Messung |
| RTX 2080 / 2080 Super | 8 GB | 256 Bit | ungefähr 88 bis 97 | Schätzung: gleicher Bus, schnellerer Speicher bei der Super |
| RTX 2080 Ti | 11 GB | 352 Bit | 107,5 | Veröffentlichte Messung |
| RTX 3060 12 GB | 12 GB | 192 Bit | 75,6 | Veröffentlichte Messung |
| RTX 4060 Ti 8 GB | 8 GB | 128 Bit | 63,9 | Veröffentlichte Messung |
Die Schätzung für die Zeile 2080 folgt einer einfachen Regel: Bei 448 GB/s dürfte die 2080 einen Durchsatz erzielen, der dem der 2070 Super sehr nahekommt, und bei 496 GB/s kann die 2080 Super bis zu 10 % mehr erreichen, also eine Größenordnung von 95 Tokens pro Sekunde. Das ist eine Projektion, keine Messung: Zitieren Sie sie nicht als Ergebnis.
Die Tabelle liefert eine nützliche Erkenntnis für alle, die überlegen, ihre Grafikkarte zu ersetzen: Die RTX 4060 Ti mit 8 GB generiert trotz ihres jüngeren Alters langsamer Text (63,9 Tokens pro Sekunde) als die 2070 Super, weil ihr 128-Bit-Bus die Bandbreite begrenzt. Bei der Textgenerierung bedeutet eine neuere GPU-Generation nicht automatisch eine höhere Geschwindigkeit. Sie bringt vor allem Energieeffizienz und neuere Funktionen, aber keine größere Speicherkapazität.
#2080 Super oder RTX 3060 12 GB: Die Speicherkapazität entscheidet
Die 3060 mit 12 GB generiert langsamer als die 2070 Super (75,6 gegenüber 88,1 Tokens pro Sekunde im Test), bietet aber 4 GB mehr. Darauf kommt es bei lokaler KI an: In 12 GB passt Gemma 4 12B (7 GB in Q4) mit Spielraum für den Kontext, was bei Karten mit 8 GB nicht möglich ist. Eine 2080 Super kann diesen Nachteil nicht durch ihre Geschwindigkeit ausgleichen, denn auch die höhere Geschwindigkeit von rund 95 Tokens pro Sekunde ändert nichts daran, dass ein 12B-Modell nicht in den Speicher passt.
| Kriterium | RTX 2080 Super | RTX 3060 12 GB |
|---|---|---|
| Speicher | 8 GB | 12 GB |
| Generierung (7B Q4_0) | Geschätzt etwa 95 Tokens/s | 75,6 Tokens/s (Messwert) |
| Modelle mit 12 Milliarden Parametern | Nein (7 GB Modellgewichte, kein Spielraum) | Ja, mit Kontext |
| Modelle mit 7 bis 9 Milliarden Parametern | Ja | Ja |
Das Fazit hängt daher von Ihrem Ziel ab. Für einen Assistenten mit 8 oder 9 Milliarden Parametern reicht Ihre 2080 aus, und der Wechsel zu einer 3060 mit 12 GB bringt keinen Geschwindigkeitsvorteil. Wenn Sie ein 12B-Modell oder lange Kontexte anstreben, ist der Wechsel gerechtfertigt. Die Gebrauchtpreise ändern sich jede Woche: Konsultieren Sie die Preisübersicht, statt sich auf eine feste Zahl zu verlassen.
- Preise für Grafikkarten für lokale KI (wöchentliche Preisbeobachtung)
- Welches LLM läuft auf der RTX 3060 mit 12 GB?
- Welches LLM für RTX 2080 Ti (11 GB)?
#Langer Kontext mit 8 GB: Der K/V-Cache entscheidet
Auf einer Karte mit 8 GB ist nicht das Modell das Problem, sondern der Kontext-Cache. Jeder Token der Konversation fügt Daten im Speicher hinzu, und ein 8B-Modell in Q4, das ohne Kontext noch in den Speicher passte, kann dessen Kapazität überschreiten, wenn Sie ein langes Dokument einfügen. In Ollama gibt es zwei Stellschrauben. Flash Attention, das die Software automatisch aktiviert, wenn die Karte es unterstützt, reduziert den Speicherbedarf bei wachsendem Kontext. Sobald Flash Attention aktiviert ist, ermöglicht es die Quantisierung des K/V-Caches. Dessen Format q8_0 benötigt laut Dokumentation etwa halb so viel Speicher wie das Standardformat. Das Format q4_0 spart noch mehr Speicher, beeinträchtigt die Genauigkeit bei großen Kontexten jedoch deutlicher.
Diese Einstellung ist global: Sie gilt für alle Modelle, die von der Instanz bedient werden, was auf einer dedizierten Maschine praktisch ist, aber beachtet werden sollte, wenn Sie sie häufig ändern. Die gute Praxis besteht darin, vor der Einstellung zu messen: Laden Sie Ihr Modell, füllen Sie einen repräsentativen Kontext für Ihre Nutzung und überprüfen Sie mit ollama ps, ob das Modell 100 % auf dem GPU bleibt. Wenn dies der Fall ist, haben Sie ausreichend Spielraum; sonst reduzieren Sie den Cache oder verringern Sie den Kontext.
#Wenn 8 GB nicht mehr ausreichen: die nächsten Stufen
| Grafikkartenspeicher | Modelle, die sich damit betreiben lassen | Gewichte in Q4 |
|---|---|---|
| 8 GB (Ihre Karte) | Modelle mit 7 bis 9 Milliarden Parametern | 4,6 bis 6 GB |
| 12 GB | Gemma 4 12B mit Kontext | 7 GB |
| 16 GB | gpt-oss 20B (13 GB) oder Qwen 3.5 27B (16 GB, sehr knapp) | 13 bis 16 GB |
Diese Tabelle lässt sich einfach lesen: Jede höhere Speicherkapazität erschließt eine neue Modellkategorie, während die reine Geschwindigkeit oberhalb von 30 oder 40 Tokens pro Sekunde am Nutzungserlebnis kaum noch etwas ändert. Wenn Sie mit einer Investition zögern, fragen Sie sich zuerst, welches Modell Sie ausführen möchten, und wählen Sie dann die Grafikkarte mit der entsprechenden Speicherkapazität. Ein Modell mit 27 Milliarden Parametern ist bei 16 GB bereits an der Grenze; wenn das Ihr Ziel ist, ziehen Sie eher 24 GB in Betracht.
#Treiber und Support im Jahr 2026
Die RTX 2080 und die 2080 Ti gehören zu den von Ollama aufgeführten Karten mit Compute Capability 7.5. Ollama erfordert einen Treiber der Version 550 oder neuer. Das gilt für die aktuellen Ollama-Versionen; wenn die Installation fehlschlägt, sollten Sie zuerst die Treiberversion mit nvidia-smi prüfen. Es gibt daher keinen Grund, bei der Installation von Ollama oder llama.cpp auf diesen Karten softwarebedingte Hindernisse zu befürchten. Zu beachten ist lediglich die Treiberversion: Aktualisieren Sie den Treiber, bevor Sie anderswo nach der Fehlerursache suchen.
#Fazit 2026
- Behalten Sie sie, wenn
- Sie ist bereits in Ihrem PC eingebaut und Sie möchten Modelle mit 7 bis 9 Milliarden Parametern in Q4 nutzen. Die Geschwindigkeit reicht mehr als aus, es entstehen keine Kosten.
- Nicht für KI kaufen
- Außer bei niedrigem Preis und klaren Garantiebedingungen. Bei ähnlichem Preis ist eine 12-GB-Karte wertvoller als ein paar zusätzliche Tokens pro Sekunde.
- Wählen Sie etwas anderes, wenn
- Sie möchten ein 12B-Modell, ein 14B-Modell oder ein größeres Modell betreiben, oder bei einem 8B-Modell einen Kontext von mehr als zehntausend Tokens nutzen. Dafür benötigen Sie 12 bis 16 GB.
#Häufig gestellte Fragen
Kann die RTX 2080 ein Modell mit 8 bis 9 Milliarden Parametern ausführen?+
RTX 2080 Super oder RTX 2080 Ti für ein LLM?+
Kann Gemma 4 12B auf einer RTX 2080 Super laufen?+
Wie kann ich überprüfen, ob mein Modell vollständig auf der GPU läuft?+
Ist eine RTX 2080 bei der Textgenerierung schneller als eine RTX 4060 Ti mit 8 GB?+
Funktioniert Ollama im Jahr 2026 noch auf einer RTX 2080?+
- Quelle: Leistungstabelle von llama.cpp unter CUDA
- Quelle: Von Ollama unterstützte NVIDIA-Grafikkarten
- Quelle: FAQ von Ollama (ollama ps, K/V-Cache)
- Quelle: Spezifikationen der GeForce-Serie 20
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.