Mittelstufe 11 Min.RTX 20

Welcher LLM auf RTX 2080 / 2080 Super (8 GB)? ?

Direkte Antwort

Eine RTX 2080 oder 2080 Super (8 GB GDDR6) führt Modelle mit 7 bis 9 Milliarden Parametern in Q4 problemlos aus, etwa Granite 4.2 8B (4,6 GB) oder Qwen 3.5 9B (6 GB). Für diese beiden Karten gibt es keine öffentlich verfügbaren Messungen, doch ihr 256-Bit-Bus bringt sie auf das Niveau der 2070 Super, mit etwa 88 Tokens/s bei einem 7B-Modell. Die Grenze bleibt die Speicherkapazität von 8 GB.

Die RTX 2080 (September 2018) und die RTX 2080 Super (Juli 2019) waren High-End-Karten; 2026 ist ihr Vorteil für lokale KI begrenzt, da sie nur 8 GB VRAM haben. Dieser Leitfaden trennt dokumentierte Angaben von Schätzungen, vergleicht diese Karten mit Alternativen mit 12 GB und erklärt, wie Sie prüfen können, ob ein Modell tatsächlich in den Speicher passt.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#RTX 2080 und 2080 Super: welche Modelle darauf laufen

Auf einer RTX 2080 oder einer 2080 Super passt ein Modell mit 7 bis 9 Milliarden Parametern in Q4 vollständig in den Grafikspeicher und läuft schnell. Laut dem QuelLLM-Katalog benötigt Granite 4.2 8B in Q4 4,6 GB und Qwen 3.5 9B 6 GB. Damit bleibt Spielraum für einen Kontext von einigen Tausend Tokens. Gemma 4 12B (7 GB in Q4) stößt an die Grenze von 8 GB und überschreitet sie, sobald das Gespräch länger wird. Keine dieser beiden Karten ist in der öffentlichen Leistungstabelle von llama.cpp aufgeführt; ihre Leistung lässt sich dennoch einordnen, da sie denselben 256-Bit-Bus wie die 2070 Super haben, für die mit einem Modell mit 7 Milliarden Parametern in Q4_0 88 Tokens pro Sekunde gemessen wurden. Die 2080 Super mit ihrem schnelleren Speicher dürfte etwas besser abschneiden. Zusammengefasst: schnell, aber durch ihre 8 GB begrenzt.

RTX 2080
September 2018, 2.944 CUDA-Kerne, 8 GB GDDR6, 256-Bit-Bus, entsprechend 448 GB/s bei 14 Gbit/s.
RTX 2080 Super
Juli 2019, 3.072 CUDA-Kerne, 8 GB GDDR6 mit 15,5 Gbit/s, also 496 GB/s, etwa 11 % mehr als die 2080.
Für ein LLM
Die Generierung hängt vor allem von der Bandbreite ab: Die Super hat einen kleinen Vorteil, die Kapazität ändert sich nicht.

#Kompatible Modelle: Was in 8 GB passt

Modelle für RTX 2080 / 2080 Super (Modellgrößen laut QuelLLM-Katalog)
ModellGewichte in Q4Was man bei 8 GB erwarten kann
Granite 4.2 8B4,6 GBKomfortabel nutzbar, Kontextfenster mit mehreren Tausend Tokens
Qwen 3.5 9B6 GBPasst in Q4 in den Speicher; moderater Kontext, passen Sie den K/V-Cache bei Bedarf an
Gemma 4 12B7 GBZu knapp: Für Cache und System reicht der Speicher nicht mehr
Qwen 3.5 9B in Q810 GBPasst nicht in den Speicher: benötigt mehr als 8 GB

Die Rechnung ist bei allen Modellen dieselbe: Modellgewichte plus Kontext-Cache plus etwa ein Gigabyte Reserve für den Treiber und den Bildschirm. Wenn Ihr Bildschirm an diese Karte angeschlossen ist, ist ihm bereits ein Teil des Speichers vorbehalten. Bei 8 GB ist es eine sichere Faustregel, höchstens 6 GB für die Modellgewichte einzuplanen. Für einen längeren Kontext bringt die Quantisierung des K/V-Caches am meisten.

#Prüfen, ob ein Modell wirklich in den Speicher der Karte passt

Viele Geschwindigkeitseinbußen entstehen, wenn ein Modell nicht vollständig in den VRAM passt: Ollama verlagert dann einen Teil auf den Prozessor, und der Durchsatz sinkt ohne Fehlermeldung. Die Dokumentation von Ollama erklärt, wie sich das erkennen lässt: Der Befehl ollama ps zeigt in der Spalte Processor an, in welchen Speicher das Modell geladen wurde. Die Angabe 100% GPU bedeutet, dass das Modell vollständig auf der Grafikkarte liegt, während ein Verhältnis wie 48%/52% CPU/GPU einen auf RAM und VRAM verteilten Ladevorgang anzeigt.

  1. 01
    Modell laden
    Starten Sie das Modell mit ollama run, gefolgt vom Namen des Modells, und senden Sie anschließend einen ersten Prompt.
  2. 02
    Die Verteilung ablesen
    In einem anderen Terminal geben Sie ollama ps ein. Notieren Sie die Spalte Processor und die angegebene Größe.
  3. 03
    Gegebenenfalls korrigieren
    Wenn das Modell nicht zu 100 % auf der GPU liegt, verringern Sie den Kontext, wählen Sie eine leichtere Quantisierung oder wechseln Sie zu einem kleineren Modell. Die Quantisierung des K/V-Caches hilft ebenfalls; die Dokumentation erklärt, dass dies Flash Attention erfordert.
Die Verteilung zwischen GPU und CPU kontrollieren
ollama ps

#Geschwindigkeit: Was gemessen wird und was geschätzt wird

Die gemeinschaftlich erstellte Tabelle von llama.cpp (Llama 2 7B in Q4_0, Dateigröße 3,56 GiB) enthält die 2070 Super, die 2080 Ti, die 3060 mit 12 GB und die 4060 Ti mit 8 GB, aber weder die 2080 noch die 2080 Super. Die Tabelle weist darauf hin, dass die Ergebnisse je nach Treiber, System und Grafikkarte variieren, selbst bei identischem Chip. Im Folgenden sehen Sie zunächst die Messwerte und anschließend, welche Schlussfolgerungen sich vernünftigerweise daraus ziehen lassen.

Test von llama.cpp, Llama 2 7B Q4_0, Generierung (Tokens/s)
KarteSpeicherBusGenerierungStatus
RTX 2070 Super8 GB256 Bit88,1Veröffentlichte Messung
RTX 2080 / 2080 Super8 GB256 Bitungefähr 88 bis 97Schätzung: gleicher Bus, schnellerer Speicher bei der Super
RTX 2080 Ti11 GB352 Bit107,5Veröffentlichte Messung
RTX 3060 12 GB12 GB192 Bit75,6Veröffentlichte Messung
RTX 4060 Ti 8 GB8 GB128 Bit63,9Veröffentlichte Messung

Die Schätzung für die Zeile 2080 folgt einer einfachen Regel: Bei 448 GB/s dürfte die 2080 einen Durchsatz erzielen, der dem der 2070 Super sehr nahekommt, und bei 496 GB/s kann die 2080 Super bis zu 10 % mehr erreichen, also eine Größenordnung von 95 Tokens pro Sekunde. Das ist eine Projektion, keine Messung: Zitieren Sie sie nicht als Ergebnis.

Die Tabelle liefert eine nützliche Erkenntnis für alle, die überlegen, ihre Grafikkarte zu ersetzen: Die RTX 4060 Ti mit 8 GB generiert trotz ihres jüngeren Alters langsamer Text (63,9 Tokens pro Sekunde) als die 2070 Super, weil ihr 128-Bit-Bus die Bandbreite begrenzt. Bei der Textgenerierung bedeutet eine neuere GPU-Generation nicht automatisch eine höhere Geschwindigkeit. Sie bringt vor allem Energieeffizienz und neuere Funktionen, aber keine größere Speicherkapazität.

#2080 Super oder RTX 3060 12 GB: Die Speicherkapazität entscheidet

Die 3060 mit 12 GB generiert langsamer als die 2070 Super (75,6 gegenüber 88,1 Tokens pro Sekunde im Test), bietet aber 4 GB mehr. Darauf kommt es bei lokaler KI an: In 12 GB passt Gemma 4 12B (7 GB in Q4) mit Spielraum für den Kontext, was bei Karten mit 8 GB nicht möglich ist. Eine 2080 Super kann diesen Nachteil nicht durch ihre Geschwindigkeit ausgleichen, denn auch die höhere Geschwindigkeit von rund 95 Tokens pro Sekunde ändert nichts daran, dass ein 12B-Modell nicht in den Speicher passt.

2080 Super oder 3060 12 GB: Entscheidung
KriteriumRTX 2080 SuperRTX 3060 12 GB
Speicher8 GB12 GB
Generierung (7B Q4_0)Geschätzt etwa 95 Tokens/s75,6 Tokens/s (Messwert)
Modelle mit 12 Milliarden ParameternNein (7 GB Modellgewichte, kein Spielraum)Ja, mit Kontext
Modelle mit 7 bis 9 Milliarden ParameternJaJa

Das Fazit hängt daher von Ihrem Ziel ab. Für einen Assistenten mit 8 oder 9 Milliarden Parametern reicht Ihre 2080 aus, und der Wechsel zu einer 3060 mit 12 GB bringt keinen Geschwindigkeitsvorteil. Wenn Sie ein 12B-Modell oder lange Kontexte anstreben, ist der Wechsel gerechtfertigt. Die Gebrauchtpreise ändern sich jede Woche: Konsultieren Sie die Preisübersicht, statt sich auf eine feste Zahl zu verlassen.

#Langer Kontext mit 8 GB: Der K/V-Cache entscheidet

Auf einer Karte mit 8 GB ist nicht das Modell das Problem, sondern der Kontext-Cache. Jeder Token der Konversation fügt Daten im Speicher hinzu, und ein 8B-Modell in Q4, das ohne Kontext noch in den Speicher passte, kann dessen Kapazität überschreiten, wenn Sie ein langes Dokument einfügen. In Ollama gibt es zwei Stellschrauben. Flash Attention, das die Software automatisch aktiviert, wenn die Karte es unterstützt, reduziert den Speicherbedarf bei wachsendem Kontext. Sobald Flash Attention aktiviert ist, ermöglicht es die Quantisierung des K/V-Caches. Dessen Format q8_0 benötigt laut Dokumentation etwa halb so viel Speicher wie das Standardformat. Das Format q4_0 spart noch mehr Speicher, beeinträchtigt die Genauigkeit bei großen Kontexten jedoch deutlicher.

Linux: Flash Attention erzwingen und den Cache in q8_0 quantisieren
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Diese Einstellung ist global: Sie gilt für alle Modelle, die von der Instanz bedient werden, was auf einer dedizierten Maschine praktisch ist, aber beachtet werden sollte, wenn Sie sie häufig ändern. Die gute Praxis besteht darin, vor der Einstellung zu messen: Laden Sie Ihr Modell, füllen Sie einen repräsentativen Kontext für Ihre Nutzung und überprüfen Sie mit ollama ps, ob das Modell 100 % auf dem GPU bleibt. Wenn dies der Fall ist, haben Sie ausreichend Spielraum; sonst reduzieren Sie den Cache oder verringern Sie den Kontext.

#Wenn 8 GB nicht mehr ausreichen: die nächsten Stufen

Was jede Speicherstufe ermöglicht (Modellgewichte in Q4, QuelLLM-Katalog)
GrafikkartenspeicherModelle, die sich damit betreiben lassenGewichte in Q4
8 GB (Ihre Karte)Modelle mit 7 bis 9 Milliarden Parametern4,6 bis 6 GB
12 GBGemma 4 12B mit Kontext7 GB
16 GBgpt-oss 20B (13 GB) oder Qwen 3.5 27B (16 GB, sehr knapp)13 bis 16 GB

Diese Tabelle lässt sich einfach lesen: Jede höhere Speicherkapazität erschließt eine neue Modellkategorie, während die reine Geschwindigkeit oberhalb von 30 oder 40 Tokens pro Sekunde am Nutzungserlebnis kaum noch etwas ändert. Wenn Sie mit einer Investition zögern, fragen Sie sich zuerst, welches Modell Sie ausführen möchten, und wählen Sie dann die Grafikkarte mit der entsprechenden Speicherkapazität. Ein Modell mit 27 Milliarden Parametern ist bei 16 GB bereits an der Grenze; wenn das Ihr Ziel ist, ziehen Sie eher 24 GB in Betracht.

#Treiber und Support im Jahr 2026

Die RTX 2080 und die 2080 Ti gehören zu den von Ollama aufgeführten Karten mit Compute Capability 7.5. Ollama erfordert einen Treiber der Version 550 oder neuer. Das gilt für die aktuellen Ollama-Versionen; wenn die Installation fehlschlägt, sollten Sie zuerst die Treiberversion mit nvidia-smi prüfen. Es gibt daher keinen Grund, bei der Installation von Ollama oder llama.cpp auf diesen Karten softwarebedingte Hindernisse zu befürchten. Zu beachten ist lediglich die Treiberversion: Aktualisieren Sie den Treiber, bevor Sie anderswo nach der Fehlerursache suchen.

#Fazit 2026

Behalten Sie sie, wenn
Sie ist bereits in Ihrem PC eingebaut und Sie möchten Modelle mit 7 bis 9 Milliarden Parametern in Q4 nutzen. Die Geschwindigkeit reicht mehr als aus, es entstehen keine Kosten.
Nicht für KI kaufen
Außer bei niedrigem Preis und klaren Garantiebedingungen. Bei ähnlichem Preis ist eine 12-GB-Karte wertvoller als ein paar zusätzliche Tokens pro Sekunde.
Wählen Sie etwas anderes, wenn
Sie möchten ein 12B-Modell, ein 14B-Modell oder ein größeres Modell betreiben, oder bei einem 8B-Modell einen Kontext von mehr als zehntausend Tokens nutzen. Dafür benötigen Sie 12 bis 16 GB.

#Häufig gestellte Fragen

Häufig gestellte Fragen
Kann die RTX 2080 ein Modell mit 8 bis 9 Milliarden Parametern ausführen?+
Ja. In Q4 benötigt Granite 4.2 8B laut QuelLLM-Katalog 4,6 GB und Qwen 3.5 9B 6 GB. Bei moderatem Kontext passt das in die 8 GB der Grafikkarte. Ihre Geschwindigkeit ist mit der einer 2070 Super vergleichbar, bei der mit einem 7B-Modell in Q4_0 88 Tokens pro Sekunde gemessen wurden.
RTX 2080 Super oder RTX 2080 Ti für ein LLM?+
Die 2080 Ti verfügt über 11 GB und eine Bandbreite von 616 GB/s, die 2080 Super über 8 GB und 496 GB/s. Für ein LLM zählen die zusätzlichen 3 GB mehr als die Geschwindigkeit: Sie ermöglichen Modelle mit 12 Milliarden Parametern. Wenn Ihr Budget es erlaubt, ist die 2080 Ti die beste Wahl der beiden.
Kann Gemma 4 12B auf einer RTX 2080 Super laufen?+
Nicht wirklich komfortabel. Der Katalog gibt für die Modellgewichte in Q4 7 GB an. Bei 8 GB bleibt damit kaum ein Gigabyte für den Kontextcache und das System übrig. Das Modell lässt sich laden, aber Ollama lagert schnell einen Teil in den Arbeitsspeicher aus, was Ihnen ollama ps anzeigen wird. Wählen Sie lieber ein 8B- oder 9B-Modell.
Wie kann ich überprüfen, ob mein Modell vollständig auf der GPU läuft?+
Verwenden Sie den Befehl ollama ps: Die Spalte Processor zeigt 100% GPU an, wenn das Modell vollständig auf der Grafikkarte geladen ist, und ein Verhältnis wie 48%/52% CPU/GPU, wenn es auf Grafikkarten- und Systemspeicher verteilt ist. Im zweiten Fall sinkt die Geschwindigkeit deutlich, und es ist besser, den Kontext zu verkleinern oder ein kleineres Modell zu verwenden.
Ist eine RTX 2080 bei der Textgenerierung schneller als eine RTX 4060 Ti mit 8 GB?+
In der öffentlichen Tabelle von llama.cpp erzeugt die 4060 Ti mit 8 GB 63,9 Tokens pro Sekunde gegenüber 88,1 bei der 2070 Super, deren Bus mit dem der 2080 identisch ist. Der 128-Bit-Bus der 4060 Ti begrenzt ihre Bandbreite. Erwarten Sie daher bei gleicher Kapazität einen höheren Durchsatz mit der 2080.
Funktioniert Ollama im Jahr 2026 noch auf einer RTX 2080?+
Ja. Ollama führt die RTX 2080 unter den Karten mit Compute Capability 7.5 auf und benötigt lediglich einen Treiber der Version 550 oder neuer. In der konsultierten Dokumentation wird für diese Familie kein Supportende angekündigt; achten Sie bei größeren Updates einfach auf die Versionshinweise zu den Treibern und CUDA.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.