Welches LLM auf einer RTX 2080 Ti (11 GB)? ?
Mit 11 GB GDDR6 und 616 GB/s Speicherbandbreite kann die RTX 2080 Ti ein Modell mit 12 Milliarden Parametern in Q4 wie Gemma 4 12B (7 GB) oder ein 8B-Modell in Q8 wie Granite 4.2 8B (9 GB) ausführen, ohne Teile davon in den Arbeitsspeicher auszulagern. Im Referenztest von llama.cpp generiert sie mit einem 7B-Modell in Q4_0 107 Tokens/s. Sie ist einer der seltenen Fälle einer Karte aus dem Jahr 2018, deren Speicherkapazität noch nützlich ist.
Die RTX 2080 Ti (September 2018) ist die einzige Karte der Turing-Generation mit mehr als 8 GB Speicher: Sie hat 11 GB. Dieser Leitfaden setzt ihre technischen Daten in Beziehung zu öffentlich verfügbaren Messungen, erläutert, welche Modelle in ihren Speicher passen, vergleicht ihr Verhältnis von Speicherkapazität zu Geschwindigkeit mit dem neuerer Karten und erklärt, wie Sie sie installieren und prüfen, dass nichts in den Arbeitsspeicher ausgelagert wird.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RTX 2080 Ti im Jahr 2026: die Kapazität, die zählt
Die RTX 2080 Ti kann ein Modell mit 12 Milliarden Parametern in Q4 ausführen, ohne die Kapazität des Grafikspeichers zu überschreiten — etwas, das keine 8-GB-Karte problemlos schafft. Laut dem QuelLLM-Katalog belegt Gemma 4 12B in Q4 7 GB, Granite 4.2 8B 4,6 GB und Qwen 3.5 9B 6 GB; in Q8 steigt der Speicherbedarf von Granite 4.2 8B auf 9 GB, was ebenfalls in die 11 GB passt. Die Karte verfügt über einen TU102-Chip, 4.352 CUDA-Kerne und 11 GB GDDR6-Speicher an einem 352-Bit-Bus, was 616 GB/s entspricht. In der öffentlichen Tabelle von llama.cpp erreicht sie bei der Generierung mit einem Modell mit 7 Milliarden Parametern in Q4_0 107,5 Tokens pro Sekunde. Diese Mischung aus Geschwindigkeit und Kapazität erklärt, warum die 2080 Ti weiterhin relevant ist, obwohl neuere 8-GB-Karten sie beim Gaming übertreffen, bei KI jedoch nicht.
- Architektur
- Turing, Chip TU102, Veröffentlichung im September 2018.
- Speicher
- 11 GB GDDR6, 352-Bit-Bus, Bandbreite von 616 GB/s.
- Cœurs
- 4.352 CUDA-Kerne und Tensor-Kerne der zweiten Generation
- Stromversorgung
- Prüfen Sie das Datenblatt Ihres konkreten Modells: Die ab Werk angebotenen Varianten unterscheiden sich je nach Hersteller.
#Mit 11 GB kompatible Modelle
| Modell | Q4 | Q5 | Q8 | Bei 11 GB |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6 GB | 9 GB | Q4 und Q5 passen problemlos, Q8 ist mit moderatem Kontext möglich |
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | Q4 und Q5 sind komfortabel; Q8 lässt kaum noch 1 GB für den Kontext |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 mit 3 bis 4 GB Reserve; Q5 passt gerade noch; Q8 passt nicht |
Die Spalte Q5 zeigt den Vorteil einer Karte mit 11 GB: Bei einem 8B- oder 9B-Modell kann man eine originalgetreuere Quantisierung als Q4 wählen, ohne etwas zu opfern. Ein 12B-Modell in Q5 (9 GB) lässt dagegen weniger als 2 GB für den Cache übrig, was den Kontext begrenzt. Ein Modell in Q4 mit großem Kontext ist oft nützlicher als eines in Q5 mit einem engen Kontextfenster: Wägen Sie je nach Nutzung ab, ob Sie lange Dokumente zusammenfassen oder kurze Gespräche führen.
Zwei praktische Orientierungspunkte. Erstens passt ein 8B-Modell in Q8 (9 GB) in den Speicher der Karte und liefert eine Qualität, die der vollen Präzision sehr nahekommt: Das ist ein Einsatz, den Karten mit 8 GB nicht ermöglichen. Zweitens wird die Reserve von 3 bis 4 GB bei einem 12B-Modell in Q4 durch den Kontext aufgebraucht: Über einige Tausend Tokens hinaus sollten Sie den K/V-Cache quantisieren oder das Kontextfenster verkleinern. Zur Wahl der Quantisierungsstufe erläutert der entsprechende Leitfaden die Qualitätsverluste im Detail.
#Installation und Überprüfung
Turing wird von Ollama unterstützt: Die Dokumentation führt die RTX 2080 Ti, 2080, 2070 und 2060 unter den Karten mit Compute Capability 7.5 auf und verlangt einen Treiber der Version 550 oder neuer. Das Vorgehen ist dasselbe wie bei jeder NVIDIA-Karte, mit einer wichtigen abschließenden Kontrolle: prüfen, ob das Modell vollständig im Speicher der Grafikkarte liegt.
- 01Den Treiber aktualisierenInstallieren Sie einen NVIDIA-Treiber der Version 550 oder neuer und prüfen Sie anschließend mit nvidia-smi, ob die Karte mit ihren 11 GB erkannt wird.
- 02Ollama installierenFolgen Sie der Installationsanleitung für Ollama für Ihr System und starten Sie anschließend ein Modell mit ollama run.
- 03Verteilung prüfenGeben Sie ollama ps ein: Die Spalte Processor muss 100% GPU anzeigen. Wenn ein CPU-Prozentsatz erscheint, wird das Modell teilweise in den Arbeitsspeicher ausgelagert: Verringern Sie die Kontextgröße oder wählen Sie ein kleineres Modell.
- 04Den K/V-Cache bei Bedarf anpassenStarten Sie Ollama mit OLLAMA_FLASH_ATTENTION=1 und OLLAMA_KV_CACHE_TYPE=q8_0, um bei langen Kontexten mehr Platz zu gewinnen.
- Wie installiert man Ollama
- Ollama-Fehlerbehebung: GPU nicht erkannt, langsamer Betrieb, Speicherfehler
#Geschwindigkeit: Was llama.cpp misst
Die gemeinschaftlich erstellte Tabelle im llama.cpp-Repository nennt für die RTX 2080 Ti 107,5 Tokens pro Sekunde bei der Generierung und 2.891 bei der Prompt-Verarbeitung mit Llama 2 7B in Q4_0, einer Datei mit 3,56 GiB. Mit Flash Attention steigen diese Werte auf 109,2 und 3.108. Ein Punkt fällt auf: Die Speicherbandbreite von 616 GB/s würde theoretisch etwa 161 Tokens pro Sekunde mit dieser 3,82 GB großen Datei ermöglichen, doch der gemessene Wert erreicht nur 67 % davon. Weniger leistungsstarke Karten kommen dieser theoretischen Grenze näher. Der tatsächliche Durchsatz hängt also auch von anderen Faktoren als dem Speicher allein ab, etwa von Taktraten oder Treibern, und die Tabelle selbst weist darauf hin, dass die Ergebnisse je nach Karte und System variieren.
Um die Geschwindigkeit eines aktuellen Modells zu schätzen, kann man anhand der Dateigröße einen Dreisatz berechnen. Ein 4,6 GB großes Modell wie Granite 4.2 8B in Q4 käme bestenfalls auf 107,5 × 3,82 ÷ 4,6, also etwa 89 Tokens pro Sekunde. Bei einem 7 GB großen Gemma 4 12B sinkt der Wert auf etwa 59 Tokens pro Sekunde. Das sind theoretische Obergrenzen, keine Messwerte; neuere Architekturen können davon abweichen. In jedem Fall liegen diese Geschwindigkeiten über dem Lesetempo.
#Langer Kontext und Dokumente: Lesen des Prompts und K/V-Cache
Die Generierungsgeschwindigkeit macht nur die Hälfte des Nutzungserlebnisses aus: Sobald Sie ein Dokument einfügen oder eine Suche in Ihren Dateien starten, verursacht das Einlesen des Prompts die Wartezeit. Die Tabelle von llama.cpp erfasst dies separat (pp512). Bei 2 891 Tokens pro Sekunde liest die 2080 Ti ein Dokument mit 10 000 Tokens in etwas mehr als dreieinhalb Sekunden ein, gegenüber etwa viereinhalb Sekunden bei der 3060 mit 12 GB (2 138) und zwei Sekunden bei der 3080 mit 10 GB (5 014). Diese Berechnung ist theoretisch und setzt einen konstanten Durchsatz voraus, vermittelt aber die Größenordnung: Die 2080 Ti bleibt für RAG angenehm zu nutzen.
Die zweite Einschränkung ist der Speicher. Der K/V-Cache wächst mit dem Kontext, und bei einem 12B-Modell in Q4, das 3 bis 4 GB Reserve lässt, verbraucht ein langes Dokument diese Reserve schnell. Die Dokumentation von Ollama erläutert, dass der K/V-Cache bei aktivierter Flash Attention quantisiert werden kann und dass das Format q8_0 etwa halb so viel Speicher benötigt wie das standardmäßig verwendete Format f16. Die Einstellung gilt für die gesamte Ollama-Instanz: Sie betrifft alle darüber bereitgestellten Modelle.
Gehen Sie mit Tests vor, deren Ergebnisse Sie messen: Laden Sie das Modell, füllen Sie das Kontextfenster in einem Umfang, der Ihrer tatsächlichen Nutzung entspricht, und prüfen Sie dann mit ollama ps, dass das Modell weiterhin zu 100 % auf der GPU läuft. Wenn das Modell nicht vollständig in den GPU-Speicher passt, ist die kostengünstigste Lösung fast immer, das Kontextfenster zu verkleinern, bevor Sie das Modell oder die Grafikkarte wechseln. Der Leitfaden zum Kontextfenster erklärt, wie es eingestellt wird.
#2080 Ti, 3060 12 GB, 5060 Ti 16 GB: welcher Kompromiss?
| Karte | Speicher | Generierung (Tok/s) | Prompt-Verarbeitung (Tok/s) |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 5060 Ti 16 GB | 16 GB | 90,9 | 3 737 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
| RTX 3080 10 GB | 10 GB | 139,7 | 5 014 |
Die 2080 Ti generiert etwa 42 % schneller als die 3060 mit 12 GB und sogar schneller als die RTX 5060 Ti mit 16 GB, deren 128-Bit-Bus sie ausbremst. Bei der Speicherkapazität liegt die 2080 Ti dagegen hinter beiden: 11 GB gegenüber 12 beziehungsweise 16 GB. Die Wahl hängt also vom gewünschten Modell ab. Für ein 12B-Modell in Q4 reicht die 2080 Ti aus und bleibt die schnellste der drei. Für ein Modell mit 20 Milliarden Parametern oder mehr oder einen sehr langen Kontext braucht man 16 GB, und die Karte der neuen Generation wird zur besseren Wahl. Die Preise ändern sich jede Woche; die Preisübersicht der Website zeigt den Preis pro GB VRAM.
- Frage 1: Welches Modell möchten Sie?
- Ein Modell mit 8 bis 12 Milliarden Parametern: Behalten Sie die 2080 Ti oder kaufen Sie sie. Ein Modell mit 20 Milliarden Parametern oder mehr: Streben Sie 16 GB an.
- Frage 2: welche Kontextlänge?
- Einige Tausend Tokens: 11 GB reichen aus. Zehntausende: Dann fehlt der nötige Speicherpuffer.
- Frage 3: Welches Strombudget?
- Vergleichen Sie den angegebenen Verbrauch auf der Produktseite Ihrer Karte mit dem der neueren Karten, die bei vergleichbarer Geschwindigkeit energieeffizienter sind.
- Preise für Grafikkarten für lokale KI (wöchentliche Preisbeobachtung)
- Welches LLM läuft auf der RTX 3060 mit 12 GB?
- Welches LLM auf RTX 5060 Ti (8 / 16 GB)?
#Turing-Unterstützung: Was bestätigt ist und was nicht
Turing ist heute die älteste von CUDA 13 unterstützte Architektur: Die Versionshinweise geben an, dass die Unterstützung älterer Architekturen (Maxwell, Volta, Pascal) in den Bibliotheken eingestellt wurde. Das bedeutet, dass die 2080 Ti unterstützt wird, aber auch, dass sie zu den ältesten noch unterstützten Karten gehört. Keine der konsultierten Quellen kündigt ein Ende der Unterstützung für Turing an; die Hardware-Neuerungen jüngerer Generationen (zum Beispiel sparsamere Rechenformate) werden dort jedoch niemals verfügbar sein. Für llama.cpp und Ollama mit klassischen GGUF-Modellen ist das kein Hindernis.
#Fazit 2026
- Behalten Sie sie, wenn
- Sie besitzen die Karte bereits: 11 GB und 107 Tokens pro Sekunde bei einem 7B-Modell machen sie für KI nützlicher als viele neuere Karten mit 8 GB.
- Kaufen Sie gebraucht, wenn
- Der Preis ist deutlich niedriger als der einer Karte mit 12 bis 16 GB, und Sie möchten ein Modell mit 8 oder 12 Milliarden Parametern einsetzen. Prüfen Sie den Zustand der Lüfter und die Garantie; diese Karten sind bereits seit mehreren Jahren in Gebrauch.
- Wechseln Sie auf 16 GB, wenn
- Sie möchten ein Modell mit 20 Milliarden Parametern oder mehr nutzen oder einen Kontext mit mehreren Zehntausend Tokens.
#Häufig gestellte Fragen
Ist die RTX 2080 Ti im Jahr 2026 noch relevant für einen LLM?+
RTX 2080 Ti oder RTX 3060 12 GB für ein LLM?+
Wie viele Tokens pro Sekunde auf einer RTX 2080 Ti?+
Unterstützt die RTX 2080 Ti Flash Attention?+
Wie kann ich feststellen, ob mein Modell vollständig auf die Grafikkarte passt?+
Besteht das Risiko, dass die RTX 2080 Ti nicht mehr unterstützt wird?+
- Quelle: Leistungstabelle von llama.cpp unter CUDA
- Quelle: Von Ollama unterstützte NVIDIA-Grafikkarten
- Quelle: FAQ von Ollama (ollama ps, K/V-Cache)
- Quelle: Spezifikationen der GeForce-Serie 20
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.