Welcher LLM auf RTX 3080 / 3080 Ti (10-12 GB)? ?
Für den lokalen Betrieb eines LLM kann eine RTX 3080 oder 3080 Ti mit 12 GB Qwen 3.5 9B in Q8 (10 GB) und Gemma 4 12B in Q4 (7 GB) mit Speicherreserve ausführen. Bei einem 7B-Modell liegt die Geschwindigkeit bei etwa 140 Tokens/s: Die 3080 mit 10 GB erreicht im llama.cpp-Test 139,7 Tokens/s. Die 10-GB-Version ist auf 8–9B-Modelle in Q4 beschränkt. Keine der drei Karten kann ein 20B-Modell in Q4 (13 GB) laden, ohne einen Teil in den Arbeitsspeicher auszulagern.
Drei Grafikkarten tragen den Namen RTX 3080: die Variante mit 10 GB vom September 2020, die mit 12 GB vom Januar 2022 und die 3080 Ti mit 12 GB vom Juni 2021. Sie haben denselben Chip, aber nicht denselben Speicher, und dieser entscheidet darüber, was Sie ausführen können. Dieser Leitfaden stützt sich bei der Geschwindigkeit auf eine öffentlich zugängliche Messung und bei der Speicherkapazität auf die offiziellen Datenblätter.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5080 16 GB.
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 3080 und 3080 Ti für ein lokales LLM: die drei Varianten
Eine RTX 3080 oder 3080 Ti mit 12 GB führt problemlos ein Modell mit 12 Milliarden Parametern in Q4 oder ein Modell mit 9 Milliarden Parametern in Q8 aus; die Version mit 10 GB ist auf Modelle mit 7 bis 9 Milliarden Parametern in Q4 beschränkt. Laut QuelLLM-Katalog benötigt Gemma 4 12B 7 GB in Q4 und 9 GB in Q5; Qwen 3.5 9B benötigt 6 GB in Q4 und 10 GB in Q8, sodass mindestens 12 GB erforderlich sind, sobald Kontext hinzukommt. Bei der Geschwindigkeit zählen diese Karten zu den schnellsten der vorherigen Generationen: Die 3080 mit 10 GB erzeugt laut der öffentlichen Tabelle von llama.cpp 139,7 Tokens pro Sekunde mit einem 7-Milliarden-Parameter-Modell in Q4_0, also fast doppelt so viele wie die RTX 3060 mit 12 GB (75,6). Bei der Wahl einer RTX 3080 für ein LLM kommt es daher auf den Speicher an, niemals auf die Geschwindigkeit.
- RTX 3080 10 GB
- September 2020, 8.704 CUDA-Kerne, 10 GB GDDR6X an einem 320-Bit-Bus, entsprechend 760 GB/s. Leistungsaufnahme der Karte: 320 W.
- RTX 3080 12 GB
- Januar 2022, 8.960 Kerne, 12 GB GDDR6X auf einem 384-Bit-Bus, also 912 GB/s, 350 W. Etwa 20 % mehr Bandbreite.
- RTX 3080 Ti
- Juni 2021, 10.240 Kerne, 12 GB GDDR6X mit einem 384-Bit-Bus wie bei der 3080 mit 12 GB, daher voraussichtlich dieselbe Bandbreite, 350 W.
Die Berechnung der Obergrenze hilft beim Verständnis: Bei der Textgenerierung werden die Gewichte für jedes Token gelesen, daher bestimmt die Bandbreite die maximale Geschwindigkeit. Die 3080 mit 12 GB und die Ti bieten 20 % mehr Bandbreite als die 10-GB-Version, aber die 3080 Ti bringt vor allem zusätzliche Rechenkerne mit, die das Einlesen des Prompts stärker beschleunigen als die Generierung.
#3080 10 GB, 12 GB oder 3080 Ti: Was man wählen sollte
| Kriterium | 3080 10 GB | 3080 12 GB | 3080 Ti 12 GB |
|---|---|---|---|
| CUDA-Kerne | 8 704 | 8 960 | 10 240 |
| Speicher | 10 GB GDDR6X | 12 GB GDDR6X | 12 GB GDDR6X |
| Bus / Bandbreite | 320 Bit / 760 GB/s | 384 Bit / 912 GB/s | 384 Bit, erwartete Bandbreite bleibt gleich |
| Kartenleistung | 320 W | 350 W | 350 W |
| Generierung mit Llama 2 7B Q4_0 | 139,7 Tok/s (Messung) | Schätzung: bis zu etwa 167 | Schätzung: nahe an der 12-GB-Version |
Für lokale KI sind die 3080 Ti und die 3080 mit 12 GB austauschbar: dieselben 12 GB, derselbe Bus und eine sehr ähnliche Generierungsgeschwindigkeit. Die Schätzung für diese beiden Karten ist eine Obergrenze, bei der die gemessene Effizienz der 10-GB-Version auf 912 GB/s übertragen wird: In der Praxis erreicht die 3090, deren Bus ebenfalls 384 Bit breit ist, gemessene 158,2 Tokens pro Sekunde. Nehmen Sie daher die günstigere der beiden, ohne sich von der Anzahl der Kerne leiten zu lassen. Die 10-GB-Version liegt dagegen bei der Kapazität eine Stufe darunter: Ihre 10 GB reichen für Modelle mit 9 Milliarden Parametern in Q8 nicht aus.
#Kompatible Modelle je nach Speichergröße
| Modell und Quantisierung | Modellgröße | 3080 10 GB | 3080 12 GB / Ti |
|---|---|---|---|
| Qwen 3.5 9B in Q4 | 6 GB | Ja, mit Kontext | Ja, mit viel Kontext |
| Gemma 4 12B in Q4 | 7 GB | Ja, mit moderater Kontextlänge | Ja, mit ausreichend Spielraum |
| Gemma 4 12B in Q5 | 9 GB | Sehr knapp | Ja, mit moderater Kontextlänge |
| Qwen 3.5 9B in Q8 | 10 GB | Nein | Ja, aber mit wenig Kontext |
| gpt-oss 20B in Q4 | 13 GB | Nein | Nein: überschreitet die Kapazität um 1 GB |
Zwei Punkte dieser Tabelle verdienen besondere Aufmerksamkeit. Erstens kann die 3080 mit 10 GB Gemma 4 12B in Q4 (7 GB) ausführen, auch wenn man das vielleicht nicht erwarten würde: Es bleiben 3 GB für den Kontext, was für Gespräche mittlerer Länge ausreicht. Zweitens ist der Sprung von 12 auf 16 GB deutlich: Ein Modell mit rund 20 Milliarden Parametern in Q4, etwa gpt-oss 20B, belegt 13 GB und passt auf keine der drei Karten. Wenn Sie ein solches Modell nutzen möchten, benötigen Sie eine Karte mit mindestens 16 GB. Der Leitfaden zu 12 GB VRAM erläutert im Detail, was genau mit 12 GB möglich ist.
#Installation, Stromversorgung und Einstellungen
Die RTX 3080 und 3080 Ti gehören zu den von Ollama aufgelisteten Karten mit Compute Capability 8.6. Ollama erfordert einen Treiber der Version 550 oder neuer. Ein Punkt, auf den Sie bei diesen Karten besonders achten sollten: Das NVIDIA-Datenblatt gibt für die Karte 350 W an, für die 10-GB-Version 320 W, und empfiehlt ein 750-W-Netzteil für das System. Prüfen Sie Ihr Netzteil, bevor Sie die Karte installieren, und schließen Sie ihre Stromanschlüsse mit separaten Kabeln an.
- 01Die Stromversorgung prüfenPrüfen Sie, ob das Netzteil 750 W liefert und über die für Ihr Grafikkartenmodell erforderlichen Anschlüsse verfügt.
- 02Treiber und Ollama installierenInstallieren Sie einen Treiber der Version 550 oder neuer, dann Ollama, und starten Sie ein Modell Ihrer Wahl.
- 03Speicher einstellenBei der 10 GB-Version starten Sie den Server mit OLLAMA_FLASH_ATTENTION=1 und OLLAMA_KV_CACHE_TYPE=q8_0: Die Dokumentation erklärt, dass der K/V-Cache quantisiert werden kann, wenn Flash Attention aktiviert ist.
- 04PrüfenMit nvidia-smi überwachen Sie den Speicher und die Temperatur unter Last: Diese Karten werden heißer als die neueren Modelle.
#Geschwindigkeit: die öffentliche Messung und ihre Extrapolationen
Die gemeinschaftlich gepflegte Tabelle von llama.cpp mit Messungen für Llama 2 7B in Q4_0 (Dateigröße 3,56 GiB, also 3,82 GB) gibt für die RTX 3080 mit 10 GB 139,65 Tokens pro Sekunde bei der Generierung und 5.014 bei der Prompt-Verarbeitung an. Mit Flash Attention bleibt die Generierung bei 139,95, die Prompt-Verarbeitung steigt jedoch auf 5.570 Tokens pro Sekunde, also um etwa 11 %. Die Bandbreite von 760 GB/s würde theoretisch knapp 199 Tokens pro Sekunde ermöglichen: Der Messwert erreicht 70 % dieser Obergrenze. Der Durchsatz hängt auch vom Treiber, vom System und vom Kartenhersteller ab, selbst bei identischem Chip.
| Karte | Speicher | Generierung (Tok/s) |
|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 |
| RTX 3080 10 GB | 10 GB | 139,7 |
| RTX 3090 | 24 GB | 158,2 |
Mit einem Dreisatz auf Grundlage der Dateigrößen würde die 3080 mit 10 GB im besten Fall etwa 89 Tokens pro Sekunde bei Qwen 3.5 9B in Q4 (6 GB) und etwa 76 bei Gemma 4 12B in Q4 (7 GB) liefern. Das sind theoretische Obergrenzen, keine Messwerte. Auf einer 3080 mit 12 GB würde Qwen 3.5 9B in Q8 (10 GB) theoretisch unter 65 Tokens pro Sekunde bleiben, was komfortabel ist. In allen Fällen liegen diese Karten weit über der Lesegeschwindigkeit; der begrenzende Faktor ist die Speicherkapazität, nicht die Geschwindigkeit.
Die Verarbeitung des Prompts ist der zweite Vorteil dieser Karten. Mit 5.014 Token pro Sekunde verarbeitet die 3080 mit 10 GB ein Dokument mit 10.000 Token in etwa zwei Sekunden, mit 5.570 Token pro Sekunde bei Flash Attention in etwas weniger Zeit – zwei theoretische Berechnungen, die einen konstanten Durchsatz voraussetzen. Das ist etwa doppelt so schnell wie eine 3060 mit 12 GB (2.138 Token pro Sekunde). Die Verarbeitung des Prompts fällt noch stärker ins Gewicht, wenn mehrere Personen denselben Rechner nutzen: Jede Anfrage muss zunächst ihren eigenen Kontext erneut verarbeiten, bevor überhaupt eine Antwort generiert werden kann. Gerade hier wird der Abstand zu einer weniger leistungsfähigen Karte größer. Für RAG mit umfangreichen Dokumenten oder einen Code-Assistenten, der bei jeder Anfrage große Dateien erneut liest, ist das ein echter Komfortgewinn. Er ist deutlich spürbarer als der Unterschied bei der Generierung, deren Geschwindigkeit ohnehin schon deutlich über dem menschlichen Lesetempo liegt.
#Kaufen im Jahr 2026: Wie sind diese Karten einzuordnen?
Gegenüber einer neuen Karte mit 16 GB punktet eine gebrauchte RTX 3080 mit hoher Geschwindigkeit zu einem moderaten Preis, hat aber zu wenig Speicher. Die 3090 erreicht bei der Messung 158,2 Tokens pro Sekunde und verfügt über 24 GB, was sie zu einer wichtigen Option auf dem Gebrauchtmarkt für Modelle mit 20 bis 30 Milliarden Parametern macht. Die Preise gebrauchter Karten ändern sich jede Woche: Die Preisübersicht dieser Website erfasst für jede Karte den niedrigsten Preis und den Preis pro GB VRAM, was hilfreicher ist als eine hier festgeschriebene Zahl.
| Zielmodell | Notwendige Speichergröße | Passende Karte |
|---|---|---|
| 8 bis 9 B in Q4 | 6 GB Modellgewichte | Jede Karte mit 8 GB |
| 12B in Q4 oder 9B in Q8 | 7 bis 10 GB Modellgewichte | 3080 12 GB oder Ti, oder 3080 10 GB für Q4 |
| 20B in Q4 (gpt-oss 20B) | 13 GB Modellgewichte | Karte mit 16 GB oder mehr |
- Preise für Grafikkarten für lokale KI (wöchentliche Preisbeobachtung)
- Welches LLM läuft auf der RTX 3090 / 3090 Ti (24 GB)?
- Welches LLM läuft auf der RTX 4070 Ti Super (16 GB)?
#Fazit 2026
- Gebrauchte 3080 mit 12 GB oder 3080 Ti
- Eine sehr gute Wahl, wenn der Preis deutlich unter dem einer neuen Grafikkarte mit 12 bis 16 GB bleibt: 12 GB, hohe Geschwindigkeit und genügend Spielraum für ein 9B-Modell in Q8 oder ein 12B-Modell in Q4.
- 3080 10 GB
- Nützlich für Modelle mit 8 bis 12 Milliarden Parametern in Q4. Da Modelle mit 9 Milliarden Parametern in Q8 nicht hineinpassen und kaum Spielraum für den Kontext bleibt, kann eine 3060 mit 12 GB besser geeignet sein, wenn Ihnen Kapazität wichtiger ist als Geschwindigkeit.
- Beim Kauf
- Prüfen Sie die Stromversorgung, die Angabe von 10 oder 12 GB und den Zustand der Lüfter: Diese Karten sind heiß geworden und haben bereits mehrere Jahre Nutzung hinter sich.
#Häufig gestellte Fragen
RTX 3080 10 GB oder 12 GB für ein LLM?+
RTX 3080 Ti oder RTX 3090 für ein LLM?+
Kann die RTX 3080 mit 12 GB gpt-oss 20B ausführen?+
Wie viele Tokens pro Sekunde auf einer RTX 3080?+
Welches Netzteil für eine RTX 3080 Ti?+
Funktioniert Ollama auf einer RTX 3080?+
Lohnt sich die RTX 3080 im Jahr 2026 noch?+
- Quelle: Leistungstabelle von llama.cpp unter CUDA
- Quelle: NVIDIA-Datenblatt für die RTX 3080 und 3080 Ti
- Quelle: Von Ollama unterstützte NVIDIA-Grafikkarten
- Quelle: Ollama-FAQ (Flash Attention, K/V-Cache)
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.