Mittelstufe 11 Min.RTX 30

Welcher LLM auf RTX 3080 / 3080 Ti (10-12 GB)? ?

Direkte Antwort

Für den lokalen Betrieb eines LLM kann eine RTX 3080 oder 3080 Ti mit 12 GB Qwen 3.5 9B in Q8 (10 GB) und Gemma 4 12B in Q4 (7 GB) mit Speicherreserve ausführen. Bei einem 7B-Modell liegt die Geschwindigkeit bei etwa 140 Tokens/s: Die 3080 mit 10 GB erreicht im llama.cpp-Test 139,7 Tokens/s. Die 10-GB-Version ist auf 8–9B-Modelle in Q4 beschränkt. Keine der drei Karten kann ein 20B-Modell in Q4 (13 GB) laden, ohne einen Teil in den Arbeitsspeicher auszulagern.

Drei Grafikkarten tragen den Namen RTX 3080: die Variante mit 10 GB vom September 2020, die mit 12 GB vom Januar 2022 und die 3080 Ti mit 12 GB vom Juni 2021. Sie haben denselben Chip, aber nicht denselben Speicher, und dieser entscheidet darüber, was Sie ausführen können. Dieser Leitfaden stützt sich bei der Geschwindigkeit auf eine öffentlich zugängliche Messung und bei der Speicherkapazität auf die offiziellen Datenblätter.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5080 16 GB.

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#RTX 3080 und 3080 Ti für ein lokales LLM: die drei Varianten

Eine RTX 3080 oder 3080 Ti mit 12 GB führt problemlos ein Modell mit 12 Milliarden Parametern in Q4 oder ein Modell mit 9 Milliarden Parametern in Q8 aus; die Version mit 10 GB ist auf Modelle mit 7 bis 9 Milliarden Parametern in Q4 beschränkt. Laut QuelLLM-Katalog benötigt Gemma 4 12B 7 GB in Q4 und 9 GB in Q5; Qwen 3.5 9B benötigt 6 GB in Q4 und 10 GB in Q8, sodass mindestens 12 GB erforderlich sind, sobald Kontext hinzukommt. Bei der Geschwindigkeit zählen diese Karten zu den schnellsten der vorherigen Generationen: Die 3080 mit 10 GB erzeugt laut der öffentlichen Tabelle von llama.cpp 139,7 Tokens pro Sekunde mit einem 7-Milliarden-Parameter-Modell in Q4_0, also fast doppelt so viele wie die RTX 3060 mit 12 GB (75,6). Bei der Wahl einer RTX 3080 für ein LLM kommt es daher auf den Speicher an, niemals auf die Geschwindigkeit.

RTX 3080 10 GB
September 2020, 8.704 CUDA-Kerne, 10 GB GDDR6X an einem 320-Bit-Bus, entsprechend 760 GB/s. Leistungsaufnahme der Karte: 320 W.
RTX 3080 12 GB
Januar 2022, 8.960 Kerne, 12 GB GDDR6X auf einem 384-Bit-Bus, also 912 GB/s, 350 W. Etwa 20 % mehr Bandbreite.
RTX 3080 Ti
Juni 2021, 10.240 Kerne, 12 GB GDDR6X mit einem 384-Bit-Bus wie bei der 3080 mit 12 GB, daher voraussichtlich dieselbe Bandbreite, 350 W.

Die Berechnung der Obergrenze hilft beim Verständnis: Bei der Textgenerierung werden die Gewichte für jedes Token gelesen, daher bestimmt die Bandbreite die maximale Geschwindigkeit. Die 3080 mit 12 GB und die Ti bieten 20 % mehr Bandbreite als die 10-GB-Version, aber die 3080 Ti bringt vor allem zusätzliche Rechenkerne mit, die das Einlesen des Prompts stärker beschleunigen als die Generierung.

#3080 10 GB, 12 GB oder 3080 Ti: Was man wählen sollte

Die drei RTX 3080
Kriterium3080 10 GB3080 12 GB3080 Ti 12 GB
CUDA-Kerne8 7048 96010 240
Speicher10 GB GDDR6X12 GB GDDR6X12 GB GDDR6X
Bus / Bandbreite320 Bit / 760 GB/s384 Bit / 912 GB/s384 Bit, erwartete Bandbreite bleibt gleich
Kartenleistung320 W350 W350 W
Generierung mit Llama 2 7B Q4_0139,7 Tok/s (Messung)Schätzung: bis zu etwa 167Schätzung: nahe an der 12-GB-Version

Für lokale KI sind die 3080 Ti und die 3080 mit 12 GB austauschbar: dieselben 12 GB, derselbe Bus und eine sehr ähnliche Generierungsgeschwindigkeit. Die Schätzung für diese beiden Karten ist eine Obergrenze, bei der die gemessene Effizienz der 10-GB-Version auf 912 GB/s übertragen wird: In der Praxis erreicht die 3090, deren Bus ebenfalls 384 Bit breit ist, gemessene 158,2 Tokens pro Sekunde. Nehmen Sie daher die günstigere der beiden, ohne sich von der Anzahl der Kerne leiten zu lassen. Die 10-GB-Version liegt dagegen bei der Kapazität eine Stufe darunter: Ihre 10 GB reichen für Modelle mit 9 Milliarden Parametern in Q8 nicht aus.

#Kompatible Modelle je nach Speichergröße

Was in 10 GB und in 12 GB passt (Modellgrößen laut QuelLLM-Katalog)
Modell und QuantisierungModellgröße3080 10 GB3080 12 GB / Ti
Qwen 3.5 9B in Q46 GBJa, mit KontextJa, mit viel Kontext
Gemma 4 12B in Q47 GBJa, mit moderater KontextlängeJa, mit ausreichend Spielraum
Gemma 4 12B in Q59 GBSehr knappJa, mit moderater Kontextlänge
Qwen 3.5 9B in Q810 GBNeinJa, aber mit wenig Kontext
gpt-oss 20B in Q413 GBNeinNein: überschreitet die Kapazität um 1 GB

Zwei Punkte dieser Tabelle verdienen besondere Aufmerksamkeit. Erstens kann die 3080 mit 10 GB Gemma 4 12B in Q4 (7 GB) ausführen, auch wenn man das vielleicht nicht erwarten würde: Es bleiben 3 GB für den Kontext, was für Gespräche mittlerer Länge ausreicht. Zweitens ist der Sprung von 12 auf 16 GB deutlich: Ein Modell mit rund 20 Milliarden Parametern in Q4, etwa gpt-oss 20B, belegt 13 GB und passt auf keine der drei Karten. Wenn Sie ein solches Modell nutzen möchten, benötigen Sie eine Karte mit mindestens 16 GB. Der Leitfaden zu 12 GB VRAM erläutert im Detail, was genau mit 12 GB möglich ist.

#Installation, Stromversorgung und Einstellungen

Die RTX 3080 und 3080 Ti gehören zu den von Ollama aufgelisteten Karten mit Compute Capability 8.6. Ollama erfordert einen Treiber der Version 550 oder neuer. Ein Punkt, auf den Sie bei diesen Karten besonders achten sollten: Das NVIDIA-Datenblatt gibt für die Karte 350 W an, für die 10-GB-Version 320 W, und empfiehlt ein 750-W-Netzteil für das System. Prüfen Sie Ihr Netzteil, bevor Sie die Karte installieren, und schließen Sie ihre Stromanschlüsse mit separaten Kabeln an.

  1. 01
    Die Stromversorgung prüfen
    Prüfen Sie, ob das Netzteil 750 W liefert und über die für Ihr Grafikkartenmodell erforderlichen Anschlüsse verfügt.
  2. 02
    Treiber und Ollama installieren
    Installieren Sie einen Treiber der Version 550 oder neuer, dann Ollama, und starten Sie ein Modell Ihrer Wahl.
  3. 03
    Speicher einstellen
    Bei der 10 GB-Version starten Sie den Server mit OLLAMA_FLASH_ATTENTION=1 und OLLAMA_KV_CACHE_TYPE=q8_0: Die Dokumentation erklärt, dass der K/V-Cache quantisiert werden kann, wenn Flash Attention aktiviert ist.
  4. 04
    Prüfen
    Mit nvidia-smi überwachen Sie den Speicher und die Temperatur unter Last: Diese Karten werden heißer als die neueren Modelle.
Linux: Ollama mit Speichereinstellungen starten
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Geschwindigkeit: die öffentliche Messung und ihre Extrapolationen

Die gemeinschaftlich gepflegte Tabelle von llama.cpp mit Messungen für Llama 2 7B in Q4_0 (Dateigröße 3,56 GiB, also 3,82 GB) gibt für die RTX 3080 mit 10 GB 139,65 Tokens pro Sekunde bei der Generierung und 5.014 bei der Prompt-Verarbeitung an. Mit Flash Attention bleibt die Generierung bei 139,95, die Prompt-Verarbeitung steigt jedoch auf 5.570 Tokens pro Sekunde, also um etwa 11 %. Die Bandbreite von 760 GB/s würde theoretisch knapp 199 Tokens pro Sekunde ermöglichen: Der Messwert erreicht 70 % dieser Obergrenze. Der Durchsatz hängt auch vom Treiber, vom System und vom Kartenhersteller ab, selbst bei identischem Chip.

Vergleich mit anderen Karten (Llama 2 7B Q4_0, Generierung)
KarteSpeicherGenerierung (Tok/s)
RTX 3060 12 GB12 GB75,6
RTX 3080 10 GB10 GB139,7
RTX 309024 GB158,2

Mit einem Dreisatz auf Grundlage der Dateigrößen würde die 3080 mit 10 GB im besten Fall etwa 89 Tokens pro Sekunde bei Qwen 3.5 9B in Q4 (6 GB) und etwa 76 bei Gemma 4 12B in Q4 (7 GB) liefern. Das sind theoretische Obergrenzen, keine Messwerte. Auf einer 3080 mit 12 GB würde Qwen 3.5 9B in Q8 (10 GB) theoretisch unter 65 Tokens pro Sekunde bleiben, was komfortabel ist. In allen Fällen liegen diese Karten weit über der Lesegeschwindigkeit; der begrenzende Faktor ist die Speicherkapazität, nicht die Geschwindigkeit.

Die Verarbeitung des Prompts ist der zweite Vorteil dieser Karten. Mit 5.014 Token pro Sekunde verarbeitet die 3080 mit 10 GB ein Dokument mit 10.000 Token in etwa zwei Sekunden, mit 5.570 Token pro Sekunde bei Flash Attention in etwas weniger Zeit – zwei theoretische Berechnungen, die einen konstanten Durchsatz voraussetzen. Das ist etwa doppelt so schnell wie eine 3060 mit 12 GB (2.138 Token pro Sekunde). Die Verarbeitung des Prompts fällt noch stärker ins Gewicht, wenn mehrere Personen denselben Rechner nutzen: Jede Anfrage muss zunächst ihren eigenen Kontext erneut verarbeiten, bevor überhaupt eine Antwort generiert werden kann. Gerade hier wird der Abstand zu einer weniger leistungsfähigen Karte größer. Für RAG mit umfangreichen Dokumenten oder einen Code-Assistenten, der bei jeder Anfrage große Dateien erneut liest, ist das ein echter Komfortgewinn. Er ist deutlich spürbarer als der Unterschied bei der Generierung, deren Geschwindigkeit ohnehin schon deutlich über dem menschlichen Lesetempo liegt.

#Kaufen im Jahr 2026: Wie sind diese Karten einzuordnen?

Gegenüber einer neuen Karte mit 16 GB punktet eine gebrauchte RTX 3080 mit hoher Geschwindigkeit zu einem moderaten Preis, hat aber zu wenig Speicher. Die 3090 erreicht bei der Messung 158,2 Tokens pro Sekunde und verfügt über 24 GB, was sie zu einer wichtigen Option auf dem Gebrauchtmarkt für Modelle mit 20 bis 30 Milliarden Parametern macht. Die Preise gebrauchter Karten ändern sich jede Woche: Die Preisübersicht dieser Website erfasst für jede Karte den niedrigsten Preis und den Preis pro GB VRAM, was hilfreicher ist als eine hier festgeschriebene Zahl.

Welche Karte passt zu Ihrem Zielmodell?
ZielmodellNotwendige SpeichergrößePassende Karte
8 bis 9 B in Q46 GB ModellgewichteJede Karte mit 8 GB
12B in Q4 oder 9B in Q87 bis 10 GB Modellgewichte3080 12 GB oder Ti, oder 3080 10 GB für Q4
20B in Q4 (gpt-oss 20B)13 GB ModellgewichteKarte mit 16 GB oder mehr

#Fazit 2026

Gebrauchte 3080 mit 12 GB oder 3080 Ti
Eine sehr gute Wahl, wenn der Preis deutlich unter dem einer neuen Grafikkarte mit 12 bis 16 GB bleibt: 12 GB, hohe Geschwindigkeit und genügend Spielraum für ein 9B-Modell in Q8 oder ein 12B-Modell in Q4.
3080 10 GB
Nützlich für Modelle mit 8 bis 12 Milliarden Parametern in Q4. Da Modelle mit 9 Milliarden Parametern in Q8 nicht hineinpassen und kaum Spielraum für den Kontext bleibt, kann eine 3060 mit 12 GB besser geeignet sein, wenn Ihnen Kapazität wichtiger ist als Geschwindigkeit.
Beim Kauf
Prüfen Sie die Stromversorgung, die Angabe von 10 oder 12 GB und den Zustand der Lüfter: Diese Karten sind heiß geworden und haben bereits mehrere Jahre Nutzung hinter sich.

#Häufig gestellte Fragen

Häufig gestellte Fragen
RTX 3080 10 GB oder 12 GB für ein LLM?+
Wählen Sie die 12-GB-Version, wenn die Preise ähnlich sind: Die zusätzlichen 2 GB ermöglichen Qwen 3.5 9B in Q8 (10 GB Modellgewichte) und bieten Spielraum für Gemma 4 12B, während die 10-GB-Version auf 8–9B-Modelle in Q4 und ein 12B-Modell in Q4 mit moderatem Kontext beschränkt ist. Ihr breiterer Bus bietet außerdem etwa 20 % mehr Bandbreite.
RTX 3080 Ti oder RTX 3090 für ein LLM?+
Die 3090 verfügt über 24 GB statt 12 GB und erreicht 158,2 Tokens pro Sekunde im llama.cpp-Test, was Modelle mit 20 bis 30 Milliarden Parametern in Q4 ermöglicht. Die 3080 Ti reicht aus, wenn Sie auf maximal 12 Milliarden beschränkt bleiben. Für diese Modelle bleiben die Generationsgeschwindigkeiten annähernd gleich: die Kapazität macht den Unterschied aus.
Kann die RTX 3080 mit 12 GB gpt-oss 20B ausführen?+
Nicht vollständig im Speicher der Karte. Der Katalog gibt für dieses Modell 13 GB in Q4 an, also 1 GB mehr als der Speicher einer 3080 mit 12 GB: Das Modell würde auf Grafikspeicher und System-RAM verteilt, und die Geschwindigkeit würde stark sinken. Eine Karte mit 16 GB ist nötig, um es mit voller Geschwindigkeit auszuführen.
Wie viele Tokens pro Sekunde auf einer RTX 3080?+
Die öffentliche Tabelle von llama.cpp nennt 139,7 Tokens pro Sekunde für die 3080 mit 10 GB bei Llama 2 7B in Q4_0. Ein größeres Modell wird langsamer sein: nach theoretischer Schätzung etwa 89 für ein 9B-Modell in Q4 und 76 für ein 12B-Modell in Q4. Die 12-GB-Version und die Ti dürften etwas schneller sein; öffentliche Messungen dazu liegen nicht vor.
Welches Netzteil für eine RTX 3080 Ti?+
NVIDIA gibt für die Karte 350 W an und empfiehlt sowohl für die 3080 als auch für die 3080 Ti ein Systemnetzteil mit 750 W. Ein 650-W-Netzteil liegt unter dieser Empfehlung. Planen Sie auch die passenden Anschlüsse und eine gute Gehäusebelüftung ein, da diese Karten unter Last viel Wärme abgeben.
Funktioniert Ollama auf einer RTX 3080?+
Ja. Ollama führt die RTX 3080 und 3080 Ti unter den Karten mit Compute Capability 8.6 auf und setzt einen Treiber der Version 550 oder neuer voraus. Aktivieren Sie bei der 10-GB-Version Flash Attention und die Quantisierung des K/V-Caches, um bei langen Kontexten Speicher zu sparen.
Lohnt sich die RTX 3080 im Jahr 2026 noch?+
Ja, wenn ihr Gebrauchtpreis weiterhin deutlich unter dem Preis einer neuen Grafikkarte mit vergleichbarer Speicherkapazität liegt. Ihre Geschwindigkeit ist hervorragend, aber entscheidend ist ihre Kapazität von 10 oder 12 GB: Schauen Sie sich die Preisübersicht der Website an und vergleichen Sie sie mit Karten mit 16 GB, bevor Sie sich entscheiden.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.