Einsteiger 11 Min.GTX 10

Welches LLM auf der GTX 1080 Ti (11 GB) ?

Direkte Antwort

Ja: Die GTX 1080 Ti (11 GB, 484 GB/s) bleibt eine der besten Pascal-Karten für ein lokales LLM. Der öffentliche Benchmark von llama.cpp misst 62,49 Tokens/s bei der Generierung mit einem Llama 2 7B in Q4_0. Damit liegt sie auf dem Niveau einer RTX 2060 Super, bietet aber 3 GB mehr Speicher. Ein 8B- oder 9B-Modell in Q4 passt mit Spielraum in ihren Speicher, ein 12B-Modell mit einer moderaten Kontextlänge. Ihre Zukunft hinsichtlich der Softwareunterstützung ist dagegen begrenzt: Pascal wird von CUDA 13 nicht mehr unterstützt.

Die GTX 1080 Ti kam im März 2017 mit 11 GB GDDR5X und einem 352-Bit-Speicherbus auf den Markt. Diese Speicherkapazität war lange selten und verschafft ihr noch heute einen Vorteil gegenüber Karten mit 8 GB. Dieser Leitfaden beziffert, was dieser Speicher heute ermöglicht, erläutert die Ergebnisse öffentlich verfügbarer Messungen und korrigiert eine verbreitete Annahme: FP16 ist auf einer Pascal-Karte nicht „zweimal langsamer“, sondern nahezu unbrauchbar. Für quantisierte Modelle spielt das jedoch kaum eine Rolle.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Die GTX 1080 Ti im Jahr 2026: Was sie hat, was sie nicht hat

Die GTX 1080 Ti ist eine Pascal-Karte (Chip GP102) mit 3 584 CUDA-Kernen, 11 GB GDDR5X und 484 GB/s Bandbreite sowie einer Leistungsaufnahme von 250 W. Im öffentlichen llama.cpp-Benchmark erzielt sie mit einem Llama 2 7B in Q4_0 bei der Generierung 62,49 Tokens/s und bei der Verarbeitung des Prompts 1 084,41 Tokens/s. Diese Ergebnisse bringen sie bei der Generierung auf das Niveau einer RTX 2060 Super, wobei sie 3 GB mehr Speicher bietet: Diese Kapazität ist es, die mehr als die Geschwindigkeit weiterhin das Interesse an der Karte rechtfertigt.

Spezifikationen (Wikipedia, GeForce 10 series)
ElementWert
ChipGP102-350, Pascal
CUDA-Kerne3 584
Speicher11 GB GDDR5X, 352-Bit-Bus
Bandbreite484 GB/s
FP32-Berechnungsleistung10 609 GFLOPS
FP16-Rechenleistung166 GFLOPS
Thermische Auslegungsleistung (TDP)250 W

Die Tabelle enthält bereits die wichtigste Information: Die FP16-Rechenleistung beträgt auf dieser Karte etwa 1/64 der FP32-Rechenleistung. Der folgende Absatz erklärt, warum sich das weniger nachteilig auswirkt, als man denkt.

#Die Grenzen von Pascal: Was zählt und was nicht

Drei Einschränkungen bestehen tatsächlich. Die erste ist das Fehlen von Tensor Cores, den mit Volta und Turing eingeführten Recheneinheiten für Matrixoperationen: Sie beschleunigen das Einlesen des Prompts und das Training, nicht die Generierung, die von der Speicherleistung abhängt. Die zweite ist der lächerlich niedrige FP16-Durchsatz bei Pascal-GPUs für den Endverbrauchermarkt (etwa 166 GFLOPS gegenüber 10.609 bei FP32): Inferenz-Engines wie llama.cpp umgehen das Problem, indem sie quantisierte Modelle mit Ganzzahlarithmetik berechnen. Die dritte ist das Ende der Softwareunterstützung, auf das weiter unten eingegangen wird.

Zwei oft wiederholte Aussagen sind falsch. FP16 ist nicht einfach doppelt so langsam, sondern sechzigmal langsamer. Und Flash Attention ist nicht auf Tensor Cores beschränkt: Im llama.cpp-Benchmark läuft die 1080 Ti mit aktivierter Flash Attention mit 1 138,14 Tokens/s bei der Prompt-Verarbeitung und 61,38 Tokens/s bei der Generierung, gegenüber 1 084,41 und 62,49 ohne Flash Attention. Der Durchsatzgewinn ist gering, aber die Funktion ist verfügbar und reduziert den Speicherbedarf des Kontexts.

!
Weder FP8 noch FP4
Neuere hardwarebasierte Quantisierungsformate (FP8, FP4) erfordern neuere Grafikkarten. Bleiben Sie auf der 1080 Ti bei den klassischen GGUF-Quantisierungen (Q4_K_M, Q5_K_M, Q8_0), die mit Ganzzahlberechnungen arbeiten.

#Was 11 GB ermöglichen: die Entscheidungstabelle

Die Richtwerte der Website veranschlagen für ein 8B-Modell in Q4 etwa 5 GB und für ein 14B-Modell etwa 9 GB, jeweils ohne KV-Cache. Bei 11 GB lässt ein 12B-Modell 4 GB Reserve, ein 14B-Modell nur 2 GB. Die Tabelle überträgt die auf dem Teststand beobachtete Effizienz (49 % der theoretischen Obergrenze von 484 GB/s, also 62,49 Tokens/s bei 3,82 GB Modellgewichten) auf gängige Modelle: Es handelt sich um Hochrechnungen, nicht um Messungen.

Modelle für 11 GB, theoretische Obergrenze und Hochrechnung bei 49 % Effizienz
Modell (Q4)ModellgrößeSpeicherreserve bei 11 GBObergrenze bei 484 GB/sSchätzung
Granite 4.2 8B4,6 GB6,4 GB105 Token/setwa 51 Tokens pro Sekunde
Qwen3.5 9B6 GB5 GB81 Tokens/setwa 40 Token pro Sekunde
Gemma 4 12B7 GB4 GB69 Tokens/setwa 34 tokens/s
Phi-4 14B9 GB2 GB54 Tokens/setwa 26 Tokens pro Sekunde, kurzer Kontext
Gemma 4 26B-A4B (MoE)16 GBnegativpasst nicht vollständig in den GPU-Speicheraußer Reichweite

Am interessantesten ist die 12B-Klasse: Das ist das größte Modell, das noch komfortabel läuft, mit einem Kontext von mehreren Tausend Tokens. Auf einer Grafikkarte mit 8 GB lässt dasselbe Modell kaum 1 GB frei und zwingt dazu, den Kontext drastisch zu verkleinern. Darüber hinaus passt ein 14B-Modell in Q4 noch hinein, aber ohne Spielraum, und ein Modell mit 30 Milliarden Parametern passt nicht hinein.

#Was die öffentlichen Benchmarks sagen

QuelLLM testet diese Karte nicht. Der Benchmark in der Diskussion „Performance of llama.cpp on Nvidia CUDA“ vergleicht alle Karten mit demselben Modell. So lässt sich die 1080 Ti im Vergleich zu benachbarten Karten einordnen.

Benchmark mit llama.cpp CUDA, Llama 2 7B Q4_0, ohne Flash Attention
KarteSpeicherPrompt (pp512)Generation (tg128)
GTX 1080 Ti11 GB GDDR5X, 352 Bit1 084,41 Tokens/s62,49 tokens/s
Tesla P40 (Pascal)24 GB GDDR5, 384 Bit1 007,42 tokens/s54,74 Token/s
RTX 2060 Super8 GB GDDR6, 256 Bit1 420,24 Token/s60,04 Tokens/s
RTX 306012 GB GDDR6, 192 Bit2 137,50 Tokens pro Sekunde75,57 Tokens pro Sekunde
RTX 2080 Ti11 GB GDDR6, 352 Bit2 890,66 Tokens/s107,51 Token/s

Drei Lesegeschwindigkeiten werden ermittelt. Bei der Generierung entspricht die 1080 Ti der RTX 2060 Super und liegt 17 % hinter einer RTX 3060 mit 12 GB. Bei der Prompt-Lesung wird der Unterschied größer: Die RTX 3060 kommt fast doppelt so schnell voran, die RTX 2080 Ti mit gleicher Kapazität übertrifft sie sogar um 2,7-mal. Schließlich erreicht die Tesla P40, eine Pascal-Karte mit 24 GB, 54,74 Tokens/s: Sie zeigt, dass eine Kapazität von 24 GB auf dieser Architektur erreichbar ist, mit einem Durchsatz unter dem der 1080 Ti.

i
Generierung versus Einlesen des Prompts
Bei Chats mit kurzen Nachrichten dominiert die Generierung, und die 1080 Ti kann gut mithalten. Beim Zusammenfassen langer Dokumente oder bei RAG kommt es auf die Verarbeitung des Prompts an: Turing- und Ampere-Karten sind dabei um den Faktor 2 bis 3 schneller.

#Die 11 GB nutzen: weniger stark quantisieren

Ein besonderer Vorteil der 11 GB ist, dass sich die Qualität statt der Modellgröße steigern lässt. Der QuelLLM-Katalog nennt für Granite 4.2 8B folgende Größen: 4,6 GB in Q4, 6 GB in Q5 und 9 GB in Q8. Bei 8 GB lässt nur Q4 noch Speicherreserven. Bei 11 GB bleibt mit Q5 (6 GB) reichlich Spielraum, und Q8 (9 GB) passt mit einem kurzen Kontext.

Granite 4.2 8B bei verschiedenen Quantisierungen mit 11 GB Speicher
QuantisierungModellgrößeSpielraumObergrenze bei 484 GB/s
Q44,6 GB6,4 GB105 Token/s
Q56 GB5 GB81 Tokens/s
Q89 GB2 GB54 Tokens/s

Der Kompromiss ist klar: Jede Quantisierungsstufe verringert die Fehler des Modells, verlangsamt aber die Generierung, weil für jedes Token mehr Gewichte erneut gelesen werden. Für gewöhnliche Chats ist Q5 ein guter Mittelweg; Q8 lohnt sich für höhere Genauigkeit (Extraktion, Code), wenn der Durchsatz wenig wichtig ist. Der Quantisierungsleitfaden erläutert den Qualitätsunterschied im Detail.

#Zwei Karten für 22 GB: möglich, muss aber geprüft werden

Die llama.cpp-Benchmarksuite weist in ihren Anweisungen darauf hin, dass Mitwirkende mit mehreren GPUs mit -sm none -mg die Nutzung einer einzigen GPU erzwingen müssen, sofern das Modell nicht zu groß für den VRAM ist: Die Engine verteilt ein Modell also tatsächlich auf mehrere Karten. Zwei GTX 1080 Ti würden 22 GB für die Modellgewichte bieten, genug für ein Modell mit 32 Milliarden Parametern in Q4 (19 bis 20 GB laut dem Richtwert dieser Website), ohne Spielraum für den Kontext.

Durch die Aufteilung addieren sich die Geschwindigkeiten nicht: Die Schichten werden auf die Karten verteilt und über den PCIe-Bus übertragen, was den Zugewinn begrenzt. Dieser Aufbau erfordert außerdem ein geeignetes Gehäuse, ein geeignetes Netzteil und ein geeignetes Mainboard und verdoppelt die Betroffenheit vom Ende des Pascal-Supports. Für ein Projekt, das 24 GB benötigt, vergleichen Sie zunächst die Kosten einer einzelnen neueren Karte.

#In vier Schritten installieren und überprüfen

  1. 01
    Den Treiber prüfen
    Starten Sie nvidia-smi. Für Karten mit Compute Capability 5.0 bis 6.2, wie die GTX 1080 Ti, erfordert die Dokumentation von Ollama einen Treiber der Version 570 oder neuer.
  2. 02
    Ollama installieren
    Folgen Sie der Installationsanleitung für Ihr System. Ollama führt die Karte in seiner offiziellen Liste als GTX 1080 Ti (Compute Capability 6.1) auf.
  3. 03
    Ein passendes Modell auswählen
    Beginnen Sie mit einem 8B-Modell in Q4, um das Zusammenspiel der Komponenten zu prüfen, und testen Sie anschließend ein 12B-Modell mit einem Kontext von 4.096 Tokens.
  4. 04
    Platzierung prüfen
    Führen Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen. Andernfalls verkleinern Sie das Kontextfenster oder wählen Sie ein kleineres Modell.

Wenn das Laden fehlschlägt, suchen Sie nicht nach einer exotischen Variable zur Umgehung des Problems: Ollama aktiviert Flash Attention automatisch, wenn die Engine und die Grafikkarte dies unterstützen, und die dokumentierte Variable lautet OLLAMA_FLASH_ATTENTION (1 zum Erzwingen, 0 zum Deaktivieren). Der Leitfaden zur Fehlerbehebung erläutert die häufigsten Fehler.

#Ende des Lebenszyklus von Pascal: Was man planen muss

Die Versionsnotizen von CUDA 13 zeigen, dass Maxwell, Pascal und Volta nicht mehr unterstützt werden. Wikipedia berichtet, dass NVIDIA im Dezember 2025 den Game Ready-Support für diese Architekturen beendet hat und Sicherheitsupdates bis Oktober 2028 bereitstellt. Heute funktioniert die GTX 1080 Ti mit Ollama und einem Treiber 570 oder neuer: Es besteht die Gefahr, dass zukünftige Inferenzmotoren ausschließlich CUDA 13 unterstützen. Notieren Sie Ihre Treiber- und Ollama-Versionen vor jeder Aktualisierung.

#Fazit: behalten, ja; kaufen, unter bestimmten Bedingungen

Entscheidung je nach Ihrer Situation
Ihre SituationEmpfehlung
Sie besitzen bereits eine 1080 TiBehalten: 8–12B-Modelle laufen problemlos, 62 Tokens/s im Benchmark
Sie möchten ein 12B-Modell mit Kontext nutzen, ohne Geld auszugebenSie ist geeignet: 11 GB, 4 GB Reserve
Sie arbeiten mit langen Dokumenten oder RAGEine Ampere- oder Turing-Karte liest den Prompt 2 bis 3 Mal schneller
Sie suchen nach einer Anschaffung, die langfristig Bestand hatTuring oder neuer anstreben: CUDA 13 unterstützt Pascal nicht mehr als Zielarchitektur
Sie möchten 16 GB oder mehrIn eine andere Leistungsklasse wechseln: Die 1080 Ti ist auf 11 GB begrenzt

Um die aktuellen Optionen zu vergleichen, ohne Preise aufzulisten, die sich jede Woche ändern, nennen die Seiten dieser Website die für die jeweilige Speicherkapazität geeigneten Modelle und verweisen auf die Seite mit den Grafikkartenpreisen.

FAQ
Kann die GTX 1080 Ti 2026 noch ein LLM ausführen?+
Ja. Der öffentliche Benchmark von llama.cpp misst 62,49 Tokens/s bei einem 7B-Modell in Q4_0. In die 11 GB der Karte passen ein 8B- oder 9B-Modell mit Speicherreserve sowie ein 12B-Modell mit einem kleinen Kontext. Die Karte bleibt eine sinnvolle Option, solange die Tools Pascal unterstützen.
GTX 1080 Ti oder RTX 2060 Super für ein LLM?+
Bei der Generierung sind sie gleichwertig: 62,49 gegenüber 60,04 Tokens/s im Benchmark. Die 1080 Ti verfügt über 3 GB mehr Speicher, was bei einem 12B-Modell ins Gewicht fällt; die 2060 Super verarbeitet den Prompt schneller (1.420 gegenüber 1.084 Tokens/s) und wird weiterhin von CUDA 13 unterstützt.
Ist die GTX 1080 Ti langsamer als die RTX 3060 für ein LLM?+
Ja, um 17 % bei der Generierung (62,49 gegenüber 75,57 Tokens/s) und um fast die Hälfte bei der Verarbeitung des Prompts (1.084 gegenüber 2.137 Tokens/s). Die 3060 hat nur 12 GB gegenüber 11 GB: Der Kapazitätsvorteil ist gering. Die 3060 punktet vor allem mit ihrer längeren Softwareunterstützung.
Unterstützt die 1080 Ti Flash Attention?+
Ja. Der llama.cpp-Benchmark misst mit Flash Attention 1 138,14 Tokens/s beim Prompt-Lesen und 61,38 bei der Generierung. Die Verbesserung der Durchsatzrate ist gering, aber die Funktion reduziert den Speicherbedarf des Kontexts. Ollama aktiviert sie automatisch, wenn die Karte dies unterstützt.
Welchen Treiber benötigt man für die GTX 1080 Ti mit Ollama?+
Laut der Ollama-Dokumentation ist für Grafikkarten mit Compute Capability 5.0 bis 6.2, darunter die GTX 1080 Ti, ein NVIDIA-Treiber der Version 570 oder neuer erforderlich. Prüfen Sie Ihre Version vor der Installation mit nvidia-smi. NVIDIA plant Sicherheitsupdates für den 580er-Zweig bis Oktober 2028, jedoch keine neuen Optimierungen.
Wann sollte die GTX 1080 Ti ersetzt werden?+
Wenn ein Tool, das Sie benötigen, Pascal nicht mehr unterstützt oder wenn Ihre Nutzung mehr als 11 GB oder eine schnelle Verarbeitung des Prompts erfordert, etwa bei langen Dokumenten und RAG. CUDA 13 hat die Unterstützung für Pascal bereits eingestellt: Darauf sollten Sie bei jedem Update von Ollama oder llama.cpp achten.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.