Welches LLM auf der GTX 1080 Ti (11 GB) ?
Ja: Die GTX 1080 Ti (11 GB, 484 GB/s) bleibt eine der besten Pascal-Karten für ein lokales LLM. Der öffentliche Benchmark von llama.cpp misst 62,49 Tokens/s bei der Generierung mit einem Llama 2 7B in Q4_0. Damit liegt sie auf dem Niveau einer RTX 2060 Super, bietet aber 3 GB mehr Speicher. Ein 8B- oder 9B-Modell in Q4 passt mit Spielraum in ihren Speicher, ein 12B-Modell mit einer moderaten Kontextlänge. Ihre Zukunft hinsichtlich der Softwareunterstützung ist dagegen begrenzt: Pascal wird von CUDA 13 nicht mehr unterstützt.
Die GTX 1080 Ti kam im März 2017 mit 11 GB GDDR5X und einem 352-Bit-Speicherbus auf den Markt. Diese Speicherkapazität war lange selten und verschafft ihr noch heute einen Vorteil gegenüber Karten mit 8 GB. Dieser Leitfaden beziffert, was dieser Speicher heute ermöglicht, erläutert die Ergebnisse öffentlich verfügbarer Messungen und korrigiert eine verbreitete Annahme: FP16 ist auf einer Pascal-Karte nicht „zweimal langsamer“, sondern nahezu unbrauchbar. Für quantisierte Modelle spielt das jedoch kaum eine Rolle.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Die GTX 1080 Ti im Jahr 2026: Was sie hat, was sie nicht hat
Die GTX 1080 Ti ist eine Pascal-Karte (Chip GP102) mit 3 584 CUDA-Kernen, 11 GB GDDR5X und 484 GB/s Bandbreite sowie einer Leistungsaufnahme von 250 W. Im öffentlichen llama.cpp-Benchmark erzielt sie mit einem Llama 2 7B in Q4_0 bei der Generierung 62,49 Tokens/s und bei der Verarbeitung des Prompts 1 084,41 Tokens/s. Diese Ergebnisse bringen sie bei der Generierung auf das Niveau einer RTX 2060 Super, wobei sie 3 GB mehr Speicher bietet: Diese Kapazität ist es, die mehr als die Geschwindigkeit weiterhin das Interesse an der Karte rechtfertigt.
| Element | Wert |
|---|---|
| Chip | GP102-350, Pascal |
| CUDA-Kerne | 3 584 |
| Speicher | 11 GB GDDR5X, 352-Bit-Bus |
| Bandbreite | 484 GB/s |
| FP32-Berechnungsleistung | 10 609 GFLOPS |
| FP16-Rechenleistung | 166 GFLOPS |
| Thermische Auslegungsleistung (TDP) | 250 W |
Die Tabelle enthält bereits die wichtigste Information: Die FP16-Rechenleistung beträgt auf dieser Karte etwa 1/64 der FP32-Rechenleistung. Der folgende Absatz erklärt, warum sich das weniger nachteilig auswirkt, als man denkt.
#Die Grenzen von Pascal: Was zählt und was nicht
Drei Einschränkungen bestehen tatsächlich. Die erste ist das Fehlen von Tensor Cores, den mit Volta und Turing eingeführten Recheneinheiten für Matrixoperationen: Sie beschleunigen das Einlesen des Prompts und das Training, nicht die Generierung, die von der Speicherleistung abhängt. Die zweite ist der lächerlich niedrige FP16-Durchsatz bei Pascal-GPUs für den Endverbrauchermarkt (etwa 166 GFLOPS gegenüber 10.609 bei FP32): Inferenz-Engines wie llama.cpp umgehen das Problem, indem sie quantisierte Modelle mit Ganzzahlarithmetik berechnen. Die dritte ist das Ende der Softwareunterstützung, auf das weiter unten eingegangen wird.
Zwei oft wiederholte Aussagen sind falsch. FP16 ist nicht einfach doppelt so langsam, sondern sechzigmal langsamer. Und Flash Attention ist nicht auf Tensor Cores beschränkt: Im llama.cpp-Benchmark läuft die 1080 Ti mit aktivierter Flash Attention mit 1 138,14 Tokens/s bei der Prompt-Verarbeitung und 61,38 Tokens/s bei der Generierung, gegenüber 1 084,41 und 62,49 ohne Flash Attention. Der Durchsatzgewinn ist gering, aber die Funktion ist verfügbar und reduziert den Speicherbedarf des Kontexts.
#Was 11 GB ermöglichen: die Entscheidungstabelle
Die Richtwerte der Website veranschlagen für ein 8B-Modell in Q4 etwa 5 GB und für ein 14B-Modell etwa 9 GB, jeweils ohne KV-Cache. Bei 11 GB lässt ein 12B-Modell 4 GB Reserve, ein 14B-Modell nur 2 GB. Die Tabelle überträgt die auf dem Teststand beobachtete Effizienz (49 % der theoretischen Obergrenze von 484 GB/s, also 62,49 Tokens/s bei 3,82 GB Modellgewichten) auf gängige Modelle: Es handelt sich um Hochrechnungen, nicht um Messungen.
| Modell (Q4) | Modellgröße | Speicherreserve bei 11 GB | Obergrenze bei 484 GB/s | Schätzung |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6,4 GB | 105 Token/s | etwa 51 Tokens pro Sekunde |
| Qwen3.5 9B | 6 GB | 5 GB | 81 Tokens/s | etwa 40 Token pro Sekunde |
| Gemma 4 12B | 7 GB | 4 GB | 69 Tokens/s | etwa 34 tokens/s |
| Phi-4 14B | 9 GB | 2 GB | 54 Tokens/s | etwa 26 Tokens pro Sekunde, kurzer Kontext |
| Gemma 4 26B-A4B (MoE) | 16 GB | negativ | passt nicht vollständig in den GPU-Speicher | außer Reichweite |
Am interessantesten ist die 12B-Klasse: Das ist das größte Modell, das noch komfortabel läuft, mit einem Kontext von mehreren Tausend Tokens. Auf einer Grafikkarte mit 8 GB lässt dasselbe Modell kaum 1 GB frei und zwingt dazu, den Kontext drastisch zu verkleinern. Darüber hinaus passt ein 14B-Modell in Q4 noch hinein, aber ohne Spielraum, und ein Modell mit 30 Milliarden Parametern passt nicht hinein.
#Was die öffentlichen Benchmarks sagen
QuelLLM testet diese Karte nicht. Der Benchmark in der Diskussion „Performance of llama.cpp on Nvidia CUDA“ vergleicht alle Karten mit demselben Modell. So lässt sich die 1080 Ti im Vergleich zu benachbarten Karten einordnen.
| Karte | Speicher | Prompt (pp512) | Generation (tg128) |
|---|---|---|---|
| GTX 1080 Ti | 11 GB GDDR5X, 352 Bit | 1 084,41 Tokens/s | 62,49 tokens/s |
| Tesla P40 (Pascal) | 24 GB GDDR5, 384 Bit | 1 007,42 tokens/s | 54,74 Token/s |
| RTX 2060 Super | 8 GB GDDR6, 256 Bit | 1 420,24 Token/s | 60,04 Tokens/s |
| RTX 3060 | 12 GB GDDR6, 192 Bit | 2 137,50 Tokens pro Sekunde | 75,57 Tokens pro Sekunde |
| RTX 2080 Ti | 11 GB GDDR6, 352 Bit | 2 890,66 Tokens/s | 107,51 Token/s |
Drei Lesegeschwindigkeiten werden ermittelt. Bei der Generierung entspricht die 1080 Ti der RTX 2060 Super und liegt 17 % hinter einer RTX 3060 mit 12 GB. Bei der Prompt-Lesung wird der Unterschied größer: Die RTX 3060 kommt fast doppelt so schnell voran, die RTX 2080 Ti mit gleicher Kapazität übertrifft sie sogar um 2,7-mal. Schließlich erreicht die Tesla P40, eine Pascal-Karte mit 24 GB, 54,74 Tokens/s: Sie zeigt, dass eine Kapazität von 24 GB auf dieser Architektur erreichbar ist, mit einem Durchsatz unter dem der 1080 Ti.
#Die 11 GB nutzen: weniger stark quantisieren
Ein besonderer Vorteil der 11 GB ist, dass sich die Qualität statt der Modellgröße steigern lässt. Der QuelLLM-Katalog nennt für Granite 4.2 8B folgende Größen: 4,6 GB in Q4, 6 GB in Q5 und 9 GB in Q8. Bei 8 GB lässt nur Q4 noch Speicherreserven. Bei 11 GB bleibt mit Q5 (6 GB) reichlich Spielraum, und Q8 (9 GB) passt mit einem kurzen Kontext.
| Quantisierung | Modellgröße | Spielraum | Obergrenze bei 484 GB/s |
|---|---|---|---|
| Q4 | 4,6 GB | 6,4 GB | 105 Token/s |
| Q5 | 6 GB | 5 GB | 81 Tokens/s |
| Q8 | 9 GB | 2 GB | 54 Tokens/s |
Der Kompromiss ist klar: Jede Quantisierungsstufe verringert die Fehler des Modells, verlangsamt aber die Generierung, weil für jedes Token mehr Gewichte erneut gelesen werden. Für gewöhnliche Chats ist Q5 ein guter Mittelweg; Q8 lohnt sich für höhere Genauigkeit (Extraktion, Code), wenn der Durchsatz wenig wichtig ist. Der Quantisierungsleitfaden erläutert den Qualitätsunterschied im Detail.
#Zwei Karten für 22 GB: möglich, muss aber geprüft werden
Die llama.cpp-Benchmarksuite weist in ihren Anweisungen darauf hin, dass Mitwirkende mit mehreren GPUs mit -sm none -mg die Nutzung einer einzigen GPU erzwingen müssen, sofern das Modell nicht zu groß für den VRAM ist: Die Engine verteilt ein Modell also tatsächlich auf mehrere Karten. Zwei GTX 1080 Ti würden 22 GB für die Modellgewichte bieten, genug für ein Modell mit 32 Milliarden Parametern in Q4 (19 bis 20 GB laut dem Richtwert dieser Website), ohne Spielraum für den Kontext.
Durch die Aufteilung addieren sich die Geschwindigkeiten nicht: Die Schichten werden auf die Karten verteilt und über den PCIe-Bus übertragen, was den Zugewinn begrenzt. Dieser Aufbau erfordert außerdem ein geeignetes Gehäuse, ein geeignetes Netzteil und ein geeignetes Mainboard und verdoppelt die Betroffenheit vom Ende des Pascal-Supports. Für ein Projekt, das 24 GB benötigt, vergleichen Sie zunächst die Kosten einer einzelnen neueren Karte.
#In vier Schritten installieren und überprüfen
- 01Den Treiber prüfenStarten Sie nvidia-smi. Für Karten mit Compute Capability 5.0 bis 6.2, wie die GTX 1080 Ti, erfordert die Dokumentation von Ollama einen Treiber der Version 570 oder neuer.
- 02Ollama installierenFolgen Sie der Installationsanleitung für Ihr System. Ollama führt die Karte in seiner offiziellen Liste als GTX 1080 Ti (Compute Capability 6.1) auf.
- 03Ein passendes Modell auswählenBeginnen Sie mit einem 8B-Modell in Q4, um das Zusammenspiel der Komponenten zu prüfen, und testen Sie anschließend ein 12B-Modell mit einem Kontext von 4.096 Tokens.
- 04Platzierung prüfenFühren Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen. Andernfalls verkleinern Sie das Kontextfenster oder wählen Sie ein kleineres Modell.
Wenn das Laden fehlschlägt, suchen Sie nicht nach einer exotischen Variable zur Umgehung des Problems: Ollama aktiviert Flash Attention automatisch, wenn die Engine und die Grafikkarte dies unterstützen, und die dokumentierte Variable lautet OLLAMA_FLASH_ATTENTION (1 zum Erzwingen, 0 zum Deaktivieren). Der Leitfaden zur Fehlerbehebung erläutert die häufigsten Fehler.
- Schritt-für-Schritt-Installation von Ollama
- Ollama-Probleme beheben: GPU nicht erkannt, langsame Ausführung
#Ende des Lebenszyklus von Pascal: Was man planen muss
Die Versionsnotizen von CUDA 13 zeigen, dass Maxwell, Pascal und Volta nicht mehr unterstützt werden. Wikipedia berichtet, dass NVIDIA im Dezember 2025 den Game Ready-Support für diese Architekturen beendet hat und Sicherheitsupdates bis Oktober 2028 bereitstellt. Heute funktioniert die GTX 1080 Ti mit Ollama und einem Treiber 570 oder neuer: Es besteht die Gefahr, dass zukünftige Inferenzmotoren ausschließlich CUDA 13 unterstützen. Notieren Sie Ihre Treiber- und Ollama-Versionen vor jeder Aktualisierung.
#Fazit: behalten, ja; kaufen, unter bestimmten Bedingungen
| Ihre Situation | Empfehlung |
|---|---|
| Sie besitzen bereits eine 1080 Ti | Behalten: 8–12B-Modelle laufen problemlos, 62 Tokens/s im Benchmark |
| Sie möchten ein 12B-Modell mit Kontext nutzen, ohne Geld auszugeben | Sie ist geeignet: 11 GB, 4 GB Reserve |
| Sie arbeiten mit langen Dokumenten oder RAG | Eine Ampere- oder Turing-Karte liest den Prompt 2 bis 3 Mal schneller |
| Sie suchen nach einer Anschaffung, die langfristig Bestand hat | Turing oder neuer anstreben: CUDA 13 unterstützt Pascal nicht mehr als Zielarchitektur |
| Sie möchten 16 GB oder mehr | In eine andere Leistungsklasse wechseln: Die 1080 Ti ist auf 11 GB begrenzt |
Um die aktuellen Optionen zu vergleichen, ohne Preise aufzulisten, die sich jede Woche ändern, nennen die Seiten dieser Website die für die jeweilige Speicherkapazität geeigneten Modelle und verweisen auf die Seite mit den Grafikkartenpreisen.
- Welches LLM für RTX 3060 12 GB
- Welches LLM auf einer RTX 2080 Ti (11 GB)?
- Welche Modelle eignen sich für 12 GB VRAM – für alle Grafikkarten
- GPU-Preise für KI vergleichen
- Quelle: Öffentlicher llama.cpp-Benchmark auf CUDA
- Quelle: Ollama-Dokumentation, unterstützte NVIDIA-Hardware
- Quelle: GeForce-10-Serie, Spezifikationen
- Quelle: Versionshinweise des CUDA Toolkits
Kann die GTX 1080 Ti 2026 noch ein LLM ausführen?+
GTX 1080 Ti oder RTX 2060 Super für ein LLM?+
Ist die GTX 1080 Ti langsamer als die RTX 3060 für ein LLM?+
Unterstützt die 1080 Ti Flash Attention?+
Welchen Treiber benötigt man für die GTX 1080 Ti mit Ollama?+
Wann sollte die GTX 1080 Ti ersetzt werden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.