Welches LLM auf GTX 1070 / 1080 (8 GB) ?
Ja: Eine GTX 1070, 1070 Ti oder 1080 mit 8 GB kann ein Modell mit 7 bis 9 Milliarden Parametern in Q4 bei einer angemessenen Kontextlänge problemlos ausführen. Der öffentliche Benchmark von llama.cpp misst auf einer GTX 1070 Ti mit einem 7B-Modell in Q4_0 37,82 Tokens/s; die 1080 mit ihrem schnelleren Speicher dürfte besser abschneiden, allerdings liegt keine direkte Messung vor. Bei mehr als 9 Milliarden Parametern reichen die 8 GB nicht mehr aus, und die Pascal-Architektur hat softwareseitig keine Zukunft mehr.
Die GTX 1070 (Juni 2016), 1070 Ti (November 2017) und 1080 (Mai 2016) haben denselben GP104-Chip und 8 GB Speicher. Sie sind zu den attraktivsten Gebrauchtkarten geworden, um ein lokales LLM auszuprobieren, ohne Geld auszugeben. Dieser Leitfaden beziffert, was ihr Speicher ermöglicht, erläutert, was öffentliche Messungen über ihre Geschwindigkeit aussagen, und erklärt, warum das Datum des Supportendes für Pascal stärker ins Gewicht fällt als der Preis.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#GTX 1070, 1070 Ti, 1080: Worin sie sich für ein LLM unterscheiden
Für ein LLM haben diese drei Karten dieselbe Kapazität von 8 GB und unterscheiden sich durch die Speicherbandbreite, die die Generierungsgeschwindigkeit bestimmt. Die 1070 und die 1070 Ti verwenden GDDR5 mit einem 256-Bit-Speicherbus, also 256 GB/s; die 1080 erreicht mit GDDR5X 320 GB/s. Da ein LLM bei jedem Token alle seine Gewichte erneut liest, schlägt sich dieser Unterschied von 25 % nahezu direkt in der Geschwindigkeit nieder – deutlich stärker als die 2.560 Kerne der 1080 gegenüber den 1.920 Kernen der 1070. Keine der Karten hat Tensor Cores: Pascal setzt weiterhin auf klassische CUDA-Berechnungen.
| Karte | CUDA-Kerne | Speicher | Bandbreite | Gemessener Durchsatz (7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | nicht auf dem Teststand gemessen |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37,82 Tokens/s |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | nicht auf dem Teststand gemessen |
Eine GTX 1080 Ti mit 11 GB und 484 GB/s gehört zu einer anderen Kategorie: Sie hat ihre eigene Seite. Wenn Ihre Karte eine 1080 Ti ist, lesen Sie stattdessen den ihr gewidmeten Leitfaden.
#Was 8 GB tatsächlich ermöglichen
Entscheidend ist das Verhältnis zwischen der Größe der Modellgewichte und dem verfügbaren Speicher, da der KV-Cache noch hinzukommt. Der Richtwert dieser Website liegt für ein 7–8B-Modell in Q4 bei etwa 5 GB für die Gewichte: Bei 8 GB bleiben ungefähr 3 GB für den Kontext und das System, also ein echter Puffer. Ein 9B-Modell in Q4 mit 6 GB lässt 2 GB übrig: Mit einem kurzen Kontext ist das möglich. Bei 12 Milliarden Parametern benötigen die Gewichte 7 GB: Es bleibt fast nichts übrig.
| Modell (Q4) | Modellgröße | Spielraum bei 8 GB | Grenze von 256 GB/s | Obergrenze bei 320 GB/s |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128 Token pro Sekunde | 160 Tokens/s |
| Granite 4.2 8B | 4,6 GB | 3,4 GB | 55 Tokens pro Sekunde | 70 Token/s |
| Qwen3.5 9B | 6 GB | 2 GB | 43 tokens/s | 53 Tokens/s |
| Gemma 4 12B | 7 GB | 1 GB | nicht empfohlen | nicht empfohlen |
| Phi-4 14B | 9 GB | negativ | passt nicht vollständig in den GPU-Speicher | passt nicht vollständig in den GPU-Speicher |
Eine theoretische Obergrenze wird nie erreicht. Im öffentlichen Benchmark erreicht die GTX 1070 Ti mit einem 3,56 GiB großen Modell 37,82 Tokens/s, also etwa 56 % ihrer Obergrenze von 256 GB/s. Überträgt man denselben Wirkungsgrad auf die oben genannten Modelle, würde Granite 4.2 8B auf einer 1070 Ti etwa 30 Tokens/s erreichen: Das ist eine proportionale Extrapolation, keine Messung.
#Was die öffentlichen Benchmarks sagen
QuelLLM testet diese Karten nicht. Die Zahlen stammen aus der Diskussion „Performance of llama.cpp on Nvidia CUDA“ im llama.cpp-Repository, in der jeder Mitwirkende llama-bench mit Llama 2 7B in Q4_0 ausführt, wobei alle Schichten auf der GPU liegen. Die GTX 1070 Ti erreicht dort 714,44 Tokens/s bei der Promptverarbeitung und 37,82 Tokens/s bei der Generierung.
Bei den Karten auf derselben Seite, für die Messwerte vorliegen, ist ein Vergleich hilfreich: Die RTX 2060 Super, eine Turing-Karte mit 8 GB und einem 256-Bit-Speicherbus, erzeugt im selben Test 60,04 Tokens/s, gegenüber 37,82 bei der 1070 Ti. Bei ähnlicher Speicherbandbreite beträgt der Zugewinn 59 %. Der Benchmark erklärt den Unterschied also besser als die Kerne oder der Preis: Turing nutzt seinen Speicher besser aus.
| Karte | Speicher | Prompt (pp512) | Generation (tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5, 256 Bit | 714,44 Tokens pro Sekunde | 37,82 Tokens/s |
| RTX 2060 Super | 8 GB GDDR6, 256 Bit | 1 420,24 Token/s | 60,04 Tokens/s |
| GTX 1080 Ti | 11 GB GDDR5X, 352 Bit | 1 084,41 Tokens/s | 62,49 tokens/s |
Bei der Interpretation dieser Zahlen sind drei Vorbehalte zu beachten. Jede Zeile des Benchmarks ist ein individueller Beitrag: Treiber, System, Kühlung und Kartenhersteller unterscheiden sich von einem Beitragenden zum anderen, was Abweichungen um einige Punkte bei demselben Chip erklärt. Das Testmodell, ein Llama 2 7B, ist älter und kleiner als aktuelle Modelle: Es dient als gemeinsamer Maßstab, nicht als Vorhersage für ein bestimmtes Modell. Schließlich hängt die Generierung vor allem vom Speicher ab, während die Verarbeitung des Prompts von der Rechenleistung abhängt: Die beiden Spalten sagen also nicht dasselbe aus.
#Die Leistung der GTX 1080 ohne Messung abschätzen: Methode und Grenzen
Die 1080 ist im Benchmark nicht enthalten. Um ihre Leistung abzuschätzen, lässt sich das Verhältnis der Speicherbandbreiten heranziehen: 320 ÷ 256 = 1,25, also etwa 47 Tokens/s (37,82 × 1,25), sofern die Effizienz dieselbe bleibt wie bei der 1070 Ti. Das ist eine plausible Annahme, kein Messergebnis: Treiber, die Version von llama.cpp, die Temperatur oder die Kühlung der Karte beeinflussen den Durchsatz erheblich.
Wenn Sie eine gebrauchte Grafikkarte für diesen Zweck kaufen, bitten Sie den Verkäufer um einen Screenshot eines tatsächlichen Tests oder führen Sie direkt nach Erhalt selbst llama-bench mit dem Modell des Benchmarks aus: Das Ergebnis lässt sich direkt mit der öffentlich zugänglichen Tabelle vergleichen.
#Der Kontext: Wohin die 3 GB Reserve gehen
Bei 8 GB lässt ein Granite 4.2 8B in Q4 etwa 3,4 GB frei. Diese Reserve teilen sich der KV-Cache, der mit jedem Token der Unterhaltung wächst, die Rechenpuffer sowie der Speicherbedarf des Treibers und der Bildschirmausgabe, falls die Grafikkarte auch Ihren Bildschirm ansteuert. Ollama startet mit einem Kontextfenster von 4.096 Tokens, das über die Variable OLLAMA_CONTEXT_LENGTH geändert werden kann; eine Verdopplung des Fensters verdoppelt den KV-Cache.
Eine einfache Entscheidungsregel: Wenn Sie mit langen Dokumenten (16.000 Tokens und mehr) arbeiten möchten, wählen Sie ein Modell mit 3 bis 4 Milliarden Parametern oder ein 8B-Modell mit quantisiertem KV-Cache. Wenn Sie in kurzen Nachrichten chatten, ist das 8B-Modell in Q4 die richtige Wahl. Prüfen Sie in beiden Fällen mit ollama ps, ob das Modell zu 100 % auf der GPU geladen ist: Eine Aufteilung zwischen GPU und Prozessor zeigt an, dass kein Speicherspielraum mehr vorhanden ist.
#Flash Attention auf Pascal: Ist sie nützlich oder nicht?
Ein verbreiteter Irrtum besagt, dass Flash Attention nur für Karten mit Tensor Cores bestimmt ist. Der llama.cpp-Benchmark widerlegt dies: Er testet jede Karte mit und ohne Flash Attention, und die GTX 1080 Ti aus der Pascal-Generation ist in beiden Tabellen aufgeführt. Mit Flash Attention steigt ihre Geschwindigkeit bei der Prompt-Verarbeitung von 1 084,41 auf 1 138,14 Tokens/s, also um etwa 5 %, und sinkt bei der Generierung von 62,49 auf 61,38 Tokens/s, also um 2 %. Der Hauptvorteil von Flash Attention liegt nicht in der Geschwindigkeit, sondern im Speicherbedarf: Flash Attention reduziert den Speicherbedarf des Kontexts, was bei 8 GB wichtig ist.
Ollama aktiviert Flash Attention automatisch, wenn die Engine und die Grafikkarte es unterstützen; OLLAMA_FLASH_ATTENTION=1 erzwingt die Aktivierung, und der Wert 0 deaktiviert Flash Attention. Die Quantisierung des KV-Caches, die den Speicherbedarf des Kontexts weiter reduziert, setzt voraus, dass Flash Attention aktiviert ist.
#Welche Anwendung eignet sich für eine 8 GB Pascal-Karte?
| Nutzung | Eignung | Empfohlene Einstellung |
|---|---|---|
| Chat, Umformulierung, Übersetzung | Gut | Granite 4.2 8B in Q4, Kontext von 4.096 Tokens |
| Codehilfe im Editor | Ordentlich | 7–8B-Modell, mittlere Kontextlänge, nur ein Modell geladen |
| Lange Dokumente zusammenfassen | Eingeschränkt | Modell mit 3–4 Milliarden Parametern oder quantisierter KV-Cache |
| Suche in eigenen Dokumenten (RAG) | Ordentlich | 3–8B-Modell, kurze Auszüge, keine 12B-Modelle |
| Agenten mit verketteten Werkzeugaufrufen | Schwach | Zu viel Kontext und zu viele Anfragen für 8 GB |
#Pascal: Software-Unterstützung als eigentliche Grenze
Das Hauptrisiko liegt nicht in der Geschwindigkeit, sondern in der Software. Ollama erfordert einen NVIDIA-Treiber ab Version 570 für Grafikkarten mit Compute Capability 5.0 bis 6.2; dazu gehören auch die GTX 1070 bis 1080. Die Versionshinweise zu CUDA 13 geben jedoch an, dass die Unterstützung für Pascal entfernt wurde, und Wikipedia weist darauf hin, dass NVIDIA den Game-Ready-Support für diese Generation im Dezember 2025 eingestellt hat, mit Sicherheitsupdates bis Oktober 2028.
- Aujourd'hui
- Ollama und llama.cpp funktionieren mit einem Treiber ab Version 570 und CUDA-12-Builds.
- Morgen
- Die neuen Funktionen und die neuen Engines werden auf CUDA 13 ausgerichtet sein: Jedes Update kann die Unterstützung für Pascal streichen.
- Sicherheit
- Sicherheitspatches für den Treiber gibt es bis Oktober 2028, aber keine neuen Optimierungen.
#Ist eine 1070 Ti die bessere Wahl oder doch etwas anderes?
Bei gleichem Budget für einen Gebrauchtkauf erfolgt der Vergleich anhand von drei Kriterien: Speicher (mindestens 8 GB), Architekturgeneration (Turing oder neuer, um CUDA 13 nutzen zu können) und Bandbreite. Ohne Preise zu nennen, die sich jede Woche ändern, lassen sich die Optionen wie folgt einordnen.
| Option | Stärken | Nachteile |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080 (bereits vorhanden) | Kostenlos; Modelle mit 7–9 Milliarden Parametern laufen problemlos | Pascal nähert sich dem Supportende, bei gleicher Bandbreite langsamer |
| RTX 2060 Super (8 GB) | 60,04 Tok/s im Benchmark, Turing, Tensor Cores | Weiterhin nur 8 GB |
| RTX 3050 (6 oder 8 GB) | Ampere, langfristige Software-Unterstützung | Je nach Version begrenzte Bandbreite |
| Karte mit 12 GB (RTX 3060 12 GB) | Spielraum für 12–14B und langen Kontext | Höheres Budget |
- Welcher LLM für die RTX 2060 / 2060 Super?
- Welches LLM für RTX 3060 12 GB
- Welche Modelle für 8 GB VRAM – unabhängig von der Grafikkarte?
- GPU-Preise für KI vergleichen
#Fazit: Ausprobieren ja, investieren nein
Wenn Sie bereits eine GTX 1070, 1070 Ti oder 1080 besitzen, ist diese eine hervorragende Einstiegslösung: 8 GB reichen aus, um ein 8B-Modell in Q4 zu betreiben, und der Durchsatz bleibt angenehm für Chat-Aufgaben. Wenn Sie kaufen möchten, bevorzugen Sie eine Karte mit 8 GB und Turing-Architektur oder neuer: Bei gleicher Speicherkapazität sind die Durchsatzwerte deutlich besser und die Softwareunterstützung hält länger an.
Ein letztes praktisches Kriterium: der Stromverbrauch. Diese Karten verbrauchen beim Spielen 150 bis 180 W; bei der Inferenz werden sie weniger heiß als beim Spielen, aber ein schlecht belüftetes Gehäuse kann den Durchsatz verringern. Prüfen Sie die Temperaturen während einer langen Generierung, bevor Sie zu dem Schluss kommen, dass die Karte langsam ist.
- Quelle: Öffentlicher llama.cpp-Benchmark auf CUDA
- Quelle: Ollama-Dokumentation, unterstützte NVIDIA-Hardware
- Quelle: GeForce-10-Serie, Spezifikationen
- Quelle: Versionshinweise des CUDA Toolkits
Kann eine GTX 1070 oder 1080 ein 8B-Modell laufen lassen?+
GTX 1070 oder GTX 1080 für einen lokalen LLM?+
Wie viele Tokens pro Sekunde auf einer GTX 1080?+
Kann Qwen3.5 9B auf einer GTX 1070 laufen?+
Sollte man im Jahr 2026 eine gebrauchte GTX 1080 kaufen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.