Einsteiger 11 Min.GTX 10

Welches LLM auf GTX 1070 / 1080 (8 GB) ?

Direkte Antwort

Ja: Eine GTX 1070, 1070 Ti oder 1080 mit 8 GB kann ein Modell mit 7 bis 9 Milliarden Parametern in Q4 bei einer angemessenen Kontextlänge problemlos ausführen. Der öffentliche Benchmark von llama.cpp misst auf einer GTX 1070 Ti mit einem 7B-Modell in Q4_0 37,82 Tokens/s; die 1080 mit ihrem schnelleren Speicher dürfte besser abschneiden, allerdings liegt keine direkte Messung vor. Bei mehr als 9 Milliarden Parametern reichen die 8 GB nicht mehr aus, und die Pascal-Architektur hat softwareseitig keine Zukunft mehr.

Die GTX 1070 (Juni 2016), 1070 Ti (November 2017) und 1080 (Mai 2016) haben denselben GP104-Chip und 8 GB Speicher. Sie sind zu den attraktivsten Gebrauchtkarten geworden, um ein lokales LLM auszuprobieren, ohne Geld auszugeben. Dieser Leitfaden beziffert, was ihr Speicher ermöglicht, erläutert, was öffentliche Messungen über ihre Geschwindigkeit aussagen, und erklärt, warum das Datum des Supportendes für Pascal stärker ins Gewicht fällt als der Preis.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#GTX 1070, 1070 Ti, 1080: Worin sie sich für ein LLM unterscheiden

Für ein LLM haben diese drei Karten dieselbe Kapazität von 8 GB und unterscheiden sich durch die Speicherbandbreite, die die Generierungsgeschwindigkeit bestimmt. Die 1070 und die 1070 Ti verwenden GDDR5 mit einem 256-Bit-Speicherbus, also 256 GB/s; die 1080 erreicht mit GDDR5X 320 GB/s. Da ein LLM bei jedem Token alle seine Gewichte erneut liest, schlägt sich dieser Unterschied von 25 % nahezu direkt in der Geschwindigkeit nieder – deutlich stärker als die 2.560 Kerne der 1080 gegenüber den 1.920 Kernen der 1070. Keine der Karten hat Tensor Cores: Pascal setzt weiterhin auf klassische CUDA-Berechnungen.

Die drei Karten im Überblick (Wikipedia, GeForce 10 series; Messung: llama.cpp-Teststand)
KarteCUDA-KerneSpeicherBandbreiteGemessener Durchsatz (7B Q4_0)
GTX 10701 9208 GB GDDR5256 GB/snicht auf dem Teststand gemessen
GTX 1070 Ti2 4328 GB GDDR5256 GB/s37,82 Tokens/s
GTX 10802 5608 GB GDDR5X320 GB/snicht auf dem Teststand gemessen

Eine GTX 1080 Ti mit 11 GB und 484 GB/s gehört zu einer anderen Kategorie: Sie hat ihre eigene Seite. Wenn Ihre Karte eine 1080 Ti ist, lesen Sie stattdessen den ihr gewidmeten Leitfaden.

#Was 8 GB tatsächlich ermöglichen

Entscheidend ist das Verhältnis zwischen der Größe der Modellgewichte und dem verfügbaren Speicher, da der KV-Cache noch hinzukommt. Der Richtwert dieser Website liegt für ein 7–8B-Modell in Q4 bei etwa 5 GB für die Gewichte: Bei 8 GB bleiben ungefähr 3 GB für den Kontext und das System, also ein echter Puffer. Ein 9B-Modell in Q4 mit 6 GB lässt 2 GB übrig: Mit einem kurzen Kontext ist das möglich. Bei 12 Milliarden Parametern benötigen die Gewichte 7 GB: Es bleibt fast nichts übrig.

Modelle für 8 GB, theoretische Obergrenzen (Bandbreite ÷ Größe der Modellgewichte; keine Messwerte)
Modell (Q4)ModellgrößeSpielraum bei 8 GBGrenze von 256 GB/sObergrenze bei 320 GB/s
Granite 4.1 3B2 GB6 GB128 Token pro Sekunde160 Tokens/s
Granite 4.2 8B4,6 GB3,4 GB55 Tokens pro Sekunde70 Token/s
Qwen3.5 9B6 GB2 GB43 tokens/s53 Tokens/s
Gemma 4 12B7 GB1 GBnicht empfohlennicht empfohlen
Phi-4 14B9 GBnegativpasst nicht vollständig in den GPU-Speicherpasst nicht vollständig in den GPU-Speicher

Eine theoretische Obergrenze wird nie erreicht. Im öffentlichen Benchmark erreicht die GTX 1070 Ti mit einem 3,56 GiB großen Modell 37,82 Tokens/s, also etwa 56 % ihrer Obergrenze von 256 GB/s. Überträgt man denselben Wirkungsgrad auf die oben genannten Modelle, würde Granite 4.2 8B auf einer 1070 Ti etwa 30 Tokens/s erreichen: Das ist eine proportionale Extrapolation, keine Messung.

#Was die öffentlichen Benchmarks sagen

QuelLLM testet diese Karten nicht. Die Zahlen stammen aus der Diskussion „Performance of llama.cpp on Nvidia CUDA“ im llama.cpp-Repository, in der jeder Mitwirkende llama-bench mit Llama 2 7B in Q4_0 ausführt, wobei alle Schichten auf der GPU liegen. Die GTX 1070 Ti erreicht dort 714,44 Tokens/s bei der Promptverarbeitung und 37,82 Tokens/s bei der Generierung.

Bei den Karten auf derselben Seite, für die Messwerte vorliegen, ist ein Vergleich hilfreich: Die RTX 2060 Super, eine Turing-Karte mit 8 GB und einem 256-Bit-Speicherbus, erzeugt im selben Test 60,04 Tokens/s, gegenüber 37,82 bei der 1070 Ti. Bei ähnlicher Speicherbandbreite beträgt der Zugewinn 59 %. Der Benchmark erklärt den Unterschied also besser als die Kerne oder der Preis: Turing nutzt seinen Speicher besser aus.

Benchmark mit llama.cpp CUDA, Llama 2 7B Q4_0, ohne Flash Attention
KarteSpeicherPrompt (pp512)Generation (tg128)
GTX 1070 Ti8 GB GDDR5, 256 Bit714,44 Tokens pro Sekunde37,82 Tokens/s
RTX 2060 Super8 GB GDDR6, 256 Bit1 420,24 Token/s60,04 Tokens/s
GTX 1080 Ti11 GB GDDR5X, 352 Bit1 084,41 Tokens/s62,49 tokens/s

Bei der Interpretation dieser Zahlen sind drei Vorbehalte zu beachten. Jede Zeile des Benchmarks ist ein individueller Beitrag: Treiber, System, Kühlung und Kartenhersteller unterscheiden sich von einem Beitragenden zum anderen, was Abweichungen um einige Punkte bei demselben Chip erklärt. Das Testmodell, ein Llama 2 7B, ist älter und kleiner als aktuelle Modelle: Es dient als gemeinsamer Maßstab, nicht als Vorhersage für ein bestimmtes Modell. Schließlich hängt die Generierung vor allem vom Speicher ab, während die Verarbeitung des Prompts von der Rechenleistung abhängt: Die beiden Spalten sagen also nicht dasselbe aus.

i
Unterschiede im Durchsatz hängen auch vom Prompt ab
Das Einlesen des Prompts dauert auf der 1070 Ti etwa doppelt so lange wie auf der 2060 Super. Bei einem langen Dokument, das in die Unterhaltung eingefügt wird, ist die Wartezeit bis zur ersten Antwort auf Pascal daher deutlich länger.

#Die Leistung der GTX 1080 ohne Messung abschätzen: Methode und Grenzen

Die 1080 ist im Benchmark nicht enthalten. Um ihre Leistung abzuschätzen, lässt sich das Verhältnis der Speicherbandbreiten heranziehen: 320 ÷ 256 = 1,25, also etwa 47 Tokens/s (37,82 × 1,25), sofern die Effizienz dieselbe bleibt wie bei der 1070 Ti. Das ist eine plausible Annahme, kein Messergebnis: Treiber, die Version von llama.cpp, die Temperatur oder die Kühlung der Karte beeinflussen den Durchsatz erheblich.

Wenn Sie eine gebrauchte Grafikkarte für diesen Zweck kaufen, bitten Sie den Verkäufer um einen Screenshot eines tatsächlichen Tests oder führen Sie direkt nach Erhalt selbst llama-bench mit dem Modell des Benchmarks aus: Das Ergebnis lässt sich direkt mit der öffentlich zugänglichen Tabelle vergleichen.

#Der Kontext: Wohin die 3 GB Reserve gehen

Bei 8 GB lässt ein Granite 4.2 8B in Q4 etwa 3,4 GB frei. Diese Reserve teilen sich der KV-Cache, der mit jedem Token der Unterhaltung wächst, die Rechenpuffer sowie der Speicherbedarf des Treibers und der Bildschirmausgabe, falls die Grafikkarte auch Ihren Bildschirm ansteuert. Ollama startet mit einem Kontextfenster von 4.096 Tokens, das über die Variable OLLAMA_CONTEXT_LENGTH geändert werden kann; eine Verdopplung des Fensters verdoppelt den KV-Cache.

Eine einfache Entscheidungsregel: Wenn Sie mit langen Dokumenten (16.000 Tokens und mehr) arbeiten möchten, wählen Sie ein Modell mit 3 bis 4 Milliarden Parametern oder ein 8B-Modell mit quantisiertem KV-Cache. Wenn Sie in kurzen Nachrichten chatten, ist das 8B-Modell in Q4 die richtige Wahl. Prüfen Sie in beiden Fällen mit ollama ps, ob das Modell zu 100 % auf der GPU geladen ist: Eine Aufteilung zwischen GPU und Prozessor zeigt an, dass kein Speicherspielraum mehr vorhanden ist.

#Flash Attention auf Pascal: Ist sie nützlich oder nicht?

Ein verbreiteter Irrtum besagt, dass Flash Attention nur für Karten mit Tensor Cores bestimmt ist. Der llama.cpp-Benchmark widerlegt dies: Er testet jede Karte mit und ohne Flash Attention, und die GTX 1080 Ti aus der Pascal-Generation ist in beiden Tabellen aufgeführt. Mit Flash Attention steigt ihre Geschwindigkeit bei der Prompt-Verarbeitung von 1 084,41 auf 1 138,14 Tokens/s, also um etwa 5 %, und sinkt bei der Generierung von 62,49 auf 61,38 Tokens/s, also um 2 %. Der Hauptvorteil von Flash Attention liegt nicht in der Geschwindigkeit, sondern im Speicherbedarf: Flash Attention reduziert den Speicherbedarf des Kontexts, was bei 8 GB wichtig ist.

Ollama aktiviert Flash Attention automatisch, wenn die Engine und die Grafikkarte es unterstützen; OLLAMA_FLASH_ATTENTION=1 erzwingt die Aktivierung, und der Wert 0 deaktiviert Flash Attention. Die Quantisierung des KV-Caches, die den Speicherbedarf des Kontexts weiter reduziert, setzt voraus, dass Flash Attention aktiviert ist.

Flash Attention beim Start des Servers erzwingen
OLLAMA_FLASH_ATTENTION=1 ollama serve

#Welche Anwendung eignet sich für eine 8 GB Pascal-Karte?

Typische Aufgaben und Eignung
NutzungEignungEmpfohlene Einstellung
Chat, Umformulierung, ÜbersetzungGutGranite 4.2 8B in Q4, Kontext von 4.096 Tokens
Codehilfe im EditorOrdentlich7–8B-Modell, mittlere Kontextlänge, nur ein Modell geladen
Lange Dokumente zusammenfassenEingeschränktModell mit 3–4 Milliarden Parametern oder quantisierter KV-Cache
Suche in eigenen Dokumenten (RAG)Ordentlich3–8B-Modell, kurze Auszüge, keine 12B-Modelle
Agenten mit verketteten WerkzeugaufrufenSchwachZu viel Kontext und zu viele Anfragen für 8 GB

#Pascal: Software-Unterstützung als eigentliche Grenze

Das Hauptrisiko liegt nicht in der Geschwindigkeit, sondern in der Software. Ollama erfordert einen NVIDIA-Treiber ab Version 570 für Grafikkarten mit Compute Capability 5.0 bis 6.2; dazu gehören auch die GTX 1070 bis 1080. Die Versionshinweise zu CUDA 13 geben jedoch an, dass die Unterstützung für Pascal entfernt wurde, und Wikipedia weist darauf hin, dass NVIDIA den Game-Ready-Support für diese Generation im Dezember 2025 eingestellt hat, mit Sicherheitsupdates bis Oktober 2028.

Aujourd'hui
Ollama und llama.cpp funktionieren mit einem Treiber ab Version 570 und CUDA-12-Builds.
Morgen
Die neuen Funktionen und die neuen Engines werden auf CUDA 13 ausgerichtet sein: Jedes Update kann die Unterstützung für Pascal streichen.
Sicherheit
Sicherheitspatches für den Treiber gibt es bis Oktober 2028, aber keine neuen Optimierungen.
!
Verlassen Sie sich nicht auf das Datum 2028
Dieses Datum betrifft die Sicherheit des Treibers, nicht die Kompatibilität der KI-Tools. Eine Inferenz-Engine kann die Unterstützung für Pascal schon deutlich früher einstellen: Planen Sie eine Ersatzkarte ein.

#Ist eine 1070 Ti die bessere Wahl oder doch etwas anderes?

Bei gleichem Budget für einen Gebrauchtkauf erfolgt der Vergleich anhand von drei Kriterien: Speicher (mindestens 8 GB), Architekturgeneration (Turing oder neuer, um CUDA 13 nutzen zu können) und Bandbreite. Ohne Preise zu nennen, die sich jede Woche ändern, lassen sich die Optionen wie folgt einordnen.

Einstiegsoptionen für ein lokales LLM
OptionStärkenNachteile
GTX 1070 / 1070 Ti / 1080 (bereits vorhanden)Kostenlos; Modelle mit 7–9 Milliarden Parametern laufen problemlosPascal nähert sich dem Supportende, bei gleicher Bandbreite langsamer
RTX 2060 Super (8 GB)60,04 Tok/s im Benchmark, Turing, Tensor CoresWeiterhin nur 8 GB
RTX 3050 (6 oder 8 GB)Ampere, langfristige Software-UnterstützungJe nach Version begrenzte Bandbreite
Karte mit 12 GB (RTX 3060 12 GB)Spielraum für 12–14B und langen KontextHöheres Budget

#Fazit: Ausprobieren ja, investieren nein

Wenn Sie bereits eine GTX 1070, 1070 Ti oder 1080 besitzen, ist diese eine hervorragende Einstiegslösung: 8 GB reichen aus, um ein 8B-Modell in Q4 zu betreiben, und der Durchsatz bleibt angenehm für Chat-Aufgaben. Wenn Sie kaufen möchten, bevorzugen Sie eine Karte mit 8 GB und Turing-Architektur oder neuer: Bei gleicher Speicherkapazität sind die Durchsatzwerte deutlich besser und die Softwareunterstützung hält länger an.

Ein letztes praktisches Kriterium: der Stromverbrauch. Diese Karten verbrauchen beim Spielen 150 bis 180 W; bei der Inferenz werden sie weniger heiß als beim Spielen, aber ein schlecht belüftetes Gehäuse kann den Durchsatz verringern. Prüfen Sie die Temperaturen während einer langen Generierung, bevor Sie zu dem Schluss kommen, dass die Karte langsam ist.

FAQ
Kann eine GTX 1070 oder 1080 ein 8B-Modell laufen lassen?+
Ja. Ein Granite 4.2 8B in Q4 benötigt etwa 4,6 GB, sodass von 8 GB mehr als 3 GB für den Kontext und das System übrig bleiben. Der llama.cpp-Benchmark liefert auf einer 1070 Ti mit einem 7B-Modell in Q4_0 37,82 Tokens/s, einen komfortablen Durchsatz für Chats.
GTX 1070 oder GTX 1080 für einen lokalen LLM?+
Die 1080. Ihr GDDR5X-Speicher mit 320 GB/s gegenüber 256 GB/s bei der 1070 erhöht bei gleichem Modell den Generierungsdurchsatz um etwa 25 %, da die Geschwindigkeit durch den Speicher begrenzt ist. Die Kapazität bleibt gleich: 8 GB. Prüfen Sie bei einer gebrauchten Karte den Zustand und die Kühlung.
Wie viele Tokens pro Sekunde auf einer GTX 1080?+
Im öffentlichen Benchmark von llama.cpp gibt es keine Messwerte für die GTX 1080. Die GTX 1070 Ti mit 256 GB/s erreicht bei einem 7B-Modell in Q4_0 37,82 Tokens/s. Bei einer proportionalen Hochrechnung anhand der Speicherbandbreiten sollte die 1080 über 45 Tokens/s erreichen – eine Schätzung, die mit llama-bench überprüft werden muss.
Kann Qwen3.5 9B auf einer GTX 1070 laufen?+
Ja, aber mit wenig Spielraum: Die Q4-Gewichte belegen etwa 6 der 8 GB, sodass 2 GB für den KV-Cache und das System verbleiben. Halten Sie den Kontext kurz und prüfen Sie mit ollama ps, ob das Modell auf der GPU bleibt.
Sollte man im Jahr 2026 eine gebrauchte GTX 1080 kaufen?+
Nur zu einem sehr niedrigen Preis und zum Ausprobieren. Die Unterstützung für Pascal wurde aus CUDA 13 entfernt, und der Game-Ready-Support endete im Dezember 2025; eine RTX 2060 Super mit 8 GB erreicht im Benchmark 60,04 Tokens/s gegenüber 37,82 bei einer 1070 Ti. Bei vergleichbarem Budget ist die Turing-Karte der bessere Kauf.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.