Einsteiger 11 Min.GPU

RTX 5070 Ti (16 GB) für lokale LLMs: Modelle und tokens/s

Wir alle fragen uns, wie wir VRAM, Geschwindigkeit und Kosten gegeneinander abwägen sollen. Die RTX 5070 Ti liegt genau in der Mitte der Blackwell-Modellreihe: 16 GB GDDR7, rund 1.400 € Ende September 2026 und eine moderate TGP. Die eigentliche Frage zur RTX 5070 Ti für lokale LLMs lautet: Bewältigt diese Karte die Modelle, auf die es 2026 ankommt — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B —, ohne dass wir bereuen, nicht die 5080 oder 5090 genommen zu haben?

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für diese Konfiguration: RTX 5070 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#Warum die 5070 Ti?

Der GPU-Markt 2026 ist sehr klar segmentiert: Die 5060 Ti mit 16 GB ist bei langen Prompts langsam, die 5080 kostet für dieselbe VRAM-Kapazität etwa 450 € mehr, und die 5090 bleibt mit etwa 5.700 € Ende September 2026 eine Investition für den professionellen Einsatz. Dazwischen nimmt die 5070 Ti die Position ein, die die 4070 Ti Super vor einem Jahr innehatte: 16 GB VRAM, eine gute Speicherbandbreite und ein Preis, der noch im Rahmen eines großzügigen Hobbybudgets liegt.

Für lokale LLMs zählen vor allem der VRAM (wie groß das Modell sein darf, das in den Speicher passt) und die Speicherbandbreite (wie schnell die Gewichte gelesen werden, um jedes Token zu generieren). Die 5070 Ti erfüllt beide Kriterien ohne größere Kompromisse.

i
Was dieser Leitfaden testet
Qwen 3.5 9B Q4_K_M, Granite 4.2 8B Q4_K_M, Gemma 4 12B Q4_K_M, GLM 4.7 Flash (MoE 30B-A3B) in Q4_K_M und Q3_K_M, gpt-oss 20B (MXFP4) und Qwen 3.8 27B Q4_K_M. Alle über Ollama 0.7, mit NVIDIA-Treiber 580.x, unter Windows 11 und Ubuntu 24.04.

#Was in der Karte steckt

VRAM
16 GB GDDR7 — genauso viel wie bei der 5080, halb so viel wie bei der 5090, aber vor allem: GDDR7 und nicht GDDR6X. Der Bandbreitenzuwachs im Vergleich zur vorherigen Generation ist deutlich.
Speicherbandbreite
Etwa 896 GB/s. Im Vergleich: 504 GB/s auf der 4070 Ti Super, 960 GB/s auf der 5080, 1792 GB/s auf der 5090. Die 5070 Ti liegt näher bei der 5080 als bei der 4070 Ti Super.
Compute
Architektur Blackwell, Tensor Cores 5. Generation mit Unterstützung von FP4. Die meisten Inferenz-Engine (llama.cpp, vLLM) nutzen diese Architektur noch nicht im Jahr 2026, aber dies wird gerade verbessert.
TGP
Nominelle TGP von 300 W. 12V-2x6-Stecker (ATX-3.0/3.1-Netzteil dringend empfohlen).
PCIe
PCIe 5.0 x16. Für die lokale Inferenz nicht entscheidend (das Modell bleibt im VRAM), aber nützlich beim Laden und für den Multi-GPU-Betrieb.
Beobachteter Preis
Zwischen 880 und 1.050 € für die Custom-Modelle im Juni 2026. Für dieses Modell gibt es keine FE.

#Hardware-Voraussetzungen

Nichts Exotisches, aber einige Punkte müssen vor dem Investieren überprüft werden.

Stromversorgung
Mindestens 750 W, bei einer leistungsstarken CPU werden 850 W empfohlen. ATX 3.0/3.1 mit nativem 12V-2x6-Stecker ist ideal – ein Adapter mit 4 × 8 Pins funktioniert, bleibt aber eine mögliche Problemquelle.
CPU
Jeder Ryzen der Serien 7000/9000 oder Intel-Prozessor der 13. oder 14. Generation reicht völlig aus. Die CPU übernimmt während der GPU-Inferenz keine Rechenarbeit: Wir haben die Benchmarks auf einem 7700X ohne Engpass durchgeführt.
System-RAM
32 GB DDR5 bieten komfortable Reserven. Wenn Sie Modelle > 16 GB (DeepSeek V3.2, Kimi K2) in den Systemspeicher auslagern möchten, erhöhen Sie den RAM auf 64 oder 128 GB.
OS
Windows 11 24H2 und Ubuntu 24.04 LTS unterstützen den Treiber 580.x problemlos. NVIDIA-Studio-Treiber (Windows) oder Produktionstreiber (Linux) — der Game-Ready-Treiber ist für Ollama nicht erforderlich.
!
Anschluss 12V-2x6
Wie bei der 5090 und der 4090 muss der Stromstecker vollständig eingesteckt werden, bis er hörbar einrastet. Anfang 2026 wurden mehrere Fälle geschmolzener Stecker bei nicht zertifizierten Kabeln von Drittanbietern gemeldet. Verwenden Sie das mit dem Netzteil gelieferte Kabel oder ein zertifiziertes PCIe-5.1-Kabel.

#Installation von Ollama und des Treibers

  1. 01
    Den NVIDIA-Treiber 580.x oder eine neuere Version installieren
    Unter Windows: in der NVIDIA App den Studio-Treiber auswählen. Unter Linux: sudo ubuntu-drivers install --gpgpu für Ubuntu oder das offizielle Runfile. Prüfen Sie mit nvidia-smi, ob die Grafikkarte und der VRAM angezeigt werden.
  2. 02
    Ollama installieren
    Laden Sie von ollama.com (Windows-Installer oder Linux-Befehl) herunter. Der Daemon hört standardmäßig auf http://localhost:11434 und erkennt die 5070 Ti automatisch über CUDA.
  3. 03
    Prüfen, ob die GPU tatsächlich genutzt wird
    ollama run qwen3.5:9b starten und anschließend die Ausgabe von nvidia-smi dmon -s u in einem separaten Terminal beobachten. Die Spalte sm (Rechenauslastung) muss während der Generierung auf 60–95 % steigen.
  4. 04
    Kontext anpassen
    Ollama lädt standardmäßig einen Kontext von 4096 Tokens. Mit 16 GB lässt sich der Kontext bei Modellen mit 8 Milliarden Parametern problemlos auf 16k oder 32k erhöhen. Umgebungsvariable OLLAMA_CONTEXT_LENGTH oder Parameter num_ctx in der API.
GPU-Erkennung überprüfen
ollama ps
# Doit afficher la colonne PROCESSOR à 100% GPU

nvidia-smi --query-gpu=name,memory.total,memory.used,utilization.gpu --format=csv
# Doit montrer une RTX 5070 Ti avec ~16 Go total

#Tokens/s bei 8B- und 14B-Modellen

Modelle, die auch mit einem großen Kontext bequem in den Speicher passen. Messungen mit einem Prompt von 512 Tokens und 256 generierten Tokens, Mittelwert aus 5 Durchläufen.

Qwen 3.5 9B Q4_K_M
Etwa 90 tok/s bei der Generierung, Prompt-Verarbeitung mit 2.800 tok/s. Belegter VRAM: 6,6 GB. Es bleiben 9 GB für den Kontext – ausreichend Spielraum bei 32k, und das Modell unterstützt ein Kontextfenster von bis zu 256k (einschließlich Vision).
Granite 4.2 8B Q4_K_M
Rund 94 tok/s. VRAM-Verbrauch: 5,3 GB, sehr token-effizient und 128k Kontext. Die ressourcenschonende Alternative zu Qwen, wenn Sie maximalen Durchsatz möchten.
Gemma 4 12B Q4_K_M
Etwa 62 tok/s. Belegter VRAM: 7,6 GB. Das ist der Sweet Spot der Mittelklasse und passt mit reichlich Spielraum auf die Karte: 8 GB bleiben für den Kontext und den KV-Cache frei, und Gemma 4 ist multimodal (Apache 2.0 seit April 2026).
Qwen 3.5 9B Q8_0
Etwa 48 tok/s. VRAM-Nutzung: 11 GB. Die höchste Qualität in dieser Klasse: dasselbe 9B-Modell, aber in Q8, wenn Sie das beste Ergebnis erzielen möchten, ohne das Modell zu wechseln.
Mistral Small 24B Q4_K_M
Etwa 36 tok/s. Verwendeter VRAM: 14,2 GB. Das Modell passt in den Speicher, ist ein solider Allrounder und gut auf Französisch, aber ohne Offload ist der Kontext auf 8k begrenzt — die Grenze von 16 GB macht sich langsam bemerkbar.
→
Einordnung der Zahl
Bei mehr als 30 tok/s erscheint der Text schneller, als ein Mensch ihn bequem lesen kann. Unter 15 tok/s entstehen spürbare Wartezeiten. Mit der 5070 Ti lässt sich die gesamte Modellpalette von 8B bis 12B komfortabel nutzen, und auch das 24B-Modell wird damit brauchbar.

#Der Fall GLM 4.7 Flash (MoE 30B-A3B)

Hier wird die 5070 Ti im Jahr 2026 besonders interessant. GLM 4.7 Flash ist ein Mixture-of-Experts-Modell: insgesamt 30 Milliarden Parameter, von denen aber nur 3 Milliarden pro Token aktiviert werden (Architektur 30B-A3B, MIT-Lizenz, sehr gut für Agenten). Der gesamte VRAM-Bedarf entspricht weiterhin dem des vollständigen Modells, aber die Inferenzgeschwindigkeit liegt nahe der eines dichten 3B-Modells.

GLM 4.7 Flash Q4_K_M
Etwa 78 tok/s bei der Generierung. VRAM-Nutzung: 18,4 GB — ja, das übersteigt die verfügbare VRAM-Kapazität. Ollama lagert automatisch 2 GB in den System-RAM aus, wodurch die tatsächlich beobachtete Geschwindigkeit in der Praxis auf 64 tok/s sinkt.
GLM 4.7 Flash Q3_K_M
Etwa 71 tok/s. Belegter VRAM: 14,8 GB. Alles passt in den VRAM, ein Kontext von 16k ist möglich. Der Qualitätsverlust gegenüber Q4 ist gering (≈ 1–2 % in öffentlich verfügbaren Benchmarks).
gpt-oss 20B (MXFP4)
Etwa 96 Tok/s. Genutzter VRAM: 14 GB. Das Open-Weight-Modell von OpenAI ist dank seiner nativen MXFP4-Quantisierung sehr schnell und bietet 131k Kontext — bei moderater Kontextlänge passt es gerade noch in die 16 GB.

MoE-Fazit: Q3_K_M ist auf dieser Karte der richtige Kompromiss für GLM 4.7 Flash. Die Qualität eines 30B bleibt bei der Geschwindigkeit eines 3B erhalten, und alles bleibt im VRAM.

#Bis auf 27–30B gehen: Qwen 3.8 und Granite 4.2

Große, dichte und professionelle Modelle mit etwa 27–30 Milliarden Parametern sind das realistische Ziel für diese Karte. Darüber hinaus ist massives Offloading nötig.

Qwen 3.8 27B Q4_K_M
Etwa 24 tok/s bei der Generierung, wobei 2 bis 3 GB in den RAM ausgelagert werden. Speichernutzung: die gesamten 16 GB VRAM plus etwas RAM. Veröffentlicht am 14.08.2026, mit 262k Kontext und Bildverarbeitung: Das ist in dieser Größenklasse das Modell, das Copilot nahekommt. Mit der standardmäßigen Einstellung für das Schlussfolgern neigt es zu übermäßig langem Nachdenken. Stellen Sie diese auf low, um direktere Antworten zu erhalten.
Qwen 3.8 27B Q3_K_M
Etwa 36 tok/s. Genutzter VRAM: 14 GB, vollständig im VRAM. Der passende Kompromiss, wenn Sie dieses große Dense-Modell flüssig ausführen möchten.
Granite 4.2 30B Q4_K_M
Etwa 22 Tok/s mit Offload. Verwendeter VRAM: 18 GB. Für den professionellen Einsatz und den Einsatz in Unternehmen ausgelegt, Profil fast identisch mit Qwen 3.8 27B.
Nemotron 3.5 Lightning 30B Q4_K_M
Passt nicht in den Speicher: 25 GB in Q4, umfangreicher Offload in RAM bzw. auf SSD erforderlich, Durchsatz um 3 tok/s – keine im Alltag brauchbare Option mit 16 GB (auch nicht mit 24 GB).
i
Q3_K_M oder Q4_K_M?
Bei Modellen mit 27–30B bleibt der Qualitätsunterschied zwischen Q4_K_M und Q3_K_M gering (in der Regel 2–3 % bei MMLU). Auf einer Karte mit 16 GB hält Q3_K_M alles im VRAM und verdreifacht die Geschwindigkeit nahezu. Das ist der passende Kompromiss für diese Konfiguration.

#Preis im Vergleich zu 5080 und 5090

Die einfache Rechnung: Preis / Tokens pro Sekunde. Nicht perfekt (Abschreibung und Stromkosten bleiben unberücksichtigt), aber sie hilft, die Größenordnungen einzuordnen.

RTX 5070 Ti (≈ 1 400 € Ende September 2026)
Bei Gemma 4 12B: ≈ 22,5 €/(tok/s). Bei GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). Bei Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
RTX 5080 (≈ 1 850 € Ende September 2026)
Bei Gemma 4 12B: ≈ 25,8 €/(tok/s). Bei GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Tatsächlicher Geschwindigkeitsgewinn (+15 bis 20 %), aber höhere Kosten.
RTX 5090 (≈ 5 700 € Ende September 2026)
Auf Gemma 4 12B: ≈ 67,0 €/(tok/s). Auf Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Wird nur dann wettbewerbsfähig, wenn die Modellgröße 70B+ erreicht, was auf 16 GB nicht möglich ist.
RTX 4070 Ti Super 16 GB (gebraucht, Preis variabel)
Bei Gemma 4 12B: 15,3 €/(tok/s). Günstiger, aber bei MoE-Modellen aufgrund des langsameren GDDR6X etwa 25 % langsamer. Als Gebrauchtkarte weiterhin eine sinnvolle Option.
RTX 3090 gebraucht (gebraucht, Preis variabel)
Für Gemma 4 12B: 24 GB VRAM zu einem variablen Gebrauchtpreis. Attraktives Leistungs-Euro-Verhältnis, wenn Sie gebrauchte Ampere-Hardware und einen Stromverbrauch von 350 W akzeptieren.

Die 5070 Ti bietet beim reinen Preis-Leistungs-Verhältnis nicht den besten Gegenwert – eine gebrauchte 3090 liegt weiterhin vorn. Sie wird zur richtigen Wahl, sobald Sie eine neue Karte mit Garantie, moderatem Stromverbrauch und FP4-Unterstützung für die Zukunft möchten.

#Verbrauch und Wärmeentwicklung

Maßnahmen beim Einbau, vollständige Maschine, Stromversorgung 850 W Gold, GPU nur im Testbetrieb, Bildschirm ausgeschaltet.

Inaktiv (Modell geladen, keine Generierung)
Der Rechner verbraucht insgesamt 75 W, davon entfallen etwa 15 W auf die GPU. Sehr sparsam: Der Bereitschaftsbetrieb für die Inferenz belastet Ihre Stromrechnung nicht.
Inferenz 8B Q4
Spitzenverbrauch von 195 W an der Steckdose (GPU ~145 W). Die Grafikkarte wird nicht voll ausgelastet – der GDDR7-Speicher ist bereits ausgelastet, bevor die Recheneinheiten an ihre Grenze kommen, wie bei der 5090.
Inferenz 12B Q4
Spitzenverbrauch von 245 W an der Steckdose (GPU ~190 W). Optimaler Kompromiss zwischen Stromverbrauch und Nutzen.
MoE-Inferenz 30B-A3B
Spitzenverbrauch von 280 W an der Steckdose (GPU ~225 W). Das MoE-Modell wird weniger heiß als ein vergleichbares dichtes Modell.
Prompt-Verarbeitung mit einem Batch von 4096 Tokens
Spitzenverbrauch von 360 W an der Steckdose (GPU ~298 W). In diesem Moment sind die Recheneinheiten voll ausgelastet und treiben die Karte nahe an ihre nominelle TGP von 300 W.
GPU-Spitzentemperatur
72 °C unter anhaltender Last, Lüfter bei etwa 1.600 U/min. Custom-Modell mit drei Lüftern – leise im Vergleich zur 5090.
→
Verbrauch begrenzen
nvidia-smi -pl 230 begrenzt die Karte auf 230 W. Bei Gemma 4 12B Q4 verliert man etwa 4 % Durchsatz (62 → 60 Tok/s) und spart dafür etwa 60 W. Interessant im 24/7-Betrieb oder wenn das Netzteil knapp dimensioniert ist.

#Urteil: Sweet Spot oder nicht?

Für wen sich der Kauf lohnt
Sie möchten Neuware kaufen und planen, hauptsächlich Modelle mit 8B–12B Parametern zu betreiben, gelegentlich auch 30B-MoE-Modelle und dichte Modelle mit 27B–30B Parametern in Q3. Sie schätzen eine leise Grafikkarte mit moderatem Stromverbrauch. Für dieses Nutzungsprofil ist die 5070 Ti gemacht.
Wann Sie stattdessen die 5080 wählen sollten
Wenn Sie täglich dichte Modelle mit 27 bis 30 Milliarden Parametern in Q4 betreiben und Sie die bis zum Anschlag belegten 16 GB stören. Die 5080 hat genauso viel VRAM, aber eine um 7 % höhere Bandbreite – ein bescheidener Gewinn für ≈ 450 € mehr.
Wann die 5090 die richtige Wahl ist
Wenn Sie ein Modell mit 70B+ in Q4 lokal verwenden oder LoRA-Fine-Tuning auf Modellen mit 13B+ durchführen möchten, reichen 16 GB weder für das eine noch für das andere aus.
Wann eine gebrauchte 3090 vorzuziehen ist
Knappes Budget, Bereitschaft zum Kauf gebrauchter Hardware und Bedarf an 24 GB für 27–30B-Modelle in Q5 oder für den Einstieg in 70B-Modelle mit geringem Offloading. Sie verlieren die FP4-Unterstützung, sparen aber weiterhin erheblich (abhängig vom aktuellen Gebrauchtpreis zu beurteilen).
Wann eine 4070 Ti Super die bessere Wahl ist
Wenn Sie eine gebrauchte Karte zu einem attraktiven Preis finden (abhängig vom Markt) und für Ihren Anwendungsfall ein 12B-Modell ausreicht. In der Praxis sehr ähnlich, aber deutlich günstiger.
i
Das Fazit in einem Satz
Für lokale LLMs im Jahr 2026 ist die RTX 5070 Ti tatsächlich ein Sweet Spot — vorausgesetzt, Sie akzeptieren, dass Ihnen die 16 GB den Zugang zu 70B-Modellen versperren und dass die eigentlichen Stärken dieser Karte im komfortablen Betrieb multimodaler 12B-Modelle und von 30B-MoE-Modellen in Q3/Q4 liegen.

#Weiterführende Informationen

Drei nützliche Lektüretipps zur Vertiefung:

Die richtige Quantisierung wählen
Der Leitfaden „Die Wahl der Quantisierung (Q4, Q5, Q8, FP16)“ erläutert ausführlich, warum Q3_K_M bei 16 GB sinnvoll wird, wenn Sie Modelle mit 30B oder mehr nutzen möchten.
Den Vergleich erweitern
Der Leitfaden „GPU für die lokale KI wählen“ erweitert das Spektrum über die Blackwell-Serie hinaus, was hilfreich ist, wenn Sie noch unsicher sind.
Ein MoE-Modell genauer kennenlernen
Der Leitfaden „Llama 4 Scout lokal“ erklärt im Detail die Funktionsweise von MoE, das besonders gut für eine Karte mit 16 GB wie die 5070 Ti geeignet ist.

Die Preise ändern sich schnell: Unser Tracking erfasst jeden Montag und Donnerstag den niedrigsten Preis für GPUs für lokale KI, einschließlich des Preises pro GB VRAM.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.