Mittelstufe 11 Min.RTX 40

Welcher LLM für die RTX 4070 Ti Super (16 GB) ?

Direkte Antwort

Die RTX 4070 Ti Super ist eine Karte mit 16 GB GDDR6X und einer Bandbreite von 672 GB/s: Sie lädt Gemma 4 12B (7,7 bis 8 GB), gpt-oss 20B, Mistral Small 24B (je 14 GB) und jedes Modell bis etwa 14 GB in den VRAM. Sie ist die einzige Karte aus der 4070-Serie mit mehr als 12 GB, und ihre Bandbreite ist mehr als doppelt so hoch wie die einer RTX 4060 Ti 16 GB. Ihr theoretischer Höchstwert liegt bei etwa 127 Tokens pro Sekunde bei einem 5,3 GB großen Modell.

Wer ein lokales LLM auf einer RTX 4070 betreiben möchte, stößt auf vier ähnliche Karten: 4070, 4070 Super, 4070 Ti und 4070 Ti Super. Nur eine bietet 16 GB. Dieser Leitfaden erklärt, was diese Speicherkapazität und der 256-Bit-Bus ermöglichen, was weiterhin außerhalb der Möglichkeiten der Karte liegt und wie sie im Vergleich zu einer RTX 4080 Super oder einer RTX 5070 Ti einzuordnen ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5070 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#RTX 4070 Ti Super für einen lokalen LLM: Was 16 GB ermöglichen

Eine RTX 4070 Ti Super führt Modelle mit 4B bis 24B in Q4 problemlos aus. Sie verfügt laut NVIDIA über 16 GB GDDR6X an einem 256-Bit-Bus, entsprechend 672 GB/s, sowie 8.448 CUDA-Kerne. Diese Kombination hebt sie über alle Karten mit 8 und 12 GB: Gemma 4 12B passt mit reichlich Spielraum für den Kontext hinein; gpt-oss 20B und Mistral Small 24B passen mit jeweils 14 GB in den VRAM und lassen etwa 2 GB frei; ein Modell mit 5 bis 8 GB läuft nahe am Bandbreitenlimit der Karte. Die nächste Größenklasse passt hingegen nicht mehr hinein: Qwen 3.5 27B ist 17 GB groß und überschreitet die Speicherkapazität der Karte. Die 4070 Ti Super ist daher keine Karte für 30B-Modelle, aber eine der ausgewogensten für alles darunter.

Architektur
Ada Lovelace, AD103-Chip, derselbe wie in der RTX 4080, aber mit weniger aktiven Einheiten.
Speicher
16 GB GDDR6X, 256-Bit-Bus, Bandbreite von 672 GB/s laut Wikipedia.
Berechnung
8.448 CUDA-Kerne laut der NVIDIA-Produktseite, Tensor Cores der 4. Generation.
Leistung
285 W Gesamtleistungsaufnahme der Grafikkarte; NVIDIA gibt für den gesamten PC ein Netzteil mit mindestens 700 W an.

#4070, 4070 Super, 4070 Ti, 4070 Ti Super: Welche für LLMs?

Die vier Karten tragen denselben Seriennamen, sind für LLMs aber nicht gleichwertig. Drei davon sind auf 12 GB VRAM begrenzt; nur die Ti Super bietet 16 GB und einen 256-Bit-Bus. Für lokale KI wiegt dieser Unterschied schwerer als die reine Rechenleistung: Er entscheidet darüber, welche Modelle auf der Karte laufen können.

Familie RTX 4070: Was für den LLM relevant ist (Quelle NVIDIA)
KarteSpeicherBusCUDA-KerneLeistung
RTX 4070 Ti Super16 GB GDDR6X256 Bit8 448285 W
RTX 4070 Ti12 GB GDDR6X192 Bit7 680285 W
RTX 4070 Super12 GB GDDR6X192 Bit7 168220 W
RTX 407012 GB GDDR6 oder GDDR6X192 Bit5 888200 W

Die RTX 4070 Ti erreicht laut Wikipedia 504 GB/s, gegenüber 672 GB/s bei der Ti Super. Wenn Sie nach einer klassischen RTX 4070 gesucht haben, behandelt die dafür vorgesehene Seite die Variante mit 12 GB. Allen gemeinsam ist: Modelle mit 12 Milliarden Parametern passen in den Speicher, Modelle ab 14 GB benötigen 16 GB.

#Welche Modelle passen in 16 GB

Modelle auf der RTX 4070 Ti Super (Größen in Ollama, nur Modellgewichte)
ModellGrößeSpeicherreserve bei 16 GBFazit
Granite 4.2 8B5,3 GB10,7 GBSehr groß: langer Kontext
Gemma 4 12B7,7 bis 8,0 GB8 GBKomfortabel
gpt-oss 20B14 GB2 GBPasst in den Speicher, Kontext im Blick behalten
Mistral Small 24B14 GB2 GBPasst in den Speicher, Kontext im Blick behalten
Devstral Small 2 24B15 GB1 GBPasst gerade noch, sehr kurzer Kontext
Qwen 3.5 27B17 GBNegativPasst nicht

Modelle mit 14 und 15 GB lassen wenig Platz für den Kontext-Cache: Ollama verwendet standardmäßig 4 096 Tokens, was noch in den Speicher passt, aber 16 000 Tokens erfordern die Quantisierung des K/V-Caches. Devstral Small 2, ein Code-Modell, liegt an der Grenze: Bei 15 GB bleibt fast nichts für den Kontext übrig. Für Code ist Mistral Small 24B oder ein kleineres Modell mit längerem Kontext auf 16 GB die bessere Wahl.

#Was mit 16 GB weiterhin nicht möglich ist

Drei Modellfamilien überschreiten die Speicherkapazität der Grafikkarte. Modelle mit 27B bis 35B in Q4: Laut Ollama benötigt Qwen 3.5 27B 17 GB und Qwen 3.5 35B 24 GB, Gemma 4 26B zwischen 16 und 19 GB. 70B-Modelle, deren Gewichte allein laut Richtwert der Website etwa 40 GB belegen. Und Modelle mit langem Kontext, deren Kontextfenster voll ausgereizt wird: Ein 8 GB großes Modell mit einem angegebenen Kontextfenster von 256.000 Tokens passt mit einem vollständigen Cache niemals in den Speicher dieser Karte. Wechseln Sie in diesen Fällen zu 24 GB VRAM, einem Mac mit gemeinsamem Speicher oder einem dedizierten Rechner: Die Seite zur Hardware vergleicht diese Optionen.

#Installieren und die Platzierung im VRAM überprüfen

  1. 01
    Treiber
    Ollama erfordert für neuere GeForce-Karten einen NVIDIA-Treiber der Version 550 oder neuer. Prüfen Sie Ihre Version mit nvidia-smi.
  2. 02
    Installation
    Installieren Sie Ollama für Ihr System, ohne separate CUDA-Installation.
  3. 03
    Erster Test
    Führen Sie ollama run mistral-small aus, um ein erstes Modell zu starten, das die 16 GB nutzt, und anschließend ollama ps.
  4. 04
    Kontrolle
    Die Spalte PROCESSOR muss 100 % GPU anzeigen; andernfalls verringern Sie den Kontext.
Langer Kontext mit 16 GB (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

Der K/V-Cache in q8_0 verwendet etwa die Hälfte des Speichers von f16, dem Standardwert, und erfordert Flash Attention. Diese Einstellung ermöglicht es einem 14-GB-Modell, einen Kontext von 16 000 Tokens auf 16 GB zu verarbeiten.

#Welche Geschwindigkeit ist zu erwarten: Obergrenzen und Messwerte Dritter

Kein Durchsatz wird hier als eigene Messung dargestellt. Die Obergrenze der Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080 mit 716,8 GB/s, also etwa 68 % ihrer Obergrenze, und 75 % auf einer RTX 4070 Ti. Die Bandbreite der 4070 Ti Super liegt nahe bei der der 4080, daher liegt auch ihr Durchsatz in einer ähnlichen Größenordnung. Die Tabelle setzt 70 % der Obergrenze an.

Theoretischer Höchstwert auf RTX 4070 Ti Super (672 GB/s)
ModellModellgrößeObergrenzeEstimate at 70 %
Granite 4.2 8B5,3 GB127 Tokens/setwa 89 Tokens/s
Qwen 3.5 9B6,6 GB102 tokens/setwa 71 tokens/s
Gemma 4 12B7,7 GB87 Tokens/setwa 61 Tokens/s
Mistral Small 24B14 GB48 Tokens/setwa 34 tokens/s

gpt-oss 20B ist ein Expertenmodell: Es liest pro Token nur einen Teil seiner Gewichte, weshalb sein Durchsatz den eines dichten Modells mit 14 GB übersteigt. Hier werden keine durch Quellen belegten Werte angegeben. Merken Sie sich vor allem: Mit einem 8B-Modell ist die Karte schnell, mit einem 24B-Modell liefert sie noch eine ordentliche Geschwindigkeit.

#4070 Ti Super gegenüber der 4080 Super und der 5070 Ti

Karten mit 16 GB zum Vergleich
KarteVRAMBandbreiteHinweis
RTX 4070 Ti Super16 GB GDDR6X672 GB/sDerselbe AD103-Chip wie bei der 4080
RTX 4080 Super16 GB GDDR6X736 GB/sEtwa 10 % zusätzliche Bandbreite
RTX 5070 Ti16 GB GDDR7896 GB/s33 % zusätzliche Bandbreite

Die drei Grafikkarten bieten jeweils 16 GB: Die Kapazität ist identisch, daher auch die Liste der Modelle. Nur die Generierungsgeschwindigkeit ändert sich, proportional zur Bandbreite. Die 4080 Super ist etwa 10 % schneller, die 5070 Ti etwa ein Drittel. Auf dem Gebrauchtmarkt zählt der Preisunterschied mehr als diese Durchsatzunterschiede: Sehen Sie sich zum Vergleich die Preisentwicklung an. Eine gebrauchte 4070 Ti Super zu einem guten Preis bleibt eine ausgezeichnete Wahl; für eine neue 5070 Ti sprechen die Garantie und die Geschwindigkeit.

#Anwendungen, die von den 16 GB profitieren

Die 16 GB verändern vor allem, was man gleichzeitig betreiben kann. Ein lokales RAG-System kombiniert ein Generierungsmodell, ein Embedding-Modell und einen Kontext, der lang genug ist, um die gefundenen Auszüge aufzunehmen: Mit Gemma 4 12B (7,7 bis 8 GB) und einem kleinen Embedding-Modell passt alles in den Speicher, wobei mehrere Gigabyte Reserve bleiben. Ein Code-Assistent kommt mit einem 8B- bis 12B-Modell und einem Kontext von 16.000 Tokens aus, ohne jegliche Einschränkungen. Ein 14 GB großes Modell wie Mistral Small 24B belegt fast den gesamten Speicher der Karte: Es wird damit zur exklusiven Wahl, nicht zu einem Modell unter mehreren.

Drei typische Konfigurationen mit 16 GB
NutzungKonfigurationVerbleibende Kapazität
Persönlicher RAGGemma 4 12B und ein leichtes Embedding-ModellEtwa 7 GB für den Kontext
Code-Assistent8B-Modell, Kontext von 16.000 Tokens, q8_0-CacheEtwa 9 GB
Chat mit maximalem QualitätsniveauMistral Small 24B alleinEtwa 2 GB, kurzer Kontext

Ein Fallstrick bei gemeinsamer Nutzung: In Ollama vergrößern mehrere parallele Anfragen an dasselbe Modell den reservierten Kontextspeicher entsprechend. Wenn ein Modell mit 14 GB drei Kollegen gleichzeitig bedient, kann daher der Speicher der Grafikkarte nicht mehr ausreichen, während ein einzelner Nutzer problemlos bedient werden kann. Begrenzen Sie bei 16 GB die Anzahl paralleler Anfragen oder wählen Sie für die Nutzung durch mehrere Personen ein kleineres Modell.

#Eine gebrauchte 4070 Ti Super kaufen: Was Sie prüfen sollten

Die Karte kam im Januar 2024 auf den Markt: Die meisten gebrauchten Exemplare sind weniger als drei Jahre alt, doch nichts garantiert, wie sie zuvor genutzt wurden. Die Preise ändern sich jede Woche: Sehen Sie sich die Preisentwicklung an, statt sich auf eine feste Zahl in diesem Leitfaden zu verlassen. Prüfen Sie vor dem Kauf, ob nvidia-smi tatsächlich 16 GB Speicher anzeigt, starten Sie ein Modell mit 14 GB Speicherbedarf, überwachen Sie die Temperatur während einer längeren Generierung und achten Sie auf die Lüftergeräusche. Fragen Sie nach der Rechnung und der verbleibenden Herstellergarantie: Beide werden häufig mit der Karte weitergegeben.

#Fazit 2026

Behalten Sie sie, wenn
Ihre Modelle passen in 16 GB. Es gibt keinen Grund, die Karte zu ersetzen, solange Sie keine 24 GB benötigen.
Erwerben Sie sie gebraucht, wenn
Der Preis ist erheblich niedriger als der einer neuen 5070 Ti. Prüfen Sie die verbleibende Garantie, die Temperatur und den Lärm der Lüfter.
Streben Sie 24 GB an, wenn
Sie möchten Qwen 3.5 27B oder ein größeres Modell: Mit keiner Einstellung lassen sich 17 GB zuzüglich Kontext in 16 GB unterbringen, und eine Karte mit 24 GB erspart Ihnen einen erneuten Kauf.

#Häufig gestellte Fragen

FAQ
Kann die RTX 4070 Ti Super Mistral Small 24B ausführen?+
Ja: Das Modell benötigt laut Ollama 14 GB, die Grafikkarte verfügt über 16 GB. Es bleiben etwa 2 GB für den Kontext und das System. Der Standardkontext von 4.096 Tokens passt in den Speicher; für 16.000 Tokens aktivieren Sie Flash Attention und den K/V-Cache in q8_0, um den Speicherbedarf des Caches etwa zu halbieren.
Welche Unterschiede gibt es zwischen RTX 4070 Ti und 4070 Ti Super für ein LLM?+
Die Ti Super verfügt über 16 GB Speicher auf einem 256-Bit-Bus, die Ti nur über 12 GB auf einem 192-Bit-Bus. Die Bandbreite steigt laut Wikipedia von 504 GB/s auf 672 GB/s. Für ein LLM zählt die Kapazität am meisten: Die Ti Super lädt Modelle mit einer Größe von 14 GB, die nicht in den Speicher der Ti passen.
RTX 4070 Ti Super oder RTX 5070 Ti?+
Beide haben 16 GB und können daher dieselben Modelle ausführen. Die 5070 Ti liest ihren Speicher mit 896 GB/s gegenüber 672 GB/s, also mit etwa einem Drittel mehr Bandbreite. Sie ist schneller und als Neuware mit Garantie erhältlich; die 4070 Ti Super lohnt sich vor allem dann, wenn ihr Gebrauchtpreis deutlich niedriger ist.
RTX 4070 Ti Super oder RTX 4080 für ein LLM?+
Beide verfügen über 16 GB VRAM. Die 4080 Super hat eine Bandbreite von 736 GB/s gegenüber 672 GB/s, also etwa 10 % mehr, und die klassische 4080 bietet 716,8 GB/s. Für LLMs ist der Unterschied gering: Entscheidend sollte der Preisunterschied auf dem Gebrauchtmarkt sein, nicht das Datenblatt.
Welches Netzteil ist für eine RTX 4070 Ti Super erforderlich?+
NVIDIA gibt eine Gesamtleistungsaufnahme der Grafikkarte von 285 W und eine Mindestleistung des Netzteils von 700 W für den gesamten PC an. Ein hochwertiges Netzteil mit 750 W bietet eine komfortable Reserve. Prüfen Sie auch die Anschlüsse: Die Karte benötigt zwei 8-polige PCIe-Kabel oder ein PCIe-Gen-5-Kabel mit einer Leistung von mindestens 300 W.
Kann Qwen 3.5 27B auf einer RTX 4070 Ti Super laufen?+
Nicht vollständig im VRAM: Das Modell ist laut Ollama 17 GB groß, die Karte hat 16 GB. Ein Teil würde aus dem System-RAM gelesen, was die Generierung deutlich verlangsamt. Streben Sie für dieses Modell 24 GB VRAM an; wählen Sie bei 16 GB ein Modell mit höchstens 14 GB.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.