Welcher LLM für die RTX 4070 Ti Super (16 GB) ?
Die RTX 4070 Ti Super ist eine Karte mit 16 GB GDDR6X und einer Bandbreite von 672 GB/s: Sie lädt Gemma 4 12B (7,7 bis 8 GB), gpt-oss 20B, Mistral Small 24B (je 14 GB) und jedes Modell bis etwa 14 GB in den VRAM. Sie ist die einzige Karte aus der 4070-Serie mit mehr als 12 GB, und ihre Bandbreite ist mehr als doppelt so hoch wie die einer RTX 4060 Ti 16 GB. Ihr theoretischer Höchstwert liegt bei etwa 127 Tokens pro Sekunde bei einem 5,3 GB großen Modell.
Wer ein lokales LLM auf einer RTX 4070 betreiben möchte, stößt auf vier ähnliche Karten: 4070, 4070 Super, 4070 Ti und 4070 Ti Super. Nur eine bietet 16 GB. Dieser Leitfaden erklärt, was diese Speicherkapazität und der 256-Bit-Bus ermöglichen, was weiterhin außerhalb der Möglichkeiten der Karte liegt und wie sie im Vergleich zu einer RTX 4080 Super oder einer RTX 5070 Ti einzuordnen ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5070 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RTX 4070 Ti Super für einen lokalen LLM: Was 16 GB ermöglichen
Eine RTX 4070 Ti Super führt Modelle mit 4B bis 24B in Q4 problemlos aus. Sie verfügt laut NVIDIA über 16 GB GDDR6X an einem 256-Bit-Bus, entsprechend 672 GB/s, sowie 8.448 CUDA-Kerne. Diese Kombination hebt sie über alle Karten mit 8 und 12 GB: Gemma 4 12B passt mit reichlich Spielraum für den Kontext hinein; gpt-oss 20B und Mistral Small 24B passen mit jeweils 14 GB in den VRAM und lassen etwa 2 GB frei; ein Modell mit 5 bis 8 GB läuft nahe am Bandbreitenlimit der Karte. Die nächste Größenklasse passt hingegen nicht mehr hinein: Qwen 3.5 27B ist 17 GB groß und überschreitet die Speicherkapazität der Karte. Die 4070 Ti Super ist daher keine Karte für 30B-Modelle, aber eine der ausgewogensten für alles darunter.
- Architektur
- Ada Lovelace, AD103-Chip, derselbe wie in der RTX 4080, aber mit weniger aktiven Einheiten.
- Speicher
- 16 GB GDDR6X, 256-Bit-Bus, Bandbreite von 672 GB/s laut Wikipedia.
- Berechnung
- 8.448 CUDA-Kerne laut der NVIDIA-Produktseite, Tensor Cores der 4. Generation.
- Leistung
- 285 W Gesamtleistungsaufnahme der Grafikkarte; NVIDIA gibt für den gesamten PC ein Netzteil mit mindestens 700 W an.
#4070, 4070 Super, 4070 Ti, 4070 Ti Super: Welche für LLMs?
Die vier Karten tragen denselben Seriennamen, sind für LLMs aber nicht gleichwertig. Drei davon sind auf 12 GB VRAM begrenzt; nur die Ti Super bietet 16 GB und einen 256-Bit-Bus. Für lokale KI wiegt dieser Unterschied schwerer als die reine Rechenleistung: Er entscheidet darüber, welche Modelle auf der Karte laufen können.
| Karte | Speicher | Bus | CUDA-Kerne | Leistung |
|---|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 256 Bit | 8 448 | 285 W |
| RTX 4070 Ti | 12 GB GDDR6X | 192 Bit | 7 680 | 285 W |
| RTX 4070 Super | 12 GB GDDR6X | 192 Bit | 7 168 | 220 W |
| RTX 4070 | 12 GB GDDR6 oder GDDR6X | 192 Bit | 5 888 | 200 W |
Die RTX 4070 Ti erreicht laut Wikipedia 504 GB/s, gegenüber 672 GB/s bei der Ti Super. Wenn Sie nach einer klassischen RTX 4070 gesucht haben, behandelt die dafür vorgesehene Seite die Variante mit 12 GB. Allen gemeinsam ist: Modelle mit 12 Milliarden Parametern passen in den Speicher, Modelle ab 14 GB benötigen 16 GB.
#Welche Modelle passen in 16 GB
| Modell | Größe | Speicherreserve bei 16 GB | Fazit |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Sehr groß: langer Kontext |
| Gemma 4 12B | 7,7 bis 8,0 GB | 8 GB | Komfortabel |
| gpt-oss 20B | 14 GB | 2 GB | Passt in den Speicher, Kontext im Blick behalten |
| Mistral Small 24B | 14 GB | 2 GB | Passt in den Speicher, Kontext im Blick behalten |
| Devstral Small 2 24B | 15 GB | 1 GB | Passt gerade noch, sehr kurzer Kontext |
| Qwen 3.5 27B | 17 GB | Negativ | Passt nicht |
Modelle mit 14 und 15 GB lassen wenig Platz für den Kontext-Cache: Ollama verwendet standardmäßig 4 096 Tokens, was noch in den Speicher passt, aber 16 000 Tokens erfordern die Quantisierung des K/V-Caches. Devstral Small 2, ein Code-Modell, liegt an der Grenze: Bei 15 GB bleibt fast nichts für den Kontext übrig. Für Code ist Mistral Small 24B oder ein kleineres Modell mit längerem Kontext auf 16 GB die bessere Wahl.
#Was mit 16 GB weiterhin nicht möglich ist
Drei Modellfamilien überschreiten die Speicherkapazität der Grafikkarte. Modelle mit 27B bis 35B in Q4: Laut Ollama benötigt Qwen 3.5 27B 17 GB und Qwen 3.5 35B 24 GB, Gemma 4 26B zwischen 16 und 19 GB. 70B-Modelle, deren Gewichte allein laut Richtwert der Website etwa 40 GB belegen. Und Modelle mit langem Kontext, deren Kontextfenster voll ausgereizt wird: Ein 8 GB großes Modell mit einem angegebenen Kontextfenster von 256.000 Tokens passt mit einem vollständigen Cache niemals in den Speicher dieser Karte. Wechseln Sie in diesen Fällen zu 24 GB VRAM, einem Mac mit gemeinsamem Speicher oder einem dedizierten Rechner: Die Seite zur Hardware vergleicht diese Optionen.
#Installieren und die Platzierung im VRAM überprüfen
- 01TreiberOllama erfordert für neuere GeForce-Karten einen NVIDIA-Treiber der Version 550 oder neuer. Prüfen Sie Ihre Version mit nvidia-smi.
- 02InstallationInstallieren Sie Ollama für Ihr System, ohne separate CUDA-Installation.
- 03Erster TestFühren Sie ollama run mistral-small aus, um ein erstes Modell zu starten, das die 16 GB nutzt, und anschließend ollama ps.
- 04KontrolleDie Spalte PROCESSOR muss 100 % GPU anzeigen; andernfalls verringern Sie den Kontext.
Der K/V-Cache in q8_0 verwendet etwa die Hälfte des Speichers von f16, dem Standardwert, und erfordert Flash Attention. Diese Einstellung ermöglicht es einem 14-GB-Modell, einen Kontext von 16 000 Tokens auf 16 GB zu verarbeiten.
#Welche Geschwindigkeit ist zu erwarten: Obergrenzen und Messwerte Dritter
Kein Durchsatz wird hier als eigene Messung dargestellt. Die Obergrenze der Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080 mit 716,8 GB/s, also etwa 68 % ihrer Obergrenze, und 75 % auf einer RTX 4070 Ti. Die Bandbreite der 4070 Ti Super liegt nahe bei der der 4080, daher liegt auch ihr Durchsatz in einer ähnlichen Größenordnung. Die Tabelle setzt 70 % der Obergrenze an.
| Modell | Modellgröße | Obergrenze | Estimate at 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 Tokens/s | etwa 89 Tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | etwa 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 Tokens/s | etwa 61 Tokens/s |
| Mistral Small 24B | 14 GB | 48 Tokens/s | etwa 34 tokens/s |
gpt-oss 20B ist ein Expertenmodell: Es liest pro Token nur einen Teil seiner Gewichte, weshalb sein Durchsatz den eines dichten Modells mit 14 GB übersteigt. Hier werden keine durch Quellen belegten Werte angegeben. Merken Sie sich vor allem: Mit einem 8B-Modell ist die Karte schnell, mit einem 24B-Modell liefert sie noch eine ordentliche Geschwindigkeit.
#4070 Ti Super gegenüber der 4080 Super und der 5070 Ti
| Karte | VRAM | Bandbreite | Hinweis |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | Derselbe AD103-Chip wie bei der 4080 |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | Etwa 10 % zusätzliche Bandbreite |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 33 % zusätzliche Bandbreite |
Die drei Grafikkarten bieten jeweils 16 GB: Die Kapazität ist identisch, daher auch die Liste der Modelle. Nur die Generierungsgeschwindigkeit ändert sich, proportional zur Bandbreite. Die 4080 Super ist etwa 10 % schneller, die 5070 Ti etwa ein Drittel. Auf dem Gebrauchtmarkt zählt der Preisunterschied mehr als diese Durchsatzunterschiede: Sehen Sie sich zum Vergleich die Preisentwicklung an. Eine gebrauchte 4070 Ti Super zu einem guten Preis bleibt eine ausgezeichnete Wahl; für eine neue 5070 Ti sprechen die Garantie und die Geschwindigkeit.
- Welcher LLM für eine RTX 4080 und eine RTX 4080 Super?
- Welches LLM eignet sich für eine RTX 5070 Ti?
- Preise für Grafikkarten für lokale KI
#Anwendungen, die von den 16 GB profitieren
Die 16 GB verändern vor allem, was man gleichzeitig betreiben kann. Ein lokales RAG-System kombiniert ein Generierungsmodell, ein Embedding-Modell und einen Kontext, der lang genug ist, um die gefundenen Auszüge aufzunehmen: Mit Gemma 4 12B (7,7 bis 8 GB) und einem kleinen Embedding-Modell passt alles in den Speicher, wobei mehrere Gigabyte Reserve bleiben. Ein Code-Assistent kommt mit einem 8B- bis 12B-Modell und einem Kontext von 16.000 Tokens aus, ohne jegliche Einschränkungen. Ein 14 GB großes Modell wie Mistral Small 24B belegt fast den gesamten Speicher der Karte: Es wird damit zur exklusiven Wahl, nicht zu einem Modell unter mehreren.
| Nutzung | Konfiguration | Verbleibende Kapazität |
|---|---|---|
| Persönlicher RAG | Gemma 4 12B und ein leichtes Embedding-Modell | Etwa 7 GB für den Kontext |
| Code-Assistent | 8B-Modell, Kontext von 16.000 Tokens, q8_0-Cache | Etwa 9 GB |
| Chat mit maximalem Qualitätsniveau | Mistral Small 24B allein | Etwa 2 GB, kurzer Kontext |
Ein Fallstrick bei gemeinsamer Nutzung: In Ollama vergrößern mehrere parallele Anfragen an dasselbe Modell den reservierten Kontextspeicher entsprechend. Wenn ein Modell mit 14 GB drei Kollegen gleichzeitig bedient, kann daher der Speicher der Grafikkarte nicht mehr ausreichen, während ein einzelner Nutzer problemlos bedient werden kann. Begrenzen Sie bei 16 GB die Anzahl paralleler Anfragen oder wählen Sie für die Nutzung durch mehrere Personen ein kleineres Modell.
#Eine gebrauchte 4070 Ti Super kaufen: Was Sie prüfen sollten
Die Karte kam im Januar 2024 auf den Markt: Die meisten gebrauchten Exemplare sind weniger als drei Jahre alt, doch nichts garantiert, wie sie zuvor genutzt wurden. Die Preise ändern sich jede Woche: Sehen Sie sich die Preisentwicklung an, statt sich auf eine feste Zahl in diesem Leitfaden zu verlassen. Prüfen Sie vor dem Kauf, ob nvidia-smi tatsächlich 16 GB Speicher anzeigt, starten Sie ein Modell mit 14 GB Speicherbedarf, überwachen Sie die Temperatur während einer längeren Generierung und achten Sie auf die Lüftergeräusche. Fragen Sie nach der Rechnung und der verbleibenden Herstellergarantie: Beide werden häufig mit der Karte weitergegeben.
#Fazit 2026
- Behalten Sie sie, wenn
- Ihre Modelle passen in 16 GB. Es gibt keinen Grund, die Karte zu ersetzen, solange Sie keine 24 GB benötigen.
- Erwerben Sie sie gebraucht, wenn
- Der Preis ist erheblich niedriger als der einer neuen 5070 Ti. Prüfen Sie die verbleibende Garantie, die Temperatur und den Lärm der Lüfter.
- Streben Sie 24 GB an, wenn
- Sie möchten Qwen 3.5 27B oder ein größeres Modell: Mit keiner Einstellung lassen sich 17 GB zuzüglich Kontext in 16 GB unterbringen, und eine Karte mit 24 GB erspart Ihnen einen erneuten Kauf.
- Quelle: offizielle Spezifikationen NVIDIA (Familie RTX 4070)
- Quelle: offizielle FAQ von Ollama (Flash Attention, K/V-Cache)
- Quelle: Größe von Mistral Small in der Ollama-Bibliothek
#Häufig gestellte Fragen
Kann die RTX 4070 Ti Super Mistral Small 24B ausführen?+
Welche Unterschiede gibt es zwischen RTX 4070 Ti und 4070 Ti Super für ein LLM?+
RTX 4070 Ti Super oder RTX 5070 Ti?+
RTX 4070 Ti Super oder RTX 4080 für ein LLM?+
Welches Netzteil ist für eine RTX 4070 Ti Super erforderlich?+
Kann Qwen 3.5 27B auf einer RTX 4070 Ti Super laufen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.