Welcher LLM für die RTX 5070 (12 GB)? ?
Die RTX 5070 verfügt über 12 GB GDDR7 mit einer Bandbreite von 672 GB/s: Sie lädt alle Modelle bis etwa 10 GB in den VRAM, darunter Qwen 3.5 9B (6,6 GB) und Gemma 4 12B (7,7 bis 8 GB), mit ausreichend Spielraum für den Kontext. Mistral Small 24B und gpt-oss 20B mit jeweils 14 GB kann sie nicht in den VRAM laden. Ihre theoretische Obergrenze liegt bei etwa 127 Tokens/s für ein Modell mit 5,3 GB, und die Grenze von 12 GB sollten Sie vor dem Kauf im Blick behalten.
Die RTX 5070 ist die schnellste Karte mit 12 GB der Blackwell-Generation und hat eine Bandbreite von 672 GB/s. Ihre Herausforderung ist nicht die Geschwindigkeit, sondern die Kapazität: 12 GB reichen für Modelle von 4B bis 12B, aber nicht darüber hinaus. Dieser Leitfaden zeigt anhand von Zahlen, was in den Speicher passt, was dessen Kapazität überschreitet, wie Sie Ollama für den Kontext einstellen und ab wann die 5070 Ti mit 16 GB der richtige Kauf ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Für diese Konfiguration: RTX 5070 12 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 5070 für ein lokales LLM: Was 12 GB GDDR7 ermöglichen
Eine RTX 5070 lädt Modelle mit 4B bis 12B in Q4 problemlos. Laut der Ollama-Bibliothek benötigt Qwen 3.5 9B 6,6 GB und Gemma 4 12B 7,7 bis 8 GB: Beide passen in die 12 GB und lassen 4 bis 5 GB Spielraum für den Kontext, was mit quantisiertem K/V-Cache 16.000 Tokens oder mehr ermöglicht. Die Karte kann hingegen kein Modell mit einem Speicherbedarf von 14 GB laden: Mistral Small 24B und gpt-oss 20B überschreiten die 12 GB. Ihre Geschwindigkeit ist für die interaktive Nutzung ausgezeichnet: 672 GB/s über einen 192-Bit-Bus. Die 5070 eignet sich daher für alltägliche Anwendungen, stößt aber an eine klare Grenze, sobald Sie Modelle mit höherer Qualität einsetzen möchten.
- Architektur
- Blackwell, 6.144 CUDA-Kerne und Tensor-Kerne der 5. Generation gemäß NVIDIA.
- Speicher
- 12 GB GDDR7 auf einem Bus von 192 Bit, 672 GB/s Bandbreite nach Wikipedia.
- Leistung
- 250 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC eine Mindestnetzteilleistung von 650 W an.
- Einführungspreis
- 549 US-Dollar, Veröffentlichung am 5. März 2025 nach Wikipedia.
#Welche Modelle passen in 12 GB?
| Modell | Größe | Verbleibender Spielraum bei 12 GB | Fazit |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | Sehr breit, langer Kontext |
| Qwen 3.5 9B | 6,6 GB | 5,4 GB | Komfortabel |
| Gemma 4 12B | 7,7 bis 8,0 GB | 4 bis 4,3 GB | Komfortabel nutzbar, Kontext mit 16.000 Tokens möglich |
| Mistral Small 24B | 14 GB | Negativ | Passt nicht in den VRAM |
| Qwen 3.5 27B | 17 GB | Negativ | Passt nicht in den VRAM |
Als Faustregel nennt die Website etwa 0,6 GB pro Milliarde Parameter in Q4, ausschließlich für die Gewichte. Bei 12 GB liegt die praktische Grenze damit bei etwa 14 bis 16 Milliarden Parametern, wenn der Kontext kurz bleibt, und bei etwa 12 Milliarden, wenn Sie mit langen Dokumenten arbeiten möchten. Bei einem Modell mit 8 bis 9 Milliarden Parametern ist der verbleibende Spielraum deutlich größer als für eine übliche Kontextlänge nötig.
#Ollama installieren und die Karte prüfen
- 01NVIDIA-TreiberOllama erfordert einen NVIDIA-Treiber ab Version 550. Installieren Sie für eine RTX 50 den neuesten von NVIDIA angebotenen Treiber und überprüfen Sie ihn mit nvidia-smi.
- 02Ollama installierenLaden Sie den Installer für Ihr System herunter: CUDA ist integriert.
- 03Ein Modell startenProbieren Sie ollama run gemma4:12b aus, um die Grenze der Karte zu testen, oder ollama run qwen3.5:9b für ein leichteres Modell.
- 04PrüfenFühren Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.
#Welche Geschwindigkeit ist zu erwarten: eine Obergrenze, keine Messung
Kein Durchsatz wird hier als eigene Messung präsentiert. Die theoretische Obergrenze für die Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080, deren Obergrenze bei 156 Tokens/s liegt, also etwa 68 %. Setzt man 70 % als groben Richtwert an, erhält man die folgenden Schätzungen für einen kurzen Kontext.
| Modell (Q4) | Modellgröße | Obergrenze | Estimate at 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 Tokens/s | etwa 89 Tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | etwa 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 Tokens/s | etwa 61 Tokens/s |
Diese Obergrenzen liegen deutlich über der menschlichen Lesegeschwindigkeit: Die 5070 wird bei diesen Modellen niemals langsam sein. Sie ist durch die Speicherkapazität begrenzt, nicht durch die Geschwindigkeit. Mit zunehmender Kontextlänge fallen die geschätzten Werte niedriger aus, und die Verarbeitung des Prompts beansprucht die Rechenleistung stärker als den Speicher.
#Den Kontext bei 12 GB verwalten
Die Speicherreserve von 4 GB bei Gemma 4 12B ist bei langem Kontext schnell aufgebraucht. Ollama quantisiert den K/V-Cache in q8_0, um etwa halb so viel Speicher wie mit dem Standardformat f16 zu benötigen, laut Dokumentation mit einem sehr geringen Genauigkeitsverlust; dafür ist Flash Attention erforderlich. Diese Einstellung macht ein 12B-Modell für lange Dokumente nutzbar.
Ein Fallstrick, wenn Sie mehrere Personen bedienen: Mehrere parallele Anfragen erhöhen den reservierten Kontext entsprechend, wie die FAQ von Ollama erläutert. Ein Modell, das für einen Nutzer noch in den Speicher passt, kann bei drei Nutzern die Speicherkapazität überschreiten.
#Was man mit 12 GB tatsächlich macht
Zwölf Gigabyte verändern die Nutzungsmöglichkeiten gegenüber 8 GB. Ein 9B-Modell lässt genug Platz für einen Kontext von 16.000 Tokens und ein kleines Embedding-Modell: Das ist eine komfortable Konfiguration für ein persönliches RAG-System. Ein 12B-Modell liefert beim Schreiben und Zusammenfassen qualitativ bessere Antworten, allerdings auf Kosten eines kleineren Kontexts. Ein Code-Assistent kommt mit einem 8B- bis 12B-Modell und gezielten Ausschnitten aus, aber nicht mit einem ganzen Repository, das auf einmal geladen wird.
| Nutzung | Realistisch? | Empfohlene Konfiguration |
|---|---|---|
| Täglicher Chat | Ja, sehr komfortabel | Qwen 3.5 9B oder Gemma 4 12B |
| Lange Dokumente zusammenfassen | Ja, mit einem Kontext von 16.000 Token | Gemma 4 12B, K/V-Cache in q8_0 |
| RAG mit Ihren Dateien | Ja | Qwen 3.5 9B und leichte Embeddings |
| Code-Assistent | Ja, mit einem Modell von 8B bis 12B | Gezielte Auszüge, Kontext von 8.192 Tokens |
| Modelle ab 14 GB | Nein | 16 GB VRAM einplanen |
Die Wahl zwischen 9B und 12B hängt von der Aufgabe ab. Das 9B-Modell lässt mehr Spielraum und eignet sich für lange Kontexte; das 12B-Modell ist leistungsfähiger, aber jedes Gigabyte für den Kontext zählt. Beginnen Sie mit dem kleinsten Modell, das Ihren Bedarf erfüllt, und wechseln Sie nur zum 12B-Modell, wenn die Qualität es erfordert.
#Wenn die 5070 nicht mehr ausreicht
Drei Anzeichen weisen darauf hin, dass Sie mehr Speicher benötigen. Sie möchten ein Modell mit 14 bis 24 Milliarden Parametern nutzen, etwa Mistral Small 24B oder gpt-oss 20B. Sie benötigen bei einem 12B-Modell einen Kontext von mehr als 16.000 Tokens. Sie laden mehrere Modelle gleichzeitig: für Generierung, Embeddings und Reranking. In diesen Fällen liegt es nicht an der Geschwindigkeit der 5070; die nächsten Stufen sind die 5070 Ti, die 5080 oder eine Karte mit 24 GB.
#Was sich mit 12 GB nicht laden lässt
| Modell | Größe | Konsequenz |
|---|---|---|
| Mistral Small 24B | 14 GB | 2 GB werden in den Arbeitsspeicher ausgelagert |
| Qwen 3.5 27B | 17 GB | Überschreitet die Speichergrenze deutlich |
| Qwen 3.5 35B | 24 GB | Außer Reichweite: Mindestens 24 GB VRAM erforderlich |
| 70B-Modelle in Q4 | etwa 40 GB | Mit einer Consumer-GPU mit 12 GB nicht machbar |
Ein Modell, das nicht vollständig in den Grafikspeicher passt, stürzt nicht ab: Ein Teil der Gewichte wird aus dem System-RAM gelesen, und der Durchsatz sinkt deutlich, da die PCIe-Verbindung wesentlich langsamer ist als GDDR7. Ein 14 GB großes Modell ist auf einer Karte mit 12 GB daher für einen Test nutzbar, aber nicht für den täglichen Gebrauch. Für diese Modelle sollten Sie 16 GB oder mehr anvisieren.
#Auf derselben Grafikkarte spielen und ein LLM ausführen
Die RTX 5070 wird oft für beide Zwecke genutzt. Das geladene Modell belegt VRAM, solange es im Speicher bleibt, und ein aktuelles Spiel benötigt ebenfalls mehrere Gigabyte: Bei 12 GB überschreiten beide zusammen schnell die verfügbare Kapazität. Die Regel ist einfach: Entladen Sie das Modell, bevor Sie ein Spiel starten, und laden Sie es anschließend wieder. Ollama gibt den Speicher nach einer Zeit der Inaktivität frei, und ollama ps zeigt an, was noch geladen ist. Wenn Sie während Ihrer Spielpartien einen verfügbaren Assistenten möchten, wählen Sie vorzugsweise ein kleines Modell mit 4 Milliarden Parametern.
#Stattdessen eine gebrauchte 4070 Ti Super?
Die Frage taucht häufig auf: eine gebrauchte RTX 4070 Ti Super mit 16 GB oder eine neue RTX 5070 mit 12 GB. Für LLMs gibt die Speicherkapazität den Ausschlag: Mit 16 GB lassen sich 14 GB große Modelle laden, die nicht in den Speicher der 5070 passen. Die 5070 bietet dagegen die Vorteile einer Garantie, eines geringeren Stromverbrauchs (250 W) und des GDDR7-Speichers. Wenn Ihre Modelle in 12 GB passen, ist die neue 5070 eine vernünftige Wahl; andernfalls hat die Speicherkapazität Vorrang. Der entsprechende Leitfaden behandelt die 4070 Ti Super im Detail.
#5070 oder 5070 Ti: 12 GB oder 16 GB
| Kriterium | RTX 5070 | RTX 5070 Ti |
|---|---|---|
| Speicher | 12 GB GDDR7, 192 Bit | 16 GB GDDR7, 256 Bit |
| Bandbreite | 672 GB/s | 896 GB/s |
| CUDA-Kerne | 6 144 | 8 960 |
| Graphikleistung | 250 W | 300 W |
| Mindestanforderungen an die Stromversorgung | 650 W | 750 W |
| Modelle mit 14 GB Speicherbedarf | Nein | Ja, mit 2 GB Reserve |
Die 5070 Ti bietet zwei Vorteile: 4 GB mehr Speicher, wodurch Mistral Small 24B und gpt-oss 20B möglich werden, und 33 % mehr Bandbreite. Die empfohlenen Preise zum Marktstart lagen bei 549 US-Dollar für die 5070 und 749 US-Dollar für die 5070 Ti, also 200 US-Dollar auseinander. Wenn Ihre Modelle in 12 GB passen, reicht die 5070; wenn Sie Modelle mit einem Speicherbedarf von 14 GB nutzen möchten, ist der Aufpreis eine gute Investition. Sehen Sie sich die Preisübersicht an, um die Preise zum Kaufzeitpunkt zu vergleichen.
- Welches LLM eignet sich für eine RTX 5070 Ti?
- Welches LLM für 12 GB VRAM
- Preise für Grafikkarten für lokale KI
#Fazit 2026
- Kaufen Sie eine 5070, wenn
- Ihre Modelle haben 4B bis 12B Parameter und Sie möchten die Geschwindigkeit der Blackwell-Generation nutzen. Die Karte ist für diesen Einsatz sehr leistungsfähig.
- Bevorzugen Sie die 5070 Ti, wenn
- Sie möchten Modelle mit 14 bis 24 Milliarden Parametern erkunden: Die 16 GB machen den Unterschied.
- Vorsicht beim gleichzeitigen Betrieb eines Spiels und eines LLM
- Ein aktuelles Spiel und ein geladenes Modell teilen sich die 12 GB: Schließen Sie eines, bevor Sie das andere starten.
Zusammenfassend ist die 5070 eine schnelle Karte, deren einziger Nachteil die Begrenzung auf 12 GB ist. Wenn Sie diese Grenze heute nicht stört, wird sie Sie auch in den kommenden Monaten nicht stören, solange Sie bei Modellen mit 4B bis 12B bleiben; falls sie Sie stört, ist es besser, schon jetzt für mehr Speicherkapazität zu bezahlen.
- Quelle: offizielle NVIDIA-Spezifikationen (RTX 5070 und 5070 Ti)
- Quelle: offizielle FAQ von Ollama (Flash Attention, K/V-Cache, Parallelismus)
- Quelle: Größen von Gemma 4 in der Ollama-Bibliothek
#Häufig gestellte Fragen
Kann die RTX 5070 12 GB ein 70B-Modell ausführen?+
Wie viele Tokens pro Sekunde auf einer RTX 5070?+
Reichen 12 GB für den beruflichen Einsatz im Jahr 2026 aus?+
Unterstützt die RTX 5070 DLSS 4 und ein LLM gleichzeitig?+
Welches Netzteil benötigt eine RTX 5070?+
Wie lässt sich überprüfen, ob das Modell in den VRAM passt?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.