Mittelstufe 11 Min.RTX 50

Welcher LLM für die RTX 5070 (12 GB)? ?

Direkte Antwort

Die RTX 5070 verfügt über 12 GB GDDR7 mit einer Bandbreite von 672 GB/s: Sie lädt alle Modelle bis etwa 10 GB in den VRAM, darunter Qwen 3.5 9B (6,6 GB) und Gemma 4 12B (7,7 bis 8 GB), mit ausreichend Spielraum für den Kontext. Mistral Small 24B und gpt-oss 20B mit jeweils 14 GB kann sie nicht in den VRAM laden. Ihre theoretische Obergrenze liegt bei etwa 127 Tokens/s für ein Modell mit 5,3 GB, und die Grenze von 12 GB sollten Sie vor dem Kauf im Blick behalten.

Die RTX 5070 ist die schnellste Karte mit 12 GB der Blackwell-Generation und hat eine Bandbreite von 672 GB/s. Ihre Herausforderung ist nicht die Geschwindigkeit, sondern die Kapazität: 12 GB reichen für Modelle von 4B bis 12B, aber nicht darüber hinaus. Dieser Leitfaden zeigt anhand von Zahlen, was in den Speicher passt, was dessen Kapazität überschreitet, wie Sie Ollama für den Kontext einstellen und ab wann die 5070 Ti mit 16 GB der richtige Kauf ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für diese Konfiguration: RTX 5070 12 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#RTX 5070 für ein lokales LLM: Was 12 GB GDDR7 ermöglichen

Eine RTX 5070 lädt Modelle mit 4B bis 12B in Q4 problemlos. Laut der Ollama-Bibliothek benötigt Qwen 3.5 9B 6,6 GB und Gemma 4 12B 7,7 bis 8 GB: Beide passen in die 12 GB und lassen 4 bis 5 GB Spielraum für den Kontext, was mit quantisiertem K/V-Cache 16.000 Tokens oder mehr ermöglicht. Die Karte kann hingegen kein Modell mit einem Speicherbedarf von 14 GB laden: Mistral Small 24B und gpt-oss 20B überschreiten die 12 GB. Ihre Geschwindigkeit ist für die interaktive Nutzung ausgezeichnet: 672 GB/s über einen 192-Bit-Bus. Die 5070 eignet sich daher für alltägliche Anwendungen, stößt aber an eine klare Grenze, sobald Sie Modelle mit höherer Qualität einsetzen möchten.

Architektur
Blackwell, 6.144 CUDA-Kerne und Tensor-Kerne der 5. Generation gemäß NVIDIA.
Speicher
12 GB GDDR7 auf einem Bus von 192 Bit, 672 GB/s Bandbreite nach Wikipedia.
Leistung
250 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC eine Mindestnetzteilleistung von 650 W an.
Einführungspreis
549 US-Dollar, Veröffentlichung am 5. März 2025 nach Wikipedia.

#Welche Modelle passen in 12 GB?

Modelle auf der RTX 5070 (Größenangaben von Ollama, nur Modellgewichte)
ModellGrößeVerbleibender Spielraum bei 12 GBFazit
Granite 4.2 8B5,3 GB6,7 GBSehr breit, langer Kontext
Qwen 3.5 9B6,6 GB5,4 GBKomfortabel
Gemma 4 12B7,7 bis 8,0 GB4 bis 4,3 GBKomfortabel nutzbar, Kontext mit 16.000 Tokens möglich
Mistral Small 24B14 GBNegativPasst nicht in den VRAM
Qwen 3.5 27B17 GBNegativPasst nicht in den VRAM

Als Faustregel nennt die Website etwa 0,6 GB pro Milliarde Parameter in Q4, ausschließlich für die Gewichte. Bei 12 GB liegt die praktische Grenze damit bei etwa 14 bis 16 Milliarden Parametern, wenn der Kontext kurz bleibt, und bei etwa 12 Milliarden, wenn Sie mit langen Dokumenten arbeiten möchten. Bei einem Modell mit 8 bis 9 Milliarden Parametern ist der verbleibende Spielraum deutlich größer als für eine übliche Kontextlänge nötig.

#Ollama installieren und die Karte prüfen

  1. 01
    NVIDIA-Treiber
    Ollama erfordert einen NVIDIA-Treiber ab Version 550. Installieren Sie für eine RTX 50 den neuesten von NVIDIA angebotenen Treiber und überprüfen Sie ihn mit nvidia-smi.
  2. 02
    Ollama installieren
    Laden Sie den Installer für Ihr System herunter: CUDA ist integriert.
  3. 03
    Ein Modell starten
    Probieren Sie ollama run gemma4:12b aus, um die Grenze der Karte zu testen, oder ollama run qwen3.5:9b für ein leichteres Modell.
  4. 04
    Prüfen
    Führen Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.

#Welche Geschwindigkeit ist zu erwarten: eine Obergrenze, keine Messung

Kein Durchsatz wird hier als eigene Messung präsentiert. Die theoretische Obergrenze für die Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080, deren Obergrenze bei 156 Tokens/s liegt, also etwa 68 %. Setzt man 70 % als groben Richtwert an, erhält man die folgenden Schätzungen für einen kurzen Kontext.

Theoretischer Grenzwert auf RTX 5070 (672 GB/s)
Modell (Q4)ModellgrößeObergrenzeEstimate at 70 %
Granite 4.2 8B5,3 GB127 Tokens/setwa 89 Tokens/s
Qwen 3.5 9B6,6 GB102 tokens/setwa 71 tokens/s
Gemma 4 12B7,7 GB87 Tokens/setwa 61 Tokens/s

Diese Obergrenzen liegen deutlich über der menschlichen Lesegeschwindigkeit: Die 5070 wird bei diesen Modellen niemals langsam sein. Sie ist durch die Speicherkapazität begrenzt, nicht durch die Geschwindigkeit. Mit zunehmender Kontextlänge fallen die geschätzten Werte niedriger aus, und die Verarbeitung des Prompts beansprucht die Rechenleistung stärker als den Speicher.

#Den Kontext bei 12 GB verwalten

Die Speicherreserve von 4 GB bei Gemma 4 12B ist bei langem Kontext schnell aufgebraucht. Ollama quantisiert den K/V-Cache in q8_0, um etwa halb so viel Speicher wie mit dem Standardformat f16 zu benötigen, laut Dokumentation mit einem sehr geringen Genauigkeitsverlust; dafür ist Flash Attention erforderlich. Diese Einstellung macht ein 12B-Modell für lange Dokumente nutzbar.

Ollama-Servereinstellungen (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

Ein Fallstrick, wenn Sie mehrere Personen bedienen: Mehrere parallele Anfragen erhöhen den reservierten Kontext entsprechend, wie die FAQ von Ollama erläutert. Ein Modell, das für einen Nutzer noch in den Speicher passt, kann bei drei Nutzern die Speicherkapazität überschreiten.

#Was man mit 12 GB tatsächlich macht

Zwölf Gigabyte verändern die Nutzungsmöglichkeiten gegenüber 8 GB. Ein 9B-Modell lässt genug Platz für einen Kontext von 16.000 Tokens und ein kleines Embedding-Modell: Das ist eine komfortable Konfiguration für ein persönliches RAG-System. Ein 12B-Modell liefert beim Schreiben und Zusammenfassen qualitativ bessere Antworten, allerdings auf Kosten eines kleineren Kontexts. Ein Code-Assistent kommt mit einem 8B- bis 12B-Modell und gezielten Ausschnitten aus, aber nicht mit einem ganzen Repository, das auf einmal geladen wird.

Anwendungen auf RTX 5070 (12 GB)
NutzungRealistisch?Empfohlene Konfiguration
Täglicher ChatJa, sehr komfortabelQwen 3.5 9B oder Gemma 4 12B
Lange Dokumente zusammenfassenJa, mit einem Kontext von 16.000 TokenGemma 4 12B, K/V-Cache in q8_0
RAG mit Ihren DateienJaQwen 3.5 9B und leichte Embeddings
Code-AssistentJa, mit einem Modell von 8B bis 12BGezielte Auszüge, Kontext von 8.192 Tokens
Modelle ab 14 GBNein16 GB VRAM einplanen

Die Wahl zwischen 9B und 12B hängt von der Aufgabe ab. Das 9B-Modell lässt mehr Spielraum und eignet sich für lange Kontexte; das 12B-Modell ist leistungsfähiger, aber jedes Gigabyte für den Kontext zählt. Beginnen Sie mit dem kleinsten Modell, das Ihren Bedarf erfüllt, und wechseln Sie nur zum 12B-Modell, wenn die Qualität es erfordert.

#Wenn die 5070 nicht mehr ausreicht

Drei Anzeichen weisen darauf hin, dass Sie mehr Speicher benötigen. Sie möchten ein Modell mit 14 bis 24 Milliarden Parametern nutzen, etwa Mistral Small 24B oder gpt-oss 20B. Sie benötigen bei einem 12B-Modell einen Kontext von mehr als 16.000 Tokens. Sie laden mehrere Modelle gleichzeitig: für Generierung, Embeddings und Reranking. In diesen Fällen liegt es nicht an der Geschwindigkeit der 5070; die nächsten Stufen sind die 5070 Ti, die 5080 oder eine Karte mit 24 GB.

#Was sich mit 12 GB nicht laden lässt

Modelle oberhalb der 12-GB-Schwelle (Größenangaben von Ollama)
ModellGrößeKonsequenz
Mistral Small 24B14 GB2 GB werden in den Arbeitsspeicher ausgelagert
Qwen 3.5 27B17 GBÜberschreitet die Speichergrenze deutlich
Qwen 3.5 35B24 GBAußer Reichweite: Mindestens 24 GB VRAM erforderlich
70B-Modelle in Q4etwa 40 GBMit einer Consumer-GPU mit 12 GB nicht machbar

Ein Modell, das nicht vollständig in den Grafikspeicher passt, stürzt nicht ab: Ein Teil der Gewichte wird aus dem System-RAM gelesen, und der Durchsatz sinkt deutlich, da die PCIe-Verbindung wesentlich langsamer ist als GDDR7. Ein 14 GB großes Modell ist auf einer Karte mit 12 GB daher für einen Test nutzbar, aber nicht für den täglichen Gebrauch. Für diese Modelle sollten Sie 16 GB oder mehr anvisieren.

#Auf derselben Grafikkarte spielen und ein LLM ausführen

Die RTX 5070 wird oft für beide Zwecke genutzt. Das geladene Modell belegt VRAM, solange es im Speicher bleibt, und ein aktuelles Spiel benötigt ebenfalls mehrere Gigabyte: Bei 12 GB überschreiten beide zusammen schnell die verfügbare Kapazität. Die Regel ist einfach: Entladen Sie das Modell, bevor Sie ein Spiel starten, und laden Sie es anschließend wieder. Ollama gibt den Speicher nach einer Zeit der Inaktivität frei, und ollama ps zeigt an, was noch geladen ist. Wenn Sie während Ihrer Spielpartien einen verfügbaren Assistenten möchten, wählen Sie vorzugsweise ein kleines Modell mit 4 Milliarden Parametern.

#Stattdessen eine gebrauchte 4070 Ti Super?

Die Frage taucht häufig auf: eine gebrauchte RTX 4070 Ti Super mit 16 GB oder eine neue RTX 5070 mit 12 GB. Für LLMs gibt die Speicherkapazität den Ausschlag: Mit 16 GB lassen sich 14 GB große Modelle laden, die nicht in den Speicher der 5070 passen. Die 5070 bietet dagegen die Vorteile einer Garantie, eines geringeren Stromverbrauchs (250 W) und des GDDR7-Speichers. Wenn Ihre Modelle in 12 GB passen, ist die neue 5070 eine vernünftige Wahl; andernfalls hat die Speicherkapazität Vorrang. Der entsprechende Leitfaden behandelt die 4070 Ti Super im Detail.

#5070 oder 5070 Ti: 12 GB oder 16 GB

RTX 5070 und RTX 5070 Ti: Was sich für den LLM ändert
KriteriumRTX 5070RTX 5070 Ti
Speicher12 GB GDDR7, 192 Bit16 GB GDDR7, 256 Bit
Bandbreite672 GB/s896 GB/s
CUDA-Kerne6 1448 960
Graphikleistung250 W300 W
Mindestanforderungen an die Stromversorgung650 W750 W
Modelle mit 14 GB SpeicherbedarfNeinJa, mit 2 GB Reserve

Die 5070 Ti bietet zwei Vorteile: 4 GB mehr Speicher, wodurch Mistral Small 24B und gpt-oss 20B möglich werden, und 33 % mehr Bandbreite. Die empfohlenen Preise zum Marktstart lagen bei 549 US-Dollar für die 5070 und 749 US-Dollar für die 5070 Ti, also 200 US-Dollar auseinander. Wenn Ihre Modelle in 12 GB passen, reicht die 5070; wenn Sie Modelle mit einem Speicherbedarf von 14 GB nutzen möchten, ist der Aufpreis eine gute Investition. Sehen Sie sich die Preisübersicht an, um die Preise zum Kaufzeitpunkt zu vergleichen.

#Fazit 2026

Kaufen Sie eine 5070, wenn
Ihre Modelle haben 4B bis 12B Parameter und Sie möchten die Geschwindigkeit der Blackwell-Generation nutzen. Die Karte ist für diesen Einsatz sehr leistungsfähig.
Bevorzugen Sie die 5070 Ti, wenn
Sie möchten Modelle mit 14 bis 24 Milliarden Parametern erkunden: Die 16 GB machen den Unterschied.
Vorsicht beim gleichzeitigen Betrieb eines Spiels und eines LLM
Ein aktuelles Spiel und ein geladenes Modell teilen sich die 12 GB: Schließen Sie eines, bevor Sie das andere starten.

Zusammenfassend ist die 5070 eine schnelle Karte, deren einziger Nachteil die Begrenzung auf 12 GB ist. Wenn Sie diese Grenze heute nicht stört, wird sie Sie auch in den kommenden Monaten nicht stören, solange Sie bei Modellen mit 4B bis 12B bleiben; falls sie Sie stört, ist es besser, schon jetzt für mehr Speicherkapazität zu bezahlen.

#Häufig gestellte Fragen

FAQ
Kann die RTX 5070 12 GB ein 70B-Modell ausführen?+
Nein. Allein die Modellgewichte eines 70B-Modells in Q4 benötigen etwa 40 GB, also mehr als das Dreifache der 12 GB der Karte. Selbst mit einer Auslagerung in den System-RAM wäre die Generierung extrem langsam. Bleiben Sie bei 12 GB bei Modellen von 4B bis 12B; planen Sie für ein 70B-Modell mindestens 48 GB Speicher ein.
Wie viele Tokens pro Sekunde auf einer RTX 5070?+
Hier wird keine zuverlässige Messung veröffentlicht. Die theoretische Obergrenze, berechnet aus der Bandbreite von 672 GB/s geteilt durch die Modellgröße, liegt für Granite 4.2 8B (5,3 GB) bei etwa 127 Tokens/s; 70 % dieser Obergrenze entsprechen knapp 89 Tokens/s. Dies ist eine Schätzung, die mit zunehmender Kontextlänge sinkt.
Reichen 12 GB für den beruflichen Einsatz im Jahr 2026 aus?+
Für Chats, Zusammenfassungen, RAG oder Extraktion mit einem Modell mit 4 bis 12 Milliarden Parametern: ja. Für hochwertige Texterstellung oder einen Code-Assistenten für ein großes Repository übersteigen Modelle mit 14 bis 24 Milliarden Parametern, die 14 GB oder mehr benötigen, die Speicherkapazität der Karte: Planen Sie 16 GB ein.
Unterstützt die RTX 5070 DLSS 4 und ein LLM gleichzeitig?+
Beide funktionieren auf der Karte, teilen sich aber die 12 GB VRAM. Ein aktuelles Spiel belegt einen erheblichen Teil des Speichers: Laden Sie das Modell vor dem Spiel oder beenden Sie das Modell, während Sie spielen. Das LLM und das Spiel sollten bei 12 GB nicht gleichzeitig laufen.
Welches Netzteil benötigt eine RTX 5070?+
NVIDIA gibt eine Gesamtgrafikleistung von 250 W und eine Mindest-Netzteilleistung von 650 W für den gesamten PC an. Ein hochwertiges Netzteil mit 650 W ist geeignet; 550 W liegen unter der Empfehlung. Prüfen Sie auch die Anschlüsse Ihres Grafikkartenmodells.
Wie lässt sich überprüfen, ob das Modell in den VRAM passt?+
Führen Sie nach dem Laden ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen. Eine Aufteilung zwischen CPU und GPU bedeutet, dass ein Teil des Modells im System-RAM liegt, was die Generierung deutlich verlangsamt. Verringern Sie dann den Kontext, aktivieren Sie den K/V-Cache mit q8_0 oder wählen Sie ein kleineres Modell.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.