Welcher LLM auf RTX 3070 / 3070 Ti (8 GB) ?
Eine RTX 3070 oder 3070 Ti bietet 8 GB VRAM: Modelle mit bis zu 8 bis 9 Milliarden Parametern in Q4 bleiben vollständig im VRAM (Granite 4.2 8B mit 5,3 GB, Qwen 3.5 9B mit 6,6 GB), Modelle mit 12 Milliarden Parametern oder mehr hingegen nicht. Die 3070 Ti generiert bei gleicher Speicherkapazität dank 608 GB/s gegenüber 448 GB/s schneller. Es liegen keine veröffentlichten Messungen vor: Die Durchsatzwerte sind Schätzungen.
Mit 8 GB bleiben die RTX 3070 und die 3070 Ti brauchbare Grafikkarten für ein Modell mit 8 Milliarden Parametern, doch ihre Speicherkapazität setzt ihnen Grenzen. Dieser Leitfaden stellt die Modelle vor, die tatsächlich in den Speicher passen, mit ihren genauen Dateigrößen, anhand der Bandbreite geschätzten Generierungsraten, den Kontextgrenzen und den Unterschieden zu vergleichbaren Grafikkarten. Sie erfahren auch, wann Sie auf 12 oder 16 GB wechseln sollten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 3070 und 3070 Ti für einen lokalen LLM: Was mit 8 GB möglich ist
Für ein lokales LLM liegt der Wert einer RTX 3070 oder 3070 Ti in ihren 8 GB VRAM, und diese Kapazität bestimmt alles: Modelle mit bis zu 8 bis 9 Milliarden Parametern passen in Q4 hinein, solche mit 12 Milliarden oder mehr nicht. Laut der Ollama-Bibliothek belegt Granite 4.2 8B 5,3 GB, Qwen3 8B 5,2 GB und Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) und gpt-oss 20B (14 GB) überschreiten die Speicherkapazität der Karte. Die 3070 Ti generiert mit 608 GB/s gegenüber 448 GB/s bei der 3070 schneller, hat aber dieselbe Kapazität.
- Speicher
- 8 GB an einem 256-Bit-Bus: GDDR6 mit 448 GB/s bei der 3070, GDDR6X mit 608 GB/s bei der 3070 Ti, laut der Tabelle auf Wikipedia und NVIDIA.
- Berechnung
- 5.888 CUDA-Kerne für die 3070 und 6.144 für die 3070 Ti, gemäß Wikipedia.
- Verbrauch
- Laut NVIDIA hat die 3070 eine Leistungsaufnahme von 220 W und benötigt ein Netzteil mit 650 W; bei der 3070 Ti sind es 290 W und 750 W. Das ist mehr als die 550 W, die man manchmal liest.
#Modelle, die in 8 GB passen
Die Modellgewichte stammen aus den Dateien der Ollama-Bibliothek, die am 29. September 2026 eingesehen wurden. Die Reserve ist der Speicher, der von 8 GB übrig bleibt, bevor Kontext, Cache und Puffer der Inferenz-Engine berücksichtigt werden; sie muss auch den Speicherbedarf für die Bildschirmausgabe abdecken, wenn die Grafikkarte Ihren Bildschirm ansteuert.
| Modell | Ollama-Datei | Bruttomarge | Fazit |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Sehr komfortabel, langer Kontext möglich |
| Qwen3 8B | 5,2 GB | 2,8 GB | Komfortabel |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Komfortabel |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Passt, Kontext begrenzen |
| Gemma 4 12B | 7,6 GB | 0,4 GB | Ohne Speicherreserve: kein sinnvoll nutzbarer Kontext |
| Qwen3 14B | 9,3 GB | Es fehlen 1,3 GB | Passt nicht |
| gpt-oss 20B | 14 GB | 6 GB fehlen | Passt nicht |
Der sicherste Ausgangspunkt ist ein Modell mit 8 Milliarden Parametern: Granite 4.2 8B oder Qwen3 8B lassen nahezu 3 GB für den Kontext frei. Qwen 3.5 9B ist in der Praxis die Obergrenze: 1,4 GB Spielraum reichen für ein kurzes Gespräch, aber nicht für ein langes Dokument. Bei einem lokalen RAG kommt ein Embedding-Modell hinzu: bge-m3 belegt in Ollama 1,2 GB, zusammen mit Granite 4.2 8B also insgesamt 6,5 GB. Damit bleiben 1,5 GB für den Rest.
#Ollama auf einer RTX 3070 installieren
- 01Treiber prüfenFühren Sie nvidia-smi in einem Terminal aus: Die Treiberversion muss 550 oder höher sein (551.61 unter Windows), und als Gesamtspeicher müssen etwa 8 GB angezeigt werden.
- 02Ollama installierenInstallieren Sie Ollama von der offiziellen Website. Die lokale API lauscht auf http://localhost:11434.
- 03Ein Modell startenFühren Sie ollama run granite4.2:8b aus: Der Download von 5,3 GB erfolgt einmalig.
- 04Verteilung prüfenFühren Sie in einem zweiten Terminal ollama ps aus: Die Spalte Processeur muss 100 % GPU anzeigen. Eine Aufteilung zwischen CPU und GPU bedeutet, dass das Modell oder der Kontext teilweise in den Arbeitsspeicher ausgelagert wird.
- 05Kontext anpassenLegen Sie die Kontextlänge mit OLLAMA_CONTEXT_LENGTH fest und führen Sie anschließend ollama ps erneut aus. Setzen Sie beim Serverstart OLLAMA_FLASH_ATTENTION auf 1 und OLLAMA_KV_CACHE_TYPE auf q8_0, um VRAM zu sparen.
#Durchsatz: Was die Bandbreite erwarten lässt
Keine maßgebliche Benchmark-Website veröffentlicht Messwerte für die RTX 3070: Die folgenden Werte sind daher Schätzungen, keine Messungen. Die Methode beruht darauf, dass die Generierung durch die Bandbreite begrenzt ist: Die theoretische Obergrenze entspricht ungefähr der Bandbreite geteilt durch die Größe der Modellgewichte. Für Granite 4.2 8B (5,3 GB) ergibt 448 ÷ 5,3 auf der 3070 85 Tokens pro Sekunde und 608 ÷ 5,3 auf der 3070 Ti 115. Für Qwen 3.5 9B (6,6 GB) liegen die Obergrenzen bei 68 und 92.
Die Community-Rangliste von llama.cpp ermöglicht es, diese Obergrenzen in Größenordnungen zu übersetzen. Bei Llama 2 7B Q4_0 generiert eine RTX 3060 Ti mit 8 GB, eine der 3070 ähnliche Karte mit einem 256-Bit-Bus, 92,23 Tokens pro Sekunde ohne Flash Attention und 96,50 mit Flash Attention. Eine RTX 3060 mit 12 GB und 360 GB/s generiert 75,57 beziehungsweise 76,92 Tokens pro Sekunde: Das Verhältnis (1,22) entspricht annähernd dem Verhältnis der Bandbreiten (448 ÷ 360 = 1,24). Eine 3070 dürfte daher ähnliche Generierungsraten wie die 3060 Ti erreichen, etwa 90 bis 95 Tokens pro Sekunde bei einem 7B-Modell, und eine 3070 Ti etwa 35 % mehr, also 120 bis 130. Das sind Schätzungen.
| Modell | Ollama-Datei | Limit 3070 (448 GB/s) | Maximaler Wert: 3070 Ti (608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 | 179 |
| Granite 4.2 8B | 5,3 GB | 85 | 115 |
| Qwen 3.5 9B | 6,6 GB | 68 | 92 |
| Gemma 4 12B | 7,6 GB | 59 | 80 |
Die tatsächlichen Durchsatzraten liegen bei den andernorts gemessenen Karten bei ungefähr 70 bis 80 % dieser Obergrenzen: Rechnen Sie daher mit 55 bis 65 Tokens pro Sekunde für Granite 4.2 8B auf einer 3070. Unabhängig vom genauen Wert liegen diese Geschwindigkeiten über der menschlichen Lesegeschwindigkeit: Die Grenze der 3070 liegt in der Speicherkapazität, nicht in der Geschwindigkeit.
#Die Grenzen von 8 GB: Kontext, RAG und große Modelle
Ollama legt den Standardkontext anhand des Videospeichers fest: Die Dokumentation nennt 4k Tokens bei weniger als 24 GiB VRAM und empfiehlt mindestens 64 000 Tokens für Agenten, Websuche und Code-Tools. Mit 8 GB sind 64 000 Tokens bei einem Modell mit 8 Milliarden Parametern nicht realistisch: Der KV-Cache, der die Schlüssel und Werte der Attention für jedes Token speichert, beansprucht die verbleibende Speicherreserve. Laut der FAQ von Ollama reduziert die q8_0-Quantisierung des Caches dessen Speicherbedarf auf etwa die Hälfte des Bedarfs bei f16, bei sehr geringem Präzisionsverlust: Dies ist die erste Einstellung, die aktiviert werden sollte.
- Modelle mit 12 bis 24 Milliarden Parametern
- Gemma 4 12B (7,6 GB) lässt keinen Platz für den Kontext; Qwen3 14B (9,3 GB) und gpt-oss 20B (14 GB) passen nicht in den Grafikspeicher. Sie werden teilweise in den Arbeitsspeicher ausgelagert, wodurch die Geschwindigkeit einbricht.
- Langer Kontext
- Mit Qwen 3.5 9B ist die Speicherreserve von 1,4 GB schnell aufgebraucht: Begrenzen Sie den Kontext auf einige Tausend Tokens und behalten Sie ollama ps im Blick.
- Mehrstufiges RAG
- Granite 4.2 8B und bge-m3 belegen 6,5 GB: Ein zusätzlicher Reranker oder ein zweites Modell überschreitet die verfügbare Speicherkapazität.
- Fine-tuning
- Laut Unsloth beträgt das absolute Minimum bei 4-Bit-QLoRA 3,5 GB für 3 Milliarden und 6 GB für 8 Milliarden Parameter: Ein 8B-Modell passt gerade noch in den Speicher, mit einer Batchgröße von 1 und einem kurzen Kontext.
Eine einfache Methode, um unter 8 GB zu bleiben, besteht aus drei Einstellungen. Wählen Sie zunächst ein Modell, dessen Datei mindestens 2 GB Spielraum lässt: Granite 4.2 8B oder Qwen3 8B. Aktivieren Sie anschließend den quantisierten Cache im Format q8_0 und Flash Attention, das laut dem offiziellen Flash-Attention-Repository mit Ampere-GPUs wie der 3070 kompatibel ist. Erhöhen Sie schließlich den Kontext schrittweise von 4.000 auf 8.000 und dann auf 16.000 Tokens und führen Sie bei jeder Stufe ollama ps erneut aus: Sobald ein CPU-Anteil angezeigt wird, kehren Sie zur vorherigen Stufe zurück. Dieses schrittweise Vorgehen verhindert, dass Sie die Grenze erst mitten im Gespräch entdecken.
#3070 im Vergleich zu anderen Karten mit 8 bis 16 GB
| Karte | Speicher | Bandbreite | Was sie verändert |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | Modelle mit 8 bis 9 Milliarden Parametern |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | Gleiche Kapazität, schnellere Generierung |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | Ermöglicht zusätzlich Modelle mit 12 bis 14 Milliarden Parametern |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | Ermöglicht zusätzlich gpt-oss 20B, ist aber langsamer |
Diese Tabelle verdeutlicht den Kompromiss. Die 3060 12 GB hat eine um 20 % niedrigere Bandbreite als die 3070, verfügt aber über 4 GB mehr: Sie akzeptiert Qwen3 14B (9,3 GB), was die 3070 ablehnt. Die 4060 Ti 16 GB ergänzt die Klasse der 20 Milliarden Parameter, wobei ihre Bandbreite von 288 GB/s sie bei kleineren Modellen langsamer macht. Für ein LLM hat die Kapazität Vorrang vor der Geschwindigkeit, sobald das angestrebte Modell 7,5 GB überschreitet.
#Fazit: behalten, ersetzen oder nicht kaufen
| Situation | Entscheidung | Begründung mit Zahlen |
|---|---|---|
| Sie besitzen bereits eine 3070 und möchten ein 8B-Modell nutzen | Behalten | Granite 4.2 8B : 5,3 GB, geschätzte Geschwindigkeit von etwa 60 Tok/s |
| Sie möchten ein Modell mit 12B bis 14B Parametern | Auf 12 oder 16 GB wechseln | Qwen3 14B benötigt 9,3 GB, die 3070 hat 8 GB |
| Sie möchten ein 20B-Modell oder einen langen Kontext | Karte mit 16 GB oder mehr | gpt-oss 20B ist 14 GB groß |
| Sie schwanken zwischen 3070 und 3070 Ti | Nehmen Sie die günstigste | Gleiche Kapazität, 608 gegen 448 GB/s |
| Sie suchen eine Grafikkarte für den Einstieg | Mit einer 3060 12 GB vergleichen | Mehr Speicher bei ähnlicher Bandbreite |
Die 3070 ist eine ordentliche Karte für ein Modell mit 8 Milliarden Parametern, mehr aber auch nicht. Als Einstiegskarte bleibt sie nützlich: Ollama unterstützt sie, und ein Modell mit 8 Milliarden Parametern antwortet darauf schneller, als man liest. Sie eignet sich nicht, wenn Sie Code-Agenten einsetzen oder lange Dokumente verarbeiten möchten: Dafür ist ein Kontext nötig, für den 8 GB nicht genügend Platz lassen. Wenn Sie sie bereits haben, reicht sie aus, um lokale LLMs kennenzulernen. Wenn Sie eine Karte ausschließlich für diesen Zweck auswählen, achten Sie zuerst auf die Speicherkapazität: Ein größeres Modell, das in den Speicher passt, ist besser als ein kleineres, schnelleres Modell. Die aktuellen Preise finden Sie in unserer Preisübersicht, die zweimal pro Woche den niedrigsten Preis jeder Karte erfasst.
- Quelle: NVIDIA, Spezifikationen von RTX 3070 und 3070 Ti
- Quelle: Community-Rangliste von llama.cpp auf CUDA
- Quelle: Ollama-Dokumentation, Kontextlänge
- Quelle: Ollama-FAQ, Flash Attention und KV-Cache
- Quelle: Unsloth, für Fine-Tuning erforderlicher VRAM
#Häufig gestellte Fragen
Welches LLM kann man auf einer RTX 3070 laufen lassen?+
Kann die RTX 3070 ein Modell mit 14 oder 24 Milliarden Parametern ausführen?+
RTX 3070 oder RTX 3060 12 GB für ein LLM?+
Welche Unterschiede gibt es zwischen 3070 und 3070 Ti für ein LLM?+
Welche Stromversorgung für eine RTX 3070 Ti?+
Lässt sich ein Modell auf einer RTX 3070 per Fine-Tuning anpassen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.