Einsteiger 11 Min.RTX 30

Welcher LLM auf RTX 3070 / 3070 Ti (8 GB) ?

Direkte Antwort

Eine RTX 3070 oder 3070 Ti bietet 8 GB VRAM: Modelle mit bis zu 8 bis 9 Milliarden Parametern in Q4 bleiben vollständig im VRAM (Granite 4.2 8B mit 5,3 GB, Qwen 3.5 9B mit 6,6 GB), Modelle mit 12 Milliarden Parametern oder mehr hingegen nicht. Die 3070 Ti generiert bei gleicher Speicherkapazität dank 608 GB/s gegenüber 448 GB/s schneller. Es liegen keine veröffentlichten Messungen vor: Die Durchsatzwerte sind Schätzungen.

Mit 8 GB bleiben die RTX 3070 und die 3070 Ti brauchbare Grafikkarten für ein Modell mit 8 Milliarden Parametern, doch ihre Speicherkapazität setzt ihnen Grenzen. Dieser Leitfaden stellt die Modelle vor, die tatsächlich in den Speicher passen, mit ihren genauen Dateigrößen, anhand der Bandbreite geschätzten Generierungsraten, den Kontextgrenzen und den Unterschieden zu vergleichbaren Grafikkarten. Sie erfahren auch, wann Sie auf 12 oder 16 GB wechseln sollten.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#RTX 3070 und 3070 Ti für einen lokalen LLM: Was mit 8 GB möglich ist

Für ein lokales LLM liegt der Wert einer RTX 3070 oder 3070 Ti in ihren 8 GB VRAM, und diese Kapazität bestimmt alles: Modelle mit bis zu 8 bis 9 Milliarden Parametern passen in Q4 hinein, solche mit 12 Milliarden oder mehr nicht. Laut der Ollama-Bibliothek belegt Granite 4.2 8B 5,3 GB, Qwen3 8B 5,2 GB und Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) und gpt-oss 20B (14 GB) überschreiten die Speicherkapazität der Karte. Die 3070 Ti generiert mit 608 GB/s gegenüber 448 GB/s bei der 3070 schneller, hat aber dieselbe Kapazität.

Speicher
8 GB an einem 256-Bit-Bus: GDDR6 mit 448 GB/s bei der 3070, GDDR6X mit 608 GB/s bei der 3070 Ti, laut der Tabelle auf Wikipedia und NVIDIA.
Berechnung
5.888 CUDA-Kerne für die 3070 und 6.144 für die 3070 Ti, gemäß Wikipedia.
Verbrauch
Laut NVIDIA hat die 3070 eine Leistungsaufnahme von 220 W und benötigt ein Netzteil mit 650 W; bei der 3070 Ti sind es 290 W und 750 W. Das ist mehr als die 550 W, die man manchmal liest.

#Modelle, die in 8 GB passen

Die Modellgewichte stammen aus den Dateien der Ollama-Bibliothek, die am 29. September 2026 eingesehen wurden. Die Reserve ist der Speicher, der von 8 GB übrig bleibt, bevor Kontext, Cache und Puffer der Inferenz-Engine berücksichtigt werden; sie muss auch den Speicherbedarf für die Bildschirmausgabe abdecken, wenn die Grafikkarte Ihren Bildschirm ansteuert.

Modelle für RTX 3070 / 3070 Ti (Ollama-Dateien, Q4, sofern nicht anders angegeben)
ModellOllama-DateiBruttomargeFazit
Qwen 3.5 4B3,4 GB4,6 GBSehr komfortabel, langer Kontext möglich
Qwen3 8B5,2 GB2,8 GBKomfortabel
Granite 4.2 8B5,3 GB2,7 GBKomfortabel
Qwen 3.5 9B6,6 GB1,4 GBPasst, Kontext begrenzen
Gemma 4 12B7,6 GB0,4 GBOhne Speicherreserve: kein sinnvoll nutzbarer Kontext
Qwen3 14B9,3 GBEs fehlen 1,3 GBPasst nicht
gpt-oss 20B14 GB6 GB fehlenPasst nicht

Der sicherste Ausgangspunkt ist ein Modell mit 8 Milliarden Parametern: Granite 4.2 8B oder Qwen3 8B lassen nahezu 3 GB für den Kontext frei. Qwen 3.5 9B ist in der Praxis die Obergrenze: 1,4 GB Spielraum reichen für ein kurzes Gespräch, aber nicht für ein langes Dokument. Bei einem lokalen RAG kommt ein Embedding-Modell hinzu: bge-m3 belegt in Ollama 1,2 GB, zusammen mit Granite 4.2 8B also insgesamt 6,5 GB. Damit bleiben 1,5 GB für den Rest.

#Ollama auf einer RTX 3070 installieren

  1. 01
    Treiber prüfen
    Führen Sie nvidia-smi in einem Terminal aus: Die Treiberversion muss 550 oder höher sein (551.61 unter Windows), und als Gesamtspeicher müssen etwa 8 GB angezeigt werden.
  2. 02
    Ollama installieren
    Installieren Sie Ollama von der offiziellen Website. Die lokale API lauscht auf http://localhost:11434.
  3. 03
    Ein Modell starten
    Führen Sie ollama run granite4.2:8b aus: Der Download von 5,3 GB erfolgt einmalig.
  4. 04
    Verteilung prüfen
    Führen Sie in einem zweiten Terminal ollama ps aus: Die Spalte Processeur muss 100 % GPU anzeigen. Eine Aufteilung zwischen CPU und GPU bedeutet, dass das Modell oder der Kontext teilweise in den Arbeitsspeicher ausgelagert wird.
  5. 05
    Kontext anpassen
    Legen Sie die Kontextlänge mit OLLAMA_CONTEXT_LENGTH fest und führen Sie anschließend ollama ps erneut aus. Setzen Sie beim Serverstart OLLAMA_FLASH_ATTENTION auf 1 und OLLAMA_KV_CACHE_TYPE auf q8_0, um VRAM zu sparen.
Grundlegende Befehle
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Durchsatz: Was die Bandbreite erwarten lässt

Keine maßgebliche Benchmark-Website veröffentlicht Messwerte für die RTX 3070: Die folgenden Werte sind daher Schätzungen, keine Messungen. Die Methode beruht darauf, dass die Generierung durch die Bandbreite begrenzt ist: Die theoretische Obergrenze entspricht ungefähr der Bandbreite geteilt durch die Größe der Modellgewichte. Für Granite 4.2 8B (5,3 GB) ergibt 448 ÷ 5,3 auf der 3070 85 Tokens pro Sekunde und 608 ÷ 5,3 auf der 3070 Ti 115. Für Qwen 3.5 9B (6,6 GB) liegen die Obergrenzen bei 68 und 92.

Die Community-Rangliste von llama.cpp ermöglicht es, diese Obergrenzen in Größenordnungen zu übersetzen. Bei Llama 2 7B Q4_0 generiert eine RTX 3060 Ti mit 8 GB, eine der 3070 ähnliche Karte mit einem 256-Bit-Bus, 92,23 Tokens pro Sekunde ohne Flash Attention und 96,50 mit Flash Attention. Eine RTX 3060 mit 12 GB und 360 GB/s generiert 75,57 beziehungsweise 76,92 Tokens pro Sekunde: Das Verhältnis (1,22) entspricht annähernd dem Verhältnis der Bandbreiten (448 ÷ 360 = 1,24). Eine 3070 dürfte daher ähnliche Generierungsraten wie die 3060 Ti erreichen, etwa 90 bis 95 Tokens pro Sekunde bei einem 7B-Modell, und eine 3070 Ti etwa 35 % mehr, also 120 bis 130. Das sind Schätzungen.

Schätzung der Generierung in Tokens pro Sekunde (theoretischer Maximalwert, RTX 3070 / 3070 Ti)
ModellOllama-DateiLimit 3070 (448 GB/s)Maximaler Wert: 3070 Ti (608 GB/s)
Qwen 3.5 4B3,4 GB132179
Granite 4.2 8B5,3 GB85115
Qwen 3.5 9B6,6 GB6892
Gemma 4 12B7,6 GB5980

Die tatsächlichen Durchsatzraten liegen bei den andernorts gemessenen Karten bei ungefähr 70 bis 80 % dieser Obergrenzen: Rechnen Sie daher mit 55 bis 65 Tokens pro Sekunde für Granite 4.2 8B auf einer 3070. Unabhängig vom genauen Wert liegen diese Geschwindigkeiten über der menschlichen Lesegeschwindigkeit: Die Grenze der 3070 liegt in der Speicherkapazität, nicht in der Geschwindigkeit.

#Die Grenzen von 8 GB: Kontext, RAG und große Modelle

Ollama legt den Standardkontext anhand des Videospeichers fest: Die Dokumentation nennt 4k Tokens bei weniger als 24 GiB VRAM und empfiehlt mindestens 64 000 Tokens für Agenten, Websuche und Code-Tools. Mit 8 GB sind 64 000 Tokens bei einem Modell mit 8 Milliarden Parametern nicht realistisch: Der KV-Cache, der die Schlüssel und Werte der Attention für jedes Token speichert, beansprucht die verbleibende Speicherreserve. Laut der FAQ von Ollama reduziert die q8_0-Quantisierung des Caches dessen Speicherbedarf auf etwa die Hälfte des Bedarfs bei f16, bei sehr geringem Präzisionsverlust: Dies ist die erste Einstellung, die aktiviert werden sollte.

Modelle mit 12 bis 24 Milliarden Parametern
Gemma 4 12B (7,6 GB) lässt keinen Platz für den Kontext; Qwen3 14B (9,3 GB) und gpt-oss 20B (14 GB) passen nicht in den Grafikspeicher. Sie werden teilweise in den Arbeitsspeicher ausgelagert, wodurch die Geschwindigkeit einbricht.
Langer Kontext
Mit Qwen 3.5 9B ist die Speicherreserve von 1,4 GB schnell aufgebraucht: Begrenzen Sie den Kontext auf einige Tausend Tokens und behalten Sie ollama ps im Blick.
Mehrstufiges RAG
Granite 4.2 8B und bge-m3 belegen 6,5 GB: Ein zusätzlicher Reranker oder ein zweites Modell überschreitet die verfügbare Speicherkapazität.
Fine-tuning
Laut Unsloth beträgt das absolute Minimum bei 4-Bit-QLoRA 3,5 GB für 3 Milliarden und 6 GB für 8 Milliarden Parameter: Ein 8B-Modell passt gerade noch in den Speicher, mit einer Batchgröße von 1 und einem kurzen Kontext.

Eine einfache Methode, um unter 8 GB zu bleiben, besteht aus drei Einstellungen. Wählen Sie zunächst ein Modell, dessen Datei mindestens 2 GB Spielraum lässt: Granite 4.2 8B oder Qwen3 8B. Aktivieren Sie anschließend den quantisierten Cache im Format q8_0 und Flash Attention, das laut dem offiziellen Flash-Attention-Repository mit Ampere-GPUs wie der 3070 kompatibel ist. Erhöhen Sie schließlich den Kontext schrittweise von 4.000 auf 8.000 und dann auf 16.000 Tokens und führen Sie bei jeder Stufe ollama ps erneut aus: Sobald ein CPU-Anteil angezeigt wird, kehren Sie zur vorherigen Stufe zurück. Dieses schrittweise Vorgehen verhindert, dass Sie die Grenze erst mitten im Gespräch entdecken.

#3070 im Vergleich zu anderen Karten mit 8 bis 16 GB

Ähnliche Grafikkarten für ein lokales LLM (NVIDIA, Hardware Corner)
KarteSpeicherBandbreiteWas sie verändert
RTX 30708 GB GDDR6448 GB/sModelle mit 8 bis 9 Milliarden Parametern
RTX 3070 Ti8 GB GDDR6X608 GB/sGleiche Kapazität, schnellere Generierung
RTX 3060 12 GB12 GB GDDR6360 GB/sErmöglicht zusätzlich Modelle mit 12 bis 14 Milliarden Parametern
RTX 4060 Ti 16 GB16 GB288 GB/sErmöglicht zusätzlich gpt-oss 20B, ist aber langsamer

Diese Tabelle verdeutlicht den Kompromiss. Die 3060 12 GB hat eine um 20 % niedrigere Bandbreite als die 3070, verfügt aber über 4 GB mehr: Sie akzeptiert Qwen3 14B (9,3 GB), was die 3070 ablehnt. Die 4060 Ti 16 GB ergänzt die Klasse der 20 Milliarden Parameter, wobei ihre Bandbreite von 288 GB/s sie bei kleineren Modellen langsamer macht. Für ein LLM hat die Kapazität Vorrang vor der Geschwindigkeit, sobald das angestrebte Modell 7,5 GB überschreitet.

#Fazit: behalten, ersetzen oder nicht kaufen

Welche Entscheidung passt zu Ihrer Situation?
SituationEntscheidungBegründung mit Zahlen
Sie besitzen bereits eine 3070 und möchten ein 8B-Modell nutzenBehaltenGranite 4.2 8B : 5,3 GB, geschätzte Geschwindigkeit von etwa 60 Tok/s
Sie möchten ein Modell mit 12B bis 14B ParameternAuf 12 oder 16 GB wechselnQwen3 14B benötigt 9,3 GB, die 3070 hat 8 GB
Sie möchten ein 20B-Modell oder einen langen KontextKarte mit 16 GB oder mehrgpt-oss 20B ist 14 GB groß
Sie schwanken zwischen 3070 und 3070 TiNehmen Sie die günstigsteGleiche Kapazität, 608 gegen 448 GB/s
Sie suchen eine Grafikkarte für den EinstiegMit einer 3060 12 GB vergleichenMehr Speicher bei ähnlicher Bandbreite

Die 3070 ist eine ordentliche Karte für ein Modell mit 8 Milliarden Parametern, mehr aber auch nicht. Als Einstiegskarte bleibt sie nützlich: Ollama unterstützt sie, und ein Modell mit 8 Milliarden Parametern antwortet darauf schneller, als man liest. Sie eignet sich nicht, wenn Sie Code-Agenten einsetzen oder lange Dokumente verarbeiten möchten: Dafür ist ein Kontext nötig, für den 8 GB nicht genügend Platz lassen. Wenn Sie sie bereits haben, reicht sie aus, um lokale LLMs kennenzulernen. Wenn Sie eine Karte ausschließlich für diesen Zweck auswählen, achten Sie zuerst auf die Speicherkapazität: Ein größeres Modell, das in den Speicher passt, ist besser als ein kleineres, schnelleres Modell. Die aktuellen Preise finden Sie in unserer Preisübersicht, die zweimal pro Woche den niedrigsten Preis jeder Karte erfasst.

#Häufig gestellte Fragen

FAQ
Welches LLM kann man auf einer RTX 3070 laufen lassen?+
Beginnen Sie mit Granite 4.2 8B (5,3 GB) oder Qwen3 8B (5,2 GB): Sie lassen fast 3 GB für den Kontext frei. Qwen 3.5 9B (6,6 GB) bildet die Obergrenze, mit 1,4 GB Speicherreserve. Bei mehr als 9 Milliarden Parametern in Q4 wird ein Teil des Modells in den Arbeitsspeicher ausgelagert.
Kann die RTX 3070 ein Modell mit 14 oder 24 Milliarden Parametern ausführen?+
Nein. Qwen3 14B benötigt in Ollama 9,3 GB, also 1,3 GB mehr Speicher, als die Karte bietet, und Modelle mit 24 Milliarden Parametern (15 GB) oder gpt-oss 20B (14 GB) benötigen fast das Doppelte. Sie werden teilweise in den Arbeitsspeicher ausgelagert, wodurch die Geschwindigkeit sinkt. Für ein 14B-Modell sind mindestens 12 GB erforderlich.
RTX 3070 oder RTX 3060 12 GB für ein LLM?+
Für ein LLM ist die 3060 mit 12 GB oft die beste Wahl: Die zusätzlichen 4 GB ermöglichen es, Qwen3 14B (9,3 GB) auszuführen. Die 3070 hat eine Bandbreite von 448 GB/s gegenüber 360 GB/s: Theoretisch generiert sie etwa ein Viertel schneller, ist mit 8 GB aber auf Modelle mit 8 bis 9 Milliarden Parametern beschränkt.
Welche Unterschiede gibt es zwischen 3070 und 3070 Ti für ein LLM?+
Gleiche Kapazität von 8 GB, aber die 3070 Ti verfügt über GDDR6X-Speicher mit 608 GB/s gegenüber 448 GB/s bei GDDR6, also 36 % mehr Bandbreite. Die durch die Bandbreite begrenzte Generierung wird theoretisch im gleichen Verhältnis schneller. Laut NVIDIA verbraucht die Ti 290 W gegenüber 220 W.
Welche Stromversorgung für eine RTX 3070 Ti?+
NVIDIA gibt als erforderliche Netzteilleistung für das Gesamtsystem 750 W für die 3070 Ti (290 W Leistungsaufnahme der Grafikkarte) und 650 W für die 3070 (220 W) an. Das sind die Herstellerangaben für einen kompletten PC: Ein 550-W-Netzteil liegt unter dieser Empfehlung, auch wenn es für einen sparsamen PC ausreichen kann.
Lässt sich ein Modell auf einer RTX 3070 per Fine-Tuning anpassen?+
Ja, mit QLoRA bei kleinen Modellen. Laut Unsloth liegt der absolute Mindestbedarf bei 3,5 GB für ein 3B-Modell und bei 6 GB für ein 8B-Modell: In 8 GB passt ein 8B-Modell gerade noch, mit einer Batchgröße von 1 und einem kurzen Kontext. Ein 14B-Modell benötigt 8,5 GB und passt nicht hinein.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.