Einsteiger 11 Min.RTX 40

Welcher LLM auf einer RTX 4060 (8 GB) ?

Direkte Antwort

Eine RTX 4060 (8 GB GDDR6, 272 GB/s) führt Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos aus: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) oder Qwen 3.5 9B (6,6 GB). Sie stößt an ihre Grenzen, sobald ein Modell zusammen mit seinem Kontext mehr als 8 GB benötigt. Ihre Speicherbandbreite setzt bei einem 8B-Modell in Q4 eine theoretische Obergrenze von etwa 50 Token/s. Darüber hinaus verändern 12 oder 16 GB die Nutzungsmöglichkeiten, nicht die Geschwindigkeit der GPU.

Die RTX 4060 ist die Einstiegskarte der Ada-Generation: 8 GB VRAM, 115 W, ein niedriger Gebrauchtpreis. Sie reicht aus, um lokale LLMs kennenzulernen, sofern Sie ihre genauen Grenzen kennen. Dieser Leitfaden zeigt anhand von Zahlen, was in ihre 8 GB passt, welche Leistung ihre Bandbreite ermöglicht, wie Sie Ollama einstellen, damit die VRAM-Kapazität nicht überschritten wird, und wann Sie besser auf eine Karte mit 12 oder 16 GB umsteigen sollten.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Die RTX 4060 für einen lokalen LLM: Was sie ermöglicht

Auf einer RTX 4060 läuft ein lokales LLM gut, solange das Modell, sein Kontext und das System zusammen in 8 GB VRAM passen. In Q4 gilt das für Modelle mit 3 bis 9 Milliarden Parametern: Laut der Ollama-Bibliothek belegt Qwen 3.5 4B 3,4 GB, Granite 4.2 8B 5,3 GB und Qwen 3.5 9B 6,6 GB. Ein 12B-Modell wie Gemma 4 12B (7,7 bis 8 GB) belegt bereits den gesamten Grafikspeicher, noch bevor der Kontext berücksichtigt wird. Die Bandbreite von 272 GB/s bestimmt die Geschwindigkeit: Bei einem Modell mit 5,3 GB setzt sie eine theoretische Obergrenze von etwa 51 Tokens/s; in der Praxis bleibt die Geschwindigkeit darunter. Für einen Chat-Assistenten, Zusammenfassungen oder ein kleines RAG-System reicht das aus. Für die Arbeit mit Code in einem großen Repository oder längere Schlussfolgerungen reicht es kaum.

Architektur
Ada Lovelace, 3.072 CUDA-Kerne, Tensor Cores der 4. Generation, CUDA Compute Capability 8.9.
Speicher
8 GB GDDR6 an einem 128-Bit-Bus, also 272 GB/s Bandbreite (Quelle: Wikipedia, Tabelle zur GeForce-40-Serie).
Verbrauch
115 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC ein Netzteil mit mindestens 550 W an.
Benutzeroberfläche
PCIe 4.0 ist auf 8 Lanes begrenzt: Ein Modell, das teilweise in den Arbeitsspeicher ausgelagert wird, muss über eine schmale Verbindung übertragen werden, was das Offloading zusätzlich ausbremst.
Verfügbarkeit
Die 2023 eingeführte Karte ist vor allem gebraucht erhältlich; die Preise werden auf der dafür vorgesehenen Seite verfolgt.
!
Warum die Bandbreite wichtiger ist als die Kernanzahl
Bei der Generierung muss die GPU für jedes Token den Großteil der Modellgewichte erneut lesen. Die Geschwindigkeit hängt daher weit stärker vom Verhältnis zwischen Speicherbandbreite und Größe der Gewichte ab als von der Anzahl der Kerne. In dieser Hinsicht ist die 4060 innerhalb der Ada-Reihe für Privatnutzer am stärksten eingeschränkt: 272 GB/s gegenüber 672 GB/s bei einer 4070 Ti Super.

#Welche Modelle passen in 8 GB

Die Faustregel der Website für Q4 ist einfach: etwa 0,6 GB pro Milliarde Parameter, allein für die Modellgewichte. Hinzu kommen der Kontext-Cache (KV-Cache) und eine Reserve für die Anzeige und das System. Ollama verwendet standardmäßig einen Kontext von 4.096 Tokens, der noch wenig Speicher beansprucht; bei 16.000 Tokens wird der Cache zu einem wichtigen Speicherposten. Die folgende Tabelle übernimmt die von Ollama veröffentlichten Größen und zeigt die verbleibende Reserve bei 8 GB, bevor der Kontext berücksichtigt wird.

Gängige Modelle für 8 GB VRAM (Ollama-Dateigrößen, nur Modellgewichte)
ModellGröße in OllamaSpielraum bei 8 GBFazit
Qwen 3.5 4B3,4 GB4,6 GBKomfortabel, langer Kontext möglich
Granite 4.2 8B5,3 GB2,7 GBKomfortabel bis etwa 16.000 Tokens mit quantisiertem Cache
Qwen 3.5 9B6,6 GB1,4 GBKnapp: kurzer Kontext, Anwendungen geschlossen
Gemma 4 12B7,7 bis 8,0 GB0 GB oder wenigerPasst mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher
gpt-oss 20B14 GBNegativMit VRAM allein nicht nutzbar
Mistral Small 24B14 GBNegativMit VRAM allein nicht nutzbar

Zwei Fallstricke treten häufig auf. Der erste: Die Dateigröße entspricht nicht dem Speicherbedarf; der Speicher für den Kontext kommt hinzu. Der zweite: Ein Modell, das nicht vollständig in den VRAM passt, stürzt nicht ab, sondern wird teilweise in den System-RAM geladen und läuft deutlich langsamer. Der Befehl ollama ps zeigt die Verteilung: Eine Zeile mit 100 % GPU zeigt den normalen Zustand an; eine zwischen CPU und GPU aufgeteilte Zeile weist darauf hin, dass ein Teil in den System-RAM ausgelagert wurde.

#Ollama installieren und erstes Modell starten

  1. 01
    Den NVIDIA-Treiber prüfen
    Ollama erfordert einen NVIDIA-Treiber der Version 550 oder neuer für Grafikkarten mit einer Compute Capability von 5.0 oder höher. Eine RTX 4060 (Compute Capability 8.9) ist ausdrücklich in der Ollama-Dokumentation aufgeführt. Prüfen Sie die Version mit nvidia-smi.
  2. 02
    Ollama installieren
    Folgen Sie der Installationsanleitung für Ihr System. CUDA ist integriert, eine separate Installation des Toolkits ist nicht erforderlich.
  3. 03
    Ein geeignetes Modell starten
    Beginnen Sie mit ollama run granite4.2:8b (5,3 GB) oder ollama run qwen3.5:9b (6,6 GB). Starten Sie anschließend in einem zweiten Terminal ollama ps.
  4. 04
    Platzierung prüfen
    Die Spalte PROCESSOR muss 100 % GPU anzeigen. Andernfalls verringern Sie den Kontext oder wechseln Sie zu einem kleineren Modell.

#Welche Geschwindigkeit zu erwarten ist: die Obergrenze, kein Versprechen

Hier liegen keine eigenen Messungen vor, und keine Durchsatzangabe wird als eigene Messung dargestellt. Eine theoretische Obergrenze lässt sich jedoch berechnen: Speicherbandbreite geteilt durch die Größe der bei jedem Token gelesenen Modellgewichte. Eine auf GitHub veröffentlichte Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Stand Mai 2024) ergibt für das Verhältnis zwischen beobachtetem Durchsatz und theoretischer Obergrenze 68 % auf einer RTX 4080 und 75 % auf einer RTX 4070 Ti. Eine vernünftige Größenordnung: 70 % der Obergrenze. Diese Werte bleiben Schätzungen und gelten für kurze Kontexte.

Theoretische Obergrenze der Generierungsgeschwindigkeit auf der RTX 4060 (272 GB/s)
Modell (Q4)ModellgrößeTheoretisches MaximumEstimate at 70 %
Qwen 3.5 4B3,4 GB80 Token pro Sekundeetwa 56 Tokens pro Sekunde
Granite 4.2 8B5,3 GB51 Tokens/sca. 36 Tokens/s
Qwen 3.5 9B6,6 GB41 Tokens/setwa 29 Tokens pro Sekunde

Diese Schätzungen passen zur Nutzung eines Chatassistenten: Ab 15 bis 20 Tokens/s lässt sich die Ausgabe angenehm lesen. Sie berücksichtigen weder den Kontext, der die Generierung mit zunehmender Länge verlangsamt, noch die Verarbeitungszeit des Prompts, die die Rechenleistung beansprucht und nicht den Speicher.

#Ollama so einstellen, dass die 8 GB nicht überschritten werden

Entscheidend sind die Einstellungen für Kontext und Cache. Ollama quantisiert den K/V-Cache in q8_0 und benötigt damit etwa halb so viel Speicher wie bei f16, laut seiner Dokumentation bei einem sehr geringen Genauigkeitsverlust; dafür ist Flash Attention erforderlich. Bei 8 GB ist dies der wirkungsvollste Stellhebel: Er ermöglicht einen längeren Kontext, ohne das Modell zu wechseln.

Ollama-Servereinstellungen (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Angemessene Kontextgröße
Erhöhen Sie den Kontext nur dann auf 8.192 oder 16.384 Tokens, wenn Ihre Nutzung dies erfordert: Jede Verdopplung des Kontexts verdoppelt den K/V-Cache.
Nur ein einziges Modell geladen
Halten Sie bei 8 GB nur ein Modell im Speicher; ein Embedding-Modell für RAG muss klein bleiben.
VRAM freigeben
Der Desktop, der Browser und Spiele reservieren VRAM. Schließen Sie sie vor dem Laden und prüfen Sie dies mit nvidia-smi.
Quantisierung
Bleiben Sie bei Q4_K_M: Ein 8B-Modell in Q8 (etwa 8,5 GB) passt nicht in den Speicher der Karte.

#Was die 4060 gut, schlecht oder gar nicht macht

Das Urteil hängt stärker vom Einsatzzweck als von der Grafikkarte ab. Ein kurzer Chat oder eine Zusammenfassung einiger Seiten bleibt im unproblematischen Bereich, sowohl mit einem 4B- als auch mit einem 8B-Modell. RAG erfordert ein Generierungsmodell, ein Embedding-Modell und einen Kontext, der lang genug ist, um die gefundenen Auszüge aufzunehmen: Bei 8 GB müssen Sie ein Generierungsmodell mit 4B bis 8B wählen und das Embedding-Modell klein halten. Ein Code-Assistent stellt höhere Anforderungen, da spezialisierte Modelle und ihre Kontexte mit mehreren Tausend Tokens schnell die Speicherkapazität der Karte überschreiten.

Häufige Anwendungen auf RTX 4060 (8 GB)
NutzungRealistisch?Empfohlene Einstellung
Täglicher Chat, kurze FragenJaGranite 4.2 8B oder Qwen 3.5 4B, Standardkontext
Zusammenfassung von Dokumenten mit 10 bis 20 SeitenJa, mit einem Kontext von 8.192 bis 16.384K/V-Cache in q8_0, Flash Attention aktiv
RAG mit Ihren DateienJa, ein Modell mit 4B bis 8B ParameternLeichte Embeddings, nur ein Modell zur Textgenerierung geladen
Code-Assistent für ein RepositoryBegrenztModell mit 4B bis 8B, kurze Ausschnitte, kein vollständiges Repository
Modell mit 20B oder mehr, darunter gpt-oss 20BNeinMindestens 16 GB VRAM einplanen

Das Beispiel gpt-oss 20B verdeutlicht die Grenze: Ollama gibt für dieses Modell 14 GB an, und die Modellbeschreibung erläutert, dass es dank der MXFP4-Quantisierung ab 16 GB Speicher ausgeführt werden kann. Eine Karte mit 8 GB gehört nicht zur vorgesehenen Zielklasse, unabhängig von ihrem Durchsatz.

#Wann sollte man zu einer anderen Karte wechseln?

Drei Signale deuten darauf hin, dass 8 GB zur Bremse werden. Sie möchten ein Modell mit 12B oder mehr, darunter Gemma 4 12B. Sie arbeiten mit langen Dokumenten, bei denen der Kontext 16 000 Tokens überschreitet. Sie verwenden einen Code-Assistenten, der ein Modell von 14 bis 24 GB lädt. In diesen Fällen löst mehr Geschwindigkeit nichts: Es fehlt der Speicherplatz, und die dedizierten Seiten für 8 GB, 12 GB und 16 GB helfen Ihnen, die richtige Stufe zu bestimmen.

#4060, 3060 mit 12 GB, 5060: ein guter Kompromiss

Einsteigerkarten: Speicherkapazität und Bandbreite
KarteVRAMBandbreiteWas sich dadurch ändert
RTX 3060 12 GB12 GB360 GB/sMehr VRAM: Gemma 4 12B passt, aber der Bus ist älter
RTX 40608 GB272 GB/sGeringer Stromverbrauch, Obergrenze bei 8B–9B
RTX 50608 GB448 GB/sGleiche Kapazität, um 65 % höhere maximale Geschwindigkeit

Die RTX 3060 mit 12 GB bietet 4 GB mehr Speicher und eine höhere Bandbreite (360 GB/s laut Wikipedia). Gebraucht ist sie in der Regel günstiger: Den aktuellen Marktstand finden Sie unter /prix-gpu-ia. Die RTX 5060 bleibt bei 8 GB, liest den Speicher aber 65 % schneller. Wenn Ihr Anwendungsfall in 8 GB passt, ist die 5060 die schnellste; wenn er mehr als 8 GB benötigt, ermöglichen die 3060 mit 12 GB oder die 4060 Ti mit 16 GB die Nutzung von Modellen, die die 4060 nicht laden kann.

#Fazit 2026

Behalten Sie Ihre 4060, wenn
Sie verwenden Modelle mit 3B bis 9B, einen Chat oder einen leichten RAG. Kein Grund, sie zu ersetzen, solange ausreichend Speicher vorhanden ist.
Kaufen Sie keine 4060 für LLMs
Wenn der Einsatz von LLMs der Hauptzweck ist, ist eine Karte mit 12 GB oder mehr sinnvoller, gegebenenfalls auch gebraucht.
Wechseln Sie auf 16 GB
Wenn Sie Modelle im Umfang von 14B bis 24B suchen, die niemals mit 8 GB auskommen werden.

#Häufig gestellte Fragen

FAQ
Kann die RTX 4060 einen LLM lokal ausführen?+
Ja, bis zu etwa 9 Milliarden Parametern in Q4. Granite 4.2 8B (5,3 GB) und Qwen 3.5 9B (6,6 GB) passen in den VRAM, beim zweiten allerdings nur mit kurzem Kontext. Bei einem Speicherbedarf von mehr als 8 GB lagert Ollama Teile des Modells in den System-RAM aus, und die Generierung wird deutlich langsamer. Dadurch sind Modelle mit 12B und mehr wenig praktikabel.
Wie viele Tokens pro Sekunde auf einer RTX 4060?+
Hier werden keine zuverlässigen Messungen veröffentlicht. Die theoretische Obergrenze — Speicherbandbreite geteilt durch die Größe der Modellgewichte — liegt bei etwa 51 Tokens/s für ein Modell mit 5,3 GB, also bei knapp 36 Tokens/s bei 70 % dieser Obergrenze. Das ist eine Schätzung, kein gemessenes Ergebnis, und der geschätzte Wert sinkt mit zunehmender Kontextlänge.
RTX 4060 oder RTX 3060 12 GB für ein LLM?+
Für LLMs ist die 3060 mit 12 GB in der Regel interessanter: 4 GB mehr Speicher und eine Bandbreite von 360 GB/s gegenüber 272 GB/s. Sie kann Gemma 4 12B laden, für das die 4060 nicht genug Speicher bietet. Die 4060 behält ihren Vorteil beim Stromverbrauch mit 115 W und beim Spielen.
Welche Stromversorgung benötigt eine RTX 4060?+
NVIDIA gibt eine Gesamtgrafikleistung von 115 W und eine empfohlene Mindestnetzteilleistung von 550 W für den gesamten PC an. Dieser Wert enthält eine Reserve für den Prozessor und Verbrauchsspitzen. Ein hochwertiges Netzteil mit dieser Leistung reicht aus, da das LLM die Grafikkarte weniger belastet als manche Spiele.
Wie erkenne ich, ob mein Modell in den VRAM passt?+
Starten Sie das Modell und führen Sie anschließend ollama ps in einem zweiten Terminal aus: Die Spalte PROCESSOR zeigt 100 % GPU an, wenn alles im VRAM liegt, oder eine CPU/GPU-Aufteilung, wenn nicht alles in den VRAM passt. Beobachten Sie auch nvidia-smi während einer langen Generierung. Wenn nicht alles in den VRAM passt, reduzieren Sie den Kontext oder wählen Sie ein kleineres Modell.
Lassen sich die 8 GB besser nutzen, ohne die Grafikkarte zu wechseln?+
Drei Maßnahmen helfen: Flash Attention aktivieren und anschließend den K/V-Cache auf q8_0 umstellen, wodurch dieser Cache ungefähr halbiert wird; den Kontext auf das tatsächlich genutzte Maß begrenzen; Anwendungen schließen, die VRAM belegen. Damit lässt sich der Kontext verlängern, aber kein größeres Modell laden.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.