Welcher LLM auf einer RTX 4060 (8 GB) ?
Eine RTX 4060 (8 GB GDDR6, 272 GB/s) führt Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos aus: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) oder Qwen 3.5 9B (6,6 GB). Sie stößt an ihre Grenzen, sobald ein Modell zusammen mit seinem Kontext mehr als 8 GB benötigt. Ihre Speicherbandbreite setzt bei einem 8B-Modell in Q4 eine theoretische Obergrenze von etwa 50 Token/s. Darüber hinaus verändern 12 oder 16 GB die Nutzungsmöglichkeiten, nicht die Geschwindigkeit der GPU.
Die RTX 4060 ist die Einstiegskarte der Ada-Generation: 8 GB VRAM, 115 W, ein niedriger Gebrauchtpreis. Sie reicht aus, um lokale LLMs kennenzulernen, sofern Sie ihre genauen Grenzen kennen. Dieser Leitfaden zeigt anhand von Zahlen, was in ihre 8 GB passt, welche Leistung ihre Bandbreite ermöglicht, wie Sie Ollama einstellen, damit die VRAM-Kapazität nicht überschritten wird, und wann Sie besser auf eine Karte mit 12 oder 16 GB umsteigen sollten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Die RTX 4060 für einen lokalen LLM: Was sie ermöglicht
Auf einer RTX 4060 läuft ein lokales LLM gut, solange das Modell, sein Kontext und das System zusammen in 8 GB VRAM passen. In Q4 gilt das für Modelle mit 3 bis 9 Milliarden Parametern: Laut der Ollama-Bibliothek belegt Qwen 3.5 4B 3,4 GB, Granite 4.2 8B 5,3 GB und Qwen 3.5 9B 6,6 GB. Ein 12B-Modell wie Gemma 4 12B (7,7 bis 8 GB) belegt bereits den gesamten Grafikspeicher, noch bevor der Kontext berücksichtigt wird. Die Bandbreite von 272 GB/s bestimmt die Geschwindigkeit: Bei einem Modell mit 5,3 GB setzt sie eine theoretische Obergrenze von etwa 51 Tokens/s; in der Praxis bleibt die Geschwindigkeit darunter. Für einen Chat-Assistenten, Zusammenfassungen oder ein kleines RAG-System reicht das aus. Für die Arbeit mit Code in einem großen Repository oder längere Schlussfolgerungen reicht es kaum.
- Architektur
- Ada Lovelace, 3.072 CUDA-Kerne, Tensor Cores der 4. Generation, CUDA Compute Capability 8.9.
- Speicher
- 8 GB GDDR6 an einem 128-Bit-Bus, also 272 GB/s Bandbreite (Quelle: Wikipedia, Tabelle zur GeForce-40-Serie).
- Verbrauch
- 115 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC ein Netzteil mit mindestens 550 W an.
- Benutzeroberfläche
- PCIe 4.0 ist auf 8 Lanes begrenzt: Ein Modell, das teilweise in den Arbeitsspeicher ausgelagert wird, muss über eine schmale Verbindung übertragen werden, was das Offloading zusätzlich ausbremst.
- Verfügbarkeit
- Die 2023 eingeführte Karte ist vor allem gebraucht erhältlich; die Preise werden auf der dafür vorgesehenen Seite verfolgt.
#Welche Modelle passen in 8 GB
Die Faustregel der Website für Q4 ist einfach: etwa 0,6 GB pro Milliarde Parameter, allein für die Modellgewichte. Hinzu kommen der Kontext-Cache (KV-Cache) und eine Reserve für die Anzeige und das System. Ollama verwendet standardmäßig einen Kontext von 4.096 Tokens, der noch wenig Speicher beansprucht; bei 16.000 Tokens wird der Cache zu einem wichtigen Speicherposten. Die folgende Tabelle übernimmt die von Ollama veröffentlichten Größen und zeigt die verbleibende Reserve bei 8 GB, bevor der Kontext berücksichtigt wird.
| Modell | Größe in Ollama | Spielraum bei 8 GB | Fazit |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Komfortabel, langer Kontext möglich |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Komfortabel bis etwa 16.000 Tokens mit quantisiertem Cache |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Knapp: kurzer Kontext, Anwendungen geschlossen |
| Gemma 4 12B | 7,7 bis 8,0 GB | 0 GB oder weniger | Passt mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher |
| gpt-oss 20B | 14 GB | Negativ | Mit VRAM allein nicht nutzbar |
| Mistral Small 24B | 14 GB | Negativ | Mit VRAM allein nicht nutzbar |
Zwei Fallstricke treten häufig auf. Der erste: Die Dateigröße entspricht nicht dem Speicherbedarf; der Speicher für den Kontext kommt hinzu. Der zweite: Ein Modell, das nicht vollständig in den VRAM passt, stürzt nicht ab, sondern wird teilweise in den System-RAM geladen und läuft deutlich langsamer. Der Befehl ollama ps zeigt die Verteilung: Eine Zeile mit 100 % GPU zeigt den normalen Zustand an; eine zwischen CPU und GPU aufgeteilte Zeile weist darauf hin, dass ein Teil in den System-RAM ausgelagert wurde.
#Ollama installieren und erstes Modell starten
- 01Den NVIDIA-Treiber prüfenOllama erfordert einen NVIDIA-Treiber der Version 550 oder neuer für Grafikkarten mit einer Compute Capability von 5.0 oder höher. Eine RTX 4060 (Compute Capability 8.9) ist ausdrücklich in der Ollama-Dokumentation aufgeführt. Prüfen Sie die Version mit nvidia-smi.
- 02Ollama installierenFolgen Sie der Installationsanleitung für Ihr System. CUDA ist integriert, eine separate Installation des Toolkits ist nicht erforderlich.
- 03Ein geeignetes Modell startenBeginnen Sie mit ollama run granite4.2:8b (5,3 GB) oder ollama run qwen3.5:9b (6,6 GB). Starten Sie anschließend in einem zweiten Terminal ollama ps.
- 04Platzierung prüfenDie Spalte PROCESSOR muss 100 % GPU anzeigen. Andernfalls verringern Sie den Kontext oder wechseln Sie zu einem kleineren Modell.
#Welche Geschwindigkeit zu erwarten ist: die Obergrenze, kein Versprechen
Hier liegen keine eigenen Messungen vor, und keine Durchsatzangabe wird als eigene Messung dargestellt. Eine theoretische Obergrenze lässt sich jedoch berechnen: Speicherbandbreite geteilt durch die Größe der bei jedem Token gelesenen Modellgewichte. Eine auf GitHub veröffentlichte Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Stand Mai 2024) ergibt für das Verhältnis zwischen beobachtetem Durchsatz und theoretischer Obergrenze 68 % auf einer RTX 4080 und 75 % auf einer RTX 4070 Ti. Eine vernünftige Größenordnung: 70 % der Obergrenze. Diese Werte bleiben Schätzungen und gelten für kurze Kontexte.
| Modell (Q4) | Modellgröße | Theoretisches Maximum | Estimate at 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 80 Token pro Sekunde | etwa 56 Tokens pro Sekunde |
| Granite 4.2 8B | 5,3 GB | 51 Tokens/s | ca. 36 Tokens/s |
| Qwen 3.5 9B | 6,6 GB | 41 Tokens/s | etwa 29 Tokens pro Sekunde |
Diese Schätzungen passen zur Nutzung eines Chatassistenten: Ab 15 bis 20 Tokens/s lässt sich die Ausgabe angenehm lesen. Sie berücksichtigen weder den Kontext, der die Generierung mit zunehmender Länge verlangsamt, noch die Verarbeitungszeit des Prompts, die die Rechenleistung beansprucht und nicht den Speicher.
#Ollama so einstellen, dass die 8 GB nicht überschritten werden
Entscheidend sind die Einstellungen für Kontext und Cache. Ollama quantisiert den K/V-Cache in q8_0 und benötigt damit etwa halb so viel Speicher wie bei f16, laut seiner Dokumentation bei einem sehr geringen Genauigkeitsverlust; dafür ist Flash Attention erforderlich. Bei 8 GB ist dies der wirkungsvollste Stellhebel: Er ermöglicht einen längeren Kontext, ohne das Modell zu wechseln.
- Angemessene Kontextgröße
- Erhöhen Sie den Kontext nur dann auf 8.192 oder 16.384 Tokens, wenn Ihre Nutzung dies erfordert: Jede Verdopplung des Kontexts verdoppelt den K/V-Cache.
- Nur ein einziges Modell geladen
- Halten Sie bei 8 GB nur ein Modell im Speicher; ein Embedding-Modell für RAG muss klein bleiben.
- VRAM freigeben
- Der Desktop, der Browser und Spiele reservieren VRAM. Schließen Sie sie vor dem Laden und prüfen Sie dies mit nvidia-smi.
- Quantisierung
- Bleiben Sie bei Q4_K_M: Ein 8B-Modell in Q8 (etwa 8,5 GB) passt nicht in den Speicher der Karte.
#Was die 4060 gut, schlecht oder gar nicht macht
Das Urteil hängt stärker vom Einsatzzweck als von der Grafikkarte ab. Ein kurzer Chat oder eine Zusammenfassung einiger Seiten bleibt im unproblematischen Bereich, sowohl mit einem 4B- als auch mit einem 8B-Modell. RAG erfordert ein Generierungsmodell, ein Embedding-Modell und einen Kontext, der lang genug ist, um die gefundenen Auszüge aufzunehmen: Bei 8 GB müssen Sie ein Generierungsmodell mit 4B bis 8B wählen und das Embedding-Modell klein halten. Ein Code-Assistent stellt höhere Anforderungen, da spezialisierte Modelle und ihre Kontexte mit mehreren Tausend Tokens schnell die Speicherkapazität der Karte überschreiten.
| Nutzung | Realistisch? | Empfohlene Einstellung |
|---|---|---|
| Täglicher Chat, kurze Fragen | Ja | Granite 4.2 8B oder Qwen 3.5 4B, Standardkontext |
| Zusammenfassung von Dokumenten mit 10 bis 20 Seiten | Ja, mit einem Kontext von 8.192 bis 16.384 | K/V-Cache in q8_0, Flash Attention aktiv |
| RAG mit Ihren Dateien | Ja, ein Modell mit 4B bis 8B Parametern | Leichte Embeddings, nur ein Modell zur Textgenerierung geladen |
| Code-Assistent für ein Repository | Begrenzt | Modell mit 4B bis 8B, kurze Ausschnitte, kein vollständiges Repository |
| Modell mit 20B oder mehr, darunter gpt-oss 20B | Nein | Mindestens 16 GB VRAM einplanen |
Das Beispiel gpt-oss 20B verdeutlicht die Grenze: Ollama gibt für dieses Modell 14 GB an, und die Modellbeschreibung erläutert, dass es dank der MXFP4-Quantisierung ab 16 GB Speicher ausgeführt werden kann. Eine Karte mit 8 GB gehört nicht zur vorgesehenen Zielklasse, unabhängig von ihrem Durchsatz.
#Wann sollte man zu einer anderen Karte wechseln?
Drei Signale deuten darauf hin, dass 8 GB zur Bremse werden. Sie möchten ein Modell mit 12B oder mehr, darunter Gemma 4 12B. Sie arbeiten mit langen Dokumenten, bei denen der Kontext 16 000 Tokens überschreitet. Sie verwenden einen Code-Assistenten, der ein Modell von 14 bis 24 GB lädt. In diesen Fällen löst mehr Geschwindigkeit nichts: Es fehlt der Speicherplatz, und die dedizierten Seiten für 8 GB, 12 GB und 16 GB helfen Ihnen, die richtige Stufe zu bestimmen.
#4060, 3060 mit 12 GB, 5060: ein guter Kompromiss
| Karte | VRAM | Bandbreite | Was sich dadurch ändert |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Mehr VRAM: Gemma 4 12B passt, aber der Bus ist älter |
| RTX 4060 | 8 GB | 272 GB/s | Geringer Stromverbrauch, Obergrenze bei 8B–9B |
| RTX 5060 | 8 GB | 448 GB/s | Gleiche Kapazität, um 65 % höhere maximale Geschwindigkeit |
Die RTX 3060 mit 12 GB bietet 4 GB mehr Speicher und eine höhere Bandbreite (360 GB/s laut Wikipedia). Gebraucht ist sie in der Regel günstiger: Den aktuellen Marktstand finden Sie unter /prix-gpu-ia. Die RTX 5060 bleibt bei 8 GB, liest den Speicher aber 65 % schneller. Wenn Ihr Anwendungsfall in 8 GB passt, ist die 5060 die schnellste; wenn er mehr als 8 GB benötigt, ermöglichen die 3060 mit 12 GB oder die 4060 Ti mit 16 GB die Nutzung von Modellen, die die 4060 nicht laden kann.
#Fazit 2026
- Behalten Sie Ihre 4060, wenn
- Sie verwenden Modelle mit 3B bis 9B, einen Chat oder einen leichten RAG. Kein Grund, sie zu ersetzen, solange ausreichend Speicher vorhanden ist.
- Kaufen Sie keine 4060 für LLMs
- Wenn der Einsatz von LLMs der Hauptzweck ist, ist eine Karte mit 12 GB oder mehr sinnvoller, gegebenenfalls auch gebraucht.
- Wechseln Sie auf 16 GB
- Wenn Sie Modelle im Umfang von 14B bis 24B suchen, die niemals mit 8 GB auskommen werden.
- Quelle: offizielle NVIDIA-Spezifikationen (RTX 4060 und 4060 Ti)
- Quelle: offizielle FAQ von Ollama (Kontext, Flash Attention, K/V-Cache)
- Quelle: Größen der Qwen-3.5-Modelle in der Ollama-Bibliothek
#Häufig gestellte Fragen
Kann die RTX 4060 einen LLM lokal ausführen?+
Wie viele Tokens pro Sekunde auf einer RTX 4060?+
RTX 4060 oder RTX 3060 12 GB für ein LLM?+
Welche Stromversorgung benötigt eine RTX 4060?+
Wie erkenne ich, ob mein Modell in den VRAM passt?+
Lassen sich die 8 GB besser nutzen, ohne die Grafikkarte zu wechseln?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.