Welcher LLM auf RTX 5060 (8 GB)? ?
Die RTX 5060 kombiniert 8 GB GDDR7 mit einer Speicherbandbreite von 448 GB/s, also 65 % mehr als bei einer RTX 4060. Sie führt Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos aus: Granite 4.2 8B (5,3 GB) oder Qwen 3.5 9B (6,6 GB), mit einer theoretischen Obergrenze von etwa 85 Tokens/s bei einem 8B-Modell. Ihre Grenze ist die Speicherkapazität: Ein Modell mit 12 Milliarden Parametern oder mehr passt mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher.
Die RTX 5060 ist dank ihres GDDR7-Speichers die schnellste 8-GB-Grafikkarte auf dem Endkundenmarkt für lokale LLMs. Aber 8 GB bleiben 8 GB. Dieser Leitfaden beziffert, was in den Speicher passt und welche Geschwindigkeit zu erwarten ist, beschreibt die Ollama-Einstellungen, die ein Überschreiten der Speicherkapazität verhindern, und zeigt, wann eine RTX 5060 Ti mit 16 GB der bessere Kauf ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Für diese Konfiguration: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.
#RTX 5060 für ein lokales LLM: Was 8 GB GDDR7 ermöglichen
Eine RTX 5060 kann Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos ausführen. Laut der Ollama-Bibliothek belegt Qwen 3.5 4B 3,4 GB, Granite 4.2 8B 5,3 GB und Qwen 3.5 9B 6,6 GB: Alle passen in die 8 GB der Karte, das letzte Modell allerdings nur mit kurzem Kontext. Ein 12B-Modell wie Gemma 4 12B (7,7 bis 8 GB) belegt bereits den gesamten Speicher vor dem ersten Kontexttoken. Die Stärke der Karte liegt in ihrem Speicher: 448 GB/s über einen 128-Bit-Bus gegenüber 272 GB/s bei der RTX 4060, also 65 % mehr. Für Chat, Zusammenfassungen oder ein kleines RAG-System ist die 5060 sehr gut geeignet. Für Modelle über 9B braucht es mehr VRAM, nicht mehr Geschwindigkeit.
- Architektur
- Blackwell, 3.840 CUDA-Kerne und Tensor-Kerne der 5. Generation laut NVIDIA.
- Speicher
- 8 GB GDDR7 auf einem 128-Bit-Bus, 448 GB/s Bandbreite.
- Leistung
- 145 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC eine Mindestnetzteil Leistung von 550 W an.
- Einführungspreis
- 299 Dollar, laut Wikipedia am 19. Mai 2025 erschienen.
#Warum die 5060 bei gleicher Kapazität schneller ist als die 4060
Bei der Generierung muss die GPU für jedes Token den Großteil der Modellgewichte erneut lesen. Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der Gewichte. Die 5060 liest ihren Speicher 65 % schneller als die 4060: Bei identischem Modell steigt die theoretische Obergrenze im gleichen Verhältnis. Das ist das einzige technische Argument, das für das LLM zählt. Die CUDA-Kerne helfen bei der Verarbeitung des Prompts, nicht bei der Generierung, die weiterhin durch den Speicher begrenzt bleibt.
| Karte | Speicher | Bandbreite | Obergrenze bei einem 5,3-GB-Modell |
|---|---|---|---|
| RTX 4060 | 8 GB GDDR6 | 272 GB/s | 51 Tokens/s |
| RTX 5060 | 8 GB GDDR7 | 448 GB/s | 85 Tokens/s |
#Welche Modelle passen in 8 GB
| Modell | Größe | Spielraum bei 8 GB | Fazit |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Komfortabel, langer Kontext möglich |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Komfortabel nutzbar, moderate Kontextlänge |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Knapp, kurzer Kontext |
| Gemma 4 12B | 7,7 bis 8,0 GB | 0 GB oder weniger | Passt mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher |
Gemma 4 12B veranschaulicht die Falle bei der Dateigröße: Seine Gewichte belegen 7,7 bis 8 GB, aber die Grafikkarte muss auch Platz für den Kontext-Cache und die Bildschirmausgabe bieten. Das Modell lässt sich laden, allerdings bestenfalls mit einem Kontext von wenigen Tausend Tokens, und Teile davon werden in den Arbeitsspeicher ausgelagert, sobald eine Anwendung etwas VRAM beansprucht. Bei 8 GB sind Qwen 3.5 9B oder Granite 4.2 8B verlässlichere Optionen, die eine nutzbare Speicherreserve lassen.
#Bilder, Bildverständnis und Quantisierung: zwei Klarstellungen
Die Ollama-Modellbibliothek gibt an, dass Qwen 3.5 Text und Bilder akzeptiert: Ein 4B- oder 9B-Modell kann daher einen Screenshot beschreiben oder ein Diagramm lesen. Bilder beanspruchen Kontext, wodurch bei 8 GB weniger Spielraum bleibt; bevorzugen Sie für Bildverarbeitung das 4B-Modell (3,4 GB), wenn Sie Speicherplatz freihalten möchten. Bei der Quantisierung bleibt Q4_K_M ein guter Kompromiss für 8 GB: Eine feinere Quantisierung vergrößert die Modellgewichte um mehrere hundert Megabyte — diese Reserve hat die Karte nicht —, ohne dass sich bei alltäglicher Nutzung ein sichtbarer Unterschied ergibt.
#Ollama installieren und die Karte prüfen
- 01NVIDIA-TreiberOllama erfordert einen NVIDIA-Treiber der Version 550 oder neuer. Installieren Sie für eine RTX 50 den neuesten von NVIDIA angebotenen Treiber. Überprüfen Sie dies mit nvidia-smi.
- 02Ollama installierenDie RTX 5060 steht auf der Liste der unterstützten Karten (Compute Capability 12.0). CUDA ist integriert: Eine separate Installation ist nicht erforderlich.
- 03Erstes ModellStarten Sie ollama run qwen3.5:9b (6,6 GB) oder ollama run granite4.2:8b (5,3 GB), wenn Sie lieber etwas Spielraum behalten möchten.
- 04KontrolleFühren Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.
#Welche Geschwindigkeit ist zu erwarten: eine Obergrenze, keine Messung
Kein Durchsatz wird hier als eigene Messung präsentiert. Die theoretische Obergrenze für die Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080, deren Obergrenze bei 156 Tokens/s liegt, also etwa 68 %. Setzt man 70 % als groben Richtwert an, erhält man die folgenden Schätzungen für einen kurzen Kontext.
| Modell (Q4) | Modellgröße | Obergrenze | Estimate at 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 Tokens pro Sekunde | etwa 92 tokens/s |
| Granite 4.2 8B | 5,3 GB | 85 Tokens/s | etwa 59 Tokens pro Sekunde |
| Qwen 3.5 9B | 6,6 GB | 68 Tokens pro Sekunde | ca. 48 Tokens pro Sekunde |
| Gemma 4 12B | 7,7 GB | 58 Token/s | etwa 40 Token/s, sehr eingeschränkter Kontext |
Alle diese Obergrenzen liegen deutlich über den etwa 15 bis 20 Tokens/s, bei denen sich der Text bequem mitlesen lässt. Die 5060 wird daher nicht durch die Geschwindigkeit begrenzt, sondern durch ihre Speicherkapazität von 8 GB.
#Ollama so einstellen, dass die 8 GB nicht überschritten werden
Ollama quantisiert den K/V-Cache in q8_0, um ungefähr halb so viel Speicher wie mit dem Standardformat f16 zu benötigen, bei laut Dokumentation sehr geringem Genauigkeitsverlust; dies setzt Flash Attention voraus. Bei 8 GB ist das die Maßnahme mit dem größten Nutzen: Sie ermöglicht einen längeren Kontext, ohne das Modell zu wechseln.
- Ein einziges Modell
- Laden Sie jeweils nur ein Modell; ein Embedding-Modell für RAG muss klein bleiben.
- Ressourcenintensive Anwendungen
- Browser mit Hardwarebeschleunigung, Spiele und Videocodierung belegen VRAM: Beenden Sie sie vor dem Laden.
- Angepasster Kontext
- Jede Verdoppelung des Kontexts verdoppelt den K/V-Cache: Erhöhen Sie den Kontext nur, wenn die Aufgabe es erfordert.
- Überwachung
- nvidia-smi zeigt während einer längeren Generierung den tatsächlichen Spielraum.
#Was man mit 8 GB konkret machen kann
Das richtige Kriterium ist die geforderte Aufgabe, nicht die Größe des Modells. Ein Chat oder eine Umformulierung ist sowohl mit einem 4B-Modell als auch mit einem 8B-Modell möglich. Eine Zusammenfassung von Dokumenten mit einigen Dutzend Seiten erfordert einen Kontext von 8 000 bis 16 000 Tokens: Mit dem K/V-Cache in q8_0 schafft ein 8B-Modell dies auf 8 GB. Ein RAG kombiniert ein Generierungsmodell, ein Embeddings-Modell und den Kontext der gefundenen Auszüge: Halten Sie das Generierungsmodell unter 9B. Der Code-Assistent ist der anspruchsvollste Fall, da spezialisierte Modelle schnell die Kapazität der Karte überschreiten.
| Nutzung | Realistisch? | Empfohlene Einstellung |
|---|---|---|
| Täglicher Chat, kurze Fragen | Ja | Granite 4.2 8B, Standardkontext |
| Zusammenfassung von Dokumenten mit 10 bis 30 Seiten | Ja, mit einem Kontext von 8.192 bis 16.384 Tokens | K/V-Cache in q8_0, Flash Attention |
| RAG mit Ihren Dateien | Ja, mit einem Modell mit 4 bis 8 Milliarden Parametern | Leichte Embeddings, ein einziges Generierungsmodell |
| Code-Assistent für ein Repository | Begrenzt | Modell mit 4B bis 8B, kurze Textauszüge |
| Modelle ab 14 GB | Nein | 16 GB VRAM einplanen |
Wenn ein Modell nicht vollständig in den GPU-Speicher passt, stoppt die Generierung nicht: Ein Teil der Gewichte wird aus dem System-RAM gelesen. Das zeigt sich in einem abrupten Rückgang des Durchsatzes. Der Befehl ollama ps zeigt die Verteilung zwischen GPU und CPU an; eine Zeile mit 100 % GPU zeigt den Normalzustand, eine Zeile mit geteilter Ausführung weist auf die Auslagerung in den System-RAM hin. Dies lässt sich beheben, indem Sie den Kontext verkleinern oder ein anderes Modell wählen.
#Wenn die 5060 nicht mehr ausreicht
Drei Signale deuten darauf hin, dass mehr Speicher benötigt wird. Sie möchten ein Modell mit 12B oder mehr für eine hochwertige Texterstellung. Ihr Kontext überschreitet regelmäßig 16 000 Tokens aufgrund langer Dokumente. Sie laden mehrere Modelle gleichzeitig: eines zur Generierung, eines für Embeddings und einen Reranker. In diesen Fällen ändert eine höhere Geschwindigkeit nichts: Es fehlt an Kapazität, und die nächsten Stufen werden auf den Seiten zu 12 GB und 16 GB beschrieben.
#5060 oder 5060 Ti 16 GB: die entscheidende Wahl
Die RTX 5060 Ti 16 GB verwendet denselben GDDR7-Speicher an einem 128-Bit-Bus und hat damit laut Wikipedia dieselbe Bandbreite von 448 GB/s. Die eigentlichen Unterschiede sind ihre 4.608 CUDA-Kerne und ihre 16 GB Speicher. Bei einem Modell, das auf beide Karten passt, generiert sie daher mit derselben Geschwindigkeit. Sie kann aber auch 14 GB große Modelle laden, die auf der 5060 keinen Platz finden. Die empfohlenen Preise zum Verkaufsstart lagen bei 299 US-Dollar für die 5060, 379 US-Dollar für die 5060 Ti 8 GB und 429 US-Dollar für die 5060 Ti 16 GB: Für 130 US-Dollar mehr erhält man die doppelte Speicherkapazität.
| Kriterium | RTX 5060 | RTX 5060 Ti 16 GB |
|---|---|---|
| Speicher | 8 GB GDDR7 | 16 GB GDDR7 |
| Bandbreite | 448 GB/s | 448 GB/s |
| CUDA-Kerne | 3 840 | 4 608 |
| Graphikleistung | 145 W | 180 W |
| Mindestanforderungen an die Stromversorgung | 550 W | 600 W |
| Modelle mit einer Größe von 14 GB (gpt-oss 20B, Mistral Small 24B) | Nein | Ja, mit 2 GB Reserve |
#Fazit 2026
- Kaufen Sie eine 5060, wenn
- Ihre Modelle haben 4B bis 9B Parameter, Ihr Budget ist knapp und Sie möchten Neuware mit Garantie. Das ist die schnellste Karte mit 8 GB.
- Wählen Sie die 5060 Ti 16 GB vorzugsweise, wenn
- Sie möchten Modelle mit 12B bis 24B nutzen: Die Speicherkapazität ist wichtiger als die Geschwindigkeit, und der Aufpreis ist gering.
- Vermeiden Sie die 5060, wenn
- Sie planen, Gemma 4 12B, gpt-oss 20B oder ein beliebiges Modell mit mehr als 8 GB ernsthaft zu verwenden.
Die Zusammenfassung lässt sich auf einen Satz bringen: Die 5060 ist die 8-GB-Karte, die man wegen ihrer Geschwindigkeit und ihres Preises wählt, nicht wegen ihrer Speicherkapazität. Wenn Ihr Einsatzzweck mit 8 GB auskommt, ist sie als Neuware schwer zu schlagen; wenn nicht, kann keine Einstellung die fehlenden 8 GB ausgleichen, und die nächsthöhere Karte der Reihe ist die richtige Investition.
- Quelle: offizielle Spezifikationen von NVIDIA (RTX 5060 und 5060 Ti)
- Quelle: Von Ollama unterstützte NVIDIA-GPUs
- Quelle: offizielle FAQ von Ollama (Flash Attention, K/V-Cache)
#Häufig gestellte Fragen
Kann die RTX 5060 einen LLM lokal ausführen?+
Wie viele Tokens pro Sekunde auf einer RTX 5060?+
RTX 5060 oder RTX 4060 Ti 16 GB für ein LLM?+
Beschleunigt FP4 auf der RTX 5060 Ollama?+
Welche Stromversorgung benötigt eine RTX 5060?+
Kann man mit einer RTX 5060 RAG durchführen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.