Einsteiger 11 Min.RTX 50

Welcher LLM auf RTX 5060 (8 GB)? ?

Direkte Antwort

Die RTX 5060 kombiniert 8 GB GDDR7 mit einer Speicherbandbreite von 448 GB/s, also 65 % mehr als bei einer RTX 4060. Sie führt Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos aus: Granite 4.2 8B (5,3 GB) oder Qwen 3.5 9B (6,6 GB), mit einer theoretischen Obergrenze von etwa 85 Tokens/s bei einem 8B-Modell. Ihre Grenze ist die Speicherkapazität: Ein Modell mit 12 Milliarden Parametern oder mehr passt mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher.

Die RTX 5060 ist dank ihres GDDR7-Speichers die schnellste 8-GB-Grafikkarte auf dem Endkundenmarkt für lokale LLMs. Aber 8 GB bleiben 8 GB. Dieser Leitfaden beziffert, was in den Speicher passt und welche Geschwindigkeit zu erwarten ist, beschreibt die Ollama-Einstellungen, die ein Überschreiten der Speicherkapazität verhindern, und zeigt, wann eine RTX 5060 Ti mit 16 GB der bessere Kauf ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Für diese Konfiguration: RTX 5060 Ti 16 GB.

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links — mögliche Provision ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

#RTX 5060 für ein lokales LLM: Was 8 GB GDDR7 ermöglichen

Eine RTX 5060 kann Modelle mit 3 bis 9 Milliarden Parametern in Q4 problemlos ausführen. Laut der Ollama-Bibliothek belegt Qwen 3.5 4B 3,4 GB, Granite 4.2 8B 5,3 GB und Qwen 3.5 9B 6,6 GB: Alle passen in die 8 GB der Karte, das letzte Modell allerdings nur mit kurzem Kontext. Ein 12B-Modell wie Gemma 4 12B (7,7 bis 8 GB) belegt bereits den gesamten Speicher vor dem ersten Kontexttoken. Die Stärke der Karte liegt in ihrem Speicher: 448 GB/s über einen 128-Bit-Bus gegenüber 272 GB/s bei der RTX 4060, also 65 % mehr. Für Chat, Zusammenfassungen oder ein kleines RAG-System ist die 5060 sehr gut geeignet. Für Modelle über 9B braucht es mehr VRAM, nicht mehr Geschwindigkeit.

Architektur
Blackwell, 3.840 CUDA-Kerne und Tensor-Kerne der 5. Generation laut NVIDIA.
Speicher
8 GB GDDR7 auf einem 128-Bit-Bus, 448 GB/s Bandbreite.
Leistung
145 W Gesamtgrafikleistung; NVIDIA gibt für den gesamten PC eine Mindestnetzteil Leistung von 550 W an.
Einführungspreis
299 Dollar, laut Wikipedia am 19. Mai 2025 erschienen.

#Warum die 5060 bei gleicher Kapazität schneller ist als die 4060

Bei der Generierung muss die GPU für jedes Token den Großteil der Modellgewichte erneut lesen. Die maximale Geschwindigkeit ergibt sich daher aus der Bandbreite geteilt durch die Größe der Gewichte. Die 5060 liest ihren Speicher 65 % schneller als die 4060: Bei identischem Modell steigt die theoretische Obergrenze im gleichen Verhältnis. Das ist das einzige technische Argument, das für das LLM zählt. Die CUDA-Kerne helfen bei der Verarbeitung des Prompts, nicht bei der Generierung, die weiterhin durch den Speicher begrenzt bleibt.

Karten mit 8 GB: Bandbreite und Leistungsobergrenze bei einem 5,3-GB-Modell
KarteSpeicherBandbreiteObergrenze bei einem 5,3-GB-Modell
RTX 40608 GB GDDR6272 GB/s51 Tokens/s
RTX 50608 GB GDDR7448 GB/s85 Tokens/s

#Welche Modelle passen in 8 GB

Modelle auf der RTX 5060 (Dateigrößen laut Ollama, nur Modellgewichte)
ModellGrößeSpielraum bei 8 GBFazit
Qwen 3.5 4B3,4 GB4,6 GBKomfortabel, langer Kontext möglich
Granite 4.2 8B5,3 GB2,7 GBKomfortabel nutzbar, moderate Kontextlänge
Qwen 3.5 9B6,6 GB1,4 GBKnapp, kurzer Kontext
Gemma 4 12B7,7 bis 8,0 GB0 GB oder wenigerPasst mit einer sinnvoll nutzbaren Kontextlänge nicht in den Speicher

Gemma 4 12B veranschaulicht die Falle bei der Dateigröße: Seine Gewichte belegen 7,7 bis 8 GB, aber die Grafikkarte muss auch Platz für den Kontext-Cache und die Bildschirmausgabe bieten. Das Modell lässt sich laden, allerdings bestenfalls mit einem Kontext von wenigen Tausend Tokens, und Teile davon werden in den Arbeitsspeicher ausgelagert, sobald eine Anwendung etwas VRAM beansprucht. Bei 8 GB sind Qwen 3.5 9B oder Granite 4.2 8B verlässlichere Optionen, die eine nutzbare Speicherreserve lassen.

#Bilder, Bildverständnis und Quantisierung: zwei Klarstellungen

Die Ollama-Modellbibliothek gibt an, dass Qwen 3.5 Text und Bilder akzeptiert: Ein 4B- oder 9B-Modell kann daher einen Screenshot beschreiben oder ein Diagramm lesen. Bilder beanspruchen Kontext, wodurch bei 8 GB weniger Spielraum bleibt; bevorzugen Sie für Bildverarbeitung das 4B-Modell (3,4 GB), wenn Sie Speicherplatz freihalten möchten. Bei der Quantisierung bleibt Q4_K_M ein guter Kompromiss für 8 GB: Eine feinere Quantisierung vergrößert die Modellgewichte um mehrere hundert Megabyte — diese Reserve hat die Karte nicht —, ohne dass sich bei alltäglicher Nutzung ein sichtbarer Unterschied ergibt.

#Ollama installieren und die Karte prüfen

  1. 01
    NVIDIA-Treiber
    Ollama erfordert einen NVIDIA-Treiber der Version 550 oder neuer. Installieren Sie für eine RTX 50 den neuesten von NVIDIA angebotenen Treiber. Überprüfen Sie dies mit nvidia-smi.
  2. 02
    Ollama installieren
    Die RTX 5060 steht auf der Liste der unterstützten Karten (Compute Capability 12.0). CUDA ist integriert: Eine separate Installation ist nicht erforderlich.
  3. 03
    Erstes Modell
    Starten Sie ollama run qwen3.5:9b (6,6 GB) oder ollama run granite4.2:8b (5,3 GB), wenn Sie lieber etwas Spielraum behalten möchten.
  4. 04
    Kontrolle
    Führen Sie ollama ps aus: Die Spalte PROCESSOR muss 100 % GPU anzeigen.

#Welche Geschwindigkeit ist zu erwarten: eine Obergrenze, keine Messung

Kein Durchsatz wird hier als eigene Messung präsentiert. Die theoretische Obergrenze für die Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 106 Tokens/s auf einer RTX 4080, deren Obergrenze bei 156 Tokens/s liegt, also etwa 68 %. Setzt man 70 % als groben Richtwert an, erhält man die folgenden Schätzungen für einen kurzen Kontext.

Theoretischer Grenzwert für RTX 5060 (448 GB/s)
Modell (Q4)ModellgrößeObergrenzeEstimate at 70 %
Qwen 3.5 4B3,4 GB132 Tokens pro Sekundeetwa 92 tokens/s
Granite 4.2 8B5,3 GB85 Tokens/setwa 59 Tokens pro Sekunde
Qwen 3.5 9B6,6 GB68 Tokens pro Sekundeca. 48 Tokens pro Sekunde
Gemma 4 12B7,7 GB58 Token/setwa 40 Token/s, sehr eingeschränkter Kontext

Alle diese Obergrenzen liegen deutlich über den etwa 15 bis 20 Tokens/s, bei denen sich der Text bequem mitlesen lässt. Die 5060 wird daher nicht durch die Geschwindigkeit begrenzt, sondern durch ihre Speicherkapazität von 8 GB.

#Ollama so einstellen, dass die 8 GB nicht überschritten werden

Ollama quantisiert den K/V-Cache in q8_0, um ungefähr halb so viel Speicher wie mit dem Standardformat f16 zu benötigen, bei laut Dokumentation sehr geringem Genauigkeitsverlust; dies setzt Flash Attention voraus. Bei 8 GB ist das die Maßnahme mit dem größten Nutzen: Sie ermöglicht einen längeren Kontext, ohne das Modell zu wechseln.

Ollama-Servereinstellungen (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Ein einziges Modell
Laden Sie jeweils nur ein Modell; ein Embedding-Modell für RAG muss klein bleiben.
Ressourcenintensive Anwendungen
Browser mit Hardwarebeschleunigung, Spiele und Videocodierung belegen VRAM: Beenden Sie sie vor dem Laden.
Angepasster Kontext
Jede Verdoppelung des Kontexts verdoppelt den K/V-Cache: Erhöhen Sie den Kontext nur, wenn die Aufgabe es erfordert.
Überwachung
nvidia-smi zeigt während einer längeren Generierung den tatsächlichen Spielraum.

#Was man mit 8 GB konkret machen kann

Das richtige Kriterium ist die geforderte Aufgabe, nicht die Größe des Modells. Ein Chat oder eine Umformulierung ist sowohl mit einem 4B-Modell als auch mit einem 8B-Modell möglich. Eine Zusammenfassung von Dokumenten mit einigen Dutzend Seiten erfordert einen Kontext von 8 000 bis 16 000 Tokens: Mit dem K/V-Cache in q8_0 schafft ein 8B-Modell dies auf 8 GB. Ein RAG kombiniert ein Generierungsmodell, ein Embeddings-Modell und den Kontext der gefundenen Auszüge: Halten Sie das Generierungsmodell unter 9B. Der Code-Assistent ist der anspruchsvollste Fall, da spezialisierte Modelle schnell die Kapazität der Karte überschreiten.

Einsatzmöglichkeiten mit der RTX 5060 (8 GB)
NutzungRealistisch?Empfohlene Einstellung
Täglicher Chat, kurze FragenJaGranite 4.2 8B, Standardkontext
Zusammenfassung von Dokumenten mit 10 bis 30 SeitenJa, mit einem Kontext von 8.192 bis 16.384 TokensK/V-Cache in q8_0, Flash Attention
RAG mit Ihren DateienJa, mit einem Modell mit 4 bis 8 Milliarden ParameternLeichte Embeddings, ein einziges Generierungsmodell
Code-Assistent für ein RepositoryBegrenztModell mit 4B bis 8B, kurze Textauszüge
Modelle ab 14 GBNein16 GB VRAM einplanen

Wenn ein Modell nicht vollständig in den GPU-Speicher passt, stoppt die Generierung nicht: Ein Teil der Gewichte wird aus dem System-RAM gelesen. Das zeigt sich in einem abrupten Rückgang des Durchsatzes. Der Befehl ollama ps zeigt die Verteilung zwischen GPU und CPU an; eine Zeile mit 100 % GPU zeigt den Normalzustand, eine Zeile mit geteilter Ausführung weist auf die Auslagerung in den System-RAM hin. Dies lässt sich beheben, indem Sie den Kontext verkleinern oder ein anderes Modell wählen.

#Wenn die 5060 nicht mehr ausreicht

Drei Signale deuten darauf hin, dass mehr Speicher benötigt wird. Sie möchten ein Modell mit 12B oder mehr für eine hochwertige Texterstellung. Ihr Kontext überschreitet regelmäßig 16 000 Tokens aufgrund langer Dokumente. Sie laden mehrere Modelle gleichzeitig: eines zur Generierung, eines für Embeddings und einen Reranker. In diesen Fällen ändert eine höhere Geschwindigkeit nichts: Es fehlt an Kapazität, und die nächsten Stufen werden auf den Seiten zu 12 GB und 16 GB beschrieben.

#5060 oder 5060 Ti 16 GB: die entscheidende Wahl

Die RTX 5060 Ti 16 GB verwendet denselben GDDR7-Speicher an einem 128-Bit-Bus und hat damit laut Wikipedia dieselbe Bandbreite von 448 GB/s. Die eigentlichen Unterschiede sind ihre 4.608 CUDA-Kerne und ihre 16 GB Speicher. Bei einem Modell, das auf beide Karten passt, generiert sie daher mit derselben Geschwindigkeit. Sie kann aber auch 14 GB große Modelle laden, die auf der 5060 keinen Platz finden. Die empfohlenen Preise zum Verkaufsstart lagen bei 299 US-Dollar für die 5060, 379 US-Dollar für die 5060 Ti 8 GB und 429 US-Dollar für die 5060 Ti 16 GB: Für 130 US-Dollar mehr erhält man die doppelte Speicherkapazität.

RTX 5060 und RTX 5060 Ti: Was sich für den Einsatz eines LLM ändert
KriteriumRTX 5060RTX 5060 Ti 16 GB
Speicher8 GB GDDR716 GB GDDR7
Bandbreite448 GB/s448 GB/s
CUDA-Kerne3 8404 608
Graphikleistung145 W180 W
Mindestanforderungen an die Stromversorgung550 W600 W
Modelle mit einer Größe von 14 GB (gpt-oss 20B, Mistral Small 24B)NeinJa, mit 2 GB Reserve

#Fazit 2026

Kaufen Sie eine 5060, wenn
Ihre Modelle haben 4B bis 9B Parameter, Ihr Budget ist knapp und Sie möchten Neuware mit Garantie. Das ist die schnellste Karte mit 8 GB.
Wählen Sie die 5060 Ti 16 GB vorzugsweise, wenn
Sie möchten Modelle mit 12B bis 24B nutzen: Die Speicherkapazität ist wichtiger als die Geschwindigkeit, und der Aufpreis ist gering.
Vermeiden Sie die 5060, wenn
Sie planen, Gemma 4 12B, gpt-oss 20B oder ein beliebiges Modell mit mehr als 8 GB ernsthaft zu verwenden.

Die Zusammenfassung lässt sich auf einen Satz bringen: Die 5060 ist die 8-GB-Karte, die man wegen ihrer Geschwindigkeit und ihres Preises wählt, nicht wegen ihrer Speicherkapazität. Wenn Ihr Einsatzzweck mit 8 GB auskommt, ist sie als Neuware schwer zu schlagen; wenn nicht, kann keine Einstellung die fehlenden 8 GB ausgleichen, und die nächsthöhere Karte der Reihe ist die richtige Investition.

#Häufig gestellte Fragen

FAQ
Kann die RTX 5060 einen LLM lokal ausführen?+
Ja, bis zu etwa 9 Milliarden Parametern in Q4. Granite 4.2 8B (5,3 GB) und Qwen 3.5 9B (6,6 GB) passen in die 8 GB VRAM der Karte. Bei größeren Modellen wie Gemma 4 12B (7,7 bis 8 GB) bleibt kein Platz mehr für den Kontext, und das Modell wird teilweise in den System-RAM ausgelagert.
Wie viele Tokens pro Sekunde auf einer RTX 5060?+
Keine zuverlässige Messung wird hier veröffentlicht. Der theoretische Grenzwert, der Bandbreitenwert von 448 GB/s geteilt durch die Modellgröße, beträgt etwa 85 Tokens/s für Granite 4.2 8B (5,3 GB), also fast 59 Tokens/s bei 70 % dieses Grenzwerts. Diese Schätzung sinkt, wenn der Kontext länger wird.
RTX 5060 oder RTX 4060 Ti 16 GB für ein LLM?+
Für Modelle, die in 8 GB passen, ist die 5060 schneller: 448 GB/s gegenüber 288 GB/s. Für Modelle mit einem Speicherbedarf von 14 GB, wie gpt-oss 20B, eignet sich nur die 4060 Ti mit 16 GB. Die Wahl hängt daher zunächst von der angestrebten Modellgröße und dann vom Gebrauchtpreis der 4060 Ti ab.
Beschleunigt FP4 auf der RTX 5060 Ollama?+
NVIDIA hebt FP4 in den Tensor Cores der fünften Generation hervor. Die gängigen Ollama-Modelle in Q4_K_M liegen nicht im FP4-Format vor: Ein Leistungsgewinn dieser Art ist hier nicht dokumentiert. Der Faktor, der die Generierung beschleunigt, ist die Bandbreite von 448 GB/s.
Welche Stromversorgung benötigt eine RTX 5060?+
NVIDIA gibt eine Gesamtleistungsaufnahme der Grafikkarte von 145 W und eine Mindestleistung des Netzteils von 550 W für den gesamten PC an. Dieser Wert berücksichtigt Reserven für den Prozessor und Verbrauchsspitzen. Ein hochwertiges Netzteil mit 550 W ist geeignet; die 5060 Ti benötigt 600 W.
Kann man mit einer RTX 5060 RAG durchführen?+
Ja, mit einem Generierungsmodell mit 4B bis 8B Parametern und einem schlanken Embedding-Modell. Halten Sie nur ein Generierungsmodell geladen, aktivieren Sie den K/V-Cache in q8_0 und begrenzen Sie den Kontext auf das, was Ihre Textauszüge erfordern. Darüber hinaus wird die Kapazität von 8 GB zum begrenzenden Faktor.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.