Welcher LLM auf einer RTX 4060 Ti (8 / 16 GB) ?
Bei der RTX 4060 Ti ist die 16-GB-Version die entscheidende Variante für ein lokales LLM: Sie lädt Gemma 4 12B (7,7 bis 8 GB), gpt-oss 20B (14 GB) oder Mistral Small 24B (14 GB), für die die 8-GB-Version nicht genug Speicher bietet. Beide Versionen haben dieselbe Speicherbandbreite von 288 GB/s und damit dieselbe Geschwindigkeit bei einem Modell, das in den Speicher beider Varianten passt. Die 8-GB-Version ist auf Modelle mit höchstens 9 Milliarden Parametern beschränkt.
Die RTX 4060 Ti gibt es in zwei Versionen, die unter demselben Namen verkauft werden: mit 8 GB und mit 16 GB. Für lokale LLMs ist dieser Unterschied keine Kleinigkeit: Er entscheidet darüber, ob eine Karte auf kleine Modelle beschränkt ist oder Modelle mit 12 bis 24 Milliarden Parametern aufnehmen kann. Dieser Leitfaden erklärt, welche Modelle jede Version laden kann, welche Grenze ihr Speicherbus setzt und welche Karten Sie vor dem Kauf vergleichen sollten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Kaufalternative für diesen Guide: RTX 5060 Ti 16 GB.
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#RTX 4060 Ti für einen lokalen LLM: 8 GB oder 16 GB
Für ein lokales LLM nehmen Sie die RTX 4060 Ti mit 16 GB und lassen Sie die 8-GB-Version beiseite. Beide Versionen verwenden denselben Chip mit laut NVIDIA 4.352 CUDA-Kernen und denselben Speicher mit einer Bandbreite von 288 GB/s: Nur die Kapazität unterscheidet sich. Diese Kapazität entscheidet darüber, was geladen werden kann. Mit 8 GB bleiben Sie bei Modellen von 4B bis 9B, etwa Granite 4.2 8B oder Qwen 3.5 9B. Mit 16 GB passt Gemma 4 12B mit einer ordentlichen Reserve für den Kontext in den Speicher; auch gpt-oss 20B und Mistral Small 24B mit jeweils 14 GB passen in den VRAM, allerdings mit wenig Spielraum. Die Geschwindigkeit ändert sich dagegen nicht zwischen den Versionen: Sie wird durch den 128-Bit-Bus begrenzt. Der Gebrauchtpreis der 16-GB-Version ist daher mit dem einer RTX 3060 mit 12 GB oder einer neuen RTX 5060 Ti mit 16 GB zu vergleichen.
- Architektur
- Ada Lovelace, 4.352 CUDA-Kerne in beiden Versionen (Produktseite NVIDIA)
- Speicher
- 8 GB oder 16 GB GDDR6, 128-Bit-Bus, Bandbreite von 288 GB/s.
- Leistung
- 160 W bei der 8-GB-Version und 165 W bei der 16-GB-Version laut Wikipedia; NVIDIA nennt für den PC ein Netzteil mit mindestens 550 W.
- Einführungspreis
- 499 US-Dollar für die 16-GB-Version, erschienen im Juli 2023 (Quelle: Wikipedia).
- Benutzeroberfläche
- PCIe 4.0, auf 8 Lanes begrenzt, wie bei der RTX 4060.
#8 GB oder 16 GB: Was jede Version laden kann
| Modell | Größe | 4060 Ti 8 GB | 4060 Ti 16 GB |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | Ja | Ja, mit viel Spielraum |
| Qwen 3.5 9B | 6,6 GB | Ja, kurzer Kontext | Ja |
| Gemma 4 12B | 7,7 bis 8,0 GB | Nein | Ja, 8 GB Speicherreserve |
| gpt-oss 20B | 14 GB | Nein | Ja, mit 2 GB Reserve |
| Mistral Small 24B | 14 GB | Nein | Ja, 2 GB Spielraum, kurzer Kontext |
| Qwen 3.5 27B | 17 GB | Nein | Nein, überschreitet 16 GB |
Die Tabelle lässt sich anhand einer Regel lesen: Lassen Sie bei 16 GB mindestens 2 GB Reserve für den Kontextcache und das System. Mit Gemma 4 12B reicht das bequem, mit gpt-oss 20B und Mistral Small 24B wird es knapp, mit einem 17 GB großen Modell ist es unmöglich. Ollama verwendet standardmäßig einen Kontext von 4.096 Tokens; darüber hinaus beansprucht der K/V-Cache diese Reserve, weshalb es sinnvoll ist, ihn zu quantisieren.
#Welches Modell für die 16-GB-Version wählen?
- Gemma 4 12B
- Die vielseitige Wahl: Modellgewichte von 7,7 bis 8,0 GB und ein in der Ollama-Bibliothek angekündigtes Kontextfenster von 256.000 Tokens. Sie können den Kontext auf 16.000 Tokens oder mehr erweitern, ohne den Grafikspeicher zu überschreiten.
- gpt-oss 20B
- Reasoning-Modell, 14 GB. Bei moderater Kontextlänge im VRAM nutzbar. Für die Installation die entsprechende Anleitung konsultieren.
- Mistral Small 24B
- 14 GB für ein dichtes Modell mit 24 Milliarden Parametern: Es liest pro Token mehr Modellgewichte und ist deshalb auf einer Karte mit 288 GB/s das langsamste der drei Modelle.
- Qwen 3.5 9B
- 6,6 GB, das Ausweichmodell, wenn Sie einen langen Kontext oder mehrere gleichzeitig geladene Modelle wünschen.
#Installieren und überprüfen, ob alles im VRAM liegt
Nach jedem Laden muss ollama ps 100 % GPU anzeigen. Eine Aufteilung zwischen CPU und GPU weist darauf hin, dass Teile des Modells in den Arbeitsspeicher ausgelagert werden. Das verlangsamt die Generierung auf dieser Karte stark, da ihre PCIe-Anbindung auf 8 Lanes begrenzt ist. Bei der Version mit 8 GB tritt genau dieser Fall auf, wenn Sie gemma4:12b oder gpt-oss:20b ausprobieren.
#Welche Geschwindigkeit ist zu erwarten: Obergrenzen und Messwerte Dritter
Keine der hier angegebenen Durchsatzraten wird als eigene Messung dargestellt. Die theoretische Obergrenze für die Generierung ergibt sich aus der Bandbreite geteilt durch die Größe der Modellgewichte. Eine öffentlich zugängliche Messung eines Dritten (LLaMA 3 8B in Q4_K_M unter llama.cpp, Mai 2024) ergibt 68 % dieser Obergrenze auf einer RTX 4080 und 75 % auf einer RTX 4070 Ti, also eine Größenordnung von 70 %. Bei 288 GB/s ergeben sich daraus die folgenden Schätzungen für einen kurzen Kontext.
| Modell | Modellgröße | Obergrenze | Estimate at 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 54 Tokens/s | etwa 38 Tokens/s |
| Qwen 3.5 9B | 6,6 GB | 44 Token/s | etwa 31 Tokens/s |
| Gemma 4 12B | 7,7 GB | 37 Tokens pro Sekunde | etwa 26 Tokens pro Sekunde |
| Mistral Small 24B | 14 GB | 21 Token pro Sekunde | etwa 14 Tokens pro Sekunde |
Diese Zahlen folgen einer zur Kapazität umgekehrten Logik: Je größer das Modell, desto stärker fällt der Bus ins Gewicht. Ein Modell mit mehreren Experten wie gpt-oss 20B liest bei jedem Token nur seine aktiven Experten; sein tatsächlicher Durchsatz liegt daher über dem eines dichten Modells gleicher Größe. Hier werden keine verlässlichen Messwerte angegeben. Bei einem Chat lässt sich eine Ausgabe mit 14 Tokens/s noch gut mitlesen; für Code mit langen Ausgaben ist das zu wenig.
#Den Kontext mit 16 GB verwalten
Der verbleibende Spielraum von 2 GB bei gpt-oss 20B oder Mistral Small 24B schrumpft mit zunehmendem Kontext. Ollama kann den K/V-Cache in q8_0 quantisieren, wodurch er etwa halb so viel Speicher benötigt wie im standardmäßig verwendeten f16-Format; dafür muss Flash Attention aktiviert sein. Bei 16 GB macht diese Einstellung ein 14 GB großes Modell, das sonst nur mit kurzem Kontext nutzbar ist, mit 8.000 Tokens oder mehr nutzbar. Die Einstellung wird beim Start des Servers vorgenommen.
#4060 Ti 16 GB, 3060 12 GB oder 5060 Ti 16 GB
| Karte | VRAM | Bandbreite | Zusammenfassung |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Weniger Speicherkapazität, schneller als die 4060 Ti |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | Speicherkapazität für den Gebrauchtkauf, mit einem langsamen Bus |
| RTX 5060 Ti 16 GB | 16 GB | 448 GB/s | Gleiche Kapazität, 55 % mehr Bandbreite |
Bei der Wahl sind zwei Kriterien entscheidend. Wenn das gewünschte Modell 14 GB groß ist, kommt nur eine Karte mit 16 GB infrage. Die 5060 Ti 16 GB liest ihren Speicher 55 % schneller als die 4060 Ti und bietet als Neuware eine Garantie. Wenn das gewünschte Modell in 12 GB passt, ist eine gebrauchte RTX 3060 12 GB in der Regel schneller und günstiger. Die 4060 Ti 16 GB ist nur dann die richtige Wahl, wenn ihr Gebrauchtpreis deutlich unter dem Preis einer neuen 5060 Ti liegt: Prüfen Sie das auf der Seite zur Preisverfolgung.
#Was sich mit 16 GB nicht laden lässt
Sechzehn Gigabyte markieren eine klare Grenze. Modelle mit 14 GB passen hinein, Modelle mit 16 GB oder mehr passen nicht hinein, selbst wenn sie in Q4 quantisiert sind, da auch der Kontext noch Platz benötigt. Die Tabelle zeigt die von Ollama veröffentlichten Größen der Modelle, die knapp über dieser Grenze liegen.
| Modell | Größe | Auswirkung bei 16 GB |
|---|---|---|
| Qwen 3.5 27B | 17 GB | Passt nicht vollständig in den VRAM: Ein Teil des Modells wird in den Arbeitsspeicher ausgelagert |
| Gemma 4 26B | 16 bis 19 GB | Passt nicht vollständig in den Grafikspeicher oder lässt keinen Platz für Kontext |
| Qwen 3.5 35B | 24 GB | Zu groß: 24 GB VRAM einplanen |
Ein Modell, das überläuft, antwortet weiter, aber ein Teil der Gewichte wird über PCIe 4.0 mit maximal 8 Linien aus dem Systemspeicher geladen. Die Generierung wird deutlich langsamer als bei einem Modell, das vollständig im Arbeitsspeicher gehalten wird. Wenn solche Modelle Ihr Ziel sind oder wenn Sie die Karte mehrere Jahre lang behalten wollen, während die Modelle wachsen, ist die bessere Entscheidung, bei der Kauf bereits 24 GB zu wählen, nicht jedoch ein 16 GB-Modell zu optimieren.
Der schmale Speicherbus ist nicht das einzige Kriterium. Die Verarbeitung des Prompts, also das Einlesen Ihrer Frage oder Ihrer Dokumente vor der ersten Antwort, beansprucht vor allem die Rechenleistung und nicht den Speicher. Hier profitiert die 4060 Ti von ihren 4.352 CUDA-Kernen gegenüber 3.072 bei der RTX 4060. Ein langes Dokument wird daher relativ schnell eingelesen (der Unterschied wurde hier nicht gemessen), auch wenn die anschließende Generierung durch die 288 GB/s begrenzt bleibt. Dieser Unterschied erklärt, warum eine Karte beim ersten Wort schnell reagiert, die fortlaufende Ausgabe danach aber langsam ist.
#Kaufen oder warten: drei Fragen, die Sie sich stellen sollten
- Welches ist das größte sinnvolle Modell?
- Wenn es ein Modell mit 14B bis 24B in Q4 ist, bietet die 16-GB-Version die passende Kapazität. Wenn ein Modell mit 8B bis 9B ausreicht, genügt bereits eine Karte mit 8 GB, und die 16-GB-Version bedeutet dann lediglich Mehrkosten.
- Zählt die Geschwindigkeit?
- Für einen Chat zum persönlichen Gebrauch reichen 15 bis 30 Tokens/s aus. Bei Agenten, die lange Ausgaben hintereinander erzeugen, wird die Bandbreite von 288 GB/s zum begrenzenden Faktor, und die 5060 Ti mit 16 GB ist die klare Wahl.
- Neu oder gebraucht?
- Eine gebrauchte Karte erspart Ihnen den Neupreis, hat aber keine Garantie mehr; eine Karte aus dem Jahr 2023 kann für Mining oder intensives Gaming genutzt worden sein. Prüfen Sie vor dem Kauf die Temperaturen und die Lüftergeräusche.
#Fazit 2026
- Wählen Sie die 16 GB-Version, wenn
- Der Gebrauchtpreis ist niedrig und Sie möchten Modelle mit 12B bis 24B nutzen. Sie akzeptieren einen durch den Bus begrenzten Durchsatz.
- Vermeiden Sie die 8-GB-Variante für LLMs
- Sie kann nicht mehr laden als eine RTX 4060 oder eine RTX 5060, die dieselbe Speicherkapazität haben.
- Bevorzugen Sie die 5060 Ti 16 GB
- Wenn Sie neu kaufen, wegen der Garantie und der höheren Bandbreite.
- Quelle: offizielle NVIDIA-Spezifikationen (RTX 4060 Ti)
- Quelle: Größen von Gemma 4 in der Ollama-Bibliothek
- Quelle: offizielle FAQ von Ollama (Flash Attention, K/V-Cache)
#Häufig gestellte Fragen
RTX 4060 Ti 8 GB oder 16 GB für ein LLM?+
Ist die RTX 4060 Ti 16 GB langsam für einen LLM?+
RTX 4060 Ti 16 GB oder RTX 3060 12 GB?+
Passt gpt-oss 20B auf eine RTX 4060 Ti?+
Welche Stromversorgung benötigt eine RTX 4060 Ti?+
Wie lässt sich überprüfen, ob das Modell in den VRAM passt?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.