RTX 5090 und lokale LLMs: Speicher, Modelle, benchmark
RTX 5090 und lokale LLMs: verstehen, was 32 GB VRAM ermöglichen, ein eindeutig identifizierbares Modell auswählen und einen reproduzierbaren Benchmark vorbereiten. Herstellerangaben und Schätzungen werden von Messungen unterschieden.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was überprüft ist und was nicht
Das NVIDIA-Datenblatt nennt 32 GB GDDR7 für die RTX 5090 gegenüber 24 GB für die RTX 4090. Dieser Unterschied erhöht den verfügbaren Speicher; er belegt weder einen Durchsatz noch eine Antwortqualität. Herstellerquelle: https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/
#Modellgewichte, Kontextcache und Speicherreserve für die Laufzeitumgebung
Die quantisierte Datei, der KV-Cache und die Laufzeitpuffer müssen zusammen in den Speicher passen. Eine 32 GB große Datei passt bei einem sinnvoll nutzbaren Kontext nicht vollständig in 32 GB VRAM. Den Kontext zu verkleinern, eine kompaktere Quantisierung zu wählen oder CPU-Offloading in Kauf zu nehmen, sind unterschiedliche Kompromisse.
Theoretische Schätzung der Größe der Gewichte allein: Gesamtzahl der Parameter × Bits pro Gewicht / 8, ohne Metadaten und Quantisierungsoverhead. Diese Berechnung ist weder eine Messung des belegten VRAM noch eine Garantie dafür, dass das Modell geladen werden kann. Die Anzahl der aktiven Parameter eines MoE ersetzt niemals die Gesamtzahl, wenn die Größe der zu speichernden Gewichte geschätzt wird.
#Llama 4 Scout: die wesentliche Korrektur
Die offizielle Modellkennung lautet meta-llama/Llama-4-Scout-17B-16E-Instruct: 17 Milliarden aktive Parameter, insgesamt 109 Milliarden Parameter und 16 Experten. Die alte Bezeichnung „17B-A2B“ und der behauptete Speicherbedarf von 17 GB waren falsch. Bei vier Bits benötigen 109 Milliarden Gewichte bereits etwa 54,5 GB in dezimaler Rechnung, noch ohne zusätzlichen Speicherbedarf. Bei dieser Quantisierung lässt sich das Modell nicht vollständig auf der GPU einer einzigen RTX 5090 mit 32 GB unterbringen.
Primärquelle: https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct . Eine Auslagerung in den RAM oder die Nutzung mehrerer Grafikkarten verändert das Testprotokoll und den Durchsatz. Wir schreiben dieser nicht vermessenen Konfiguration keine Geschwindigkeitsergebnisse zu.
#Ein erstes identifizierbares Modell
Für den Einstieg sind Qwen/Qwen3-8B und Qwen/Qwen3-14B zwei eindeutig identifizierbare, von Qwen veröffentlichte Modelle. Beginnen Sie mit einer Q4-Quantisierung und einem Kontext von 4096 Tokens und prüfen Sie anschließend die tatsächliche Verteilung auf die Hardware. Das 8B-Modell lässt mehr Spielraum; das 14B-Modell ist eine Alternative, die Sie anhand Ihrer eigenen Aufgaben vergleichen sollten. Diese Auswahl für den Einstieg ist keine auf einer RTX 5090 getestete Qualitätsrangliste.
Quellen: https://huggingface.co/Qwen/Qwen3-8B und https://huggingface.co/Qwen/Qwen3-14B; Verteilungen Ollama: https://ollama.com/library/qwen3:8b und https://ollama.com/library/qwen3:14b. Der Tag kann sich ändern: Aktualisieren Sie seinen Digest und die Quantisierung mit ollama show avant um die Ergebnisse zu vergleichen.
#RTX 5090 und RTX 4090: Vergleichen ohne falsche Benchmark-Werte
Die RTX 4090 unterstützt kein NVLink. Zwei RTX 4090 bilden nicht automatisch einen Pool von 48 GB, der wie eine einzelne Karte genutzt werden kann. Die Laufzeitumgebung kann bestimmte Lasten über PCIe verteilen, wobei Kommunikationsaufwand und modellspezifische Einschränkungen zu berücksichtigen sind. Quelle: NVIDIA, https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/
Ein Vergleich allein anhand der Bandbreite liefert keinen verlässlichen Faktor für die Anzahl der Tokens pro Sekunde. Promptverarbeitung, Generierung, Quantisierung, Kontext, Kernels und Offload müssen identisch sein. Hier wird ohne vergleichbare Messungen kein bezifferter Vorteil im Vergleich zwischen 5090, 4090 und 3090 behauptet.
#Anzuwendendes reproduzierbares Testprotokoll
Das genaue GPU-Modell und die VRAM-Kapazität mit nvidia-smi erfassen, ebenso CPU, RAM, Betriebssystem, Treiber, Runtime-Version, Modellkennung und Modell-Hash, Quantisierung, Kontext, Batch und Offload. Während des Tests nur einen Benutzer zulassen und jede weitere GPU-Last vermeiden. Einen dokumentierten Aufwärmlauf durchführen und anschließend fünf Wiederholungen mit denselben Eingaben ausführen.
prompt_eval_count / prompt_eval_duration und eval_count / eval_duration in den JSON-Antworten von Ollama getrennt festhalten. Die Zeitangaben sind in Nanosekunden. Jeden Wiederholungslauf sowie Median und Streuung veröffentlichen und dabei auf das Prompt-Caching hinweisen. Quelle: https://docs.ollama.com/api/generate . Der Generierungsdurchsatz misst weder die gesamte wahrgenommene Latenz noch die Qualität.
#Verbrauch und Preis: hier nicht gemessen
Die vom Hersteller angegebene Leistung entspricht nicht dem Verbrauch an der Steckdose. Ein Energievergleich erfordert ein Wattmessgerät, dasselbe System sowie Angaben zur Dauer und zu den erzeugten Ausgaben. Die früheren Preis/Token-Verhältnisse und Empfehlungen mit konkreten Werten für das Power-Limit wurden mangels nachvollziehbarer Messungen entfernt. Vergleichen Sie die aktuellen Preise erst, nachdem Sie Ihren Speicherbedarf festgelegt haben.
#Nach der tatsächlich benötigten Speichergröße wählen
Eine Grafikkarte mit 32 GB kann nützlich sein, wenn Ihr quantisiertes Modell und sein Kontext mehr Speicher benötigen, als eine Karte mit 24 GB bietet, aber unter der Kapazität einer Karte mit 32 GB bleiben. Prüfen Sie bei kleinen Modellen zunächst das Ergebnis auf Ihrer aktuellen Hardware. Bei Scout bleibt der Speicherbedarf aller Modellgewichte entscheidend: Die aktiven Parameter machen dieses Modell nicht mit 32 GB kompatibel.
#Weiter zu einer kostenlosen Installation
Der Konfigurator liefert eine Einschätzung der Kompatibilität. Die Modellbeschreibung und der Leitfaden zu Ollama ermöglichen es anschließend, vor einem Kauf die Installation und die Verteilung auf CPU und GPU zu prüfen. Die auf der Seite Benchmarks veröffentlichten Hardware-Ergebnisse sollten unter Berücksichtigung des jeweiligen Messprotokolls und des exakt verwendeten Rechners gelesen werden.
- Offizielle Modellkarte zu Llama 4 Scout
- Spezifikationen RTX 4090 — NVIDIA
- Nachvollziehbare Messungen auf unserem Testrechner
- Qwen3 8B installieren
- Hardwarekompatibilität abschätzen
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.