Bestes LLM für Ryzen AI 9
Wählen Sie den bestes LLM für Ryzen AI 9 ist keine Frage der reinen Rechenleistung, sondern der Abstimmung zwischen dem verfügbaren vereinheitlichten Speicher, der Modellarchitektur (dicht oder Mixture-of-Experts) und dem tatsächlichen Durchsatz der RDNA-iGPU und der XDNA-NPU. Auf diesen Plattformen übertrifft ein MoE-Modell mit wenigen aktiven Parametern häufig ein kleineres dichtes Modell. Dieser Artikel erläutert die VRAM-Spezifikationen je nach Quantisierung, die erwarteten Durchsätze, die Lizenzen, die Benchmark-Richtwerte und konkrete Anwendungsfälle, um einen stimmigen Arbeitsplatz für lokale Inferenz auf Ryzen AI 9 aufzubauen.
Das Speicherlimit des Ryzen AI 9 verstehen
Die Ryzen-AI-9-APUs (HX und Max) basieren auf vereinheitlichtem Speicher, den sich CPU, iGPU und NPU teilen. Die Speichermenge, die der GPU zugewiesen werden kann, bestimmt unmittelbar, welches Modell Sie laden können. Bei einer Ryzen-AI-Max-395-Konfiguration mit 128 GB vereinheitlichtem Speicher ist der für die Inferenz nutzbare Speicher deutlich größer als bei einem HX 370, der auf etwa 32 GB begrenzt ist.
Orientierungswerte für die Dimensionierung (Größenordnungen, die je nach Ihrer Speicherzuweisung im BIOS zu überprüfen sind):
- Q4 : ~0,55 bis 0,60 GB VRAM pro Milliarde gespeicherter Parameter
- Q5 : etwa +20 % im Vergleich zum Q4
- Q8 : etwa das Doppelte von Q4
- FP16 : etwa das Vierfache des Q4
Für das vollständige Vorgehen zur Zuweisung an NPU/iGPU lesen Sie den Leitfaden für Ryzen AI 9 HX und das Ryzen AI Max 395-Anleitung. Details zur Wahl der Quantisierung finden Sie in unserem Leitfaden Q4/Q5/Q8.
Warum MoE-Modelle mit geringer Aktivierung bevorzugt werden sollten
Bei einer iGPU mit moderater Speicherbandbreite ist die Anzahl der Parameter der begrenzende Faktor actifs pro Token, nicht insgesamt. Ein Mixture-of-Experts-Modell aktiviert nur einen Bruchteil seiner Gewichte pro Durchlauf.
- Qwen3.8 Flash Next 125B-A6B (125B, ~72 GB Q4, ctx 256000): nur ~6B aktive Parameter, was ihn zu einem effizienten Kandidaten für einen interaktiven Durchsatz bei großem Unified Memory macht. Siehe das Modellsteckbrief zu Qwen3.8 Flash Next und den Herausgeber Alibaba auf Hugging Face.
- Qwen 3.5 122B-A10B (122B, ~73 GB Q4, ctx 262000, Apache 2.0): ~10B aktive Parameter, guter Kompromiss zwischen Qualität und Durchsatz. Siehe das Datenblatt Qwen 3.5 122B-A10B.
- Mixtral 8x22B Instruct (141B, ~82 GB Q4, ctx 64000, Apache 2.0): ein historisches MoE-Modell von Mistral AI auf Hugging Face, eine bewährte Wahl. Siehe die Modellprofil von Mixtral 8x22B.
Diese drei Modelle passen in Q4 nur in den Speicher einer Konfiguration mit viel gemeinsamem Speicher (etwa Ryzen AI Max 395, 128 GB). Auf einem HX 370 mit 32 GB lassen sie sich lokal nur mit sehr langsamem Offloading auf einen Datenträger betreiben.
Dichte, kompakte Modelle und Alternativen
Wenn Ihre Arbeitslast ein besser vorhersehbares dichtes Modell erfordert:
- Mistral Small 4 (119B, ~72 GB Q4, ctx 256000, Apache 2.0): permissive Lizenz für die kommerzielle Nutzung. Siehe die Datenblatt Mistral Small 4.
- Nemotron 3 Super 120B (120B, ~72 GB Q4, ctx 128000, NVIDIA Open Model License): siehe die Datenblatt zu Nemotron 3 Super et NVIDIA auf Hugging Face.
- DBRX Instruct (132B, ~76 GB Q4, ctx 32768, Databricks Open Model License): siehe die Datenblatt DBRX Instruct.
- dots.llm1 Instruct (142B, ~85 GB Q4, ctx 32768, MIT): siehe die Modellprofil dots.llm1.
Bei gleicher VRAM-Kapazität beansprucht ein dichtes Modell pro Token mehr Bandbreite als ein MoE mit wenigen aktiven Parametern: Rechnen Sie auf einer iGPU mit einem geringeren Durchsatz. Die genauen Durchsatzwerte in Tokens pro Sekunde auf Ryzen AI hängen vom Backend und der Speicherzuweisung ab und müssen auf Ihrem Rechner noch bestätigt werden.
Lizenzen und Konformität
Für den professionellen Einsatz ist die Lizenz genauso wichtig wie der Durchsatz:
- Apache 2.0 : Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4 — weitreichende kommerzielle Nutzung.
- MIT : dots.llm1 Instruct — sehr liberal.
- NVIDIA Open Model License : Nemotron 3 Super 120B — prüfen Sie die Klauseln zur Namensnennung.
- Databricks Open Model License : DBRX Instruct — die spezifischen Bedingungen lesen.
Bei europäischen regulatorischen Fragen lesen Sie unseren Leitfaden zur Einhaltung des AI Act.
Empfohlene Inferenz-Backends
Die Wahl der Inferenz-Engine beeinflusst den erzielten Durchsatz erheblich:
- llama.cpp : Vulkan/ROCm-Unterstützung für AMD-iGPUs, quantisiertes GGUF-Format, ideal für Self-Hosting auf Ryzen AI.
- Ollama : praktische Zusatzschicht zur lokalen Verwaltung von GGUF-Modellen.
- vLLM : auf hohen Serverdurchsatz ausgelegt, sinnvoll, wenn Sie eine interne API bereitstellen.
Führen Sie die Inferenz ausschließlich lokal aus: Der Zweck eines Rechners mit Ryzen AI 9 ist es, Ihre Daten auf dem Gerät zu behalten.
FAQ
F: Welches Modell passt in den Speicher eines Ryzen AI 9 HX 370 (32 GB)?
Mit etwa 32 GB vereinheitlichtem Speicher, von dem ein Teil für die GPU reserviert ist, passen die hier aufgeführten Modelle (68 GB+ in Q4) nicht in den Speicher. Der HX 370 ist eher für leichtere Modelle außerhalb dieser Auswahl gedacht. Konsultieren Sie den Katalog filtert nach VRAM und dem Konfigurator für eine Dimensionierung, die Ihrer tatsächlichen Speicherkapazität entspricht.
F: MoE oder ein dichtes Modell für eine AMD-iGPU?
Ein MoE mit wenigen aktiven Parametern wie Qwen3.8 Flash Next 125B-A6B (~6B aktive Parameter) beansprucht pro Token weniger Bandbreite als ein dichtes Modell mit 120B Parametern. Auf einer iGPU mit begrenzter Bandbreite bietet das MoE bei vergleichbarer Qualität in der Regel einen besseren interaktiven Durchsatz, allerdings bei einem größeren Gesamtspeicherbedarf.
F: Welche Quantisierung wählen?
Q4 maximiert die Anzahl der ladbaren Parameter und bleibt der übliche Kompromiss. Q5 verbessert die Wiedergabetreue leicht und benötigt dafür ~20 % mehr VRAM. Q8 verdoppelt den Speicherbedarf: Reservieren Sie es für Konfigurationen mit 128 GB. Details finden Sie im Leitfaden Q4/Q5/Q8.
Q: Beschleunigt die NPU die LLM-Inferenz?
Die XDNA-NPU ist vor allem auf bestimmte Arbeitslasten ausgelegt, und ihre Integration in Open-Source-LLM-Backends entwickelt sich weiter. In der Praxis übernimmt die RDNA-iGPU über Vulkan/ROCm derzeit den Großteil der Inferenz. Prüfen Sie die aktuelle Unterstützung in llama.cpp — der genaue Stand muss je nach Ihrem Treiber noch bestätigt werden.
F: Welche Lizenz für kommerziellen Einsatz?
Bevorzugen Sie Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) oder MIT (dots.llm1 Instruct) für größtmögliche Nutzungsfreiheit. Die Lizenzen von NVIDIA und Databricks enthalten besondere Bedingungen, die Sie vor jedem Deployment lesen sollten.
Fazit
Le bestes LLM für Ryzen AI 9 hängt vor allem von Ihrem vereinheitlichten Speicher ab: Auf einer Konfiguration mit 128 GB wie dem Ryzen AI Max 395 bieten MoE-Modelle mit wenigen aktiven Parametern wie Qwen 3.5 122B-A10B oder Qwen3.8 Flash Next 125B-A6B in Q4 das beste Verhältnis von Durchsatz zu Qualität, während Mistral Small 4 eine Option mit dichter Architektur und permissiver Lizenz bleibt. Prüfen Sie Ihren tatsächlichen Durchsatz, bevor Sie sich endgültig entscheiden. Dimensionieren Sie Ihren Rechner mit dem Konfigurator oder durchsuchen Sie den Katalog complet.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.