Bestes LLM für Ryzen AI 9

Wählen Sie den bestes LLM für Ryzen AI 9 ist keine Frage der reinen Rechenleistung, sondern der Abstimmung zwischen dem verfügbaren vereinheitlichten Speicher, der Modellarchitektur (dicht oder Mixture-of-Experts) und dem tatsächlichen Durchsatz der RDNA-iGPU und der XDNA-NPU. Auf diesen Plattformen übertrifft ein MoE-Modell mit wenigen aktiven Parametern häufig ein kleineres dichtes Modell. Dieser Artikel erläutert die VRAM-Spezifikationen je nach Quantisierung, die erwarteten Durchsätze, die Lizenzen, die Benchmark-Richtwerte und konkrete Anwendungsfälle, um einen stimmigen Arbeitsplatz für lokale Inferenz auf Ryzen AI 9 aufzubauen.

Das Speicherlimit des Ryzen AI 9 verstehen

Die Ryzen-AI-9-APUs (HX und Max) basieren auf vereinheitlichtem Speicher, den sich CPU, iGPU und NPU teilen. Die Speichermenge, die der GPU zugewiesen werden kann, bestimmt unmittelbar, welches Modell Sie laden können. Bei einer Ryzen-AI-Max-395-Konfiguration mit 128 GB vereinheitlichtem Speicher ist der für die Inferenz nutzbare Speicher deutlich größer als bei einem HX 370, der auf etwa 32 GB begrenzt ist.

Orientierungswerte für die Dimensionierung (Größenordnungen, die je nach Ihrer Speicherzuweisung im BIOS zu überprüfen sind):

Für das vollständige Vorgehen zur Zuweisung an NPU/iGPU lesen Sie den Leitfaden für Ryzen AI 9 HX und das Ryzen AI Max 395-Anleitung. Details zur Wahl der Quantisierung finden Sie in unserem Leitfaden Q4/Q5/Q8.

Warum MoE-Modelle mit geringer Aktivierung bevorzugt werden sollten

Bei einer iGPU mit moderater Speicherbandbreite ist die Anzahl der Parameter der begrenzende Faktor actifs pro Token, nicht insgesamt. Ein Mixture-of-Experts-Modell aktiviert nur einen Bruchteil seiner Gewichte pro Durchlauf.

Diese drei Modelle passen in Q4 nur in den Speicher einer Konfiguration mit viel gemeinsamem Speicher (etwa Ryzen AI Max 395, 128 GB). Auf einem HX 370 mit 32 GB lassen sie sich lokal nur mit sehr langsamem Offloading auf einen Datenträger betreiben.

Dichte, kompakte Modelle und Alternativen

Wenn Ihre Arbeitslast ein besser vorhersehbares dichtes Modell erfordert:

Bei gleicher VRAM-Kapazität beansprucht ein dichtes Modell pro Token mehr Bandbreite als ein MoE mit wenigen aktiven Parametern: Rechnen Sie auf einer iGPU mit einem geringeren Durchsatz. Die genauen Durchsatzwerte in Tokens pro Sekunde auf Ryzen AI hängen vom Backend und der Speicherzuweisung ab und müssen auf Ihrem Rechner noch bestätigt werden.

Lizenzen und Konformität

Für den professionellen Einsatz ist die Lizenz genauso wichtig wie der Durchsatz:

Bei europäischen regulatorischen Fragen lesen Sie unseren Leitfaden zur Einhaltung des AI Act.

Empfohlene Inferenz-Backends

Die Wahl der Inferenz-Engine beeinflusst den erzielten Durchsatz erheblich:

Führen Sie die Inferenz ausschließlich lokal aus: Der Zweck eines Rechners mit Ryzen AI 9 ist es, Ihre Daten auf dem Gerät zu behalten.

FAQ

F: Welches Modell passt in den Speicher eines Ryzen AI 9 HX 370 (32 GB)?

Mit etwa 32 GB vereinheitlichtem Speicher, von dem ein Teil für die GPU reserviert ist, passen die hier aufgeführten Modelle (68 GB+ in Q4) nicht in den Speicher. Der HX 370 ist eher für leichtere Modelle außerhalb dieser Auswahl gedacht. Konsultieren Sie den Katalog filtert nach VRAM und dem Konfigurator für eine Dimensionierung, die Ihrer tatsächlichen Speicherkapazität entspricht.

F: MoE oder ein dichtes Modell für eine AMD-iGPU?

Ein MoE mit wenigen aktiven Parametern wie Qwen3.8 Flash Next 125B-A6B (~6B aktive Parameter) beansprucht pro Token weniger Bandbreite als ein dichtes Modell mit 120B Parametern. Auf einer iGPU mit begrenzter Bandbreite bietet das MoE bei vergleichbarer Qualität in der Regel einen besseren interaktiven Durchsatz, allerdings bei einem größeren Gesamtspeicherbedarf.

F: Welche Quantisierung wählen?

Q4 maximiert die Anzahl der ladbaren Parameter und bleibt der übliche Kompromiss. Q5 verbessert die Wiedergabetreue leicht und benötigt dafür ~20 % mehr VRAM. Q8 verdoppelt den Speicherbedarf: Reservieren Sie es für Konfigurationen mit 128 GB. Details finden Sie im Leitfaden Q4/Q5/Q8.

Q: Beschleunigt die NPU die LLM-Inferenz?

Die XDNA-NPU ist vor allem auf bestimmte Arbeitslasten ausgelegt, und ihre Integration in Open-Source-LLM-Backends entwickelt sich weiter. In der Praxis übernimmt die RDNA-iGPU über Vulkan/ROCm derzeit den Großteil der Inferenz. Prüfen Sie die aktuelle Unterstützung in llama.cpp — der genaue Stand muss je nach Ihrem Treiber noch bestätigt werden.

F: Welche Lizenz für kommerziellen Einsatz?

Bevorzugen Sie Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) oder MIT (dots.llm1 Instruct) für größtmögliche Nutzungsfreiheit. Die Lizenzen von NVIDIA und Databricks enthalten besondere Bedingungen, die Sie vor jedem Deployment lesen sollten.

Fazit

Le bestes LLM für Ryzen AI 9 hängt vor allem von Ihrem vereinheitlichten Speicher ab: Auf einer Konfiguration mit 128 GB wie dem Ryzen AI Max 395 bieten MoE-Modelle mit wenigen aktiven Parametern wie Qwen 3.5 122B-A10B oder Qwen3.8 Flash Next 125B-A6B in Q4 das beste Verhältnis von Durchsatz zu Qualität, während Mistral Small 4 eine Option mit dichter Architektur und permissiver Lizenz bleibt. Prüfen Sie Ihren tatsächlichen Durchsatz, bevor Sie sich endgültig entscheiden. Dimensionieren Sie Ihren Rechner mit dem Konfigurator oder durchsuchen Sie den Katalog complet.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Amazon RTX 5070 Ti →

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.