Bestes LLM für AMD AI PC (Ryzen AI & NPU)
Un AMD AI PC bezeichnet einen Rechner mit einem Ryzen-AI-Prozessor, also einer APU, die Zen-5-Kerne, eine integrierte Radeon-GPU und eine XDNA-2-NPU vereint. Den besten LLM für einen AMD AI PC auszuwählen, bedeutet daher, eine konkrete Frage zu beantworten: Wie viel vereinheitlichten Speicher kann der Rechner dem Modell zur Verfügung stellen, und mit welcher Bandbreite wird auf diesen Speicher zugegriffen? Die Antwort fällt für einen Laptop mit Ryzen AI 9 HX und 32 GB anders aus als für eine Workstation mit Ryzen AI Max+ 395 und 128 GB. Dieser Artikel beschreibt die beiden Rechnerfamilien, die Modelle aus dem Katalog quelllm.fr, die tatsächlich in ihren Speicher passen, die Rolle der NPU, die kompatiblen Inferenzwerkzeuge und die Lizenzen und beantwortet anschließend die häufigsten Fragen.
Zwei AMD-AI-PC-Familien, zwei Speicherbudgets
Der Begriff AMD AI PC umfasst sehr unterschiedliche Geräte. Sie müssen vor der Diskussion über Modelle voneinander abgegrenzt werden.
- Ryzen AI 300 (HX 370, HX 375, 9 365) : Radeon-890M-GPU, LPDDR5X-Speicher mit 128-Bit-Bus, Bandbreite von etwa 120 GB/s (geschätzt). Handelsübliche Laptops verfügen über 16, 32 oder manchmal 64 GB Speicher, den sich System und GPU teilen. Unser Leitfaden für Ryzen AI 9 HX erläutert diese Konfiguration.
- Ryzen AI Max (385, 390, Max+ 395, Codename Strix Halo) : Radeon-8060S-GPU mit 40 Recheneinheiten beim Max+ 395, 256-Bit-Speicherbus, Bandbreite von etwa 256 GB/s (geschätzt). Die Mini-PCs und Workstations werden mit 64 oder 128 GB verlötetem LPDDR5X-Speicher verkauft. Der Leitfaden zum Ryzen AI Max+ 395 behandelt die BIOS- und Linux-Einstellungen.
Die Faustregel ist einfach. Das quantisierte Modell muss in den der GPU zugewiesenen Speicher passen, mit einer Reserve für den KV-Cache und das System. Auf einem Rechner mit 128 GB erreicht der im BIOS einstellbare GPU-Speicheranteil unter Windows häufig 96 GB, unter Linux über die GTT-Speicherzuweisung mehr (der genaue Wert muss je nach Mainboard und Kernel bestätigt werden).
Welche Modelle aus dem Katalog passen auf einen Ryzen AI Max+ 395 mit 128 GB
Mit etwa 96 GB Speicher, die der GPU zur Verfügung stehen, kann eine Ryzen-AI-Max+-395-Workstation mehrere Modelle mit 118 bis 142 Milliarden Parametern in Q4-Quantisierung aufnehmen. Hier sind die Modelle aus dem Katalog von quelllm.fr mit dem erfassten Q4-Speicherbedarf und Schätzungen für die anderen Quantisierungen (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, geschätzt).
- Qwen 3.5 122B-A10B (Alibaba, Apache 2.0): Q4 ~73 GB, Q5 ~88 GB (geschätzt), Q8 ~139 GB (passt nicht in den Speicher), Kontextfenster von 262.000 Tokens. MoE-Architektur mit etwa 10 Milliarden aktiven Parametern pro Token, was das Modell zum schnellsten Kandidaten dieser Liste macht. Die Modellgewichte veröffentlicht Alibaba auf Hugging Face.
- Qwen3.8 Flash Next 125B-A6B (Qwen, spezielle Open-Weights-Lizenz): Q4 ~72 GB, Kontext 256.000 Tokens. Nur 6 Milliarden aktive Parameter, daher ein noch höherer Durchsatz als beim vorherigen Modell (geschätzt), allerdings mit einer Lizenz, die vor einer kommerziellen Nutzung sorgfältig gelesen werden muss.
- Mistral Small 4 (Mistral AI, Apache 2.0): Q4 ~72 GB, Kontext 256.000 Tokens. Gute Leistung im Französischen, veröffentlicht von Mistral AI auf Hugging Face.
- Mistral Medium 3.5 128B (Mistral AI, Modified MIT): Q4 ~74 GB, Kontext 256.000 Tokens. Hinsichtlich der Qualität oberhalb von Small 4 positioniert; die Scores sind auf den Modellseiten zu überprüfen.
- Nemotron 3 Super 120B (NVIDIA, NVIDIA Open Model License): Q4 ~72 GB, Kontextfenster von 128.000 Tokens. Auf logisches Schlussfolgern und Agenten ausgerichtet. Modellgewichte verfügbar bei NVIDIA auf Hugging Face.
- Laguna S 2.1 (Poolside, OpenMDW 1.1): Q4 ~68 GB, Kontext 262.144 Tokens. Das leichteste Modell der Auswahl, auf Code spezialisiert, veröffentlicht von Poolside auf Hugging Face.
- Mixtral 8x22B Instruct (Mistral AI, Apache 2.0): Q4 ~82 GB, Kontext 64 000 Tokens. Passt noch in 96 GB, lässt aber wenig Platz für den KV-Cache. Ein älteres Modell, vor allem als Referenz nützlich.
- dots.llm1 Instruct (Rednote, MIT): Q4 ~85 GB, Kontext 32.768 Tokens. Oberes Limit bei einer Speicherzuweisung von 96 GB, kurzer Kontext.
Darüber hinaus, Step 3.5 Flash (Q4 ~118 GB) und MiniMax-M2.7 (Q4 ~138 GB) benötigen mehr Speicher, als ein AMD AI PC mit 128 GB bietet, selbst unter Linux. Ohne aggressivere Quantisierung sind sie auf dieser Plattform keine realistischen Optionen (Q2 oder Q3, Qualität noch zu bestätigen).
Erwarteter Durchsatz: Die Bandbreite entscheidet, nicht die Anzahl der Kerne
Bei einem Chip mit Unified Memory wird die Tokengenerierung durch die Speicherbandbreite begrenzt. Für jedes Token muss die GPU sämtliche aktiven Parameter erneut lesen. Die Abschätzung der Größenordnung lautet daher: maximaler Durchsatz ≈ Speicherbandbreite ÷ pro Token gelesene Bytes.
- MoE-Modell mit 10 Milliarden aktiven Parametern in Q4 (wie bei Qwen 3.5 122B-A10B): Pro Token werden etwa 5 bis 6 GB gelesen. Bei den 256 GB/s des Ryzen AI Max+ 395 ergibt sich eine theoretische Obergrenze von 40 bis 50 Tokens/s und ein tatsächlicher Durchsatz von 20 bis 35 Tokens/s, wenn der KV-Cache und der Runtime-Overhead berücksichtigt werden (geschätzt, von quelllm.fr auf diesem Rechner nicht gemessen).
- MoE-Modell mit 6 Milliarden aktiven Parametern (Qwen3.8 Flash Next): geschätzter tatsächlicher Durchsatz von 30 bis 50 Tokens/s, noch zu bestätigen.
- Dichtes Modell mit 70 bis 120 Milliarden Parametern in Q4 : Pro Token werden 40 bis 70 GB gelesen, das entspricht 3 bis 6 Tokens/s. Das lässt sich mitlesen, ist aber für die interaktive Nutzung langsam. Prüfen Sie daher vor dem Herunterladen die Modellarchitektur auf der Modellseite: Die Angabe „A10B“ oder „A6B“ weist auf ein MoE hin.
- Ryzen AI 9 HX 370 : Bei etwa 120 GB/s passen dieselben MoE-Modelle mit 120 Milliarden Parametern nicht in den Speicher. Das Problem ist nicht die Bandbreite, sondern die Kapazität.
Die Verarbeitung des Prompts (Prefill) hängt dagegen von der reinen Rechenleistung und nicht von der Bandbreite ab. Ein Kontext von 30.000 Tokens kann auf einer Radeon 8060S mehrere Dutzend Sekunden beanspruchen. Berücksichtigen Sie das bei RAG-Anwendungen oder der Analyse langer Dokumente.
Und die NPU XDNA 2? Nützlich, aber nicht für große Modelle
Die in Ryzen-AI-Prozessoren integrierte NPU wird mit etwa 50 TOPS bei INT8 angegeben. Es muss präzise beschrieben werden, was sie tatsächlich für ein lokales LLM leistet.
- Was es tut : im ONNX-Format kompilierte Modelle über AMDs Ryzen-AI-Softwarestack ausführen, für die Generierung im Hybridmodus NPU + GPU. Die derzeit unterstützten Modelle sind klein und haben 1 bis 8 Milliarden Parameter (je nach Version des Softwarestacks zu bestätigen).
- Was es nicht tut : Beschleunigung eines im GGUF geladenen Modells llama.cpp oder Ollama. Diese Runtimes nutzen die Radeon-GPU über Vulkan oder ROCm und ignorieren die NPU.
- Sein Vorteil : GPU und Akku bei Hintergrundaufgaben entlasten (Transkription, kleiner dauerhaft laufender Assistent, Embeddings), während die GPU ein größeres Modell ausführt.
Bei den oben aufgeführten Modellen mit 118 Milliarden Parametern und mehr spielt die NPU keine Rolle. Die Radeon-GPU und der vereinheitlichte Speicher übernehmen die gesamte Arbeit. Unser Artikel Was ist ein NPU vertieft diesen Punkt.
Mit Ryzen AI kompatible Inferenztools
Es gibt drei Möglichkeiten, ein Modell aus dem Katalog auf einem AMD AI PC auszuführen.
- llama.cpp mit Vulkan-Backend : der robusteste Ansatz sowohl unter Windows als auch unter Linux. Das Vulkan-Backend funktioniert auf allen integrierten Radeon-GPUs ohne ROCm-Installation. Die Leistungsgewinne durch das Quantisierungsformat (Q4_K_M, Q5_K_M, Q8_0) sind mit denen vergleichbar, die auf dedizierten GPUs beobachtet werden.
- Ollama mit ROCm : Unter Linux nutzt ROCm die Radeon 8060S nativ. Für die Konfiguration sind einige Umgebungsvariablen erforderlich. Diese beschreibt unser Leitfaden Ollama auf einer AMD-GPU mit ROCm. Unter Windows basiert Ollama auf Vulkan (Unterstützung je nach Version zu bestätigen).
- vLLM : unter Linux mit ROCm möglich, aber auf Mehrbenutzerserver ausgerichtet. Für einen einzelnen Rechner bleibt llama.cpp einfacher. Die vLLM-Dokumentation listet die unterstützten AMD-GPUs auf.
Stellen Sie in jedem Fall den GPU-Speicher im BIOS auf den Maximalwert ein (die Option heißt häufig „UMA frame buffer“ oder „variable graphics memory“). Überprüfen Sie anschließend mit der Laufzeitumgebung, dass das Modell vollständig auf der GPU und nicht teilweise auf der CPU geladen ist.
Lizenzen und Benchmarks: Was vor der Auswahl zu überprüfen ist
Die Lizenz bestimmt die Bedingungen für den beruflichen Einsatz. Die genannten Modelle lassen sich wie folgt einordnen.
- Apache 2.0 : Qwen 3.5 122B-A10B, Mistral Small 4, Mixtral 8x22B. Freie kommerzielle Nutzung, Änderungen und Weiterverbreitung sind erlaubt.
- MIT oder modifizierte MIT : dots.llm1 (MIT), Mistral Medium 3.5 (Modified MIT). Die hinzugefügten Klauseln der modifizierten Version lesen.
- Anbieterlizenzen : Nemotron 3 Super 120B (NVIDIA Open Model License), Laguna S 2.1 (OpenMDW 1.1), Qwen3.8 Flash Next (spezifische Open-Weights-Lizenz). Diese Lizenztexte erlauben in der Regel die kommerzielle Nutzung, enthalten jedoch zusätzliche Bedingungen zur Namensnennung oder Nutzung. Unser Leitfaden zur Konformität mit dem AI Act für Modelle mit offenen Gewichten hilft dabei, diese Wahl zu dokumentieren.
Für Benchmarks hat quelllm.fr diese Modelle nicht auf Ryzen AI vermessen. Die von den Anbietern veröffentlichten Ergebnisse (MMLU für Allgemeinwissen, HumanEval und SWE-bench für Code, AIME für mathematisches Schlussfolgern) müssen anhand der Modellseiten und auf demOpen LLM Leaderboard. Ein Benchmark-Ergebnis ersetzt keinen Test mit Ihren eigenen französischsprachigen Dokumenten. Unser Leitfaden Leaderboards verstehen erklärt die Fallstricke bei der Interpretation.
FAQ
F: Welches LLM sollte man für einen AMD-AI-PC mit 32 GB RAM wählen?
Keines der Modelle mit 118 Milliarden Parametern oder mehr aus dieser Auswahl passt in 32 GB. Wählen Sie auf einem Laptop mit Ryzen AI 9 HX Modelle mit 7 bis 14 Milliarden Parametern in Q4, die 5 bis 10 GB belegen. Unser Konfigurationsanleitung für 32 GB und die Seite bestes LLM mit 8 GB VRAM listen geeignete Kandidaten auf.
F: Ist der Ryzen AI Max+ 395 mit 128 GB besser als eine dedizierte Grafikkarte?
Das hängt vom angestrebten Modell ab. Eine RX 9070 XT mit 16 GB bietet eine deutlich höhere Bandbreite und ist bei einem Modell mit 30 Milliarden Parametern schneller. Sie wird jedoch niemals ein Modell mit 120 Milliarden Parametern in Q4 laden können. Beim Ryzen AI Max+ 395 hat die Kapazität Vorrang vor dem Durchsatz. Siehe unsere Seite bestes LLM für RX 9070 XT zum Vergleich.
F: Kann die NPU verwendet werden, um Ollama oder llama.cpp zu beschleunigen?
Nein, bislang nicht. Diese beiden Runtimes nutzen die Radeon-GPU über Vulkan oder ROCm. Die XDNA-2-NPU wird nur für ONNX-Modelle mit etwa 1 bis 8 Milliarden Parametern genutzt, die über den Ryzen-AI-Softwarestack ausgeführt werden. Verlassen Sie sich bei großen Modellen ausschließlich auf die GPU und den gemeinsam genutzten Arbeitsspeicher.
Q: Sollte man für die lokale Inferenz auf einem AMD AI PC Windows oder Linux verwenden?
Beide funktionieren. Windows bietet Vulkan über llama.cpp ohne besondere Konfiguration. Linux bietet zusätzlich ROCm und ermöglicht es, der GPU über die BIOS-Grenze hinaus mehr Speicher zuzuweisen, was bei einem Rechner mit 128 GB wichtig ist. Um Mixtral 8x22B oder dots.llm1 mit einem Speicherbedarf von mehr als 80 GB zu laden, ist Linux der sicherste Weg.
F: Welche Quantisierung sollte man auf einem Ryzen AI Max+ 395 wählen?
Q4_K_M ist ein guter Kompromiss für Modelle mit 118 bis 128 Milliarden Parametern, bei etwa 72 GB. Q5 bleibt für kleinere Modelle wie Laguna S 2.1 möglich, mit einem geschätzten Bedarf von etwa 82 GB. Q8 überschreitet bei allen Modellen dieser Auswahl den verfügbaren Speicher. Halten Sie mindestens 10 GB für den KV-Cache frei, wenn Sie lange Kontexte verwenden.
F: Sind diese Modelle gut im Französischen?
Mistral Small 4 und Mistral Medium 3.5 werden von einem französischen Anbieter trainiert und liefern gute Ergebnisse auf Französisch. Qwen 3.5 122B-A10B ist mehrsprachig und unterstützt Französisch ordentlich. Die genauen Bewertungen pro Sprache müssen anhand der Modellsteckbriefe noch bestätigt werden. Unsere Seite Bestes LLM für Französisch vergleicht mehrere Modelle anhand dieses Kriteriums.
Fazit
Das beste LLM für einen AMD-AI-PC hängt zunächst vom verfügbaren Arbeitsspeicher ab. Auf einem Ryzen AI Max+ 395 mit 128 GB passen Qwen 3.5 122B-A10B, Mistral Small 4 und Nemotron 3 Super 120B in Q4 in den Speicher; bei MoE-Architekturen reicht der Durchsatz für eine interaktive Nutzung. Auf einem Ryzen AI 9 HX mit 32 GB sollten Sie deutlich kleinere Modelle wählen. Die NPU bleibt eine Ergänzung für kleine Aufgaben. Um die Auswahl auf Ihren konkreten Rechner abzustimmen, verwenden Sie den Konfigurator oder durchsuchen Sie den Katalog filtert nach VRAM.
Das Hardware-Setup für die lokale Ausführung eines LLM
Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.