Bestes LLM für AMD AI PC (Ryzen AI & NPU)

Un AMD AI PC bezeichnet einen Rechner mit einem Ryzen-AI-Prozessor, also einer APU, die Zen-5-Kerne, eine integrierte Radeon-GPU und eine XDNA-2-NPU vereint. Den besten LLM für einen AMD AI PC auszuwählen, bedeutet daher, eine konkrete Frage zu beantworten: Wie viel vereinheitlichten Speicher kann der Rechner dem Modell zur Verfügung stellen, und mit welcher Bandbreite wird auf diesen Speicher zugegriffen? Die Antwort fällt für einen Laptop mit Ryzen AI 9 HX und 32 GB anders aus als für eine Workstation mit Ryzen AI Max+ 395 und 128 GB. Dieser Artikel beschreibt die beiden Rechnerfamilien, die Modelle aus dem Katalog quelllm.fr, die tatsächlich in ihren Speicher passen, die Rolle der NPU, die kompatiblen Inferenzwerkzeuge und die Lizenzen und beantwortet anschließend die häufigsten Fragen.

Zwei AMD-AI-PC-Familien, zwei Speicherbudgets

Der Begriff AMD AI PC umfasst sehr unterschiedliche Geräte. Sie müssen vor der Diskussion über Modelle voneinander abgegrenzt werden.

Die Faustregel ist einfach. Das quantisierte Modell muss in den der GPU zugewiesenen Speicher passen, mit einer Reserve für den KV-Cache und das System. Auf einem Rechner mit 128 GB erreicht der im BIOS einstellbare GPU-Speicheranteil unter Windows häufig 96 GB, unter Linux über die GTT-Speicherzuweisung mehr (der genaue Wert muss je nach Mainboard und Kernel bestätigt werden).

Welche Modelle aus dem Katalog passen auf einen Ryzen AI Max+ 395 mit 128 GB

Mit etwa 96 GB Speicher, die der GPU zur Verfügung stehen, kann eine Ryzen-AI-Max+-395-Workstation mehrere Modelle mit 118 bis 142 Milliarden Parametern in Q4-Quantisierung aufnehmen. Hier sind die Modelle aus dem Katalog von quelllm.fr mit dem erfassten Q4-Speicherbedarf und Schätzungen für die anderen Quantisierungen (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, geschätzt).

Darüber hinaus, Step 3.5 Flash (Q4 ~118 GB) und MiniMax-M2.7 (Q4 ~138 GB) benötigen mehr Speicher, als ein AMD AI PC mit 128 GB bietet, selbst unter Linux. Ohne aggressivere Quantisierung sind sie auf dieser Plattform keine realistischen Optionen (Q2 oder Q3, Qualität noch zu bestätigen).

Erwarteter Durchsatz: Die Bandbreite entscheidet, nicht die Anzahl der Kerne

Bei einem Chip mit Unified Memory wird die Tokengenerierung durch die Speicherbandbreite begrenzt. Für jedes Token muss die GPU sämtliche aktiven Parameter erneut lesen. Die Abschätzung der Größenordnung lautet daher: maximaler Durchsatz ≈ Speicherbandbreite ÷ pro Token gelesene Bytes.

Die Verarbeitung des Prompts (Prefill) hängt dagegen von der reinen Rechenleistung und nicht von der Bandbreite ab. Ein Kontext von 30.000 Tokens kann auf einer Radeon 8060S mehrere Dutzend Sekunden beanspruchen. Berücksichtigen Sie das bei RAG-Anwendungen oder der Analyse langer Dokumente.

Und die NPU XDNA 2? Nützlich, aber nicht für große Modelle

Die in Ryzen-AI-Prozessoren integrierte NPU wird mit etwa 50 TOPS bei INT8 angegeben. Es muss präzise beschrieben werden, was sie tatsächlich für ein lokales LLM leistet.

Bei den oben aufgeführten Modellen mit 118 Milliarden Parametern und mehr spielt die NPU keine Rolle. Die Radeon-GPU und der vereinheitlichte Speicher übernehmen die gesamte Arbeit. Unser Artikel Was ist ein NPU vertieft diesen Punkt.

Mit Ryzen AI kompatible Inferenztools

Es gibt drei Möglichkeiten, ein Modell aus dem Katalog auf einem AMD AI PC auszuführen.

Stellen Sie in jedem Fall den GPU-Speicher im BIOS auf den Maximalwert ein (die Option heißt häufig „UMA frame buffer“ oder „variable graphics memory“). Überprüfen Sie anschließend mit der Laufzeitumgebung, dass das Modell vollständig auf der GPU und nicht teilweise auf der CPU geladen ist.

Lizenzen und Benchmarks: Was vor der Auswahl zu überprüfen ist

Die Lizenz bestimmt die Bedingungen für den beruflichen Einsatz. Die genannten Modelle lassen sich wie folgt einordnen.

Für Benchmarks hat quelllm.fr diese Modelle nicht auf Ryzen AI vermessen. Die von den Anbietern veröffentlichten Ergebnisse (MMLU für Allgemeinwissen, HumanEval und SWE-bench für Code, AIME für mathematisches Schlussfolgern) müssen anhand der Modellseiten und auf demOpen LLM Leaderboard. Ein Benchmark-Ergebnis ersetzt keinen Test mit Ihren eigenen französischsprachigen Dokumenten. Unser Leitfaden Leaderboards verstehen erklärt die Fallstricke bei der Interpretation.

FAQ

F: Welches LLM sollte man für einen AMD-AI-PC mit 32 GB RAM wählen?

Keines der Modelle mit 118 Milliarden Parametern oder mehr aus dieser Auswahl passt in 32 GB. Wählen Sie auf einem Laptop mit Ryzen AI 9 HX Modelle mit 7 bis 14 Milliarden Parametern in Q4, die 5 bis 10 GB belegen. Unser Konfigurationsanleitung für 32 GB und die Seite bestes LLM mit 8 GB VRAM listen geeignete Kandidaten auf.

F: Ist der Ryzen AI Max+ 395 mit 128 GB besser als eine dedizierte Grafikkarte?

Das hängt vom angestrebten Modell ab. Eine RX 9070 XT mit 16 GB bietet eine deutlich höhere Bandbreite und ist bei einem Modell mit 30 Milliarden Parametern schneller. Sie wird jedoch niemals ein Modell mit 120 Milliarden Parametern in Q4 laden können. Beim Ryzen AI Max+ 395 hat die Kapazität Vorrang vor dem Durchsatz. Siehe unsere Seite bestes LLM für RX 9070 XT zum Vergleich.

F: Kann die NPU verwendet werden, um Ollama oder llama.cpp zu beschleunigen?

Nein, bislang nicht. Diese beiden Runtimes nutzen die Radeon-GPU über Vulkan oder ROCm. Die XDNA-2-NPU wird nur für ONNX-Modelle mit etwa 1 bis 8 Milliarden Parametern genutzt, die über den Ryzen-AI-Softwarestack ausgeführt werden. Verlassen Sie sich bei großen Modellen ausschließlich auf die GPU und den gemeinsam genutzten Arbeitsspeicher.

Q: Sollte man für die lokale Inferenz auf einem AMD AI PC Windows oder Linux verwenden?

Beide funktionieren. Windows bietet Vulkan über llama.cpp ohne besondere Konfiguration. Linux bietet zusätzlich ROCm und ermöglicht es, der GPU über die BIOS-Grenze hinaus mehr Speicher zuzuweisen, was bei einem Rechner mit 128 GB wichtig ist. Um Mixtral 8x22B oder dots.llm1 mit einem Speicherbedarf von mehr als 80 GB zu laden, ist Linux der sicherste Weg.

F: Welche Quantisierung sollte man auf einem Ryzen AI Max+ 395 wählen?

Q4_K_M ist ein guter Kompromiss für Modelle mit 118 bis 128 Milliarden Parametern, bei etwa 72 GB. Q5 bleibt für kleinere Modelle wie Laguna S 2.1 möglich, mit einem geschätzten Bedarf von etwa 82 GB. Q8 überschreitet bei allen Modellen dieser Auswahl den verfügbaren Speicher. Halten Sie mindestens 10 GB für den KV-Cache frei, wenn Sie lange Kontexte verwenden.

F: Sind diese Modelle gut im Französischen?

Mistral Small 4 und Mistral Medium 3.5 werden von einem französischen Anbieter trainiert und liefern gute Ergebnisse auf Französisch. Qwen 3.5 122B-A10B ist mehrsprachig und unterstützt Französisch ordentlich. Die genauen Bewertungen pro Sprache müssen anhand der Modellsteckbriefe noch bestätigt werden. Unsere Seite Bestes LLM für Französisch vergleicht mehrere Modelle anhand dieses Kriteriums.

Fazit

Das beste LLM für einen AMD-AI-PC hängt zunächst vom verfügbaren Arbeitsspeicher ab. Auf einem Ryzen AI Max+ 395 mit 128 GB passen Qwen 3.5 122B-A10B, Mistral Small 4 und Nemotron 3 Super 120B in Q4 in den Speicher; bei MoE-Architekturen reicht der Durchsatz für eine interaktive Nutzung. Auf einem Ryzen AI 9 HX mit 32 GB sollten Sie deutlich kleinere Modelle wählen. Die NPU bleibt eine Ergänzung für kleine Aufgaben. Um die Auswahl auf Ihren konkreten Rechner abzustimmen, verwenden Sie den Konfigurator oder durchsuchen Sie den Katalog filtert nach VRAM.

Das Hardware-Setup für die lokale Ausführung eines LLM

Um diese Modelle komfortabel lokal auszuführen, benötigt man RTX 5070 Ti bietet ein hervorragendes Preis-Leistungs-Verhältnis. Vergleichen Sie die Preise:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.