NPU: Was ist das, und ist es nützlich für einen lokalen LLM? ?
Eine NPU (Neural Processing Unit) ist ein stromsparender Prozessor, der in den Chip der meisten seit 2024 verkauften Laptops integriert ist und für kleine, kontinuierlich laufende KI-Aufgaben vorgesehen ist: Hintergrundunschärfe, Live-Untertitel und Fotosuche. Ihre prominenteste Kennzahl, die TOPS, sagt fast nichts darüber aus, wie gut sie ein lokales LLM ausführen kann: Die Generierungsgeschwindigkeit hängt von der Speicherbandbreite ab, und die NPU nutzt denselben langsamen Arbeitsspeicher wie der Prozessor.
Eine NPU, kurz für Neural Processing Unit, ist ein auf Berechnungen für neuronale Netze spezialisierter Prozessor, der in den Chip der meisten seit 2024 verkauften Laptops integriert ist. Sie führt kontinuierlich kleine KI-Aufgaben wie das Weichzeichnen des Hintergrunds oder die Erstellung von Live-Untertiteln aus und benötigt dafür nur wenige Watt. Ihre prominenteste Kennzahl, die TOPS, dient auf sämtlichen Etiketten von „KI-PCs“ als Verkaufsargument. Mit Stand vom 20. September 2026 sagt diese Kennzahl jedoch fast nichts darüber aus, ob ein Rechner ein LLM lokal ausführen kann. Hier erfahren Sie, warum das so ist und worauf Sie stattdessen achten sollten.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Was ist eine NPU?
Ein neuronales Netzwerk lässt sich rechnerisch auf riesige Serien von Matrixmultiplikationen mit Zahlen niedriger Präzision reduzieren, die milliardenfach wiederholt werden. Ein klassischer Prozessor kann das langsam ausführen, jeweils nur eine Handvoll Operationen. Eine Grafikkarte schafft es schnell und parallel mit Tausenden Recheneinheiten, bei einem Verbrauch von Dutzenden bis Hunderten von Watt. Eine NPU ist ein Siliziumbereich, der ausschließlich dafür ausgelegt ist: fest verdrahtete Recheneinheiten für 8- und 4-Bit-Ganzzahlen, kleine Speicher direkt daneben, um teure Datentransfers zu vermeiden, und ein Scheduler, der die Daten möglichst wenig bewegt. Das Ergebnis dieser extremen Spezialisierung: eine im Vergleich zu einer GPU moderate Spitzenleistung, aber eine deutlich höhere Effizienz pro Watt, was im Akkubetrieb besonders zählt.
Die Idee ist älter als die Marketingbezeichnung, die sie heute begleitet. Apple integriert seit 2017 eine Neural Engine in seine iPhones und seit ihrer Einführung in alle Macs mit Apple Silicon; Googles Pixel-Chips enthalten seit mehreren Generationen einen TPU-Block. Was sich 2024 tatsächlich geändert hat: Intel, AMD und Qualcomm haben alle gleichzeitig eine leistungsfähige NPU in ihre Prozessoren für Notebooks im Endkundenmarkt integriert, und Microsoft hat daraufhin eine ganze Reihe von Windows-Funktionen unter der Markenbezeichnung Copilot+ PC an das Vorhandensein einer solchen NPU geknüpft. Dieses Zusammentreffen erklärt stärker als die Technologie selbst, warum seit zwei Jahren die Regale mit „KI-PC“-Etiketten überschwemmt werden.
#CPU, GPU, NPU: Unterschiede
| CPU | GPU | NPU | |
|---|---|---|---|
| Entwickelt für | Die allgemeine Logik, die geringe Latenz | Massiv paralleles Rechnen, Grafik | Ausschließlich die Inferenz neuronaler Netze |
| Stromverbrauch unter KI-Last | 15 à 125 W | 30 W (integriert) bis 575 W (RTX 5090) | 1 à 10 W |
| Genutzter Speicher | Der Systemspeicher | Eigener VRAM oder bei integrierter GPU der Arbeitsspeicher | Der Systemspeicher |
| Software-Unterstützung | Universell | Sehr breit: CUDA, ROCm, Metal, Vulkan | Eng, spezifisch für jeden Hersteller |
| Einsatzgebiet | Orchestrierung, kleine Modelle als Notlösung | LLMs, Bildgenerierung, Training | Leichtgewichtige, dauerhaft laufende KI im Akkubetrieb |
Die drei Chips ergänzen einander, statt miteinander zu konkurrieren: Jeder bietet einen anderen Kompromiss zwischen Geschwindigkeit, Stromverbrauch und Vielseitigkeit. Auf einem „KI-PC“ übernimmt die NPU während einer vierstündigen Videokonferenz die Webcam-Effekte, während die GPU inaktiv bleibt. Dadurch bleibt ein erheblicher Teil der Akkulaufzeit erhalten, der bei einem kontinuierlichen GPU-Einsatz verloren gegangen wäre. Lassen Sie auf derselben Maschine einen Assistenten mit 14 Milliarden Parametern laufen, übernimmt die GPU die gesamte Arbeit, weil dort sowohl die nötige Speicherbandbreite als auch ausgereifte Softwareunterstützung vorhanden sind: Keine Laufzeitumgebung für Endanwender kann derzeit ein LLM dieser Größe auf einer NPU ausführen.
#Die TOPS: Was sie messen, was sie verbergen
TOPS bedeutet „eine Billion Operationen pro Sekunde“ (Tera Operations Per Second). Die Operationen werden fast immer mit 8-Bit-Ganzzahlen gemessen, damit die Angaben verschiedener Datenblätter vergleichbar bleiben. Es handelt sich um eine Spitzenrechenleistung, die im Labor unter günstigen Bedingungen gemessen wird. Sie sagt nichts darüber aus, wie schnell die Daten aus dem Speicher zu diesen Recheneinheiten gelangen. Genau das begrenzt ein Sprachmodell in der Praxis: Eine NPU, der es an Daten fehlt, verbringt die meiste Zeit mit Warten, ob die TOPS nun hoch sind oder nicht.
| Chipfamilie | Angekündigte NPU-Leistung | Copilot+-Eignung (40 TOPS und mehr) |
|---|---|---|
| Intel Core Ultra Serie 1 (Meteor Lake) | ≈ 11 TOPS | Nein |
| Apple M4 (Neural Engine) | 38 TOPS | Nicht zutreffend (macOS) |
| Qualcomm Snapdragon X Elite und X Plus | 45 TOPS | Ja |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | Ja |
| AMD Ryzen AI 300 | 50 TOPS | Ja |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | Ja |
| Intel Core Ultra 300 (Panther Lake, CES Januar 2026) | Bis zu 50 TOPS (NPU 5) | Ja |
| AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES Januar 2026) | Bis zu 60 TOPS | Ja |
| Qualcomm Snapdragon X2 Elite (CES Januar 2026) | 80 TOPS | Ja |
Diese neue Generation, die im Januar 2026 auf der CES vorgestellt wurde und zum Stand vom 28. September 2026 bereits in erhältlichen Laptops verbaut ist, hebt den angegebenen Wert deutlich über die Mindestschwelle für Copilot+: Der Snapdragon X2 Elite erreicht mit 80 TOPS gegenüber zuvor 45 fast das Doppelte seines Vorgängers. All das ändert nichts an der Schlussfolgerung dieser Seite: Das folgende Argument zur gemeinsam genutzten Speicherbandbreite gilt gleichermaßen für diese neuen Chips, so beeindruckend ihre TOPS-Angabe auf dem Etikett auch erscheinen mag.
#Warum eine NPU Ihre LLMs nicht beschleunigt
Um ein einziges Token zu erzeugen, muss ein Modell den Großteil seiner im Speicher liegenden Gewichte erneut lesen, vom ersten bis zum letzten aktiven Parameter. Ein Modell mit 14 Milliarden Parametern in Q4 benötigt etwa 9 GB: 20 Tokens pro Sekunde zu erzeugen bedeutet daher, 180 GB pro Sekunde zwischen dem Speicher und den Recheneinheiten zu übertragen. Die eigentliche arithmetische Berechnung, also die Multiplikation selbst, ist im Vergleich zu diesem ständigen Datentransfer wenig aufwendig. Die Generierungsgeschwindigkeit richtet sich daher nach der verfügbaren Speicherbandbreite, nicht nach der im Produktdatenblatt angegebenen Rechenleistung in TOPS oder TFLOPS. Das erklärt, warum zwei Chips mit sehr unterschiedlichen TOPS-Werten Text mit genau derselben Geschwindigkeit erzeugen können.
| Wo befindet sich das Modell? | Bandbreite | Obergrenze für ein 9-GB-Modell |
|---|---|---|
| LPDDR5X-Speicher im Laptop (gemeinsam von NPU und integrierter GPU genutzt) | ≈ 70 bis 135 GB/s | ≈ 8 bis 15 Tok/s |
| Einheitlicher Speicher des Ryzen AI Max+ 395 | 256 GB/s | ≈ 28 Tok/s |
| RTX 4070 (GDDR6X) | 504 GB/s | ≈ 56 Tok/s |
| RTX 5070 Ti (GDDR7) | 896 GB/s | ≈ 100 tok/s |
| RTX 5090 (GDDR7) | 1 792 GB/s | ≈ 200 Tok/s |
Eine NPU mit 50 TOPS steht ebenso wie eine NPU mit 80 TOPS auf den allerneuesten Chips in der ersten Zeile der Tabelle. Sie greift auf denselben LPDDR5X-Speicher zu, den sie mit dem Prozessor teilt: Unabhängig von der angegebenen TOPS-Zahl kann sie physikalisch nicht schneller arbeiten, als dieser Speicher es erlaubt. Ein Laptop mit 45 TOPS und ein Laptop mit 80 TOPS werden daher Text mit exakt derselben Geschwindigkeit erzeugen, wenn ihr Speicher hinsichtlich Kapazität und Datendurchsatz identisch bleibt.
Eine NPU kann tatsächlich bei der Verarbeitung des Prompts helfen. Diese Phase benötigt vor allem Rechenleistung statt Speicherbandbreite, da das Modell den gesamten bereits vorhandenen Text auf einmal verarbeitet, statt ihn Wort für Wort zu erzeugen. Hybride Konfigurationen, die diese Verarbeitung der NPU und die Generierung der integrierten GPU überlassen, verkürzen bei kleinen, gut unterstützten Modellen die Wartezeit bis zum ersten angezeigten Wort und senken den gesamten Energieverbrauch. Das verbessert die Akkulaufzeit und die wahrgenommene Reaktionsgeschwindigkeit, messbar an der Latenz. Es ermöglicht jedoch weder den Betrieb größerer Modelle noch eine schnellere fortlaufende Textgenerierung.
#Das eigentliche Hindernis: die Software
- Ollama, llama.cpp, LM Studio
- Sie laufen auf der GPU oder der CPU. Auf einem Copilot+-Laptop nutzen sie die integrierte GPU oder den Prozessor und ignorieren die NPU.
- Windows
- Die eingebetteten Modelle von Microsoft und die Microsoft-Umgebung Foundry Local zielen über ONNX Runtime auf die NPU ab, mit einer Auswahl kleiner Modelle.
- AMD
- Ryzen AI Software und der Lemonade-Server führen bestimmte ONNX-Modelle im hybriden Modus (NPU und integrierte GPU) aus.
- Intel
- OpenVINO kann unterstützte Modelle auf der NPU ausführen.
- Qualcomm
- Die QNN-Toolchain und AI Hub stellen bereits für die Hexagon-NPU konvertierte Modelle bereit.
- Apple
- Core ML nutzt die Neural Engine, aber die auf dem Mac tatsächlich verwendeten LLM-Tools (MLX, llama.cpp, Ollama) nutzen die GPU über Metal.
Allen diesen Tools ist eines gemeinsam: Wer die NPU nutzt, wählt aus einer kurzen Liste von Modellen, die der Hersteller bereits konvertiert und validiert hat, in der Regel mit 1 bis 8 Milliarden Parametern. Man kann also nicht einfach eine beliebige GGUF-Datei von Hugging Face herunterladen und direkt ausführen. Diese Konvertierung erfordert für jeden Hersteller ein anderes Format und eine andere Werkzeugkette. Das erklärt, warum bislang kein Community-Projekt die NPU-Unterstützung vereinheitlicht hat, wie llama.cpp es für GPUs getan hat.
- Ryzen AI 9 HX: Was die NPU mit einem lokalen LLM wirklich leistet
- Snapdragon X Elite: Lokales LLM auf einem ARM-PC
#Worauf Sie stattdessen vor dem Kauf achten sollten
- 01Der Speicher, den die GPU nutzen kannDer VRAM einer dedizierten Grafikkarte oder der vereinheitlichte Speicher eines Macs oder einer Strix-Halo-Maschine. Dieser Speicher entscheidet, welche Modelle sich laden lassen.
- 02Die Bandbreite dieses SpeichersSie bestimmt direkt die Anzahl der pro Sekunde generierten Tokens.
- 03Der Weg über die SoftwareNVIDIA völlig problemlos, Apple Silicon fast ebenso gut, AMD unter Linux ordentlich unterstützt.
- 04Die TOPS der NPUNützlich, wenn Sie die Copilot+-Funktionen von Windows und eine lange Akkulaufzeit bei Videokonferenzen wünschen. Derzeit ohne Wirkung auf LLMs mit offenen Gewichten.
- Hardware für lokale KI: unsere Geräteübersichten
- Mini-PC Ryzen AI Max+ 395: Wenn Unified Memory den Unterschied macht
- Welche GPU für ein lokales LLM?
- Microsoft: Geräte mit Copilot+ und deren NPU
- Quelle: Wikipedia, Geschichte und Architektur der NPU
- Quelle: AMD-Pressemitteilung zu Ryzen AI 400 (CES 2026)
#FAQ
Was bedeutet NPU?+
Ist eine NPU für KI besser als eine GPU?+
Nutzen Ollama oder LM Studio die NPU?+
Ist eine NPU erforderlich, um eine KI lokal zu betreiben?+
Wie viele TOPS sind erforderlich?+
Verändern die neuen NPU-Chips von 2026 etwas für die lokale KI?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.