Einsteiger 11 Min.NPU

NPU: Was ist das, und ist es nützlich für einen lokalen LLM? ?

Direkte Antwort

Eine NPU (Neural Processing Unit) ist ein stromsparender Prozessor, der in den Chip der meisten seit 2024 verkauften Laptops integriert ist und für kleine, kontinuierlich laufende KI-Aufgaben vorgesehen ist: Hintergrundunschärfe, Live-Untertitel und Fotosuche. Ihre prominenteste Kennzahl, die TOPS, sagt fast nichts darüber aus, wie gut sie ein lokales LLM ausführen kann: Die Generierungsgeschwindigkeit hängt von der Speicherbandbreite ab, und die NPU nutzt denselben langsamen Arbeitsspeicher wie der Prozessor.

Eine NPU, kurz für Neural Processing Unit, ist ein auf Berechnungen für neuronale Netze spezialisierter Prozessor, der in den Chip der meisten seit 2024 verkauften Laptops integriert ist. Sie führt kontinuierlich kleine KI-Aufgaben wie das Weichzeichnen des Hintergrunds oder die Erstellung von Live-Untertiteln aus und benötigt dafür nur wenige Watt. Ihre prominenteste Kennzahl, die TOPS, dient auf sämtlichen Etiketten von „KI-PCs“ als Verkaufsargument. Mit Stand vom 20. September 2026 sagt diese Kennzahl jedoch fast nichts darüber aus, ob ein Rechner ein LLM lokal ausführen kann. Hier erfahren Sie, warum das so ist und worauf Sie stattdessen achten sollten.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Was ist eine NPU?

Ein neuronales Netzwerk lässt sich rechnerisch auf riesige Serien von Matrixmultiplikationen mit Zahlen niedriger Präzision reduzieren, die milliardenfach wiederholt werden. Ein klassischer Prozessor kann das langsam ausführen, jeweils nur eine Handvoll Operationen. Eine Grafikkarte schafft es schnell und parallel mit Tausenden Recheneinheiten, bei einem Verbrauch von Dutzenden bis Hunderten von Watt. Eine NPU ist ein Siliziumbereich, der ausschließlich dafür ausgelegt ist: fest verdrahtete Recheneinheiten für 8- und 4-Bit-Ganzzahlen, kleine Speicher direkt daneben, um teure Datentransfers zu vermeiden, und ein Scheduler, der die Daten möglichst wenig bewegt. Das Ergebnis dieser extremen Spezialisierung: eine im Vergleich zu einer GPU moderate Spitzenleistung, aber eine deutlich höhere Effizienz pro Watt, was im Akkubetrieb besonders zählt.

Die Idee ist älter als die Marketingbezeichnung, die sie heute begleitet. Apple integriert seit 2017 eine Neural Engine in seine iPhones und seit ihrer Einführung in alle Macs mit Apple Silicon; Googles Pixel-Chips enthalten seit mehreren Generationen einen TPU-Block. Was sich 2024 tatsächlich geändert hat: Intel, AMD und Qualcomm haben alle gleichzeitig eine leistungsfähige NPU in ihre Prozessoren für Notebooks im Endkundenmarkt integriert, und Microsoft hat daraufhin eine ganze Reihe von Windows-Funktionen unter der Markenbezeichnung Copilot+ PC an das Vorhandensein einer solchen NPU geknüpft. Dieses Zusammentreffen erklärt stärker als die Technologie selbst, warum seit zwei Jahren die Regale mit „KI-PC“-Etiketten überschwemmt werden.

#CPU, GPU, NPU: Unterschiede

CPUGPUNPU
Entwickelt fürDie allgemeine Logik, die geringe LatenzMassiv paralleles Rechnen, GrafikAusschließlich die Inferenz neuronaler Netze
Stromverbrauch unter KI-Last15 à 125 W30 W (integriert) bis 575 W (RTX 5090)1 à 10 W
Genutzter SpeicherDer SystemspeicherEigener VRAM oder bei integrierter GPU der ArbeitsspeicherDer Systemspeicher
Software-UnterstützungUniversellSehr breit: CUDA, ROCm, Metal, VulkanEng, spezifisch für jeden Hersteller
EinsatzgebietOrchestrierung, kleine Modelle als NotlösungLLMs, Bildgenerierung, TrainingLeichtgewichtige, dauerhaft laufende KI im Akkubetrieb

Die drei Chips ergänzen einander, statt miteinander zu konkurrieren: Jeder bietet einen anderen Kompromiss zwischen Geschwindigkeit, Stromverbrauch und Vielseitigkeit. Auf einem „KI-PC“ übernimmt die NPU während einer vierstündigen Videokonferenz die Webcam-Effekte, während die GPU inaktiv bleibt. Dadurch bleibt ein erheblicher Teil der Akkulaufzeit erhalten, der bei einem kontinuierlichen GPU-Einsatz verloren gegangen wäre. Lassen Sie auf derselben Maschine einen Assistenten mit 14 Milliarden Parametern laufen, übernimmt die GPU die gesamte Arbeit, weil dort sowohl die nötige Speicherbandbreite als auch ausgereifte Softwareunterstützung vorhanden sind: Keine Laufzeitumgebung für Endanwender kann derzeit ein LLM dieser Größe auf einer NPU ausführen.

#Die TOPS: Was sie messen, was sie verbergen

TOPS bedeutet „eine Billion Operationen pro Sekunde“ (Tera Operations Per Second). Die Operationen werden fast immer mit 8-Bit-Ganzzahlen gemessen, damit die Angaben verschiedener Datenblätter vergleichbar bleiben. Es handelt sich um eine Spitzenrechenleistung, die im Labor unter günstigen Bedingungen gemessen wird. Sie sagt nichts darüber aus, wie schnell die Daten aus dem Speicher zu diesen Recheneinheiten gelangen. Genau das begrenzt ein Sprachmodell in der Praxis: Eine NPU, der es an Daten fehlt, verbringt die meiste Zeit mit Warten, ob die TOPS nun hoch sind oder nicht.

Herstellerangaben · Die Messmethoden variieren, ein Unterschied von einigen Punkten ist nicht signifikant
ChipfamilieAngekündigte NPU-LeistungCopilot+-Eignung (40 TOPS und mehr)
Intel Core Ultra Serie 1 (Meteor Lake)≈ 11 TOPSNein
Apple M4 (Neural Engine)38 TOPSNicht zutreffend (macOS)
Qualcomm Snapdragon X Elite und X Plus45 TOPSJa
Intel Core Ultra 200V (Lunar Lake)48 TOPSJa
AMD Ryzen AI 30050 TOPSJa
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSJa
Intel Core Ultra 300 (Panther Lake, CES Januar 2026)Bis zu 50 TOPS (NPU 5)Ja
AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES Januar 2026)Bis zu 60 TOPSJa
Qualcomm Snapdragon X2 Elite (CES Januar 2026)80 TOPSJa

Diese neue Generation, die im Januar 2026 auf der CES vorgestellt wurde und zum Stand vom 28. September 2026 bereits in erhältlichen Laptops verbaut ist, hebt den angegebenen Wert deutlich über die Mindestschwelle für Copilot+: Der Snapdragon X2 Elite erreicht mit 80 TOPS gegenüber zuvor 45 fast das Doppelte seines Vorgängers. All das ändert nichts an der Schlussfolgerung dieser Seite: Das folgende Argument zur gemeinsam genutzten Speicherbandbreite gilt gleichermaßen für diese neuen Chips, so beeindruckend ihre TOPS-Angabe auf dem Etikett auch erscheinen mag.

#Warum eine NPU Ihre LLMs nicht beschleunigt

Um ein einziges Token zu erzeugen, muss ein Modell den Großteil seiner im Speicher liegenden Gewichte erneut lesen, vom ersten bis zum letzten aktiven Parameter. Ein Modell mit 14 Milliarden Parametern in Q4 benötigt etwa 9 GB: 20 Tokens pro Sekunde zu erzeugen bedeutet daher, 180 GB pro Sekunde zwischen dem Speicher und den Recheneinheiten zu übertragen. Die eigentliche arithmetische Berechnung, also die Multiplikation selbst, ist im Vergleich zu diesem ständigen Datentransfer wenig aufwendig. Die Generierungsgeschwindigkeit richtet sich daher nach der verfügbaren Speicherbandbreite, nicht nach der im Produktdatenblatt angegebenen Rechenleistung in TOPS oder TFLOPS. Das erklärt, warum zwei Chips mit sehr unterschiedlichen TOPS-Werten Text mit genau derselben Geschwindigkeit erzeugen können.

Theoretische Obergrenze = Bandbreite ÷ Modellgröße (Qwen 3 14B in Q4, 9 GB im QuelLLM-Katalog). Reale Systeme nähern sich diesem Wert an, ohne ihn zu erreichen.
Wo befindet sich das Modell?BandbreiteObergrenze für ein 9-GB-Modell
LPDDR5X-Speicher im Laptop (gemeinsam von NPU und integrierter GPU genutzt)≈ 70 bis 135 GB/s≈ 8 bis 15 Tok/s
Einheitlicher Speicher des Ryzen AI Max+ 395256 GB/s≈ 28 Tok/s
RTX 4070 (GDDR6X)504 GB/s≈ 56 Tok/s
RTX 5070 Ti (GDDR7)896 GB/s≈ 100 tok/s
RTX 5090 (GDDR7)1 792 GB/s≈ 200 Tok/s

Eine NPU mit 50 TOPS steht ebenso wie eine NPU mit 80 TOPS auf den allerneuesten Chips in der ersten Zeile der Tabelle. Sie greift auf denselben LPDDR5X-Speicher zu, den sie mit dem Prozessor teilt: Unabhängig von der angegebenen TOPS-Zahl kann sie physikalisch nicht schneller arbeiten, als dieser Speicher es erlaubt. Ein Laptop mit 45 TOPS und ein Laptop mit 80 TOPS werden daher Text mit exakt derselben Geschwindigkeit erzeugen, wenn ihr Speicher hinsichtlich Kapazität und Datendurchsatz identisch bleibt.

Eine NPU kann tatsächlich bei der Verarbeitung des Prompts helfen. Diese Phase benötigt vor allem Rechenleistung statt Speicherbandbreite, da das Modell den gesamten bereits vorhandenen Text auf einmal verarbeitet, statt ihn Wort für Wort zu erzeugen. Hybride Konfigurationen, die diese Verarbeitung der NPU und die Generierung der integrierten GPU überlassen, verkürzen bei kleinen, gut unterstützten Modellen die Wartezeit bis zum ersten angezeigten Wort und senken den gesamten Energieverbrauch. Das verbessert die Akkulaufzeit und die wahrgenommene Reaktionsgeschwindigkeit, messbar an der Latenz. Es ermöglicht jedoch weder den Betrieb größerer Modelle noch eine schnellere fortlaufende Textgenerierung.

#Das eigentliche Hindernis: die Software

Ollama, llama.cpp, LM Studio
Sie laufen auf der GPU oder der CPU. Auf einem Copilot+-Laptop nutzen sie die integrierte GPU oder den Prozessor und ignorieren die NPU.
Windows
Die eingebetteten Modelle von Microsoft und die Microsoft-Umgebung Foundry Local zielen über ONNX Runtime auf die NPU ab, mit einer Auswahl kleiner Modelle.
AMD
Ryzen AI Software und der Lemonade-Server führen bestimmte ONNX-Modelle im hybriden Modus (NPU und integrierte GPU) aus.
Intel
OpenVINO kann unterstützte Modelle auf der NPU ausführen.
Qualcomm
Die QNN-Toolchain und AI Hub stellen bereits für die Hexagon-NPU konvertierte Modelle bereit.
Apple
Core ML nutzt die Neural Engine, aber die auf dem Mac tatsächlich verwendeten LLM-Tools (MLX, llama.cpp, Ollama) nutzen die GPU über Metal.

Allen diesen Tools ist eines gemeinsam: Wer die NPU nutzt, wählt aus einer kurzen Liste von Modellen, die der Hersteller bereits konvertiert und validiert hat, in der Regel mit 1 bis 8 Milliarden Parametern. Man kann also nicht einfach eine beliebige GGUF-Datei von Hugging Face herunterladen und direkt ausführen. Diese Konvertierung erfordert für jeden Hersteller ein anderes Format und eine andere Werkzeugkette. Das erklärt, warum bislang kein Community-Projekt die NPU-Unterstützung vereinheitlicht hat, wie llama.cpp es für GPUs getan hat.

#Worauf Sie stattdessen vor dem Kauf achten sollten

  1. 01
    Der Speicher, den die GPU nutzen kann
    Der VRAM einer dedizierten Grafikkarte oder der vereinheitlichte Speicher eines Macs oder einer Strix-Halo-Maschine. Dieser Speicher entscheidet, welche Modelle sich laden lassen.
  2. 02
    Die Bandbreite dieses Speichers
    Sie bestimmt direkt die Anzahl der pro Sekunde generierten Tokens.
  3. 03
    Der Weg über die Software
    NVIDIA völlig problemlos, Apple Silicon fast ebenso gut, AMD unter Linux ordentlich unterstützt.
  4. 04
    Die TOPS der NPU
    Nützlich, wenn Sie die Copilot+-Funktionen von Windows und eine lange Akkulaufzeit bei Videokonferenzen wünschen. Derzeit ohne Wirkung auf LLMs mit offenen Gewichten.

#FAQ

Was bedeutet NPU?+
Neural Processing Unit, also eine neuronale Verarbeitungseinheit. Das ist ein Prozessorblock, der speziell für die effiziente Ausführung neuronaler Netze ausgelegt ist und in den meisten neueren Chips für Laptops und Telefone neben CPU und GPU vorhanden ist. Er übernimmt kontinuierlich kleine KI-Aufgaben, etwa das Weichzeichnen des Hintergrunds bei Videokonferenzen, ohne den Akku zu erhitzen oder schnell zu entladen.
Ist eine NPU für KI besser als eine GPU?+
Eine NPU ist bei kleinen, kontinuierlichen Aufgaben deutlich sparsamer im Energieverbrauch: etwa 1 bis 10 W gegenüber 30 W und mehr bei einer GPU. Für große Modelle, LLMs und Bildgeneratoren ist eine GPU weiterhin deutlich schneller und wird von der Software wesentlich besser unterstützt. Sie sind keine Konkurrenten: Sie erledigen schlicht unterschiedliche Aufgaben und arbeiten mit unterschiedlichen Modellgrößen.
Nutzen Ollama oder LM Studio die NPU?+
Nein, Stand 28. September 2026. Sie laufen je nach Hardware über CUDA, ROCm, Metal oder Vulkan auf der GPU oder als letzte Möglichkeit auf dem Prozessor. Für die Nutzung der NPU sind die herstellerspezifischen Tools erforderlich: ONNX Runtime für Windows, Ryzen AI Software für AMD und OpenVINO für Intel, jeweils mit einer begrenzten Liste bereits konvertierter Modelle.
Ist eine NPU erforderlich, um eine KI lokal zu betreiben?+
Nein, absolut nicht. Jeder Rechner mit einer geeigneten GPU oder ausreichend vereinheitlichtem Speicher kann lokale Modelle ohne jegliche NPU ausführen, wie es bereits vor 2024 der Fall war. Eine NPU ist nur erforderlich, um die Windows-spezifischen Copilot+-Funktionen zu aktivieren, nicht für Ollama, LM Studio oder andere gängige Inferenzwerkzeuge.
Wie viele TOPS sind erforderlich?+
40 TOPS ist der Schwellenwert für Microsofts Copilot+ PC-Label. Die auf der CES im Januar 2026 erschienenen Chips Panther Lake, Ryzen AI 400 und Snapdragon X2 Elite erreichen inzwischen 50, 60 und bis zu 80 TOPS. Oberhalb des Copilot+-Schwellenwerts hat dieser Unterschied kaum spürbare praktische Auswirkungen und absolut keine auf die Generierungsgeschwindigkeit eines lokal betriebenen LLM.
Verändern die neuen NPU-Chips von 2026 etwas für die lokale KI?+
Nein, nicht für LLMs. Panther Lake, Ryzen AI 400 und Snapdragon X2 Elite erhöhen die angegebenen TOPS-Werte, aber die NPU greift weiterhin auf denselben Systemspeicher wie der Prozessor zu, ohne dass damit eine höhere Speicherbandbreite einhergeht. Der Engpass, der die Generierungsgeschwindigkeit eines Sprachmodells begrenzt, bleibt genau derselbe wie bei der vorherigen Chipgeneration.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.