Fortgeschritten 12 Min.llama.cpp

llama.cpp mit Vulkan (GPU universel)

Vulkan ist eine herstellerübergreifende Grafik-API: Sie funktioniert auf NVIDIA-, AMD- und Intel-Arc-GPUs, sogar auf iGPUs. Wer llama.cpp mit dem Vulkan-Backend kompiliert, kann die Schwierigkeiten mit CUDA/ROCm vollständig umgehen und erhält eine Lösung, die überall funktioniert. Dafür liegt die Leistung 10 bis 20 % unter der eines nativen Backends – oft ein guter Kompromiss für heterogene Setups.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Vulkan

Vendor-agnostic
Dasselbe ausführbare Programm läuft auf GeForce, Radeon, Arc und Iris. Praktisch, um ein Tool zu verteilen oder ein Modell zu testen, bevor Sie eine Grafikkarte kaufen.
Einfache Installation
Die Vulkan-Treiber sind in den üblichen Grafiktreibern enthalten. Sie müssen kein mehrere GB großes Toolkit installieren.
Alte Karten
Eine GTX 1060 mit 6 GB oder eine RX 580 funktioniert über Vulkan, während die CUDA-Unterstützung aufgegeben wurde und ROCm diese Karten nicht unterstützt.
Intel Arc
Die Grafikkarten Arc A580/A750/A770 werden korrekt über Vulkan unterstützt, während oneAPI hierbei weniger zuverlässig ist.

#Kompatible GPUs

NVIDIA
Jede Karte ab Maxwell (GTX 900 und neuer). Vulkan wird von allen neueren NVIDIA-Treibern unterstützt.
AMD
Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa unter Linux, offizielle Treiber unter Windows.
Intel Arc
Alchemist (A380-A770) und Battlemage. Hervorragendes Preis-Leistungs-Verhältnis für lokale KI.
Intel-iGPU
Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Nützlich für kleine Modelle auf Laptops ohne dedizierte GPU.

#Voraussetzungen

Ubuntu / Debian
sudo apt update
sudo apt install libvulkan-dev vulkan-tools glslang-tools \
  cmake build-essential git
Fedora
sudo dnf install vulkan-headers vulkan-tools \
  glslang-devel cmake gcc-c++ git
Windows
# Installer le SDK Vulkan LunarG (fournit les headers et shaderc)
winget install KhronosGroup.VulkanSDK
Prüfen, ob Vulkan die GPU erkennt
vulkaninfo | grep -i "deviceName"
# Doit afficher votre GPU

#1. Build

Terminal
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Die Vulkan-Shader werden beim Build kompiliert. Rechnen Sie je nach CPU mit 3–8 Minuten.

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

#2. Testen

Starten
./build/bin/llama-cli \
  -m ./models/qwen3.5-9b-q4_k_m.gguf \
  -p "Bonjour" -n 128 -ngl 99

Beim Start zeigt llama.cpp die über Vulkan erkannte GPU an: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Wenn Sie mehrere GPUs haben, wählen Sie mit -mg N (Index der Haupt-GPU) die gewünschte GPU aus.

#3. Leistung im Vergleich zu CUDA / ROCm

Tokens pro Sekunde bei Qwen 3.5 9B Q4_K_M mit aktiviertem Flash Attention (ungefähre Größenordnungen):

RTX 4070 — native CUDA-Unterstützung
~82 Tok/s (Referenz).
RTX 4070 — Vulkan
~70 Tok/s (-15 %).
RX 7800 XT — ROCm
~56 Tok/s.
RX 7800 XT — Vulkan
~48 Tok/s (-15 %). Manchmal die schnellste Option, wenn ROCm nicht funktioniert.
Arc A770 16 GB — Vulkan
~43 Tok/s. Bestes Preis-Leistungs-Verhältnis.
iGPU Intel Xe (Lunar Lake)
~8-13 Tok/s. Für Modelle mit 2-3B geeignet, bei 9B nur eingeschränkt nutzbar.

#Wann Vulkan wählen?

Sie besitzen eine Intel Arc-Karte
Vulkan > oneAPI im Jahr 2026. Stabile Leistung, keine exotische Installation nötig.
ROCm will nicht mitspielen
AMD-Karte nicht offiziell unterstützt, Override stürzt ab: Vulkan ist der funktionierende Plan B.
Multi-Hersteller-Setup
Eine Maschine mit GeForce + Intel Arc, ein Laptop mit Thunderbolt+eGPU, variabel. Vulkan ist kompatibel.
Verteilung eines Tools
Sie entwickeln eine App, die auf unbekannten Maschinen laufen muss: Die Vulkan-Binärdatei bietet die höchste Kompatibilität.
i
Nicht für Mac
Unter macOS läuft Vulkan über MoltenVK (eine Übersetzungsschicht zu Metal). Verwenden Sie stattdessen das native Metal-Backend von llama.cpp – das ist schneller.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.