llama.cpp mit Vulkan (GPU universel)
Vulkan ist eine herstellerübergreifende Grafik-API: Sie funktioniert auf NVIDIA-, AMD- und Intel-Arc-GPUs, sogar auf iGPUs. Wer llama.cpp mit dem Vulkan-Backend kompiliert, kann die Schwierigkeiten mit CUDA/ROCm vollständig umgehen und erhält eine Lösung, die überall funktioniert. Dafür liegt die Leistung 10 bis 20 % unter der eines nativen Backends – oft ein guter Kompromiss für heterogene Setups.
#Warum Vulkan
- Vendor-agnostic
- Dasselbe ausführbare Programm läuft auf GeForce, Radeon, Arc und Iris. Praktisch, um ein Tool zu verteilen oder ein Modell zu testen, bevor Sie eine Grafikkarte kaufen.
- Einfache Installation
- Die Vulkan-Treiber sind in den üblichen Grafiktreibern enthalten. Sie müssen kein mehrere GB großes Toolkit installieren.
- Alte Karten
- Eine GTX 1060 mit 6 GB oder eine RX 580 funktioniert über Vulkan, während die CUDA-Unterstützung aufgegeben wurde und ROCm diese Karten nicht unterstützt.
- Intel Arc
- Die Grafikkarten Arc A580/A750/A770 werden korrekt über Vulkan unterstützt, während oneAPI hierbei weniger zuverlässig ist.
#Kompatible GPUs
- NVIDIA
- Jede Karte ab Maxwell (GTX 900 und neuer). Vulkan wird von allen neueren NVIDIA-Treibern unterstützt.
- AMD
- Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa unter Linux, offizielle Treiber unter Windows.
- Intel Arc
- Alchemist (A380-A770) und Battlemage. Hervorragendes Preis-Leistungs-Verhältnis für lokale KI.
- Intel-iGPU
- Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Nützlich für kleine Modelle auf Laptops ohne dedizierte GPU.
#Voraussetzungen
#1. Build
Die Vulkan-Shader werden beim Build kompiliert. Rechnen Sie je nach CPU mit 3–8 Minuten.
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
#2. Testen
Beim Start zeigt llama.cpp die über Vulkan erkannte GPU an: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Wenn Sie mehrere GPUs haben, wählen Sie mit -mg N (Index der Haupt-GPU) die gewünschte GPU aus.
#3. Leistung im Vergleich zu CUDA / ROCm
Tokens pro Sekunde bei Qwen 3.5 9B Q4_K_M mit aktiviertem Flash Attention (ungefähre Größenordnungen):
- RTX 4070 — native CUDA-Unterstützung
- ~82 Tok/s (Referenz).
- RTX 4070 — Vulkan
- ~70 Tok/s (-15 %).
- RX 7800 XT — ROCm
- ~56 Tok/s.
- RX 7800 XT — Vulkan
- ~48 Tok/s (-15 %). Manchmal die schnellste Option, wenn ROCm nicht funktioniert.
- Arc A770 16 GB — Vulkan
- ~43 Tok/s. Bestes Preis-Leistungs-Verhältnis.
- iGPU Intel Xe (Lunar Lake)
- ~8-13 Tok/s. Für Modelle mit 2-3B geeignet, bei 9B nur eingeschränkt nutzbar.
#Wann Vulkan wählen?
- Sie besitzen eine Intel Arc-Karte
- Vulkan > oneAPI im Jahr 2026. Stabile Leistung, keine exotische Installation nötig.
- ROCm will nicht mitspielen
- AMD-Karte nicht offiziell unterstützt, Override stürzt ab: Vulkan ist der funktionierende Plan B.
- Multi-Hersteller-Setup
- Eine Maschine mit GeForce + Intel Arc, ein Laptop mit Thunderbolt+eGPU, variabel. Vulkan ist kompatibel.
- Verteilung eines Tools
- Sie entwickeln eine App, die auf unbekannten Maschinen laufen muss: Die Vulkan-Binärdatei bietet die höchste Kompatibilität.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.