llama.cpp mit CUDA kompilieren: Build-Anleitung Schritt für pas
Ollama und LM Studio umschließen llama.cpp — aber sie bleiben oft noch 1 oder 2 Versionen hinterher, mit konservativen Flags. Die eigene Compilation von llama.cpp führt auf einem aktuellen RTX zu einer Geschwindigkeitssteigerung von 20 bis 40 % und ermöglicht den Zugriff auf gerade erschienene Funktionen. Dieser Leitfaden umfasst Windows, Linux und den CUDA-Build.
#Warum selbst kompilieren
- Vorab-Funktionen
- Neue Quantisierungen (IQ4_NL, Q2_K_S), neue Modelle (Mamba, DeepSeek), experimentelle Flags.
- Optimale Leistung
- Optimierter Build für Ihren spezifischen CPU-Typ (AVX-512, AMX) und Ihre CUDA-Generation (sm_89 für RTX 40, sm_90 für RTX 50).
- Low-Level-Werkzeuge
- llama-bench für Benchmarks, llama-cli für Skripte, llama-server für einen schlanken Endpunkt (ohne UI oder Abhängigkeiten).
#Voraussetzungen
- CUDA Toolkit 12.x
- Zum Download auf developer.nvidia.com verfügbar. Nicht mit den Treibern verwechseln – das Toolkit enthält nvcc, den Compiler.
- CMake 3.21+
- apt install cmake unter Linux, über chocolatey unter Windows.
- C++-Compiler
- gcc 11+ unter Linux, MSVC 2022 Build Tools unter Windows
- Git
- Zum Klonen und Aktualisieren.
#1. Das Repository klonen
#2. Build mit CUDA
Die Kompilierung dauert je nach Ihrer CPU 3 bis 10 Minuten. Die Binärdateien landen in build/bin/ (Linux) oder build/bin/Release/ (Windows).
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
#3. Testen
#4. Optimierungsoptionen
- -ngl N
- Anzahl der auf die GPU geladenen Schichten. Geben Sie 99 (oder mehr) ein, um alle Schichten auf die GPU zu laden, sofern der VRAM ausreicht.
- -fa
- Flash Attention. 20–30 % mehr Geschwindigkeit, geringerer VRAM-Bedarf für den Kontext. Aktivieren Sie die Funktion immer, wenn Ihre GPU auf Ampere oder einer neueren Architektur basiert (RTX 30xx und neuer).
- -c N
- Kontextlänge. Stellen Sie keinen höheren Wert als nötig ein: Der KV-Cache verbraucht VRAM.
- -b N / -ub N
- Batch-Größe und Micro-Batch. Standard: 512/512. 1024/512 für eine beschleunigte Promptverarbeitung.
- --no-mmap
- Deaktiviert mmap. Bei langsamem anfänglichem Laden auf bestimmten SSDs ausprobieren.
#5. Auf dem neuesten Stand bleiben
llama.cpp veröffentlicht mehrere Commits pro Tag. Ein wöchentlicher git pull ist ein guter Rhythmus. Wechseln Sie bei einer Regression mit git checkout zu einem bestimmten Tag (z. B. b4400).
#Fehlerbehebung
- nvcc not found
- Das CUDA Toolkit befindet sich nicht im PATH. Auf Linux: export PATH=/usr/local/cuda/bin:$PATH.
- Nicht übereinstimmende CUDA-Versionen
- NVIDIA-Treiber sind älter als das Toolkit. Aktualisieren Sie die Treiber (mindestens auf die für das jeweilige Toolkit erforderliche Version).
- Linkerfehler mit cuBLAS
- Falscher LD_LIBRARY_PATH. Fügen Sie /usr/local/cuda/lib64 hinzu.
- Build scheitert bei MSVC
- Öffnen Sie einen 'x64 Native Tools Command Prompt for VS 2022', nicht PowerShell. Einige CMake-Tools finden sonst cl.exe nicht.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.