Fortgeschritten 15 minllama.cpp

llama.cpp mit CUDA kompilieren: Build-Anleitung Schritt für pas

Ollama und LM Studio umschließen llama.cpp — aber sie bleiben oft noch 1 oder 2 Versionen hinterher, mit konservativen Flags. Die eigene Compilation von llama.cpp führt auf einem aktuellen RTX zu einer Geschwindigkeitssteigerung von 20 bis 40 % und ermöglicht den Zugriff auf gerade erschienene Funktionen. Dieser Leitfaden umfasst Windows, Linux und den CUDA-Build.

Von Mohamed Meguedmi·Aktualisierung 2026-03-05·Unter Windows, macOS und Linux getestet

#Warum selbst kompilieren

Vorab-Funktionen
Neue Quantisierungen (IQ4_NL, Q2_K_S), neue Modelle (Mamba, DeepSeek), experimentelle Flags.
Optimale Leistung
Optimierter Build für Ihren spezifischen CPU-Typ (AVX-512, AMX) und Ihre CUDA-Generation (sm_89 für RTX 40, sm_90 für RTX 50).
Low-Level-Werkzeuge
llama-bench für Benchmarks, llama-cli für Skripte, llama-server für einen schlanken Endpunkt (ohne UI oder Abhängigkeiten).
i
Wer sollte kompilieren?
Wenn Sie Entwickler sind, sich für die Leistung interessieren oder mit Mamba/Jamba arbeiten, das von Ollama nicht unterstützt wird: ja. Ansonsten erledigt Ollama 95 % der Arbeit ohne Kompilierung.

#Voraussetzungen

CUDA Toolkit 12.x
Zum Download auf developer.nvidia.com verfügbar. Nicht mit den Treibern verwechseln – das Toolkit enthält nvcc, den Compiler.
CMake 3.21+
apt install cmake unter Linux, über chocolatey unter Windows.
C++-Compiler
gcc 11+ unter Linux, MSVC 2022 Build Tools unter Windows
Git
Zum Klonen und Aktualisieren.

#1. Das Repository klonen

Terminal
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

#2. Build mit CUDA

Linux / macOS
cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j $(nproc)
Windows (PowerShell)
cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Die Kompilierung dauert je nach Ihrer CPU 3 bis 10 Minuten. Die Binärdateien landen in build/bin/ (Linux) oder build/bin/Release/ (Windows).

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
→
Für Ihre GPU optimierter Build
Fügen Sie -DCMAKE_CUDA_ARCHITECTURES=89 hinzu, um ausschließlich für RTX 40 zu kompilieren (oder 90 für RTX 50). Die Binärdatei ist kleiner und der Build schneller.

#3. Testen

Herunterladen eines GGUF
# Via Hugging Face CLI
pip install huggingface_hub
huggingface-cli download \
  TheBloke/Mistral-7B-Instruct-v0.2-GGUF \
  mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  --local-dir ./models
Inferenz
./build/bin/llama-cli \
  -m ./models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  -p "Explique ce qu'est un LLM en 3 phrases." \
  -n 256 \
  -ngl 99  # nombre de couches sur GPU
HTTP-Server mit OpenAI-Kompatibilität
./build/bin/llama-server \
  -m ./models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  --port 8080 \
  -ngl 99 \
  -c 8192

#4. Optimierungsoptionen

-ngl N
Anzahl der auf die GPU geladenen Schichten. Geben Sie 99 (oder mehr) ein, um alle Schichten auf die GPU zu laden, sofern der VRAM ausreicht.
-fa
Flash Attention. 20–30 % mehr Geschwindigkeit, geringerer VRAM-Bedarf für den Kontext. Aktivieren Sie die Funktion immer, wenn Ihre GPU auf Ampere oder einer neueren Architektur basiert (RTX 30xx und neuer).
-c N
Kontextlänge. Stellen Sie keinen höheren Wert als nötig ein: Der KV-Cache verbraucht VRAM.
-b N / -ub N
Batch-Größe und Micro-Batch. Standard: 512/512. 1024/512 für eine beschleunigte Promptverarbeitung.
--no-mmap
Deaktiviert mmap. Bei langsamem anfänglichem Laden auf bestimmten SSDs ausprobieren.

#5. Auf dem neuesten Stand bleiben

Update
cd llama.cpp
git pull
cmake --build build --config Release -j

llama.cpp veröffentlicht mehrere Commits pro Tag. Ein wöchentlicher git pull ist ein guter Rhythmus. Wechseln Sie bei einer Regression mit git checkout zu einem bestimmten Tag (z. B. b4400).

#Fehlerbehebung

nvcc not found
Das CUDA Toolkit befindet sich nicht im PATH. Auf Linux: export PATH=/usr/local/cuda/bin:$PATH.
Nicht übereinstimmende CUDA-Versionen
NVIDIA-Treiber sind älter als das Toolkit. Aktualisieren Sie die Treiber (mindestens auf die für das jeweilige Toolkit erforderliche Version).
Linkerfehler mit cuBLAS
Falscher LD_LIBRARY_PATH. Fügen Sie /usr/local/cuda/lib64 hinzu.
Build scheitert bei MSVC
Öffnen Sie einen 'x64 Native Tools Command Prompt for VS 2022', nicht PowerShell. Einige CMake-Tools finden sonst cl.exe nicht.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.