Fortgeschritten 11 Min.Backends

llama.cpp vs. vLLM vs. Exllama

Direkte Antwort

llama.cpp ist die portable Engine für den persönlichen Gebrauch (GGUF, CPU, Mac, GPUs aller Marken) und bildet auch die Grundlage von Ollama und LM Studio. vLLM ist dafür ausgelegt, mit kontinuierlichem Batching viele Nutzer gleichzeitig auf GPUs zu bedienen; Red Hat misst auf einer A100 bis zu 793 Tokens/s gegenüber 41 bei Ollama. ExLlamaV2 ist archiviert: Die Entwicklung wird in ExLlamaV3 fortgesetzt.

Hinter Ollama, LM Studio oder Jan steckt eine Inferenz-Engine, und diese bestimmt die akzeptierten Formate, die nutzbare Hardware und das Verhalten unter Last. Dieser Leitfaden vergleicht llama.cpp, vLLM, ExLlama und SGLang anhand von Kriterien, die sich in ihren Repositories überprüfen lassen, korrigiert verbreitete Irrtümer und gibt eine Regel für die Auswahl. Er veröffentlicht keine eigenen Durchsatzmessungen: Aufgeführt werden ausschließlich Messungen Dritter mit Quellenangabe.

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Inferenz-Engines: Was sie wirklich unterscheidet

Eine Inferenz-Engine wandelt Eingabetokens in Ausgabetokens um. Die Anwendungen, die Sie installieren (Ollama, LM Studio, Jan), enthalten eine solche Engine; Produktionsserver (vLLM, SGLang) sind selbst eine. Drei Unterschiede wirken sich auf Ihre Nutzung aus: die unterstützten Modellformate, die nutzbare Hardware und die Art, wie mehrere Anfragen gleichzeitig verarbeitet werden.

Die Inferenz-Engines im tabellarischen Überblick (offizielle Repositories, September 2026)
EngineLizenzAngekündigte Formate und HardwareTypische Nutzung
llama.cppMITGGUF; CPU, Apple Silicon, NVIDIA (CUDA), AMD (HIP), Vulkan, SYCL und anderePersönlicher Rechner, Laptop, kleiner Server
vLLMApache 2.0Hugging-Face-Modelle; FP8, INT4, GPTQ, AWQ, GGUF (experimentell); GPUs von NVIDIA, AMD und Intel sowie x86-/ARM-CPUsViele Nutzer bedienen, Produktivbetrieb
SGLangApache 2.0Hugging Face-Modelle; FP4, FP8, INT4, AWQ, GPTQServer mit hohem Durchsatz, gemeinsam genutzte Präfixe
ExLlamaV3MITEXL3; NVIDIA-GPUs für den Consumer-MarktLatenz auf der eigenen GPU, mit TabbyAPI
MLX LMMITNur Apple SiliconMac: Generierung und Fine-Tuning
i
Ollama und LM Studio sind keine konkurrierenden Inferenz-Engines zu diesen
Das Ollama-Repository führt llama.cpp unter „Supported backends“ auf, und die Startseite von LM Studio nennt eine auf MLX und llama.cpp basierende Engine. „Ollama vs llama.cpp“ zu vergleichen bedeutet, eine Anwendung mit ihrer Engine zu vergleichen: Der spezielle Leitfaden zu Ollama versus llama.cpp behandelt diesen Fall.

#Das Modellformat bestimmt, welche Inferenz-Engine verwendet werden kann

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Bevor Sie Geschwindigkeiten vergleichen, prüfen Sie, in welchem Format das gewünschte Modell veröffentlicht ist. Eine GGUF-Datei lässt sich in llama.cpp und damit auch in Ollama, LM Studio und Jan laden. Modellgewichte von Hugging Face in FP16, FP8 oder mit AWQ oder GPTQ quantisiert lassen sich in vLLM oder SGLang laden. Ein für MLX konvertiertes Modell lässt sich auf dem Mac mit MLX LM laden, ein EXL3-Modell mit ExLlamaV3. Ein Wechsel der Inferenz-Engine bedeutet oft, das Modell in einem anderen Format erneut herunterzuladen.

Format und kompatible Inferenz-Engine
FormatNaheliegende Inferenz-EngineAndere mögliche Inferenz-Engine
GGUFllama.cpp (und damit Ollama, LM Studio, Jan)vLLM im experimentellen Modus
Modellgewichte von Hugging Face (FP16, FP8)vLLM, SGLangMLX LM nach der Konvertierung, auf dem Mac
AWQ, GPTQvLLM, SGLangJe nach Inferenz-Engine; zu prüfen
EXL3ExLlamaV3Keine
MLXMLX LMLM Studio und Jan, die MLX ankündigen

#llama.cpp: der portable Standard

llama.cpp ist eine C/C++-Implementierung ohne Abhängigkeiten, deren erklärtes Ziel es ist, Inferenz mit minimalem Konfigurationsaufwand auf einem breiten Spektrum an Hardware zu ermöglichen. Apple Silicon wird dabei vorrangig berücksichtigt (NEON, Accelerate, Metal), x86-CPUs werden mit AVX, AVX2, AVX512 und AMX unterstützt, ebenso NVIDIA-GPUs (CUDA), AMD-GPUs (HIP) sowie Vulkan und SYCL. llama.cpp bietet Quantisierungen von 1,5 bis 8 Bit und hybride Inferenz auf CPU und GPU, mit der sich ein Modell ausführen lässt, dessen Speicherbedarf den verfügbaren VRAM übersteigt.

Ein verbreiteter Irrtum muss korrigiert werden: llama.cpp ist nicht auf eine Anfrage gleichzeitig beschränkt. Sein Server bietet laut Beschreibung parallele Generierung für mehrere Nutzer und kontinuierliches Batching, das standardmäßig aktiviert ist; die Anzahl der Slots wird über den Parameter --parallel festgelegt. Damit eignet er sich durchaus für ein kleines Team; mit den Funktionen von vLLM für den Produktionsbetrieb in großem Maßstab will er jedoch nicht gleichziehen.

Stärken
Portabilität (Mac, Linux, Windows, Android), weit verbreitete GGUF-Formate, hybrider CPU- und GPU-Modus, geringe Abhängigkeit.
Grenzen
Keine Funktionen für verteilte Bereitstellung, die mit denen von vLLM vergleichbar wären; Kenntnisse der Einstellungen (Kontext, Slots, Schichten auf der GPU) erforderlich.
Ökosystem
Grundlage von Ollama und LM Studio, auch von Jan genannt.

Zum Kompilieren mit CUDA, Metal oder Vulkan lesen Sie die Kompilierungsanleitungen; der vollständige Leitfaden zu llama.cpp erläutert die Nutzung im Detail.

#vLLM: der Server für viele Benutzer

vLLM ist eine Bibliothek für Inferenz und die Bereitstellung von Modellen als Dienst, die am Sky Computing Lab der University of California in Berkeley entstand. Sie basiert auf PagedAttention, das den Speicher für die Schlüssel und Werte des Attention-Mechanismus seitenweise verwaltet, und auf kontinuierlichem Batching, ergänzt durch stückweises Prefill und Prefix-Caching. Sie gibt Unterstützung für die Formate FP8, INT4, GPTQ, AWQ und GGUF, eine OpenAI-kompatible API sowie für GPUs von NVIDIA, AMD und Intel und CPUs der Architekturen x86, ARM und PowerPC an.

Zwei verbreitete Irrtümer sind zu korrigieren. Erstens ist vLLM nicht mehr auf NVIDIA beschränkt und unterstützt inzwischen auch CPUs: Sein Repository nennt die Unterstützung verschiedener GPUs und CPUs. Zweitens unterstützt vLLM inzwischen auch GGUF: Die Dokumentation beschreibt diese Unterstützung als sehr experimentell und wenig optimiert; sie ist vor allem zur Verringerung des Speicherbedarfs nutzbar. Für den täglichen Einsatz von GGUF bleibt llama.cpp der übliche Weg.

Stärken
Durchsatz unter Last, seitenweise Verwaltung des Cache-Speichers, OpenAI-kompatible API, Parallelisierung (Tensor, Pipeline, Experten), zahlreiche Formate.
Grenzen
Aufwendiger zu installieren und zu konfigurieren als llama.cpp; für GPU-Server konzipiert; GGUF gehört nicht zu seinen Stärken.
Ökosystem
Die Standardwahl, wenn mehrere Personen oder Anwendungen gleichzeitig dasselbe Modell abfragen.

Der Leitfaden zu vLLM erklärt, was die Inferenz-Engine ist; der Leitfaden zu ihrem Einsatz in der Produktion beschreibt die Einstellungen und die Überwachung im Detail.

#ExLlama: V2 archiviert, V3 im Entwicklungsstadium

Im Repository von ExLlamaV2 steht ein Hinweis, dass das Projekt vorerst archiviert ist und die Entwicklung in ExLlamaV3 fortgesetzt wird. Viele Vergleiche, darunter die frühere Version dieser Seite, stellen V2 weiterhin als die fortschrittlichste Option dar. Das Repository von ExLlamaV3 kündigt das Quantisierungsformat EXL3, tensor- und expertenparallele Inferenz, CPU-Offloading für Expertenmodelle, kontinuierliches Batching, spekulatives Decoding und eine OpenAI-kompatible API über TabbyAPI, den empfohlenen Server, an.

ExLlamaV3 richtet sich an Consumer-GPUs, nicht an Produktionsserver oder Macs. Wenn Sie eine NVIDIA-Grafikkarte besitzen und den besten Kompromiss zwischen Qualität und Größe suchen, ist die EXL3-Quantisierung einen Versuch wert; prüfen Sie zuerst, ob Ihr Modell in der Architekturliste des Repositorys aufgeführt ist.

#SGLang, MLX LM und die anderen

SGLang
Serving-Framework, das als auf geringe Latenz und hohen Durchsatz ausgelegt beschrieben wird, von einer einzelnen GPU bis hin zu großen Clustern. Es wirbt mit RadixAttention für das Präfix-Caching, kontinuierlichem Batching, PagedAttention und spekulativem Decoding. Auf Servern konkurriert es mit vLLM; der eigens dafür vorgesehene Leitfaden erläutert es im Detail.
MLX LM
Python-Paket zur Textgenerierung und zum Fine-Tuning von Modellen auf Apple Silicon mit MLX. Es funktioniert nur auf dem Mac. Der Leitfaden MLX vs. llama.cpp vergleicht die beiden auf dem Mac.
TensorRT-LLM
Engine von NVIDIA, auf NVIDIA-Karten sehr leistungsfähig, aber aufwendiger einzurichten; nur für eine Flotte von NVIDIA-GPUs im Produktionsbetrieb in Betracht ziehen.

#Was die veröffentlichten Messungen zeigen

Die Durchsatzraten hängen von der Hardware, dem Modell, der Quantisierung, der Länge der Anfragen und der Version der Engine ab und verändern sich jeden Monat. Dieser Leitfaden enthält daher keine eigenen Messungen und empfiehlt Ihnen, Tabellen mit Tokens pro Sekunde ohne dokumentiertes Messverfahren skeptisch zu betrachten. Ein Drittanbieter hat jedoch ein vollständiges Messverfahren veröffentlicht: Red Hat im August 2025.

Messung von Red Hat: vLLM gegenüber Ollama auf einer A100 (August 2025)
ElementVon Red Hat veröffentlichter Wert
HardwareEine NVIDIA A100-PCIE-40GB-Karte
ModellLlama 3.1 8B Instruct (FP16 bei Ollama)
VersionenvLLM 0.9.1; Ollama 0.9.2
TestwerkzeugGuideLLM 0.2.1, 1 bis 256 Benutzer gleichzeitig
Maximaler Durchsatz793 Tokens/s für vLLM gegenüber 41 für Ollama
P99-Latenz im Hochlastfall80 ms für vLLM gegenüber 673 ms für Ollama

Mit Vorbehalt zu lesen: Der Artikel ist den Produkten von Red Hat AI zugeordnet und stammt somit von einem kommerziellen Anbieter in diesem Bereich; die Tests betreffen Ollama und nicht direkt llama.cpp und wurden mit Standardeinstellungen durchgeführt; seitdem sind mehrere Versionen erschienen. Die belastbare Aussage ist qualitativer Natur: Bei vielen gleichzeitigen Anfragen übertrifft eine Serving-Engine mit aggressivem Batching eine Anwendung, die für einen einzelnen Nutzer konzipiert ist. Bei alleiniger Nutzung ist der Durchsatzunterschied nicht der Faktor, der Sie ausbremst.

!
Keine Tabelle mit Tokens pro Sekunde auf dieser Seite
Die alte Version dieses Leitfadens enthielt Durchsatzwerte und Zeiten bis zur ersten Antwort für drei Inferenz-Engines. Diese Angaben waren durch keine Quelle belegt und wurden entfernt. Um die Engines auf Ihrem Rechner zu vergleichen, messen Sie selbst mit Ihrem Modell und Ihren Anfragen.

#Speicher: Was jede Engine reserviert

Der Speicherbedarf eines Modells setzt sich aus den Gewichten, dem Kontext-Cache (KV) und einer Reserve zusammen. Die Größe der Gewichte lässt sich berechnen: Ein Modell mit 8 Milliarden Parametern benötigt etwa 16 GB in FP16 (8 Milliarden mal 2 Byte) und etwa 5 GB in Q4 – ein Richtwert dieser Website. Der Kontext-Cache wächst mit der Gesprächslänge und der Anzahl gleichzeitiger Anfragen.

Wie jede Inferenz-Engine den Kontextspeicher verwaltet
EngineDokumentiertes VerhaltenPraktische Konsequenz
llama.cppBenutzerdefinierter Kontext; parallele Slots mit einem gemeinsamen CacheSie legen die Kontextgröße und die Anzahl der Slots fest
vLLMReserviert vorab einen Teil des GPU-Speichers für den Cache, standardmäßig 92 %Auf einer Karte mit 24 GB werden etwa 22 GB bereits standardmäßig reserviert
ExLlamaV3Cache-Quantisierung von 2 bis 8 BitDer Cache kann komprimiert werden, um in die VRAM zu passen

Merken Sie sich: vLLM reserviert den Speicher von Anfang an. Das macht es für den Inferenzbetrieb effizient, aber wenig geeignet für eine Grafikkarte, die auch von anderen Anwendungen genutzt wird. Reduzieren Sie den Parameter gpu_memory_utilization, wenn die Karte auch anderen Zwecken dient.

#Welche Inferenz-Engine für welchen Einsatz

Situationsspezifische Entscheidung
Ihre SituationEmpfohlene Inferenz-EngineGrund
Persönlicher Gebrauch auf Mac, PC oder Laptopllama.cpp über Ollama oder LM StudioPortabel und einfach
Mac mit Apple Silicon, hoher Durchsatz gewünschtMLX LM oder llama.cppMLX ist für Apple Silicon konzipiert; mit Ihren Modellen vergleichen
Ein Team oder eine Anwendung fragt das Modell abvLLM oder SGLangKontinuierliches Batching, Cache-Seiten
Eine NVIDIA-Grafikkarte für den Verbrauchermarkt, maximale QualitätExLlamaV3 mit TabbyAPIQuantisierung EXL3
Gemischte Hardware, CPU, AMD, Intelllama.cppBreite Hardwareunterstützung
Modell ausschließlich im GGUF-Formatllama.cppvLLM unterstützt dies nur experimentell

Die Engines können nebeneinander betrieben werden: Ollama für den alltäglichen Chat, vLLM bei Bedarf zum Verarbeiten eines Stapels von Extraktionsaufgaben. Es gibt keinen Grund, nur eine zu behalten, wenn sich die Einsatzbereiche unterscheiden. Planen Sie lediglich genügend Festplattenspeicher für dasselbe Modell in zwei Formaten ein, etwa eine GGUF-Datei für den Chat und Hugging-Face-Gewichte für den Server.

Häufige Fragen zu Inferenz-Engines
vLLM oder llama.cpp: Was sollte man wählen?+
llama.cpp für den persönlichen Gebrauch oder für unterschiedliche Hardware, einschließlich CPU und Mac. vLLM, um mehrere Benutzer über eine GPU zu bedienen, dank kontinuierlichem Batching und seitenbasierter Speicherverwaltung. Wenn Sie allein vor Ihrem Rechner sitzen, reicht llama.cpp über Ollama oder LM Studio fast immer aus.
Verwendet Ollama llama.cpp?+
Das Ollama-Repository führt llama.cpp unter „Supported backends“ auf. Ollama ergänzt diesen Unterbau um die Modellverwaltung, eine API und eine Anwendung. Wer Ollama und llama.cpp vergleicht, vergleicht also eine Anwendung mit ihrer Engine, wobei sich Standardeinstellungen, Formate und Funktionen unterscheiden; für Einzelheiten siehe den Leitfaden zu diesem Vergleich.
Kann vLLM Modelle im GGUF-Format ausführen?+
Ja, aber die Dokumentation beschreibt diese Unterstützung als sehr experimentell und wenig optimiert; sie ist vor allem zur Verringerung des Speicherbedarfs nützlich. Sie erfolgt inzwischen über ein separates Plugin. Verwenden Sie für vLLM vorzugsweise Hugging-Face-Modellgewichte in FP16, FP8 oder mit AWQ- oder GPTQ-Quantisierung und reservieren Sie GGUF für llama.cpp.
Wird ExLlamaV2 weiterhin gepflegt?+
Nein: Im Repository steht, dass es derzeit archiviert ist und die Entwicklung in ExLlamaV3 fortgesetzt wird. ExLlamaV3 bietet das Format EXL3 und einen empfohlenen Server, TabbyAPI. Wenn Sie von einem Tutorial zu ExLlamaV2 und dem Format EXL2 ausgehen, suchen Sie vor dem Start nach dem entsprechenden Tutorial für V3.
Welches Inferenz-Backend ist am schnellsten?+
Das hängt von der Hardware, dem Modell und der Anzahl gleichzeitiger Nutzer ab. Bei vielen parallelen Anfragen misst Red Hat einen deutlichen Vorteil von vLLM gegenüber Ollama. Bei jeweils nur einer Anfrage sind die Unterschiede geringer und hängen von der Hardware ab. Messen Sie mit Ihrem eigenen Modell, bevor Sie entscheiden.
Ist eine NVIDIA-GPU für vLLM erforderlich?+
Nein. Das vLLM-Repository nennt die Unterstützung von NVIDIA-, AMD- und Intel-GPUs sowie x86-, ARM- und PowerPC-CPUs, mit Erweiterungen für andere Beschleuniger. Der Funktionsumfang variiert je nach Hardware: Lesen Sie die Installationsdokumentation Ihrer Plattform, bevor Sie sich festlegen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.