Einsteiger 11 Min.Andere Tools

Llamafile: Ein vollständiges LLM in einer einzigen Datei ausführbar

Direkte Antwort

Llamafile (Projekt mozilla-ai/llamafile, Lizenz Apache 2.0) bündelt mithilfe von Cosmopolitan Libc ein GGUF-Modell und dessen llama.cpp-Engine in einer einzigen ausführbaren Datei. Sie laden eine Datei herunter, machen sie ausführbar (oder geben ihr unter Windows die Endung .exe), und eine Chatoberfläche öffnet sich unter http://localhost:8080, ohne Installation oder Daemon. Dieselbe Datei läuft unter Windows, macOS, Linux und BSD, wobei unter Windows eine Grenze von 4 GB gilt.

Llamafile ist ein Mozilla-Projekt, das ein vollständiges Sprachmodell und seine Inferenz-Engine in einer einzigen ausführbaren Datei bündelt. Keine Installation, keine Abhängigkeiten, kein Daemon: Sie laden eine Datei herunter, starten sie, und ein LLM läuft auf Ihrem Rechner mit einer Weboberfläche. Dieselbe Datei funktioniert unter Windows, macOS und Linux auf die gleiche Weise. Dieser Leitfaden zeigt, wie Sie ein llamafile starten, was darin steckt und wann es die bessere Wahl als Tools wie Ollama ist.

Von Clara M.·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Warum llamafile

Die meisten lokalen LLM-Tools erfordern eine Installation, einen Hintergrunddienst und anschließend den Download eines Modells. Llamafile macht all diese Schritte überflüssig: Die Inferenz-Engine und die Modellgewichte befinden sich in einer einzigen Datei. Sie machen sie ausführbar, starten sie, und Ihr Browser öffnet eine Chat-Oberfläche. Das ist der kürzeste Weg von einem Download-Link zu einem Gespräch mit einem lokal ausgeführten Modell.

Dieses Format spielt in drei Situationen seine Stärken aus. Um ein Modell schnell zu testen, ohne das eigene System mit zusätzlichen Installationen zu überladen. Um ein LLM an Kollegen oder Nutzer ohne technische Kenntnisse weiterzugeben: nur eine einzige Datei verschicken, nichts konfigurieren. Und zur Archivierung: Ein llamafile wird auch in Jahren noch funktionieren, ohne von einer zu installierenden Laufzeitumgebung oder einem weiterhin zugänglichen Online-Repository abhängig zu sein.

Keine Installation erforderlich
Kein Paket, kein Daemon, keine Umgebungsvariable zu konfigurieren.
Eine einzige Datei
Engine und Modell vereint, leicht zu kopieren, zu sichern oder zu teilen.
Multi-OS
Das gleiche Binärprogramm läuft unter Windows, macOS, Linux, BSD (x86-64 und ARM64).
100 % lokal
Keine Daten verlassen den Rechner, und nach dem Download ist keine Netzwerkverbindung erforderlich.

#So funktioniert es: das Mozilla-Format

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Llamafile kombiniert zwei Open-Source-Bausteine. Der erste ist llama.cpp, die in C/C++ geschriebene Inferenz-Engine, die Modelle im GGUF-Format sowohl auf der CPU als auch auf der GPU ausführt. Der zweite ist Cosmopolitan Libc, eine von Justine Tunney entwickelte Bibliothek, mit der sich eine „polyglotte“ ausführbare Datei kompilieren lässt: ein und dieselbe Binärdatei, die von mehreren Betriebssystemen erkannt und nativ ausgeführt wird.

Konkret ist eine .llamafile-Datei zugleich ein Programm und ein Archiv. Sie enthält den Code des Inferenzservers und die darin verpackte GGUF-Datei mit den Modellgewichten. Beim Start erkennt das Programm das Betriebssystem und die Architektur, lädt das Modell aus der eigenen Datei und startet anschließend einen lokalen HTTP-Server mit einer Weboberfläche zum Chatten.

i
GGUF, die gemeinsame Grundlage
Die in einem llamafile enthaltenen Gewichte liegen im GGUF-Format vor, demselben Format, das auch llama.cpp, Ollama oder LM Studio verwenden. Ein llamafile erfindet kein neues Modellformat: Es bündelt ein vorhandenes GGUF-Modell mit seiner Engine.

Das llamafile-Projekt selbst steht unter der Apache-2.0-Lizenz; die für das Projekt vorgenommenen Änderungen an llama.cpp und whisper.cpp bleiben wie die ursprünglichen Projekte unter der MIT-Lizenz, damit sie kompatibel bleiben und wieder in die Ursprungsprojekte übernommen werden können. Seit Version 0.10.0 verwendet llamafile ein neues Build-System, das an neuere Versionen von llama.cpp angelehnt ist und die Unterstützung für neuere Modelle und Funktionen erweitert; ältere Versionen bleiben für diejenigen verfügbar, die die „klassische“ Nutzungserfahrung bevorzugen.

Das Projekt umfasst auch whisperfile, ein ergänzendes Tool in einer einzigen Datei, das auf whisper.cpp basiert und dieselbe Cosmopolitan-Paketierung nutzt. Es dient der Audiotranskription und -übersetzung, benötigt keine Installation und läuft auf denselben Plattformen wie ein klassisches llamafile.

#Voraussetzungen

Die Anforderungen sind bewusst minimal gehalten. Entscheidend ist, genügend Speicher für das gewählte Modell zu haben, da die Dateigröße und der benötigte Arbeitsspeicher direkt von der Quantisierung abhängen.

OS
Windows 10+, macOS 11+, eine neuere Linux-Version oder BSD. x86-64 oder ARM64 (einschließlich Apple Silicon).
RAM
Grob mit der Dateigröße plus einer Reserve rechnen. Ein 7B-Modell in Q4 (~5 GB) läuft mit 8 bis 16 GB problemlos.
GPU (optional)
Beschleunigung möglich über NVIDIA (CUDA) oder Apple Metal. Ohne GPU erfolgt die Inferenz auf CPU, langsamer, aber funktional.
Festplattenspeicher
Von etwa 500 MB für ein kleines Modell bis zu mehreren Dutzend GB für ein großes, nicht quantisiertes Modell.
!
Die Grenze von 4 GB unter Windows
Windows begrenzt die Größe ausführbarer Dateien auf 4 GB. Darüber hinaus muss entweder ein kleineres llamafile gewählt werden oder die .gguf-Datei mit den Modellgewichten separat bleiben und dem llamafile mit der Option -m übergeben werden. Andere Systeme sind davon nicht betroffen.

#In wenigen Sekunden herunterladen und starten

Das offizielle Repository mozilla-ai/llamafile auf GitHub listet einsatzbereite llamafiles auf, und Hugging Face hostet zahlreiche weitere. Das ursprünglich von Mozilla Builders gestartete Projekt wird heute von Mozilla.ai weitergeführt und gepflegt. Sobald die Datei heruntergeladen ist, unterscheidet sich das Vorgehen je nach Betriebssystem kaum.

  1. 01
    Datei herunterladen
    Laden Sie eine .llamafile-Datei von der GitHub-Seite des Projekts oder von Hugging Face herunter (suchen Sie in der Suchleiste für Modelle nach „llamafile“).
  2. 02
    macOS und Linux: ausführbar machen
    Öffnen Sie ein Terminal im Download-Verzeichnis, machen Sie die Datei mit chmod ausführbar und starten Sie sie anschließend.
  3. 03
    Windows: in .exe umbenennen
    Fügen Sie dem Dateinamen die Endung .exe hinzu und doppelklicken Sie anschließend auf die Datei (oder starten Sie sie über PowerShell).
  4. 04
    Oberfläche öffnen
    Das Programm startet einen lokalen Server und öffnet normalerweise Ihren Browser automatisch. Andernfalls besuchen Sie http://localhost:8080.
Terminal — macOS / Linux
# Rendre le fichier exécutable
chmod +x Llama-3.2-3B-Instruct.Q4_K_M.llamafile

# Lancer : ouvre l'interface web sur http://localhost:8080
./Llama-3.2-3B-Instruct.Q4_K_M.llamafile
PowerShell — Windows
# Renommer pour ajouter l'extension .exe
Rename-Item .\Llama-3.2-3B-Instruct.Q4_K_M.llamafile Llama-3.2-3B.exe

# Lancer
.\Llama-3.2-3B.exe
→
Der Doppelklick
Unter Windows genügt nach dem Umbenennen in .exe und unter macOS/Linux nach dem Setzen des Ausführungsbits ein einfacher Doppelklick im Dateimanager, um die llamafile zu starten. Für die normale Nutzung ist kein Terminal erforderlich.

#Dieselbe Datei unter Windows, Mac und Linux

Das ist das überraschendste Versprechen von llamafile: Die Datei, die Sie unter Linux herunterladen, ist genau dieselbe, die auf einem Mac oder einem Windows-PC läuft. Sie müssen keine „Windows“-, „Mac“- oder „Linux“-Version auswählen. Diese Portabilität beruht auf Cosmopolitan Libc, das eine ausführbare Datei erzeugt, die von mehreren Betriebssystemen gleichermaßen verstanden wird.

In der Praxis bedeutet das, dass dieselbe llamafile-Datei auf einem USB-Stick oder einer Netzwerkfreigabe für ein ganzes Team funktioniert, unabhängig von den jeweiligen Rechnern. Sie verteilen ein Modell, ohne sich um das Betriebssystem jedes Einzelnen kümmern oder jemanden bitten zu müssen, irgendetwas zu installieren.

i
ARM und Apple Silicon
Neuere llamafiles enthalten auch den Code für ARM64. Auf einem Mac M1/M2/M3/M4 nutzt die Inferenz Metal und läuft nativ, ohne Rosetta-Emulation.

#Nützliche Optionen in der Kommandozeile

Die Weboberfläche reicht zum Chatten aus, aber mit einigen Optionen lässt sich das Verhalten anpassen. Diese werden beim Start hinter dem Dateinamen angegeben.

-ngl N
Lagert N Schichten des Modells auf die GPU aus (zum Beispiel -ngl 999, um alles in den VRAM zu laden, sofern dieser ausreicht).
-c N
Legt die Größe des Kontextfensters in Tokens fest (z. B. -c 4096).
--host / --port
Ändert die Adresse und den Port, auf denen der Server lauscht (Standard: localhost:8080).
-m fichier.gguf
Verwendet eine externe Gewichtsdatei anstelle der eingebauten – nützlich, um die Windows-Grenze von 4 GB zu umgehen.
--server --nobrowser
Startet im Servermodus, ohne einen Browser zu öffnen – praktisch für den Headless-Betrieb.
Terminal — Optionen
# Tout charger sur le GPU, contexte 8k, port personnalisé
./Llama-3.2-3B-Instruct.Q4_K_M.llamafile -ngl 999 -c 8192 --port 8090

# Serveur headless avec un GGUF externe (contourne la limite 4 Go)
./llava-v1.5-7b-q4.llamafile --server --nobrowser -m modele.gguf

Der Server bietet außerdem eine OpenAI-kompatible API unter /v1/chat/completions. Sie können daher ein llamafile mit jedem Client verbinden, der das OpenAI-Protokoll unterstützt, indem Sie die Basis-URL einfach auf http://localhost:8080/v1 setzen.

#Eigenes llamafile erstellen

Sie sind nicht auf Dateien beschränkt, die andere vorbereitet haben: Jedes GGUF-Modell lässt sich paketieren. Das Projekt stellt eine zipalign-Binärdatei und eine „leere“ ausführbare Datei bereit, die nur die Inferenz-Engine enthält und der die Gewichtsdatei sowie eine Datei mit Standardargumenten hinzugefügt werden.

  1. 01
    Tools abrufen
    Laden Sie das neueste Release von GitHub herunter: Es enthält die Binärdatei llamafile (nur die Engine) und das Hilfsprogramm zipalign.
  2. 02
    Eine GGUF-Datei haben
    Laden Sie die .gguf-Datei des gewünschten Modells von Hugging Face in der Quantisierung Ihrer Wahl herunter (Q4_K_M ist ein guter Kompromiss).
  3. 03
    Standardargumente schreiben
    Erstellen Sie eine Datei .args, in der die zu verwendenden Optionen beim Start festgelegt werden (Modell, Webinterface usw.).
  4. 04
    Mit zipalign verpacken
    Kopieren Sie die Engine unter einem neuen Namen und fügen Sie anschließend die GGUF-Datei und die .args-Datei mit zipalign hinzu.
  5. 05
    Testen
    Machen Sie das Ergebnis ausführbar und starten Sie es wie jedes andere llamafile.
Terminal – Paketierung
# Fichier d'arguments par défaut
cat > .args <<'EOF'
-m
modele.Q4_K_M.gguf
--host
0.0.0.0
...
EOF

# Copier le moteur, puis y injecter poids + args
cp llamafile mon-modele.llamafile
zipalign -j0 mon-modele.llamafile modele.Q4_K_M.gguf .args

# Tester
chmod +x mon-modele.llamafile
./mon-modele.llamafile
→
Die richtige Quantisierung wählen
Für eine llamafile, die weitergegeben werden soll, bietet Q4_K_M das beste Verhältnis zwischen Größe und Qualität. Verwenden Sie Q5_K_M oder Q8_0 nur in Fällen, in denen die Qualität wichtiger ist als die Dateigröße, und FP16 ausschließlich für die verlustfreie Archivierung.

#Llamafile vs Ollama: zwei Philosophien

Llamafile und Ollama erfüllen denselben Bedarf — ein LLM lokal auszuführen —, verfolgen dabei aber gegensätzliche Ansätze. Ollama installiert einen Daemon, der auf http://localhost:11434 lauscht und eine Bibliothek von Modellen verwaltet, die bei Bedarf heruntergeladen werden. Llamafile verwaltet nichts: Jedes Modell ist eine eigenständige Datei, die Sie direkt starten.

Llamafile oder Ollama, schneller Vergleich
KriteriumLlamafileOllama
Mentales ModellEine Datei = ein Modell, ohne DienstModellmanager mit zentralem Daemon
InstallationKeine, die Datei startet unverändertWird einmal installiert; anschließend werden die Modelle per „pull“ heruntergeladen
VerteilungLässt sich unverändert weitergeben, läuft überallSetzt voraus, dass der Empfänger Ollama installiert
Mehrere ModelleWird schnell schwer, eine Datei pro ModellHervorragend: sofortiger Wechsel per Befehl
Audio (STT)Whisperfile als separates BegleittoolNicht nativ
OpenAI-kompatible APIJaJa
LizenzApache 2.0 (MIT für die übernommenen Bausteine)MIT
Gute Wahl, wennTesten oder verteilen ohne InstallationTägliche Arbeit mit mehreren Modellen

Die Entscheidung lässt sich so zusammenfassen: llamafile ist im Vorteil, wenn Sie gelegentlich testen, ein Modell an Personen ohne technischen Hintergrund weitergeben oder ein Modell in einem festen Stand archivieren möchten. Ollama ist im Vorteil, sobald Sie im Alltag zwischen mehreren Modellen wechseln oder ein LLM in einen dauerhaft genutzten Stack mit einer Oberfläche wie Open WebUI oder LM Studio integrieren.

i
Sie sind keine Konkurrenten
Nichts spricht dagegen, beide zu nutzen: ein llamafile, um einem Kunden auf seinem Laptop ein Modell zu zeigen, und Ollama als dauerhaft laufende Engine auf dem eigenen Arbeitsrechner. Beide basieren übrigens auf llama.cpp.

#Fehlerbehebung

„run-detectors“ oder Startverweigerung (Linux)
Ein zu übereifriges binutils/binfmt kann das polyglotte Format blockieren. Lösung: das APE-Loader-Paket installieren oder mit sh -c "./fichier.llamafile" starten.
Datei zu groß unter Windows
Bei mehr als 4 GB lassen Sie die GGUF-Datei separat und übergeben sie mit -m an eine kleine llamafile-Datei, die nur die Engine enthält.
Keine GPU-Beschleunigung
Prüfen Sie, ob die CUDA-Treiber (NVIDIA) vorhanden sind, und fügen Sie -ngl 999 hinzu. Auf dem Mac wird Metal automatisch verwendet.
Bereits belegter Port
Ein anderer Dienst läuft auf Port 8080: Ändern Sie den Port beispielsweise mit --port 8090.
Langsame Antworten
Bei reinem CPU-Betrieb ist das bei großen Modellen zu erwarten. Wählen Sie eine weniger speicherintensive Quantisierung oder ein kleineres Modell (3B statt 7B).

#Weiterführende Informationen

Llamafile ist eine ideale Einstiegslösung. Für einen umfassenderen und dauerhaften lokalen Einsatz ergänzen diese Anleitungen das Thema.


#FAQ

Ist Llamafile kostenlos?+
Ja. Das Projekt llamafile ist open source unter der Apache 2.0-Lizenz, und die Änderungen an llama.cpp und whisper.cpp bleiben unter der MIT-Lizenz. Sie zahlen nur für Hardware und Strom, die den Modellbetrieb unterstützen, wie bei jedem lokalen Inferenzwerkzeug, das Sie selbst ausführen.
Wer entwickelt llamafile?+
Das Projekt wurde 2023 von Mozilla Builders gestartet und anschließend von Mozilla.ai übernommen und modernisiert. Das offizielle Repository hat deshalb seine GitHub-Adresse geändert: Es befindet sich nun unter der Organisation mozilla-ai statt unter der früheren Organisation Mozilla-Ocho und verwendet seit Version 0.10.0 ein neues Build-System.
Kann Llamafile auch Audio transkribieren?+
Ja, über whisperfile, ein ergänzendes Programm in einer einzigen Datei, das auf whisper.cpp basiert und dieselbe Cosmopolitan-Verpackung verwendet. Es ermöglicht die Transkription und Übersetzung von Audio ohne Installation auf denselben Plattformen wie ein klassisches llamafile für Chats – nach genau demselben Prinzip einer einzigen, eigenständigen Datei zum Herunterladen.
Warum startet mein llamafile unter Windows nicht?+
Die häufigste Ursache ist die für ausführbare Windows-Dateien geltende Grenze von 4 GB: Eine größere llamafile-Datei lässt sich dort nicht unverändert ausführen. Die Lösung besteht darin, die GGUF-Gewichtsdatei separat aufzubewahren und sie mit der Option -m an eine kleinere llamafile-Datei zu übergeben, die „nur die Engine“ enthält.
Muss llama.cpp installiert werden, um llamafile zu verwenden?+
Nein. Llamafile enthält dank Cosmopolitan Libc bereits die kompilierte llama.cpp-Engine direkt in der Datei. Genau das macht das Format eigenständig: Sie müssen keine externen Abhängigkeiten installieren, bevor Sie das Modell starten können, und müssen vorher nicht einmal wissen, dass llama.cpp existiert.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.