Llamafile: Ein vollständiges LLM in einer einzigen Datei ausführbar
Llamafile (Projekt mozilla-ai/llamafile, Lizenz Apache 2.0) bündelt mithilfe von Cosmopolitan Libc ein GGUF-Modell und dessen llama.cpp-Engine in einer einzigen ausführbaren Datei. Sie laden eine Datei herunter, machen sie ausführbar (oder geben ihr unter Windows die Endung .exe), und eine Chatoberfläche öffnet sich unter http://localhost:8080, ohne Installation oder Daemon. Dieselbe Datei läuft unter Windows, macOS, Linux und BSD, wobei unter Windows eine Grenze von 4 GB gilt.
Llamafile ist ein Mozilla-Projekt, das ein vollständiges Sprachmodell und seine Inferenz-Engine in einer einzigen ausführbaren Datei bündelt. Keine Installation, keine Abhängigkeiten, kein Daemon: Sie laden eine Datei herunter, starten sie, und ein LLM läuft auf Ihrem Rechner mit einer Weboberfläche. Dieselbe Datei funktioniert unter Windows, macOS und Linux auf die gleiche Weise. Dieser Leitfaden zeigt, wie Sie ein llamafile starten, was darin steckt und wann es die bessere Wahl als Tools wie Ollama ist.
#Warum llamafile
Die meisten lokalen LLM-Tools erfordern eine Installation, einen Hintergrunddienst und anschließend den Download eines Modells. Llamafile macht all diese Schritte überflüssig: Die Inferenz-Engine und die Modellgewichte befinden sich in einer einzigen Datei. Sie machen sie ausführbar, starten sie, und Ihr Browser öffnet eine Chat-Oberfläche. Das ist der kürzeste Weg von einem Download-Link zu einem Gespräch mit einem lokal ausgeführten Modell.
Dieses Format spielt in drei Situationen seine Stärken aus. Um ein Modell schnell zu testen, ohne das eigene System mit zusätzlichen Installationen zu überladen. Um ein LLM an Kollegen oder Nutzer ohne technische Kenntnisse weiterzugeben: nur eine einzige Datei verschicken, nichts konfigurieren. Und zur Archivierung: Ein llamafile wird auch in Jahren noch funktionieren, ohne von einer zu installierenden Laufzeitumgebung oder einem weiterhin zugänglichen Online-Repository abhängig zu sein.
- Keine Installation erforderlich
- Kein Paket, kein Daemon, keine Umgebungsvariable zu konfigurieren.
- Eine einzige Datei
- Engine und Modell vereint, leicht zu kopieren, zu sichern oder zu teilen.
- Multi-OS
- Das gleiche Binärprogramm läuft unter Windows, macOS, Linux, BSD (x86-64 und ARM64).
- 100 % lokal
- Keine Daten verlassen den Rechner, und nach dem Download ist keine Netzwerkverbindung erforderlich.
#So funktioniert es: das Mozilla-Format
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Llamafile kombiniert zwei Open-Source-Bausteine. Der erste ist llama.cpp, die in C/C++ geschriebene Inferenz-Engine, die Modelle im GGUF-Format sowohl auf der CPU als auch auf der GPU ausführt. Der zweite ist Cosmopolitan Libc, eine von Justine Tunney entwickelte Bibliothek, mit der sich eine „polyglotte“ ausführbare Datei kompilieren lässt: ein und dieselbe Binärdatei, die von mehreren Betriebssystemen erkannt und nativ ausgeführt wird.
Konkret ist eine .llamafile-Datei zugleich ein Programm und ein Archiv. Sie enthält den Code des Inferenzservers und die darin verpackte GGUF-Datei mit den Modellgewichten. Beim Start erkennt das Programm das Betriebssystem und die Architektur, lädt das Modell aus der eigenen Datei und startet anschließend einen lokalen HTTP-Server mit einer Weboberfläche zum Chatten.
Das llamafile-Projekt selbst steht unter der Apache-2.0-Lizenz; die für das Projekt vorgenommenen Änderungen an llama.cpp und whisper.cpp bleiben wie die ursprünglichen Projekte unter der MIT-Lizenz, damit sie kompatibel bleiben und wieder in die Ursprungsprojekte übernommen werden können. Seit Version 0.10.0 verwendet llamafile ein neues Build-System, das an neuere Versionen von llama.cpp angelehnt ist und die Unterstützung für neuere Modelle und Funktionen erweitert; ältere Versionen bleiben für diejenigen verfügbar, die die „klassische“ Nutzungserfahrung bevorzugen.
Das Projekt umfasst auch whisperfile, ein ergänzendes Tool in einer einzigen Datei, das auf whisper.cpp basiert und dieselbe Cosmopolitan-Paketierung nutzt. Es dient der Audiotranskription und -übersetzung, benötigt keine Installation und läuft auf denselben Plattformen wie ein klassisches llamafile.
#Voraussetzungen
Die Anforderungen sind bewusst minimal gehalten. Entscheidend ist, genügend Speicher für das gewählte Modell zu haben, da die Dateigröße und der benötigte Arbeitsspeicher direkt von der Quantisierung abhängen.
- OS
- Windows 10+, macOS 11+, eine neuere Linux-Version oder BSD. x86-64 oder ARM64 (einschließlich Apple Silicon).
- RAM
- Grob mit der Dateigröße plus einer Reserve rechnen. Ein 7B-Modell in Q4 (~5 GB) läuft mit 8 bis 16 GB problemlos.
- GPU (optional)
- Beschleunigung möglich über NVIDIA (CUDA) oder Apple Metal. Ohne GPU erfolgt die Inferenz auf CPU, langsamer, aber funktional.
- Festplattenspeicher
- Von etwa 500 MB für ein kleines Modell bis zu mehreren Dutzend GB für ein großes, nicht quantisiertes Modell.
#In wenigen Sekunden herunterladen und starten
Das offizielle Repository mozilla-ai/llamafile auf GitHub listet einsatzbereite llamafiles auf, und Hugging Face hostet zahlreiche weitere. Das ursprünglich von Mozilla Builders gestartete Projekt wird heute von Mozilla.ai weitergeführt und gepflegt. Sobald die Datei heruntergeladen ist, unterscheidet sich das Vorgehen je nach Betriebssystem kaum.
- 01Datei herunterladenLaden Sie eine .llamafile-Datei von der GitHub-Seite des Projekts oder von Hugging Face herunter (suchen Sie in der Suchleiste für Modelle nach „llamafile“).
- 02macOS und Linux: ausführbar machenÖffnen Sie ein Terminal im Download-Verzeichnis, machen Sie die Datei mit chmod ausführbar und starten Sie sie anschließend.
- 03Windows: in .exe umbenennenFügen Sie dem Dateinamen die Endung .exe hinzu und doppelklicken Sie anschließend auf die Datei (oder starten Sie sie über PowerShell).
- 04Oberfläche öffnenDas Programm startet einen lokalen Server und öffnet normalerweise Ihren Browser automatisch. Andernfalls besuchen Sie http://localhost:8080.
#Dieselbe Datei unter Windows, Mac und Linux
Das ist das überraschendste Versprechen von llamafile: Die Datei, die Sie unter Linux herunterladen, ist genau dieselbe, die auf einem Mac oder einem Windows-PC läuft. Sie müssen keine „Windows“-, „Mac“- oder „Linux“-Version auswählen. Diese Portabilität beruht auf Cosmopolitan Libc, das eine ausführbare Datei erzeugt, die von mehreren Betriebssystemen gleichermaßen verstanden wird.
In der Praxis bedeutet das, dass dieselbe llamafile-Datei auf einem USB-Stick oder einer Netzwerkfreigabe für ein ganzes Team funktioniert, unabhängig von den jeweiligen Rechnern. Sie verteilen ein Modell, ohne sich um das Betriebssystem jedes Einzelnen kümmern oder jemanden bitten zu müssen, irgendetwas zu installieren.
#Nützliche Optionen in der Kommandozeile
Die Weboberfläche reicht zum Chatten aus, aber mit einigen Optionen lässt sich das Verhalten anpassen. Diese werden beim Start hinter dem Dateinamen angegeben.
- -ngl N
- Lagert N Schichten des Modells auf die GPU aus (zum Beispiel -ngl 999, um alles in den VRAM zu laden, sofern dieser ausreicht).
- -c N
- Legt die Größe des Kontextfensters in Tokens fest (z. B. -c 4096).
- --host / --port
- Ändert die Adresse und den Port, auf denen der Server lauscht (Standard: localhost:8080).
- -m fichier.gguf
- Verwendet eine externe Gewichtsdatei anstelle der eingebauten – nützlich, um die Windows-Grenze von 4 GB zu umgehen.
- --server --nobrowser
- Startet im Servermodus, ohne einen Browser zu öffnen – praktisch für den Headless-Betrieb.
Der Server bietet außerdem eine OpenAI-kompatible API unter /v1/chat/completions. Sie können daher ein llamafile mit jedem Client verbinden, der das OpenAI-Protokoll unterstützt, indem Sie die Basis-URL einfach auf http://localhost:8080/v1 setzen.
#Eigenes llamafile erstellen
Sie sind nicht auf Dateien beschränkt, die andere vorbereitet haben: Jedes GGUF-Modell lässt sich paketieren. Das Projekt stellt eine zipalign-Binärdatei und eine „leere“ ausführbare Datei bereit, die nur die Inferenz-Engine enthält und der die Gewichtsdatei sowie eine Datei mit Standardargumenten hinzugefügt werden.
- 01Tools abrufenLaden Sie das neueste Release von GitHub herunter: Es enthält die Binärdatei llamafile (nur die Engine) und das Hilfsprogramm zipalign.
- 02Eine GGUF-Datei habenLaden Sie die .gguf-Datei des gewünschten Modells von Hugging Face in der Quantisierung Ihrer Wahl herunter (Q4_K_M ist ein guter Kompromiss).
- 03Standardargumente schreibenErstellen Sie eine Datei .args, in der die zu verwendenden Optionen beim Start festgelegt werden (Modell, Webinterface usw.).
- 04Mit zipalign verpackenKopieren Sie die Engine unter einem neuen Namen und fügen Sie anschließend die GGUF-Datei und die .args-Datei mit zipalign hinzu.
- 05TestenMachen Sie das Ergebnis ausführbar und starten Sie es wie jedes andere llamafile.
#Llamafile vs Ollama: zwei Philosophien
Llamafile und Ollama erfüllen denselben Bedarf — ein LLM lokal auszuführen —, verfolgen dabei aber gegensätzliche Ansätze. Ollama installiert einen Daemon, der auf http://localhost:11434 lauscht und eine Bibliothek von Modellen verwaltet, die bei Bedarf heruntergeladen werden. Llamafile verwaltet nichts: Jedes Modell ist eine eigenständige Datei, die Sie direkt starten.
| Kriterium | Llamafile | Ollama |
|---|---|---|
| Mentales Modell | Eine Datei = ein Modell, ohne Dienst | Modellmanager mit zentralem Daemon |
| Installation | Keine, die Datei startet unverändert | Wird einmal installiert; anschließend werden die Modelle per „pull“ heruntergeladen |
| Verteilung | Lässt sich unverändert weitergeben, läuft überall | Setzt voraus, dass der Empfänger Ollama installiert |
| Mehrere Modelle | Wird schnell schwer, eine Datei pro Modell | Hervorragend: sofortiger Wechsel per Befehl |
| Audio (STT) | Whisperfile als separates Begleittool | Nicht nativ |
| OpenAI-kompatible API | Ja | Ja |
| Lizenz | Apache 2.0 (MIT für die übernommenen Bausteine) | MIT |
| Gute Wahl, wenn | Testen oder verteilen ohne Installation | Tägliche Arbeit mit mehreren Modellen |
Die Entscheidung lässt sich so zusammenfassen: llamafile ist im Vorteil, wenn Sie gelegentlich testen, ein Modell an Personen ohne technischen Hintergrund weitergeben oder ein Modell in einem festen Stand archivieren möchten. Ollama ist im Vorteil, sobald Sie im Alltag zwischen mehreren Modellen wechseln oder ein LLM in einen dauerhaft genutzten Stack mit einer Oberfläche wie Open WebUI oder LM Studio integrieren.
#Fehlerbehebung
- „run-detectors“ oder Startverweigerung (Linux)
- Ein zu übereifriges binutils/binfmt kann das polyglotte Format blockieren. Lösung: das APE-Loader-Paket installieren oder mit sh -c "./fichier.llamafile" starten.
- Datei zu groß unter Windows
- Bei mehr als 4 GB lassen Sie die GGUF-Datei separat und übergeben sie mit -m an eine kleine llamafile-Datei, die nur die Engine enthält.
- Keine GPU-Beschleunigung
- Prüfen Sie, ob die CUDA-Treiber (NVIDIA) vorhanden sind, und fügen Sie -ngl 999 hinzu. Auf dem Mac wird Metal automatisch verwendet.
- Bereits belegter Port
- Ein anderer Dienst läuft auf Port 8080: Ändern Sie den Port beispielsweise mit --port 8090.
- Langsame Antworten
- Bei reinem CPU-Betrieb ist das bei großen Modellen zu erwarten. Wählen Sie eine weniger speicherintensive Quantisierung oder ein kleineres Modell (3B statt 7B).
#Weiterführende Informationen
Llamafile ist eine ideale Einstiegslösung. Für einen umfassenderen und dauerhaften lokalen Einsatz ergänzen diese Anleitungen das Thema.
- Ein LLM lokal installieren: Schritt-für-Schritt-Anleitung
- Ollama vs llama.cpp: Welches wählen?
- Alternativen zu Ollama: ein Überblick
- Ollama in 5 Minuten installieren
- Quelle: GitHub-Repository von llamafile
- Quelle: offizielle llamafile-Dokumentation
- Quelle: ursprüngliche Ankündigung von llamafile
#FAQ
Ist Llamafile kostenlos?+
Wer entwickelt llamafile?+
Kann Llamafile auch Audio transkribieren?+
Warum startet mein llamafile unter Windows nicht?+
Muss llama.cpp installiert werden, um llamafile zu verwenden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.