Einsteiger 10 Min.Mobil

LLM lokal auf Android: PocketPal, MLC Chat (2026)

Ein lokales LLM auf Android ist ein Assistent, der offline, ohne Cloud und direkt auf dem Prozessor Ihres Telefons antwortet. Quantisierte Modelle mit 1 bis 4 Milliarden Parametern passen heute in den Arbeitsspeicher eines Mittelklasse-Smartphones und antworten mit einer brauchbaren Geschwindigkeit. Dieser Leitfaden behandelt drei Ansätze – PocketPal und MLC Chat für den Einstieg ohne Kommandozeile sowie llama.cpp über Termux für weitergehende Möglichkeiten – und berücksichtigt dabei die tatsächlichen Einschränkungen bei Geschwindigkeit, Wärmeentwicklung und Akkulaufzeit.

Von Léa B.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein LLM lokal auf Android betreiben

Ein lokales LLM auf Android auszuführen erfüllt drei konkrete Bedürfnisse: vollständige Vertraulichkeit (Ihre Prompts verlassen das Gerät nie), Offline-Betrieb (im Flugzeug, im Funkloch, bei teurem Roaming) und kostenlose Nutzung (kein Abonnement und keine Abrechnung pro Token). Der Kompromiss liegt in der Modellgröße: Auf einem Smartphone laufen deutlich kleinere und damit weniger leistungsfähige Modelle als auf einem PC. Für Zusammenfassungen, Umformulierungen, Übersetzungen oder ein einfaches Gespräch reicht ein 3B-Modell jedoch völlig aus.

Datenschutz
Das Modell läuft auf dem SoC des Telefons. Es werden keine Daten über das Internet gesendet. Das lässt sich überprüfen, indem Sie WLAN und mobile Daten ausschalten.
Offline
Nach dem Download des Modells funktioniert alles im Flugmodus. Praktisch unterwegs oder in Gebieten ohne Netzabdeckung.
Kostenlose Nutzung
Kein Konto, kein Kontingent, keine Kosten pro Token. Sie zahlen nur mit der verbrauchten Akkuladung.
Eine wichtige Einschränkung
Bei einem Smartphone liegt die praktische Obergrenze bei etwa 4 Milliarden Parametern. Für komplexes Schlussfolgern oder Programmieren bleibt ein lokales LLM auf dem PC deutlich überlegen.
i
Lokal auf dem Smartphone ≠ lokal auf dem PC
Vergleichen Sie ein 3B-Modell auf einem Mobilgerät nicht mit GPT-4. Vergleichen Sie es mit dem, was ein Offline-Assistent leisten kann: eine Nachricht umformulieren, einen eingefügten Text zusammenfassen, eine Frage zum Allgemeinwissen beantworten. In diesem Rahmen ist das beeindruckend. Darüber hinaus zeigt es schnell seine Grenzen.

#Welche Anforderungen das Smartphone erfüllen muss

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Der entscheidende Faktor ist der Arbeitsspeicher (RAM), genauso wie auf dem PC der Grafikspeicher (VRAM) die Modellgröße begrenzt. Ein mit Q4 quantisiertes 3B-Modell belegt etwa 2 GB; hinzu kommt der Speicherbedarf des Systems und der Anwendung. In der Praxis braucht man Spielraum, da Android Anwendungen, die zu viel Speicher verbrauchen, konsequent schließt.

RAM 6 GB
Das gerade noch ausreichende Minimum. Modelle von 1B bis 3B in Q4. Schließen Sie die anderen Anwendungen, bevor Sie eine Inferenz starten.
RAM 8 GB
Für 3B-Modelle ausreichend bemessen, auch 4B-Modelle sind möglich. Der Sweet Spot für aktuelle Mittelklassegeräte.
RAM von 12 GB und mehr
Aktuelle Flaggschiff-Smartphones. Damit laufen 4B-Modelle problemlos, sogar stark quantisierte 7B-Modelle sind möglich, allerdings langsam.
Speicher
Planen Sie pro heruntergeladenem Modell 2 bis 5 GB freien Speicherplatz ein. GGUF-Dateien sind groß.
SoC
Ein Snapdragon der 8er-Serie oder ein vergleichbarer neuerer Chip beschleunigt die Verarbeitung deutlich. Einsteigerchips funktionieren, bleiben aber langsam.
→
Prüfen Sie Ihren tatsächlich verfügbaren Arbeitsspeicher
Der angegebene Arbeitsspeicher steht nicht vollständig zur Verfügung: Das System reserviert einen Teil davon. Rechnen Sie bei einem Smartphone mit 8 GB mit 5 bis 6 GB, die einer Anwendung tatsächlich zugewiesen werden können. Das ist der verfügbare Spielraum zum Laden eines Modells.

#PocketPal: Ein lokaler LLM in 5 Minuten

PocketPal AI ist die einfachste App für den Einstieg. Das Open-Source-Projekt ist im Play Store erhältlich und bringt llama.cpp sowie einen Katalog von Modellen mit, die sich direkt von Hugging Face herunterladen lassen – ganz ohne Kommandozeile.

  1. 01
    Die Anwendung installieren
    Suchen Sie im Google Play Store nach „PocketPal AI“ und installieren Sie die App. Sie ist kostenlos und Open Source (Quellcode auf GitHub verfügbar).
  2. 02
    Modellkatalog öffnen
    Sehen Sie sich im Tab Models die Liste der empfohlenen Modelle an. PocketPal zeigt die Dateigröße an und kennzeichnet die Modelle, die zu Ihrem verfügbaren RAM passen.
  3. 03
    Ein Modell mit 1 bis 4 Milliarden Parametern herunterladen
    Wählen Sie für den Einstieg ein kleines Modell, beispielsweise Qwen 3.5 2B (~1,9 GB) oder Granite 4.2 3B (~2,2 GB) mit Q4-Quantisierung. Der Download erfolgt über das Netzwerk und ist nur einmal nötig.
  4. 04
    Laden und chatten
    Tippen Sie neben dem heruntergeladenen Modell auf „Load“, warten Sie, bis es in den Speicher geladen ist, und öffnen Sie dann den Chat. Die erste Antwort beginnt nach einigen Sekunden Aufwärmzeit.

Mit PocketPal können Sie außerdem die Inferenzparameter (Temperatur, Kontextgröße, Anzahl der CPU-Threads) einstellen und Ihre eigenen GGUF-Dateien importieren, wenn Sie ein Modell verwenden möchten, das nicht im Katalog enthalten ist. Für Ihre ersten Erfahrungen mit einem lokalen LLM auf Android ist das der kürzeste Weg.

→
Trennen Sie zum Testen die Netzwerkverbindung.
Sobald das Modell geladen ist, aktivieren Sie den Flugmodus und starten Sie ein Gespräch. Es funktioniert: ein konkreter Beweis dafür, dass die Inferenz zu 100 % lokal erfolgt, ohne jegliche Netzwerkaufrufe.

#MLC Chat und die GPU-Beschleunigung

MLC Chat ist die Demo-Anwendung des Projekts MLC LLM, das Modelle kompiliert, um die mobile GPU über die Vulkan-/OpenCL-API zu nutzen, statt alles auf der CPU auszuführen. Auf einem aktuellen SoC kann dies die Geschwindigkeit verbessern und den Energieverbrauch gegenüber einer reinen CPU-Ausführung etwas senken.

  1. 01
    APK abrufen
    MLC Chat ist nicht immer im Play Store verfügbar. Laden Sie die offizielle APK von der Website des Projekts MLC LLM (llm.mlc.ai) herunter und erlauben Sie die Installation aus einer externen Quelle.
  2. 02
    Ein kompiliertes Modell herunterladen
    Die App bietet Modelle an, die bereits ins MLC-Format konvertiert wurden (Gemma, Qwen, Granite in kleinen Varianten). Wählen Sie eines aus, das zum verfügbaren Arbeitsspeicher passt.
  3. 03
    Den Chat starten
    Wählen Sie das Modell aus, warten Sie auf die Initialisierung und beginnen Sie dann zu chatten. MLC zeigt unten auf dem Bildschirm die Geschwindigkeit in Tokens pro Sekunde an.
i
Mobile GPU: Ein Geschwindigkeitsvorteil ist nicht garantiert
Die GPU-Beschleunigung hängt stark vom SoC und den Treibern ab. Auf manchen Smartphones ist MLC schneller als llama.cpp auf der CPU, auf anderen ist es wegen der Wärmeentwicklung und der Drosselung umgekehrt. Testen Sie beide auf Ihrem Gerät, bevor Sie eine Schlussfolgerung ziehen.

#llama.cpp über Termux für weitergehende Möglichkeiten

Für vollständige Kontrolle – das Modell und die Quantisierung genau auswählen, einen lokalen Server bereitstellen – führt der Weg für Fortgeschrittene über Termux, einen Android-Terminalemulator, der ohne Root-Zugriff Zugang zu einer Linux-Umgebung bietet. Dort kompiliert man llama.cpp und startet die Inferenz über die Kommandozeile, wie auf einem Linux-PC.

!
Installieren Sie Termux über F-Droid, nicht über den Play Store
Die Version aus dem Play Store ist veraltet und wird nicht mehr gepflegt. Installieren Sie Termux über F-Droid oder GitHub, um aktuelle Pakete zu erhalten. Das ist die häufigste Fehlerquelle bei Anfängern.
  1. 01
    Termux installieren und vorbereiten
    Installieren Sie Termux über F-Droid, öffnen Sie es und aktualisieren Sie die Basispakete.
  2. 02
    Die Build-Tools installieren
    Holen Sie sich den Compiler, git und cmake, die erforderlich sind, um llama.cpp zu kompilieren.
  3. 03
    llama.cpp kompilieren
    Klonen Sie das offizielle Repository und kompilieren Sie es. Auf Mobilgeräten ist der CPU-Build (ARM NEON) am zuverlässigsten.
  4. 04
    Ein GGUF-Modell herunterladen
    Laden Sie mit curl oder wget eine kleine .gguf-Datei (1–3B in Q4) von Hugging Face herunter.
  5. 05
    Inferenz starten
    Verwenden Sie llama-cli zum Chatten oder llama-server, um auf localhost eine OpenAI-kompatible API bereitzustellen, die über einen Browser zugänglich ist.
Termux – Vorbereitung
# Mettre à jour les paquets
pkg update && pkg upgrade -y

# Outils de compilation
pkg install -y git cmake clang wget
Termux – llama.cpp kompilieren
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
Termux — ein Modell herunterladen und chatten
# Exemple : un petit modèle Q4 depuis Hugging Face
wget -O qwen3.5-2b-q4.gguf "<URL_DU_FICHIER_GGUF>"

# Discuter en ligne de commande
./build/bin/llama-cli -m qwen3.5-2b-q4.gguf -p "Résume ce texte : ..." -n 256
Termux — lokaler OpenAI-kompatibler Server
# Expose une API sur http://localhost:8080
./build/bin/llama-server -m qwen3.5-2b-q4.gguf --port 8080

Der Servermodus ist interessant: Er stellt auf localhost einen OpenAI-kompatiblen Endpunkt bereit, den Sie über den Browser Ihres Telefons oder eine andere App abfragen können. Das ist dasselbe Prinzip wie beim Ollama-Server auf dem PC (der standardmäßig auf Port 11434 lauscht), nur im Taschenformat.

#Welche Modelle mit 1 bis 4 Milliarden Parametern tatsächlich laufen

Alles spielt sich im Bereich von 1 bis 4 Milliarden Parametern mit Q4_K_M-Quantisierung ab (der beste Kompromiss zwischen Qualität und Größe, wie auf dem PC). Oberhalb von 4B wird ein Smartphone langsam oder hat nicht genug RAM. Hier sind die Modellfamilien, die auf Französisch die besten Ergebnisse liefern.

Qwen 3.5 2B
Das kleine Standardmodell für 2026 (~1,9 GB in Q4). Hervorragend für mehrsprachige Aufgaben und Französisch, erweitertes Kontextfenster, Lizenz Apache 2.0. Der beste Ausgangspunkt für hohe Geschwindigkeit auf einem Smartphone mit 6 GB.
Qwen 3.5 4B
Qualitätssteigerung (~3,4 GB in Q4) ohne den mobilen Bereich zu verlassen. Konsistent und leistungsfähig in Q4, wenn Ihr Smartphone mindestens 8 GB RAM hat. Apache 2.0.
Granite 4.2 3B
Das kleine IBM-Modell (~2,2 GB in Q4), sehr speichersparend und token-effizient. Ein solides Offline-Allzweckmodell, wenn der Arbeitsspeicher knapp ist. Apache 2.0.
Gemma 4 E2B
Die kompakte Variante von Google (~4,3 GB), multimodal und seit April 2026 wieder unter der Apache-2.0-Lizenz. Nur auf Smartphones mit mindestens 8 GB verwenden.
→
Speicherbedarf in Q4
Als Orientierung: Ein 1B-Modell passt bei Q4 in etwa 1 GB, ein 3B-Modell in etwa 2 GB und ein 4B-Modell in etwa 3 GB. Rechnen Sie den Speicherbedarf des Systems und der App hinzu: Deshalb kommen für ein Smartphone mit 8 GB Modelle mit 3–4B infrage, aber keine größeren.

#Geschwindigkeit, Hitze und Akku: was man wissen muss

Die LLM-Inferenz lastet die CPU (oder GPU) voll aus. Das hat auf einem Smartphone drei ganz konkrete Folgen: Die Geschwindigkeit bleibt mäßig, das Gerät wird warm, und während der Generierung entlädt sich der Akku schnell. Das verhindert die Nutzung nicht, aber man sollte die Größenordnungen im Hinterkopf behalten.

Geschwindigkeit
Rechnen Sie grob mit 5 bis 15 Tokens pro Sekunde für ein 3B-Modell in Q4 auf einem SoC der mittleren bis oberen Leistungsklasse. Das lässt sich in Echtzeit mitlesen, bleibt aber weit hinter einer PC-GPU zurück. Ein 1B-Modell ist deutlich schneller.
Wärmeentwicklung und thermische Drosselung
Nach einer langen Generierung wird der SoC heißer und drosselt seine Leistung (Throttling), wodurch die nachfolgenden Antworten langsamer werden. Legen Sie zwischen zwei langen Anfragen eine Pause ein.
Akku
Eine intensive Sitzung kann den Akkustand innerhalb weniger Minuten um mehrere Prozent senken. Bei gelegentlicher Nutzung fällt das kaum ins Gewicht; bei intensiver Nutzung schließen Sie das Ladegerät an.
Kontext
Je größer das Kontextfenster ist, desto höher sind der Speicherbedarf und die Verarbeitungszeit. Halten Sie auf Mobilgeräten das Kontextfenster in einem vernünftigen Rahmen (2k–4k Tokens), damit die Nutzung flüssig bleibt.
!
Verwenden Sie keine Schnellladefunktion
Ein LLM auszuführen und gleichzeitig per Schnellladung aufzuladen, kombiniert zwei Wärmequellen. Auf Dauer verschleißt die wiederholte Erwärmung den Akku. Laden Sie bei intensiver Nutzung lieber langsam oder legen Sie Pausen ein.

#Fehlerbehebung

Die App schließt sich beim Laden des Modells
Zu wenig RAM. Schließen Sie alle anderen Anwendungen, wählen Sie ein kleineres Modell (1B statt 3B) oder eine speichersparendere Quantisierung.
Sehr langsame Antworten
Verringern Sie den Kontextumfang, reduzieren Sie die Anzahl der generierten Tokens oder wechseln Sie zu einem kleineren Modell. Prüfen Sie außerdem, ob das Telefon seine Leistung wegen Überhitzung drosselt.
Termux: Befehl nach der Kompilierung nicht gefunden
Der Build ist unbemerkt fehlgeschlagen. Starten Sie die Kompilierung erneut und lesen Sie die Fehlermeldungen. Prüfen Sie, ob git, cmake und clang installiert sind.
Termux nicht mehr gepflegt / veraltete Pakete
Sie haben die Play Store-Version installiert. Deinstallieren Sie diese und installieren Sie Termux erneut über F-Droid oder GitHub.
Inkonsistente Antworten
Normal für ein sehr kleines Modell bei einer komplexen Aufgabe. Vereinfachen Sie die Anfrage oder akzeptieren Sie, dass ein 1-3B-Modell Grenzen im Denken hat.

#Weiterführende Informationen

Sobald Sie mit der Nutzung auf dem Mobilgerät vertraut sind, möchten Sie wahrscheinlich einen leistungsfähigeren Rechner zu Hause für anspruchsvolle Aufgaben. Diese Leitfäden der Website führen den vorliegenden Leitfaden weiter:

Ein LLM lokal ohne GPU ausführen (nur CPU)
Die gleiche Logik wie auf Mobilgeräten, aber auf dem PC: Empfohlene Modelle je nach RAM und Tipps, um die Leistung im reinen CPU-Modus zu steigern.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Verstehen, warum Q4_K_M sowohl auf dem Smartphone als auch auf dem PC der empfohlene Kompromiss ist.
Ollama installieren
Für einen echten LLM-Server zu Hause, der von Ihrem Smartphone über das lokale Netzwerk abgefragt werden kann.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.