LLM lokal auf Android: PocketPal, MLC Chat (2026)
Ein lokales LLM auf Android ist ein Assistent, der offline, ohne Cloud und direkt auf dem Prozessor Ihres Telefons antwortet. Quantisierte Modelle mit 1 bis 4 Milliarden Parametern passen heute in den Arbeitsspeicher eines Mittelklasse-Smartphones und antworten mit einer brauchbaren Geschwindigkeit. Dieser Leitfaden behandelt drei Ansätze – PocketPal und MLC Chat für den Einstieg ohne Kommandozeile sowie llama.cpp über Termux für weitergehende Möglichkeiten – und berücksichtigt dabei die tatsächlichen Einschränkungen bei Geschwindigkeit, Wärmeentwicklung und Akkulaufzeit.
#Warum ein LLM lokal auf Android betreiben
Ein lokales LLM auf Android auszuführen erfüllt drei konkrete Bedürfnisse: vollständige Vertraulichkeit (Ihre Prompts verlassen das Gerät nie), Offline-Betrieb (im Flugzeug, im Funkloch, bei teurem Roaming) und kostenlose Nutzung (kein Abonnement und keine Abrechnung pro Token). Der Kompromiss liegt in der Modellgröße: Auf einem Smartphone laufen deutlich kleinere und damit weniger leistungsfähige Modelle als auf einem PC. Für Zusammenfassungen, Umformulierungen, Übersetzungen oder ein einfaches Gespräch reicht ein 3B-Modell jedoch völlig aus.
- Datenschutz
- Das Modell läuft auf dem SoC des Telefons. Es werden keine Daten über das Internet gesendet. Das lässt sich überprüfen, indem Sie WLAN und mobile Daten ausschalten.
- Offline
- Nach dem Download des Modells funktioniert alles im Flugmodus. Praktisch unterwegs oder in Gebieten ohne Netzabdeckung.
- Kostenlose Nutzung
- Kein Konto, kein Kontingent, keine Kosten pro Token. Sie zahlen nur mit der verbrauchten Akkuladung.
- Eine wichtige Einschränkung
- Bei einem Smartphone liegt die praktische Obergrenze bei etwa 4 Milliarden Parametern. Für komplexes Schlussfolgern oder Programmieren bleibt ein lokales LLM auf dem PC deutlich überlegen.
#Welche Anforderungen das Smartphone erfüllen muss
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Der entscheidende Faktor ist der Arbeitsspeicher (RAM), genauso wie auf dem PC der Grafikspeicher (VRAM) die Modellgröße begrenzt. Ein mit Q4 quantisiertes 3B-Modell belegt etwa 2 GB; hinzu kommt der Speicherbedarf des Systems und der Anwendung. In der Praxis braucht man Spielraum, da Android Anwendungen, die zu viel Speicher verbrauchen, konsequent schließt.
- RAM 6 GB
- Das gerade noch ausreichende Minimum. Modelle von 1B bis 3B in Q4. Schließen Sie die anderen Anwendungen, bevor Sie eine Inferenz starten.
- RAM 8 GB
- Für 3B-Modelle ausreichend bemessen, auch 4B-Modelle sind möglich. Der Sweet Spot für aktuelle Mittelklassegeräte.
- RAM von 12 GB und mehr
- Aktuelle Flaggschiff-Smartphones. Damit laufen 4B-Modelle problemlos, sogar stark quantisierte 7B-Modelle sind möglich, allerdings langsam.
- Speicher
- Planen Sie pro heruntergeladenem Modell 2 bis 5 GB freien Speicherplatz ein. GGUF-Dateien sind groß.
- SoC
- Ein Snapdragon der 8er-Serie oder ein vergleichbarer neuerer Chip beschleunigt die Verarbeitung deutlich. Einsteigerchips funktionieren, bleiben aber langsam.
#PocketPal: Ein lokaler LLM in 5 Minuten
PocketPal AI ist die einfachste App für den Einstieg. Das Open-Source-Projekt ist im Play Store erhältlich und bringt llama.cpp sowie einen Katalog von Modellen mit, die sich direkt von Hugging Face herunterladen lassen – ganz ohne Kommandozeile.
- 01Die Anwendung installierenSuchen Sie im Google Play Store nach „PocketPal AI“ und installieren Sie die App. Sie ist kostenlos und Open Source (Quellcode auf GitHub verfügbar).
- 02Modellkatalog öffnenSehen Sie sich im Tab Models die Liste der empfohlenen Modelle an. PocketPal zeigt die Dateigröße an und kennzeichnet die Modelle, die zu Ihrem verfügbaren RAM passen.
- 03Ein Modell mit 1 bis 4 Milliarden Parametern herunterladenWählen Sie für den Einstieg ein kleines Modell, beispielsweise Qwen 3.5 2B (~1,9 GB) oder Granite 4.2 3B (~2,2 GB) mit Q4-Quantisierung. Der Download erfolgt über das Netzwerk und ist nur einmal nötig.
- 04Laden und chattenTippen Sie neben dem heruntergeladenen Modell auf „Load“, warten Sie, bis es in den Speicher geladen ist, und öffnen Sie dann den Chat. Die erste Antwort beginnt nach einigen Sekunden Aufwärmzeit.
Mit PocketPal können Sie außerdem die Inferenzparameter (Temperatur, Kontextgröße, Anzahl der CPU-Threads) einstellen und Ihre eigenen GGUF-Dateien importieren, wenn Sie ein Modell verwenden möchten, das nicht im Katalog enthalten ist. Für Ihre ersten Erfahrungen mit einem lokalen LLM auf Android ist das der kürzeste Weg.
#MLC Chat und die GPU-Beschleunigung
MLC Chat ist die Demo-Anwendung des Projekts MLC LLM, das Modelle kompiliert, um die mobile GPU über die Vulkan-/OpenCL-API zu nutzen, statt alles auf der CPU auszuführen. Auf einem aktuellen SoC kann dies die Geschwindigkeit verbessern und den Energieverbrauch gegenüber einer reinen CPU-Ausführung etwas senken.
- 01APK abrufenMLC Chat ist nicht immer im Play Store verfügbar. Laden Sie die offizielle APK von der Website des Projekts MLC LLM (llm.mlc.ai) herunter und erlauben Sie die Installation aus einer externen Quelle.
- 02Ein kompiliertes Modell herunterladenDie App bietet Modelle an, die bereits ins MLC-Format konvertiert wurden (Gemma, Qwen, Granite in kleinen Varianten). Wählen Sie eines aus, das zum verfügbaren Arbeitsspeicher passt.
- 03Den Chat startenWählen Sie das Modell aus, warten Sie auf die Initialisierung und beginnen Sie dann zu chatten. MLC zeigt unten auf dem Bildschirm die Geschwindigkeit in Tokens pro Sekunde an.
#llama.cpp über Termux für weitergehende Möglichkeiten
Für vollständige Kontrolle – das Modell und die Quantisierung genau auswählen, einen lokalen Server bereitstellen – führt der Weg für Fortgeschrittene über Termux, einen Android-Terminalemulator, der ohne Root-Zugriff Zugang zu einer Linux-Umgebung bietet. Dort kompiliert man llama.cpp und startet die Inferenz über die Kommandozeile, wie auf einem Linux-PC.
- 01Termux installieren und vorbereitenInstallieren Sie Termux über F-Droid, öffnen Sie es und aktualisieren Sie die Basispakete.
- 02Die Build-Tools installierenHolen Sie sich den Compiler, git und cmake, die erforderlich sind, um llama.cpp zu kompilieren.
- 03llama.cpp kompilierenKlonen Sie das offizielle Repository und kompilieren Sie es. Auf Mobilgeräten ist der CPU-Build (ARM NEON) am zuverlässigsten.
- 04Ein GGUF-Modell herunterladenLaden Sie mit curl oder wget eine kleine .gguf-Datei (1–3B in Q4) von Hugging Face herunter.
- 05Inferenz startenVerwenden Sie llama-cli zum Chatten oder llama-server, um auf localhost eine OpenAI-kompatible API bereitzustellen, die über einen Browser zugänglich ist.
Der Servermodus ist interessant: Er stellt auf localhost einen OpenAI-kompatiblen Endpunkt bereit, den Sie über den Browser Ihres Telefons oder eine andere App abfragen können. Das ist dasselbe Prinzip wie beim Ollama-Server auf dem PC (der standardmäßig auf Port 11434 lauscht), nur im Taschenformat.
#Welche Modelle mit 1 bis 4 Milliarden Parametern tatsächlich laufen
Alles spielt sich im Bereich von 1 bis 4 Milliarden Parametern mit Q4_K_M-Quantisierung ab (der beste Kompromiss zwischen Qualität und Größe, wie auf dem PC). Oberhalb von 4B wird ein Smartphone langsam oder hat nicht genug RAM. Hier sind die Modellfamilien, die auf Französisch die besten Ergebnisse liefern.
- Qwen 3.5 2B
- Das kleine Standardmodell für 2026 (~1,9 GB in Q4). Hervorragend für mehrsprachige Aufgaben und Französisch, erweitertes Kontextfenster, Lizenz Apache 2.0. Der beste Ausgangspunkt für hohe Geschwindigkeit auf einem Smartphone mit 6 GB.
- Qwen 3.5 4B
- Qualitätssteigerung (~3,4 GB in Q4) ohne den mobilen Bereich zu verlassen. Konsistent und leistungsfähig in Q4, wenn Ihr Smartphone mindestens 8 GB RAM hat. Apache 2.0.
- Granite 4.2 3B
- Das kleine IBM-Modell (~2,2 GB in Q4), sehr speichersparend und token-effizient. Ein solides Offline-Allzweckmodell, wenn der Arbeitsspeicher knapp ist. Apache 2.0.
- Gemma 4 E2B
- Die kompakte Variante von Google (~4,3 GB), multimodal und seit April 2026 wieder unter der Apache-2.0-Lizenz. Nur auf Smartphones mit mindestens 8 GB verwenden.
#Geschwindigkeit, Hitze und Akku: was man wissen muss
Die LLM-Inferenz lastet die CPU (oder GPU) voll aus. Das hat auf einem Smartphone drei ganz konkrete Folgen: Die Geschwindigkeit bleibt mäßig, das Gerät wird warm, und während der Generierung entlädt sich der Akku schnell. Das verhindert die Nutzung nicht, aber man sollte die Größenordnungen im Hinterkopf behalten.
- Geschwindigkeit
- Rechnen Sie grob mit 5 bis 15 Tokens pro Sekunde für ein 3B-Modell in Q4 auf einem SoC der mittleren bis oberen Leistungsklasse. Das lässt sich in Echtzeit mitlesen, bleibt aber weit hinter einer PC-GPU zurück. Ein 1B-Modell ist deutlich schneller.
- Wärmeentwicklung und thermische Drosselung
- Nach einer langen Generierung wird der SoC heißer und drosselt seine Leistung (Throttling), wodurch die nachfolgenden Antworten langsamer werden. Legen Sie zwischen zwei langen Anfragen eine Pause ein.
- Akku
- Eine intensive Sitzung kann den Akkustand innerhalb weniger Minuten um mehrere Prozent senken. Bei gelegentlicher Nutzung fällt das kaum ins Gewicht; bei intensiver Nutzung schließen Sie das Ladegerät an.
- Kontext
- Je größer das Kontextfenster ist, desto höher sind der Speicherbedarf und die Verarbeitungszeit. Halten Sie auf Mobilgeräten das Kontextfenster in einem vernünftigen Rahmen (2k–4k Tokens), damit die Nutzung flüssig bleibt.
#Fehlerbehebung
- Die App schließt sich beim Laden des Modells
- Zu wenig RAM. Schließen Sie alle anderen Anwendungen, wählen Sie ein kleineres Modell (1B statt 3B) oder eine speichersparendere Quantisierung.
- Sehr langsame Antworten
- Verringern Sie den Kontextumfang, reduzieren Sie die Anzahl der generierten Tokens oder wechseln Sie zu einem kleineren Modell. Prüfen Sie außerdem, ob das Telefon seine Leistung wegen Überhitzung drosselt.
- Termux: Befehl nach der Kompilierung nicht gefunden
- Der Build ist unbemerkt fehlgeschlagen. Starten Sie die Kompilierung erneut und lesen Sie die Fehlermeldungen. Prüfen Sie, ob git, cmake und clang installiert sind.
- Termux nicht mehr gepflegt / veraltete Pakete
- Sie haben die Play Store-Version installiert. Deinstallieren Sie diese und installieren Sie Termux erneut über F-Droid oder GitHub.
- Inkonsistente Antworten
- Normal für ein sehr kleines Modell bei einer komplexen Aufgabe. Vereinfachen Sie die Anfrage oder akzeptieren Sie, dass ein 1-3B-Modell Grenzen im Denken hat.
#Weiterführende Informationen
Sobald Sie mit der Nutzung auf dem Mobilgerät vertraut sind, möchten Sie wahrscheinlich einen leistungsfähigeren Rechner zu Hause für anspruchsvolle Aufgaben. Diese Leitfäden der Website führen den vorliegenden Leitfaden weiter:
- Ein LLM lokal ohne GPU ausführen (nur CPU)
- Die gleiche Logik wie auf Mobilgeräten, aber auf dem PC: Empfohlene Modelle je nach RAM und Tipps, um die Leistung im reinen CPU-Modus zu steigern.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Verstehen, warum Q4_K_M sowohl auf dem Smartphone als auch auf dem PC der empfohlene Kompromiss ist.
- Ollama installieren
- Für einen echten LLM-Server zu Hause, der von Ihrem Smartphone über das lokale Netzwerk abgefragt werden kann.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.