LLM lokal auf iPhone und iPad: Apps und Modelle, die laufen vraiment
Ein lokales LLM auf dem iPhone auszuführen, ist möglich und funktioniert tatsächlich: Apple-Silicon-Chips (A- und M-Serie) und das MLX-Framework ermöglichen es, Modelle mit 1 bis 8 Milliarden Parametern offline direkt auf dem Gerät auszuführen. Dieser Leitfaden zeigt, welche Apps ihre Versprechen halten, erklärt, welchen Unterschied der RAM je nach iPhone oder iPad tatsächlich macht, und liefert realistische Anhaltspunkte zur Leistung – ohne Marketing.
#Warum ein lokales LLM auf dem iPhone betreiben?
Ein lokales LLM unter iOS führt sämtliche Berechnungen auf Ihrem Gerät aus: kein Server, kein Abonnement, keine Daten, die das Telefon verlassen. Das ist das Gegenteil einer App wie ChatGPT, die jede Nachricht in die Cloud sendet. Die Gründe dafür sind konkret: vollständige Vertraulichkeit (medizinische Notizen, Entwürfe, Code), Nutzung im Flugzeug oder ohne Netz und keinerlei laufende Kosten, sobald das Modell heruntergeladen ist.
Der Kompromiss ist real: Ein iPhone hat weder so viel Speicher noch so viel Leistung wie ein PC mit einer RTX 4070. Ein 70B-Modell lässt sich nicht in der Hosentasche betreiben. Ein richtig quantisiertes 3B-Modell reicht jedoch völlig aus, um einen Text zusammenzufassen, eine E-Mail umzuformulieren, einfache Fragen zu beantworten oder zu übersetzen – alles offline und sofort verfügbar.
#Apple Silicon, MLX und Neural Engine
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Moderne iPhones und iPads teilen mit Macs die Apple-Silicon-Architektur: einen Systemchip (A-Serie beim iPhone, M-Serie beim iPad Pro) und vor allem einen einheitlichen Speicher, den sich CPU, GPU und Neural Engine teilen. Dieser gemeinsame RAM-Pool ermöglicht die LLM-Inferenz auf Mobilgeräten — das Modell wird einmal geladen und ist ohne Kopieren für alle Kerne zugänglich.
MLX ist Apples Machine-Learning-Framework, das für diesen vereinheitlichten Speicher entwickelt wurde. Ausgereifte iOS-Apps nutzen es (oder mit Metal kompiliertes llama.cpp), um die GPU des Chips zu nutzen. Dort findet der Großteil der Inferenzberechnung statt: auf der GPU über Metal, nicht allein auf der CPU.
- Unified Memory
- CPU, GPU und ANE teilen die gleiche RAM. Dies ist der entscheidende Faktor Nr. 1 für die Größe des Modells, das Sie laden können.
- Metal-GPU
- Führt die Inferenz über MLX oder llama.cpp aus. Das bestimmt, wie viele Tokens pro Sekunde Sie erhalten.
- Neural Engine (ANE)
- Leistungsstark, aber spezialisiert. Bislang wenig für die Textgenerierung mit LLMs genutzt.
#Voraussetzungen und RAM pro Gerät
Unter iOS ist die RAM-Kapazität die einzige Zahl, die wirklich zählt, und Apple stellt sie nicht in den Vordergrund. Dennoch entscheidet sie darüber, ob sich ein Modell laden lässt oder die App zum Absturz bringt. Hier sind die Richtwerte für neuere Geräte.
- iPhone 15 / 15 Plus
- 6 GB RAM. Komfortabel für 1B–3B-Modelle in Q4. Ein 3B-Modell läuft, ein 7B-Modell liegt an der Grenze und lässt dem System wenig Spielraum.
- iPhone 15 Pro / 16 / 16 Pro
- 8 GB. Der Sweet Spot für Mobilgeräte: 3B läuft flüssig, 7B–8B ist in Q4 mit moderatem Kontext praktikabel.
- iPhone 17 Pro
- 12 GB (aktuelle Pro-Modellreihe). Echter Spielraum für den komfortablen Betrieb eines 7B–8B-Modells und für längere Kontexte.
- iPad Pro M4
- 16 GB oder mehr je nach Konfiguration. Die beste Wahl für iOS: 8B läuft flüssig, und auch größere Modelle werden denkbar.
Der Speicherbedarf eines Q4-quantisierten Modells liegt in derselben Größenordnung wie auf einem Desktop-Rechner: Ein 3B benötigt etwa 2 GB, ein 7B etwa 5 GB, ein 8B etwas mehr. Rechnen Sie den Kontextspeicher (KV-Cache) hinzu, der mit der Länge des Gesprächs wächst. Deshalb kann ein langer Kontext eine App zum Absturz bringen, die zunächst problemlos gestartet ist.
#iOS-Anwendungen, die sich bewähren
Der App Store ist voller „KI“-Apps, die lediglich als Oberfläche für Cloud-Dienste dienen. Für einen wirklich lokalen Betrieb brauchen Sie eine App, die das Modell auf das Gerät herunterlädt und mit MLX oder llama.cpp ausführt. Hier sind die bewährten Optionen.
- PocketPal AI
- Kostenlos und Open Source. Die App lädt GGUF-Modelle von Hugging Face herunter und führt sie über llama.cpp aus. Einfache Chat-Oberfläche, Einstellungen für Kontext und Temperatur. Der empfohlene Einstieg.
- LLM Farm
- Open Source, mit umfangreichen Einstellmöglichkeiten. Unterstützt zahlreiche Formate und ermöglicht eine präzise Anpassung der Inferenz. Technisch anspruchsvoller, ideal zum Testen verschiedener Modelle.
- Enclave / MLX-basierte Anwendungen
- Apps, die auf MLX, dem Framework von Apple, basieren. Gute Leistung auf neuerem Apple Silicon, oft mit Fokus auf Datenschutz.
- Private LLM
- Kostenpflichtige App mit optimierten quantisierten Modellen und einer sofort einsatzbereiten Lösung. Keine Konfiguration erforderlich, alles ist bereits enthalten.
#Ein Modell installieren und starten: Schritt für Schritt
Das folgende Beispiel verwendet PocketPal AI, eine kostenlose App, die den allgemeinen Ablauf veranschaulicht. Die Vorgehensweise ist in den anderen Apps dieselbe.
- 01Die App installierenLaden Sie PocketPal AI aus dem App Store herunter. Kein Konto erforderlich, keine Verbindung zu einem Server.
- 02Ein Modell auswählenÖffnen Sie die integrierte Modellbibliothek. Die App bietet Modelle für mobile Geräte an (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Beginnen Sie klein: ein 2B oder 3B in Q4.
- 03HerunterladenStarten Sie das Herunterladen (einige Hundert MB bis ca. 2 GB je nach Größe). Führen Sie es über WLAN durch. Die Datei bleibt lokal auf dem Gerät gespeichert.
- 04Modell ladenWählen Sie das heruntergeladene Modell aus, um es in den Speicher zu laden. Wenn sich die Anwendung an dieser Stelle schließt, reicht der RAM nicht aus: Wählen Sie ein kleineres Modell oder schließen Sie die anderen Anwendungen.
- 05Offline chattenÖffnen Sie einen Chat und stellen Sie eine Frage. Aktivieren Sie zur Überprüfung den Flugmodus: Alles funktioniert weiter – der Beweis, dass nichts das Gerät verlässt.
Für Neugierige, die möglichst nah an der technischen Basis arbeiten möchten, ist es auch möglich, llama.cpp selbst zu kompilieren. iOS erlaubt jedoch nicht, beliebigen Code außerhalb einer signierten App auszuführen: In der Praxis ist eine dafür vorgesehene App für die große Mehrheit der Nutzer der einzige realistische Weg.
#Welche Modelle je nach RAM auswählen?
Das passende Modell hängt in erster Linie von Ihrem Gerät ab. Hier finden Sie konkrete Empfehlungen, vom einfachsten bis zum leistungsfähigsten Modell, alle mit Q4-Quantisierung.
- iPhone 15 / 15 Plus (6 GB)
- Qwen 3.5 2B (1,9 GB) oder Granite 4.2 3B (2,2 GB) für flüssige Antworten; Qwen 3.5 4B (3,4 GB) für höhere Qualität. Bleiben Sie bei kurzen Kontexten.
- iPhone 16 / 16 Pro (8 GB)
- Ein 3B–4B-Modell für flüssige Nutzung im Alltag. Ein 8B–9B-Modell (Granite 4.2 8B mit 5,3 GB, Qwen 3.5 9B mit 6,6 GB, 256k Kontext und Bildverarbeitung) läuft in Q4 mit moderater Kontextlänge – langsamer, aber deutlich leistungsfähiger.
- iPhone 17 Pro (12 GB)
- 8B–9B problemlos nutzbar, längere Kontexte und Qwen 3.5 9B in Q8 (11 GB) für die maximale Qualität in dieser Speicherklasse.
- iPad Pro M4 (16 GB+)
- Qwen 3.5 9B läuft im praktischen Einsatz flüssig; Modelle bis etwa 12B (Gemma 4 12B, multimodal, 7,6 GB) lassen sich ausprobieren, wobei die Geschwindigkeit dank der M4-GPU weiterhin ordentlich bleibt.
Bei französischen Texten schneiden Gemma 4 und die Qwen-3.5-Modelle für ihre Größe gut ab. Für Zusammenfassungen, Umformulierungen und kurze Antworten reicht ein 3B-Modell aus. Bei anspruchsvollerem logischem Denken oder Programmieren machen sich die Grenzen des Mobilgeräts schnell bemerkbar – dann ist es Zeit, auf einen Rechner zu Hause umzusteigen.
#Vollständige Vertraulichkeit: Nichts verlässt das Gerät
Das ist das stärkste Argument für lokale KI auf Mobilgeräten. Sobald das Modell heruntergeladen ist, sind zum Chatten keine Netzwerkanfragen erforderlich. Ihre Prompts, Ihre Dokumente und Ihre Entwürfe bleiben auf dem iPhone. Keine Gesprächstelemetrie, kein Training mit Ihren Daten, kein Risiko eines serverseitigen Datenlecks.
- Prüfen Sie es im Flugmodus
- Der einfachste Test: Trennen Sie alle Netzwerkverbindungen und prüfen Sie, ob der Chat weiterhin funktioniert. Wenn er offline funktioniert, wird nichts übertragen.
- Vorsicht bei hybriden Apps
- Einige « KI »-Apps wechseln schweigend auf den Cloud-Server, wenn der lokale Modellversuch fehlschlägt. Wählen Sie lieber 100 % lokale und open source Anwendungen, um Zweifel zu beseitigen.
- Sensible Daten
- Gesundheitsnotizen, geschäftliche Dokumente unter NDA, personenbezogene Daten: Nur der lokale Betrieb gewährleistet, dass sie niemals Ihr Gerät verlassen.
#Fehlerbehebung und Tipps
- Die App stürzt beim Laden des Modells ab
- Nicht genügend RAM. Schließen Sie alle anderen Anwendungen, wählen Sie ein kleineres Modell (3B statt 7B) oder eine speichersparendere Quantisierung (Q4 statt Q5/Q8).
- Sehr langsame Antworten
- Verringern Sie die Kontextlänge und die Anzahl der generierten Tokens. Prüfen Sie auch die Temperatur: Ein heißes iPhone drosselt seine Leistung und verlangsamt dadurch die Inferenz.
- Das iPhone wird heiß und der Akku leert sich schnell
- Die Inferenz lastet die GPU voll aus. Das ist bei langen Sitzungen normal. Machen Sie Pausen, vermeiden Sie eine ununterbrochene Generierung und lassen Sie das Gerät bei intensiver Nutzung am Strom angeschlossen.
- Das Modell antwortet an der Frage vorbei
- Das ist bei einem sehr kleinen Modell und einer komplexen Aufgabe normal. Vereinfachen Sie die Anfrage oder wechseln Sie zur nächstgrößeren Modellvariante, wenn Ihr Arbeitsspeicher dies zulässt.
- Herunterladen blockiert
- GGUF-Dateien sind groß. Bleiben Sie während des Downloads mit dem WLAN verbunden und vermeiden Sie es, die App in den Hintergrund zu verschieben.
#Weiterführende Informationen
Ein Mobilgerät ist ideal für die Nutzung unterwegs und für vertrauliche Aufgaben, aber für anspruchsvolle Aufgaben werden Sie einen leistungsfähigen Rechner wollen. Diese Leitfäden der Website führen diesen Leitfaden weiter:
- Ein LLM lokal auf Android ausführen
- Das Gegenstück unter Android: PocketPal, MLC Chat und llama.cpp über Termux, mit denselben RAM-Beschränkungen.
- Ollama auf macOS (Apple Silicon) installieren
- Für den Wechsel vom Smartphone zum Mac: Der gemeinsame Speicher von M1/M2/M3/M4 ermöglicht deutlich mehr, bis hin zu 32B-Modellen und darüber hinaus.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Verstehen, warum Q4_K_M sowohl auf Mobilgeräten als auch auf PCs der empfohlene Kompromiss ist und wann sich der Wechsel zu Q5/Q8 lohnt.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.