Einsteiger 10 Min.Mobil

LLM lokal auf iPhone und iPad: Apps und Modelle, die laufen vraiment

Ein lokales LLM auf dem iPhone auszuführen, ist möglich und funktioniert tatsächlich: Apple-Silicon-Chips (A- und M-Serie) und das MLX-Framework ermöglichen es, Modelle mit 1 bis 8 Milliarden Parametern offline direkt auf dem Gerät auszuführen. Dieser Leitfaden zeigt, welche Apps ihre Versprechen halten, erklärt, welchen Unterschied der RAM je nach iPhone oder iPad tatsächlich macht, und liefert realistische Anhaltspunkte zur Leistung – ohne Marketing.

Von Clara M.·Aktualisierung 2026-08-27·Getestet auf macOS 14+

#Warum ein lokales LLM auf dem iPhone betreiben?

Ein lokales LLM unter iOS führt sämtliche Berechnungen auf Ihrem Gerät aus: kein Server, kein Abonnement, keine Daten, die das Telefon verlassen. Das ist das Gegenteil einer App wie ChatGPT, die jede Nachricht in die Cloud sendet. Die Gründe dafür sind konkret: vollständige Vertraulichkeit (medizinische Notizen, Entwürfe, Code), Nutzung im Flugzeug oder ohne Netz und keinerlei laufende Kosten, sobald das Modell heruntergeladen ist.

Der Kompromiss ist real: Ein iPhone hat weder so viel Speicher noch so viel Leistung wie ein PC mit einer RTX 4070. Ein 70B-Modell lässt sich nicht in der Hosentasche betreiben. Ein richtig quantisiertes 3B-Modell reicht jedoch völlig aus, um einen Text zusammenzufassen, eine E-Mail umzuformulieren, einfache Fragen zu beantworten oder zu übersetzen – alles offline und sofort verfügbar.

i
Was auf Mobilgeräten realistisch ist
Setzen Sie auf Modelle von 1B bis 8B mit Q4-Quantisierung. Unter 1B bricht die Qualität ein; über 8B kommen nur neuere iPad-Pro-Modelle und iPhones der Spitzenklasse mit, und selbst diese sind langsam.

#Apple Silicon, MLX und Neural Engine

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Moderne iPhones und iPads teilen mit Macs die Apple-Silicon-Architektur: einen Systemchip (A-Serie beim iPhone, M-Serie beim iPad Pro) und vor allem einen einheitlichen Speicher, den sich CPU, GPU und Neural Engine teilen. Dieser gemeinsame RAM-Pool ermöglicht die LLM-Inferenz auf Mobilgeräten — das Modell wird einmal geladen und ist ohne Kopieren für alle Kerne zugänglich.

MLX ist Apples Machine-Learning-Framework, das für diesen vereinheitlichten Speicher entwickelt wurde. Ausgereifte iOS-Apps nutzen es (oder mit Metal kompiliertes llama.cpp), um die GPU des Chips zu nutzen. Dort findet der Großteil der Inferenzberechnung statt: auf der GPU über Metal, nicht allein auf der CPU.

!
Was die Neural Engine (noch) nicht macht
Oft wird angenommen, dass die Neural Engine (ANE) LLMs beschleunigt. In der Praxis erfolgt die Textgenerierung Token für Token heute hauptsächlich über die GPU mit Metal, mithilfe von MLX oder llama.cpp. Die ANE ist besonders leistungsfähig bei Modellen mit festem Graphen (Bildverarbeitung, Face ID), weniger bei der autoregressiven Generierung. Verlassen Sie sich bei Ihrem Durchsatz in Tokens/s nicht auf sie.
Unified Memory
CPU, GPU und ANE teilen die gleiche RAM. Dies ist der entscheidende Faktor Nr. 1 für die Größe des Modells, das Sie laden können.
Metal-GPU
Führt die Inferenz über MLX oder llama.cpp aus. Das bestimmt, wie viele Tokens pro Sekunde Sie erhalten.
Neural Engine (ANE)
Leistungsstark, aber spezialisiert. Bislang wenig für die Textgenerierung mit LLMs genutzt.

#Voraussetzungen und RAM pro Gerät

Unter iOS ist die RAM-Kapazität die einzige Zahl, die wirklich zählt, und Apple stellt sie nicht in den Vordergrund. Dennoch entscheidet sie darüber, ob sich ein Modell laden lässt oder die App zum Absturz bringt. Hier sind die Richtwerte für neuere Geräte.

iPhone 15 / 15 Plus
6 GB RAM. Komfortabel für 1B–3B-Modelle in Q4. Ein 3B-Modell läuft, ein 7B-Modell liegt an der Grenze und lässt dem System wenig Spielraum.
iPhone 15 Pro / 16 / 16 Pro
8 GB. Der Sweet Spot für Mobilgeräte: 3B läuft flüssig, 7B–8B ist in Q4 mit moderatem Kontext praktikabel.
iPhone 17 Pro
12 GB (aktuelle Pro-Modellreihe). Echter Spielraum für den komfortablen Betrieb eines 7B–8B-Modells und für längere Kontexte.
iPad Pro M4
16 GB oder mehr je nach Konfiguration. Die beste Wahl für iOS: 8B läuft flüssig, und auch größere Modelle werden denkbar.
→
Faustregel zum Arbeitsspeicher
iOS erlaubt einer App nicht, den gesamten Arbeitsspeicher für sich zu beanspruchen. Rechnen Sie damit, dass einer Drittanbieter-App grob die Hälfte bis zwei Drittel des physischen Arbeitsspeichers zur Verfügung stehen. Planen Sie auf einem iPhone mit 8 GB RAM ein realistisches Speicherbudget von etwa 4–5 GB für das Modell ein — damit passt ein 7B-Modell in Q4 gerade so hinein, ein 3B-Modell dagegen sehr bequem.

Der Speicherbedarf eines Q4-quantisierten Modells liegt in derselben Größenordnung wie auf einem Desktop-Rechner: Ein 3B benötigt etwa 2 GB, ein 7B etwa 5 GB, ein 8B etwas mehr. Rechnen Sie den Kontextspeicher (KV-Cache) hinzu, der mit der Länge des Gesprächs wächst. Deshalb kann ein langer Kontext eine App zum Absturz bringen, die zunächst problemlos gestartet ist.

#iOS-Anwendungen, die sich bewähren

Der App Store ist voller „KI“-Apps, die lediglich als Oberfläche für Cloud-Dienste dienen. Für einen wirklich lokalen Betrieb brauchen Sie eine App, die das Modell auf das Gerät herunterlädt und mit MLX oder llama.cpp ausführt. Hier sind die bewährten Optionen.

PocketPal AI
Kostenlos und Open Source. Die App lädt GGUF-Modelle von Hugging Face herunter und führt sie über llama.cpp aus. Einfache Chat-Oberfläche, Einstellungen für Kontext und Temperatur. Der empfohlene Einstieg.
LLM Farm
Open Source, mit umfangreichen Einstellmöglichkeiten. Unterstützt zahlreiche Formate und ermöglicht eine präzise Anpassung der Inferenz. Technisch anspruchsvoller, ideal zum Testen verschiedener Modelle.
Enclave / MLX-basierte Anwendungen
Apps, die auf MLX, dem Framework von Apple, basieren. Gute Leistung auf neuerem Apple Silicon, oft mit Fokus auf Datenschutz.
Private LLM
Kostenpflichtige App mit optimierten quantisierten Modellen und einer sofort einsatzbereiten Lösung. Keine Konfiguration erforderlich, alles ist bereits enthalten.
i
GGUF, das Dateiformat der Modelle
Die meisten dieser Apps laden GGUF-Dateien – das Format von llama.cpp. Sie wählen beim Download die Quantisierung aus: Q4_K_M ist der beste Kompromiss zwischen Größe und Qualität, genau wie auf dem PC. Vermeiden Sie FP16 auf Mobilgeräten: Es ist viel zu ressourcenintensiv.

#Ein Modell installieren und starten: Schritt für Schritt

Das folgende Beispiel verwendet PocketPal AI, eine kostenlose App, die den allgemeinen Ablauf veranschaulicht. Die Vorgehensweise ist in den anderen Apps dieselbe.

  1. 01
    Die App installieren
    Laden Sie PocketPal AI aus dem App Store herunter. Kein Konto erforderlich, keine Verbindung zu einem Server.
  2. 02
    Ein Modell auswählen
    Öffnen Sie die integrierte Modellbibliothek. Die App bietet Modelle für mobile Geräte an (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Beginnen Sie klein: ein 2B oder 3B in Q4.
  3. 03
    Herunterladen
    Starten Sie das Herunterladen (einige Hundert MB bis ca. 2 GB je nach Größe). Führen Sie es über WLAN durch. Die Datei bleibt lokal auf dem Gerät gespeichert.
  4. 04
    Modell laden
    Wählen Sie das heruntergeladene Modell aus, um es in den Speicher zu laden. Wenn sich die Anwendung an dieser Stelle schließt, reicht der RAM nicht aus: Wählen Sie ein kleineres Modell oder schließen Sie die anderen Anwendungen.
  5. 05
    Offline chatten
    Öffnen Sie einen Chat und stellen Sie eine Frage. Aktivieren Sie zur Überprüfung den Flugmodus: Alles funktioniert weiter – der Beweis, dass nichts das Gerät verlässt.

Für Neugierige, die möglichst nah an der technischen Basis arbeiten möchten, ist es auch möglich, llama.cpp selbst zu kompilieren. iOS erlaubt jedoch nicht, beliebigen Code außerhalb einer signierten App auszuführen: In der Praxis ist eine dafür vorgesehene App für die große Mehrheit der Nutzer der einzige realistische Weg.

#Welche Modelle je nach RAM auswählen?

Das passende Modell hängt in erster Linie von Ihrem Gerät ab. Hier finden Sie konkrete Empfehlungen, vom einfachsten bis zum leistungsfähigsten Modell, alle mit Q4-Quantisierung.

iPhone 15 / 15 Plus (6 GB)
Qwen 3.5 2B (1,9 GB) oder Granite 4.2 3B (2,2 GB) für flüssige Antworten; Qwen 3.5 4B (3,4 GB) für höhere Qualität. Bleiben Sie bei kurzen Kontexten.
iPhone 16 / 16 Pro (8 GB)
Ein 3B–4B-Modell für flüssige Nutzung im Alltag. Ein 8B–9B-Modell (Granite 4.2 8B mit 5,3 GB, Qwen 3.5 9B mit 6,6 GB, 256k Kontext und Bildverarbeitung) läuft in Q4 mit moderater Kontextlänge – langsamer, aber deutlich leistungsfähiger.
iPhone 17 Pro (12 GB)
8B–9B problemlos nutzbar, längere Kontexte und Qwen 3.5 9B in Q8 (11 GB) für die maximale Qualität in dieser Speicherklasse.
iPad Pro M4 (16 GB+)
Qwen 3.5 9B läuft im praktischen Einsatz flüssig; Modelle bis etwa 12B (Gemma 4 12B, multimodal, 7,6 GB) lassen sich ausprobieren, wobei die Geschwindigkeit dank der M4-GPU weiterhin ordentlich bleibt.
→
Klein und neu schlägt groß und alt
Ein neueres 3B-Modell (Granite 4.2 3B, Qwen 3.5 2B/4B, Gemma 4 E2B) liefert oft bessere Antworten als ein älteres 7B-Modell und verbraucht dabei nur halb so viel RAM. Geben Sie auf Mobilgeräten der Modellgeneration Vorrang vor der reinen Größe.

Bei französischen Texten schneiden Gemma 4 und die Qwen-3.5-Modelle für ihre Größe gut ab. Für Zusammenfassungen, Umformulierungen und kurze Antworten reicht ein 3B-Modell aus. Bei anspruchsvollerem logischem Denken oder Programmieren machen sich die Grenzen des Mobilgeräts schnell bemerkbar – dann ist es Zeit, auf einen Rechner zu Hause umzusteigen.

#Vollständige Vertraulichkeit: Nichts verlässt das Gerät

Das ist das stärkste Argument für lokale KI auf Mobilgeräten. Sobald das Modell heruntergeladen ist, sind zum Chatten keine Netzwerkanfragen erforderlich. Ihre Prompts, Ihre Dokumente und Ihre Entwürfe bleiben auf dem iPhone. Keine Gesprächstelemetrie, kein Training mit Ihren Daten, kein Risiko eines serverseitigen Datenlecks.

Prüfen Sie es im Flugmodus
Der einfachste Test: Trennen Sie alle Netzwerkverbindungen und prüfen Sie, ob der Chat weiterhin funktioniert. Wenn er offline funktioniert, wird nichts übertragen.
Vorsicht bei hybriden Apps
Einige « KI »-Apps wechseln schweigend auf den Cloud-Server, wenn der lokale Modellversuch fehlschlägt. Wählen Sie lieber 100 % lokale und open source Anwendungen, um Zweifel zu beseitigen.
Sensible Daten
Gesundheitsnotizen, geschäftliche Dokumente unter NDA, personenbezogene Daten: Nur der lokale Betrieb gewährleistet, dass sie niemals Ihr Gerät verlassen.
i
Lokal bedeutet nicht unfehlbar
Das Modell gibt Ihre Daten nicht preis, kann sich aber irren (Halluzinationen). Bleiben Sie bei wichtigen Entscheidungen kritisch – Vertraulichkeit ist nicht dasselbe wie Zuverlässigkeit.

#Fehlerbehebung und Tipps

Die App stürzt beim Laden des Modells ab
Nicht genügend RAM. Schließen Sie alle anderen Anwendungen, wählen Sie ein kleineres Modell (3B statt 7B) oder eine speichersparendere Quantisierung (Q4 statt Q5/Q8).
Sehr langsame Antworten
Verringern Sie die Kontextlänge und die Anzahl der generierten Tokens. Prüfen Sie auch die Temperatur: Ein heißes iPhone drosselt seine Leistung und verlangsamt dadurch die Inferenz.
Das iPhone wird heiß und der Akku leert sich schnell
Die Inferenz lastet die GPU voll aus. Das ist bei langen Sitzungen normal. Machen Sie Pausen, vermeiden Sie eine ununterbrochene Generierung und lassen Sie das Gerät bei intensiver Nutzung am Strom angeschlossen.
Das Modell antwortet an der Frage vorbei
Das ist bei einem sehr kleinen Modell und einer komplexen Aufgabe normal. Vereinfachen Sie die Anfrage oder wechseln Sie zur nächstgrößeren Modellvariante, wenn Ihr Arbeitsspeicher dies zulässt.
Herunterladen blockiert
GGUF-Dateien sind groß. Bleiben Sie während des Downloads mit dem WLAN verbunden und vermeiden Sie es, die App in den Hintergrund zu verschieben.

#Weiterführende Informationen

Ein Mobilgerät ist ideal für die Nutzung unterwegs und für vertrauliche Aufgaben, aber für anspruchsvolle Aufgaben werden Sie einen leistungsfähigen Rechner wollen. Diese Leitfäden der Website führen diesen Leitfaden weiter:

Ein LLM lokal auf Android ausführen
Das Gegenstück unter Android: PocketPal, MLC Chat und llama.cpp über Termux, mit denselben RAM-Beschränkungen.
Ollama auf macOS (Apple Silicon) installieren
Für den Wechsel vom Smartphone zum Mac: Der gemeinsame Speicher von M1/M2/M3/M4 ermöglicht deutlich mehr, bis hin zu 32B-Modellen und darüber hinaus.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Verstehen, warum Q4_K_M sowohl auf Mobilgeräten als auch auf PCs der empfohlene Kompromiss ist und wann sich der Wechsel zu Q5/Q8 lohnt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.