LLM auf Raspberry Pi 5: lokale KI eingebettet
Ein LLM auf einem Raspberry Pi zu betreiben, klang vor zwei Jahren wie ein Scherz. Mit dem Pi 5 mit 8 GB, seinem BCM2712-SoC mit vier Cortex-A76-Kernen bei 2,4 GHz und der Welle kleiner Modelle mit 2–4 Milliarden Parametern, die 2026 erschienen sind, ist daraus eine echte Anwendungsmöglichkeit geworden. Dieser Leitfaden zeigt die Installation von Ollama auf dem Raspberry Pi, misst die Tokens pro Sekunde bei Qwen 3.5 2B, Granite 4.2 3B und Qwen 3.5 4B und zeigt, in welchen Fällen ein LLM in einem eingebetteten System sinnvoll ist.
#Warum ein LLM auf Raspberry Pi?
Ein Raspberry Pi 5 ersetzt kein RTX 4090. Der Zweck liegt nicht in der reinen Leistung, sondern im Embedded-Ansatz: Eine Karte für 80 €, die 5–12 W verbraucht, passt in eine Karte der Kreditkartengröße und läuft 24 Stunden ohne Lärm. Für edge-Anwendungen – lokaler Sprachassistent, intelligente Wetterstation, offline-kiosk, mobiler Roboter – ist dies ausreichend und um ein Vielfaches günstiger als ein Mini-PC.
Der weitere Vorteil: absolute Vertraulichkeit. Keine Daten verlassen das lokale Netzwerk. Sie können einen Familienassistenten in einem Kinderzimmer einrichten — ohne Cloud, ohne Telemetrie und ohne Abonnement.
#Hardware-Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Raspberry Pi 5 (8 GB erforderlich)
- Die 4-GB-Version kann Qwen 3.5 2B ausführen, stößt aber bei größeren Modellen an ihre Grenzen. Die 8-GB-Version ist das Minimum für eine komfortable Nutzung. Die 16-GB-Version (Ende 2024 erschienen) ermöglicht den Betrieb von Qwen 3.5 4B ohne Swap.
- A2-microSD-Karte oder NVMe-SSD
- Eine A1-SD-Karte verlangsamt das erstmalige Laden des Modells erheblich. Ideal ist eine NVMe-SSD über den offiziellen M.2-HAT – Bandbreite von 500+ MB/s, Laden von Qwen 3.5 4B in 4 s gegenüber 30 s mit einer SD-Karte.
- Offizielles 27-W-Netzteil
- Der Pi 5 verbraucht bei der Inferenz 9–12 W. Das offizielle USB-C-Netzteil mit 5 V/5 A ist erforderlich, um eine Leistungsdrosselung zu vermeiden. Ein generisches 15-W-Netzteil versorgt die Platine mit zu niedriger Spannung.
- Aktive Kühlung
- Unverzichtbar. Der SoC drosselt seine Leistung ab 80 °C. Der offizielle Lüfter (5 €) oder ein Argon ONE V3-Gehäuse reicht aus. Ohne Kühlkörper verlieren Sie nach 2 Minuten Inferenz 30–40 % an Durchsatz.
- Pi OS 64-Bit (Bookworm)
- Raspberry Pi OS in der 64-Bit-Version auf Basis von Debian 12. Ollama unterstützt keine 32-Bit-Systeme. Prüfen Sie dies mit uname -m → die Ausgabe muss aarch64 sein.
#1. Ollama auf dem Pi 5 installieren
Ollama unterstützt linux/arm64 offiziell seit 2024. Das universelle Installationsskript funktioniert direkt auf Pi OS; eine manuelle Kompilierung ist nicht erforderlich.
Das Skript lädt die ARM64-Binärdatei (~150 MB) herunter, installiert einen systemd-Dienst und startet den Daemon auf Port 11434. Rechnen Sie mit 1 bis 2 Minuten.
#2. Empfohlene Modelle für Raspberry Pi
Auf einem Pi 5 mit 8 GB haben Sie etwa 6,5 GB tatsächlich nutzbaren Arbeitsspeicher (das System und sein Cache belegen den Rest). Jedes LLM, das bei Q4-Quantisierung mehr als 4–5 GB benötigt, ist unbrauchbar – es lagert auf die microSD-Karte aus und fällt auf 0,1 tok/s ab.
Drei Modelle erzielen auf dem Pi 5 im August 2026 die besten Ergebnisse:
- Qwen 3.5 2B (Alibaba, Apache 2.0)
- Spitzenreiter beim Verhältnis von Leistung zu RAM-Bedarf. 1,9 GB in Q4_K_M, multimodal, 256k Kontext, hervorragend für kurze Chats und auf Französisch. Ideal für einen einfachen Assistenten oder Sprachsteuerung.
- Granite 4.2 3B (IBM, Apache 2.0)
- Sehr sparsam und token-effizient. 2,2 GB in Q4_K_M. Eine Stufe höher in der Qualität beim Reasoning, ausgelegt für den Dauerbetrieb (H24), ohne den RAM zu sättigen. Solide im Multilingualen.
- Qwen 3.5 4B (Alibaba, Apache 2.0)
- Das neue „kleine Standardmodell“ und das leistungsfähigste der drei. 3,4 GB in Q4_K_M. Passt in den RAM eines Pi 5 mit 8 GB, allerdings bleibt wenig Spielraum – keine ressourcenintensive grafische Oberfläche parallel betreiben.
#3. Benchmarks in Tokens/s (Größenordnungen)
Größenordnungen, ermittelt auf einem Raspberry Pi 5 mit 8 GB, offiziellem Aktivkühler, NVMe-SSD über ein M.2-HAT, Pi OS Bookworm 64-Bit, einer aktuellen Ollama-Version, Q4_K_M-Quantisierung und einem Prompt zur Generierung von 200 Tokens. Die Zahlen variieren je nach Ollama-Version und thermischen Bedingungen – betrachten Sie sie als Größenordnungen, nicht als absolute Werte.
- Qwen 3.5 2B Q4_K_M
- ≈ 4,4 Token/s Generierung · 6,6 Token/s Prompt-Verarbeitung · 1,9 GB RAM · 9,6 W
- Granite 4.2 3B Q4_K_M
- ≈ 3,4 Tokens/s Generierung · 5,1 Tokens/s Prompt-Verarbeitung · 2,2 GB RAM · 10,2 W
- Qwen 3.5 4B Q4_K_M
- ≈ 2,3 Tokens/Sekunde Generierung · 3,6 Tok/s Prompt-Bewertung · 3,4 GB RAM · 11,2 W
- Gemma 4 E2B (multimodale Referenz)
- ≈ 3,9 Tokens/s · 4,3 GB RAM · 10,4 W. Schnelles MoE, aber mit höherem RAM-Bedarf.
- Granite 4.2 3B Q3_K_S (ressourcensparende Variante)
- ≈ 3,6 Tokens/sec · 1,7 GB RAM · 9,9 W. Leichtestes Modell, ideal, wenn die RAM-Kapazität begrenzt ist (Pi 4 GB).
Das Flag --verbose zeigt am Ende der Generierung folgende Werte an: eval rate (tok/s), prompt eval rate, total duration. Das ist die offizielle Messung für Vergleiche.
#4. Sinnvolle Offline-Anwendungsfälle
Bei 2–5 Tok/s ist die Inferenz auf dem Pi nicht für Echtzeit-Chats ausgelegt. Ihre Stärken liegen in Anwendungsfällen, in denen die Latenz nicht entscheidend ist oder Datenschutz und Autonomie wichtiger sind als Geschwindigkeit.
- Lokaler Sprachassistent
- Pi 5 + USB-Mikrofon + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS. Frage → Transkription → Antwort → synthetisierte Stimme, alles in 8–12 s ohne Cloud. Offline-Hausautomation, Kiosk für Kinder, Lernroboter.
- E-Mails oder Nachrichten im Batch zusammenfassen
- Cron-Job, der stündlich die RSS-Feeds abruft, sie mit Qwen 3.5 4B zusammenfasst und die Zusammenfassungen an Telegram/Matrix sendet. Bei asynchroner Ausführung ist die Inferenzverzögerung nicht wahrnehmbar.
- Protokoll- oder Ticketklassifizierung
- Pi am Netzwerkrand, der eingehende Logs ('kritischer Fehler', 'Spam', 'normal') markiert, bevor er sie an einen zentralen Server sendet. Spart WAN-Bandbreite.
- Demo auf einem eingebetteten System / portable Demo
- Präsentation beim Kunden, Schulworkshop, Konferenz: Pi 5 in der Tasche, USB-C-Akku, zu 100 % autonome Demo lokaler KI.
- Schutzmechanismus für andere LLMs
- Ein kleines lokales Modell, das einen Prompt filtert oder umformuliert, bevor es ihn an ein Cloud-LLM sendet. Nützlich, um sensible Daten direkt auf dem Edge-Gerät zu anonymisieren.
#5. Spezifische Optimierungen für Pi
#Das Kontextfenster verkleinern
Standardmäßig verwendet Ollama num_ctx=2048. Auf einem Pi ist das bereits viel – jedes Kontexttoken verbraucht RAM und verlangsamt die Prompt-Auswertung. Für einen Chatassistenten mit kurzen Gesprächen reduzieren Sie den Wert auf 1024.
#Threads begrenzen
Ollama nutzt standardmäßig alle Kerne. Auf dem Pi 5 (4 Kerne) ist das für die reine Geschwindigkeit optimal, lastet den SoC aber vollständig aus, was nach 1–2 Minuten zu thermischer Drosselung führt. Bei längerer Nutzung hält eine Begrenzung auf 3 Kerne den Durchsatz länger stabil.
#NVMe gegenüber microSD bevorzugen
Beim ersten Laden eines Modells von einer SD-Karte werden mehrere GB sequenziell gelesen. SD A1 → 30–40 Sekunden für Phi-3.5 Mini. NVMe → 3–5 Sekunden. Sobald das Modell im RAM liegt, ist die Inferenz identisch.
#Eine Stufe heruntergehen, wenn der RAM nicht ausreicht
Auf einem Pi 5 mit 8 GB RAM und aktiver grafischer Oberfläche kann Qwen 3.5 4B in Q4_K_M anfangen, Daten in den Swap-Speicher auszulagern. Zwei Optionen: auf Granite 4.2 3B (2,2 GB) oder Qwen 3.5 2B (1,9 GB) wechseln. Diese Modelle geben 1 bis 1,5 GB RAM frei, ohne dass die Qualität stark einbricht.
#Fehlerbehebung
- ollama: command not found nach der Installation
- Das systemd-Skript ist fehlgeschlagen (häufige Ursache: Pi OS ist zu alt). Prüfen Sie sudo systemctl status ollama. Bei der Fehlermeldung 'exec format error' verwenden Sie ein 32-Bit-System – installieren Sie Pi OS in der 64-Bit-Version neu.
- Das Modell wird geladen, aber nur 0,3 tok/s
- Ihr System nutzt Swap. Prüfen Sie free -h: Wenn der Wert in der Spalte 'available' während der Inferenz unter 500 MB liegt, ist Ihr Modell zu groß. Wechseln Sie zu einem kleineren Modell wie Granite 4.2 3B oder Qwen 3.5 2B oder zur Quantisierung Q3.
- Thermische Drosselung nach 1 Minute
- Die Temperatur des SoC hat 80 °C überschritten. Prüfen Sie sie während der Inferenz mit vcgencmd measure_temp. Lösung: offizieller Lüfter oder Argon ONE V3. Ohne aktive Kühlung ist die Pi 5 bei der Inferenz nicht im Dauerbetrieb nutzbar.
- Out of memory mitten in der Generierung
- Der Linux-OOM-Killer hat Ollama beendet. Reduzieren Sie num_ctx auf 1024, schließen Sie den Browser oder wechseln Sie zu einem kleineren Modell. Bleiben Sie auf einem Pi mit 4 GB bei Qwen 3.5 2B, dem kleinsten Modell im Katalog 2026.
- Der Ollama-Dienst startet nicht beim Systemstart
- sudo systemctl enable ollama pour activer l'autostart. Vérifiez ensuite avec systemctl is-enabled ollama.
#Weiterführende Informationen
Sobald Ollama auf Ihrem Pi 5 läuft, bieten sich drei naheliegende Möglichkeiten zur Vertiefung an:
- Quantisierung verstehen, um mehr herauszuholen
- Der Leitfaden zur Auswahl der Quantisierung vergleicht Q3, Q4, Q5 und Q8 im Detail. Auf dem Pi ist das entscheidend, denn dort zählen jede 100 MB RAM.
- In eine Python-Anwendung integrieren
- Der Leitfaden „Ollama über die REST-API in Python integrieren“ zeigt, wie Sie Ihren Pi 5 aus einem Flask-/FastAPI-Skript heraus steuern – die Grundlage für jeden Edge-Assistenten.
- Offline-Workflows automatisieren
- Der Leitfaden zur Automatisierung mit n8n und Ollama lässt sich unverändert auf dem Pi anwenden (n8n läuft nativ auf ARM64). Ideal für einen autonomen KI-basierten Smart-Home-Hub.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.