Mittelstufe 15 minEdge

LLM auf Raspberry Pi 5: lokale KI eingebettet

Ein LLM auf einem Raspberry Pi zu betreiben, klang vor zwei Jahren wie ein Scherz. Mit dem Pi 5 mit 8 GB, seinem BCM2712-SoC mit vier Cortex-A76-Kernen bei 2,4 GHz und der Welle kleiner Modelle mit 2–4 Milliarden Parametern, die 2026 erschienen sind, ist daraus eine echte Anwendungsmöglichkeit geworden. Dieser Leitfaden zeigt die Installation von Ollama auf dem Raspberry Pi, misst die Tokens pro Sekunde bei Qwen 3.5 2B, Granite 4.2 3B und Qwen 3.5 4B und zeigt, in welchen Fällen ein LLM in einem eingebetteten System sinnvoll ist.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein LLM auf Raspberry Pi?

Ein Raspberry Pi 5 ersetzt kein RTX 4090. Der Zweck liegt nicht in der reinen Leistung, sondern im Embedded-Ansatz: Eine Karte für 80 €, die 5–12 W verbraucht, passt in eine Karte der Kreditkartengröße und läuft 24 Stunden ohne Lärm. Für edge-Anwendungen – lokaler Sprachassistent, intelligente Wetterstation, offline-kiosk, mobiler Roboter – ist dies ausreichend und um ein Vielfaches günstiger als ein Mini-PC.

Der weitere Vorteil: absolute Vertraulichkeit. Keine Daten verlassen das lokale Netzwerk. Sie können einen Familienassistenten in einem Kinderzimmer einrichten — ohne Cloud, ohne Telemetrie und ohne Abonnement.

i
Kurz gesagt
Pi 5 + Ollama + ein 2–4B-Modell mit Q4-Quantisierung = ein lokaler Assistent, der mit 2 bis 4 Tokens pro Sekunde antwortet. Langsam, aber autonom, leise und mit minimalen Hardwarekosten.

#Hardware-Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Raspberry Pi 5 (8 GB erforderlich)
Die 4-GB-Version kann Qwen 3.5 2B ausführen, stößt aber bei größeren Modellen an ihre Grenzen. Die 8-GB-Version ist das Minimum für eine komfortable Nutzung. Die 16-GB-Version (Ende 2024 erschienen) ermöglicht den Betrieb von Qwen 3.5 4B ohne Swap.
A2-microSD-Karte oder NVMe-SSD
Eine A1-SD-Karte verlangsamt das erstmalige Laden des Modells erheblich. Ideal ist eine NVMe-SSD über den offiziellen M.2-HAT – Bandbreite von 500+ MB/s, Laden von Qwen 3.5 4B in 4 s gegenüber 30 s mit einer SD-Karte.
Offizielles 27-W-Netzteil
Der Pi 5 verbraucht bei der Inferenz 9–12 W. Das offizielle USB-C-Netzteil mit 5 V/5 A ist erforderlich, um eine Leistungsdrosselung zu vermeiden. Ein generisches 15-W-Netzteil versorgt die Platine mit zu niedriger Spannung.
Aktive Kühlung
Unverzichtbar. Der SoC drosselt seine Leistung ab 80 °C. Der offizielle Lüfter (5 €) oder ein Argon ONE V3-Gehäuse reicht aus. Ohne Kühlkörper verlieren Sie nach 2 Minuten Inferenz 30–40 % an Durchsatz.
Pi OS 64-Bit (Bookworm)
Raspberry Pi OS in der 64-Bit-Version auf Basis von Debian 12. Ollama unterstützt keine 32-Bit-Systeme. Prüfen Sie dies mit uname -m → die Ausgabe muss aarch64 sein.
!
Keine nutzbare GPU vorhanden
Der VideoCore VII des Pi 5 wird für LLM-Inferenz nicht offiziell unterstützt (kein stabiles Vulkan-Backend, keine ausgereiften ML-Treiber). Alles läuft auf den 4 ARM-CPU-Kernen. Das ist die wichtigste Einschränkung.

#1. Ollama auf dem Pi 5 installieren

Ollama unterstützt linux/arm64 offiziell seit 2024. Das universelle Installationsskript funktioniert direkt auf Pi OS; eine manuelle Kompilierung ist nicht erforderlich.

Ollama-Installation (1 Zeile)
curl -fsSL https://ollama.com/install.sh | sh

Das Skript lädt die ARM64-Binärdatei (~150 MB) herunter, installiert einen systemd-Dienst und startet den Daemon auf Port 11434. Rechnen Sie mit 1 bis 2 Minuten.

Prüfen, ob der Dienst läuft
systemctl status ollama
ollama --version
→
Zugriff über das lokale Netzwerk
Standardmäßig hört Ollama auf 127.0.0.1:11434. Um es von einem anderen Gerät im LAN (Telefon, Laptop) zu nutzen, bearbeiten Sie /etc/systemd/system/ollama.service und fügen Sie Environment="OLLAMA_HOST=0.0.0.0:11434" hinzu. Danach führen Sie sudo systemctl daemon-reload && sudo systemctl restart ollama aus.

#2. Empfohlene Modelle für Raspberry Pi

Auf einem Pi 5 mit 8 GB haben Sie etwa 6,5 GB tatsächlich nutzbaren Arbeitsspeicher (das System und sein Cache belegen den Rest). Jedes LLM, das bei Q4-Quantisierung mehr als 4–5 GB benötigt, ist unbrauchbar – es lagert auf die microSD-Karte aus und fällt auf 0,1 tok/s ab.

Drei Modelle erzielen auf dem Pi 5 im August 2026 die besten Ergebnisse:

Qwen 3.5 2B (Alibaba, Apache 2.0)
Spitzenreiter beim Verhältnis von Leistung zu RAM-Bedarf. 1,9 GB in Q4_K_M, multimodal, 256k Kontext, hervorragend für kurze Chats und auf Französisch. Ideal für einen einfachen Assistenten oder Sprachsteuerung.
Granite 4.2 3B (IBM, Apache 2.0)
Sehr sparsam und token-effizient. 2,2 GB in Q4_K_M. Eine Stufe höher in der Qualität beim Reasoning, ausgelegt für den Dauerbetrieb (H24), ohne den RAM zu sättigen. Solide im Multilingualen.
Qwen 3.5 4B (Alibaba, Apache 2.0)
Das neue „kleine Standardmodell“ und das leistungsfähigste der drei. 3,4 GB in Q4_K_M. Passt in den RAM eines Pi 5 mit 8 GB, allerdings bleibt wenig Spielraum – keine ressourcenintensive grafische Oberfläche parallel betreiben.
Die drei Modelle herunterladen
ollama pull qwen3.5:2b
ollama pull granite4.2:3b
ollama pull qwen3.5:4b
i
Warum nicht gpt-oss 20B oder Mistral Small 24B?
Diese Modelle benötigen in Q4 etwa 14 GB und passen nicht in die tatsächlich nutzbaren 6,5 GB eines Pi 5 mit 8 GB. Selbst ein Pi mit 16 GB müsste dafür auf Swap zurückgreifen und käme nur auf 0,3–0,5 tok/s – unbrauchbar. Bleiben Sie auf dem Pi unter 4B; diese Modelle benötigen einen Mac oder eine GPU.

#3. Benchmarks in Tokens/s (Größenordnungen)

Größenordnungen, ermittelt auf einem Raspberry Pi 5 mit 8 GB, offiziellem Aktivkühler, NVMe-SSD über ein M.2-HAT, Pi OS Bookworm 64-Bit, einer aktuellen Ollama-Version, Q4_K_M-Quantisierung und einem Prompt zur Generierung von 200 Tokens. Die Zahlen variieren je nach Ollama-Version und thermischen Bedingungen – betrachten Sie sie als Größenordnungen, nicht als absolute Werte.

Qwen 3.5 2B Q4_K_M
≈ 4,4 Token/s Generierung · 6,6 Token/s Prompt-Verarbeitung · 1,9 GB RAM · 9,6 W
Granite 4.2 3B Q4_K_M
≈ 3,4 Tokens/s Generierung · 5,1 Tokens/s Prompt-Verarbeitung · 2,2 GB RAM · 10,2 W
Qwen 3.5 4B Q4_K_M
≈ 2,3 Tokens/Sekunde Generierung · 3,6 Tok/s Prompt-Bewertung · 3,4 GB RAM · 11,2 W
Gemma 4 E2B (multimodale Referenz)
≈ 3,9 Tokens/s · 4,3 GB RAM · 10,4 W. Schnelles MoE, aber mit höherem RAM-Bedarf.
Granite 4.2 3B Q3_K_S (ressourcensparende Variante)
≈ 3,6 Tokens/sec · 1,7 GB RAM · 9,9 W. Leichtestes Modell, ideal, wenn die RAM-Kapazität begrenzt ist (Pi 4 GB).
→
Diese Zahlen einordnen
Bei 5 tok/s liegt eine Antwort mit 80 Wörtern nach 20–25 Sekunden vor. Das ist langsamer als ein Cloud-Assistent, reicht aber für nicht interaktive Anwendungen (Benachrichtigungen, Batch-Zusammenfassungen, asynchrone Sprachsteuerung) mehr als aus.
Diese Benchmarks auf Ihrem eigenen System reproduzieren
ollama run qwen3.5:2b --verbose "Explique en 100 mots ce qu'est un Raspberry Pi."

Das Flag --verbose zeigt am Ende der Generierung folgende Werte an: eval rate (tok/s), prompt eval rate, total duration. Das ist die offizielle Messung für Vergleiche.

#4. Sinnvolle Offline-Anwendungsfälle

Bei 2–5 Tok/s ist die Inferenz auf dem Pi nicht für Echtzeit-Chats ausgelegt. Ihre Stärken liegen in Anwendungsfällen, in denen die Latenz nicht entscheidend ist oder Datenschutz und Autonomie wichtiger sind als Geschwindigkeit.

Lokaler Sprachassistent
Pi 5 + USB-Mikrofon + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS. Frage → Transkription → Antwort → synthetisierte Stimme, alles in 8–12 s ohne Cloud. Offline-Hausautomation, Kiosk für Kinder, Lernroboter.
E-Mails oder Nachrichten im Batch zusammenfassen
Cron-Job, der stündlich die RSS-Feeds abruft, sie mit Qwen 3.5 4B zusammenfasst und die Zusammenfassungen an Telegram/Matrix sendet. Bei asynchroner Ausführung ist die Inferenzverzögerung nicht wahrnehmbar.
Protokoll- oder Ticketklassifizierung
Pi am Netzwerkrand, der eingehende Logs ('kritischer Fehler', 'Spam', 'normal') markiert, bevor er sie an einen zentralen Server sendet. Spart WAN-Bandbreite.
Demo auf einem eingebetteten System / portable Demo
Präsentation beim Kunden, Schulworkshop, Konferenz: Pi 5 in der Tasche, USB-C-Akku, zu 100 % autonome Demo lokaler KI.
Schutzmechanismus für andere LLMs
Ein kleines lokales Modell, das einen Prompt filtert oder umformuliert, bevor es ihn an ein Cloud-LLM sendet. Nützlich, um sensible Daten direkt auf dem Edge-Gerät zu anonymisieren.
!
Fälle, in denen der Pi nicht ausreicht
RAG mit mehr als 50 Dokumenten, umfangreiche Codegenerierung, Agenten mit komplexen Tool-Aufrufen, schrittweises Schlussfolgern (Chain-of-Thought-Modelle wie Qwen 3.8 27B) – wählen Sie in diesen Fällen eher einen Mac mini M4 oder einen Mini-PC von GMKtec/Beelink. Das Verhältnis von Leistung zu Preis ist dort deutlich besser.

#5. Spezifische Optimierungen für Pi

#Das Kontextfenster verkleinern

Standardmäßig verwendet Ollama num_ctx=2048. Auf einem Pi ist das bereits viel – jedes Kontexttoken verbraucht RAM und verlangsamt die Prompt-Auswertung. Für einen Chatassistenten mit kurzen Gesprächen reduzieren Sie den Wert auf 1024.

Zur Laufzeit in der Sitzung
/set parameter num_ctx 1024

#Threads begrenzen

Ollama nutzt standardmäßig alle Kerne. Auf dem Pi 5 (4 Kerne) ist das für die reine Geschwindigkeit optimal, lastet den SoC aber vollständig aus, was nach 1–2 Minuten zu thermischer Drosselung führt. Bei längerer Nutzung hält eine Begrenzung auf 3 Kerne den Durchsatz länger stabil.

Die Anzahl der Threads über env begrenzen
OLLAMA_NUM_PARALLEL=1 OLLAMA_NUM_THREAD=3 ollama serve

#NVMe gegenüber microSD bevorzugen

Beim ersten Laden eines Modells von einer SD-Karte werden mehrere GB sequenziell gelesen. SD A1 → 30–40 Sekunden für Phi-3.5 Mini. NVMe → 3–5 Sekunden. Sobald das Modell im RAM liegt, ist die Inferenz identisch.

#Eine Stufe heruntergehen, wenn der RAM nicht ausreicht

Auf einem Pi 5 mit 8 GB RAM und aktiver grafischer Oberfläche kann Qwen 3.5 4B in Q4_K_M anfangen, Daten in den Swap-Speicher auszulagern. Zwei Optionen: auf Granite 4.2 3B (2,2 GB) oder Qwen 3.5 2B (1,9 GB) wechseln. Diese Modelle geben 1 bis 1,5 GB RAM frei, ohne dass die Qualität stark einbricht.

Leichteres Modell
ollama pull granite4.2:3b
→
Headless-Modus empfohlen
Wenn Sie den Pi als dedizierten Inferenzserver einrichten, deaktivieren Sie die LXDE-Desktopumgebung: sudo raspi-config → Boot Options → Console. Dadurch werden 300–500 MB RAM frei – genug, um bequem von einem 2B-Modell auf ein 4B-Modell umzusteigen.

#Fehlerbehebung

ollama: command not found nach der Installation
Das systemd-Skript ist fehlgeschlagen (häufige Ursache: Pi OS ist zu alt). Prüfen Sie sudo systemctl status ollama. Bei der Fehlermeldung 'exec format error' verwenden Sie ein 32-Bit-System – installieren Sie Pi OS in der 64-Bit-Version neu.
Das Modell wird geladen, aber nur 0,3 tok/s
Ihr System nutzt Swap. Prüfen Sie free -h: Wenn der Wert in der Spalte 'available' während der Inferenz unter 500 MB liegt, ist Ihr Modell zu groß. Wechseln Sie zu einem kleineren Modell wie Granite 4.2 3B oder Qwen 3.5 2B oder zur Quantisierung Q3.
Thermische Drosselung nach 1 Minute
Die Temperatur des SoC hat 80 °C überschritten. Prüfen Sie sie während der Inferenz mit vcgencmd measure_temp. Lösung: offizieller Lüfter oder Argon ONE V3. Ohne aktive Kühlung ist die Pi 5 bei der Inferenz nicht im Dauerbetrieb nutzbar.
Out of memory mitten in der Generierung
Der Linux-OOM-Killer hat Ollama beendet. Reduzieren Sie num_ctx auf 1024, schließen Sie den Browser oder wechseln Sie zu einem kleineren Modell. Bleiben Sie auf einem Pi mit 4 GB bei Qwen 3.5 2B, dem kleinsten Modell im Katalog 2026.
Der Ollama-Dienst startet nicht beim Systemstart
sudo systemctl enable ollama pour activer l'autostart. Vérifiez ensuite avec systemctl is-enabled ollama.

#Weiterführende Informationen

Sobald Ollama auf Ihrem Pi 5 läuft, bieten sich drei naheliegende Möglichkeiten zur Vertiefung an:

Quantisierung verstehen, um mehr herauszuholen
Der Leitfaden zur Auswahl der Quantisierung vergleicht Q3, Q4, Q5 und Q8 im Detail. Auf dem Pi ist das entscheidend, denn dort zählen jede 100 MB RAM.
In eine Python-Anwendung integrieren
Der Leitfaden „Ollama über die REST-API in Python integrieren“ zeigt, wie Sie Ihren Pi 5 aus einem Flask-/FastAPI-Skript heraus steuern – die Grundlage für jeden Edge-Assistenten.
Offline-Workflows automatisieren
Der Leitfaden zur Automatisierung mit n8n und Ollama lässt sich unverändert auf dem Pi anwenden (n8n läuft nativ auf ARM64). Ideal für einen autonomen KI-basierten Smart-Home-Hub.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.