Mittelstufe 11 Min.Smart Home

Home Assistant + lokales LLM: privates Smart Home, ohne cloud

Cloudbasierte Hausautomation – Google Home, Alexa, SmartThings – sendet laufend Informationen darüber, was bei Ihnen zu Hause passiert, an entfernte Server. Ein lokales LLM für die Hausautomation zum Schutz Ihrer Privatsphäre kehrt dieses Prinzip um: Ihr Home-Assistant-Server steuert Ihre Lampen und Thermostate, ein Ollama-Modell übersetzt Ihre Wünsche in Aktionen, und nichts verlässt das lokale Netzwerk. Dieser Leitfaden zeigt, wie Sie Ollama konkret mit Home Assistant verbinden, welches ressourcenschonende Modell Sie wählen sollten, um unter zwei Sekunden Latenz zu bleiben, und welchen tatsächlichen Gewinn an Vertraulichkeit Sie erzielen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein lokaler LLM für das vernetzte Zuhause?

Bei einem klassischen Cloud-Lautsprecher wird jeder gesprochene Satz an einen entfernten Server gesendet, um transkribiert, verstanden und ausgeführt zu werden. Die Transkription wird gespeichert und manchmal von externen Dienstleistern angehört, um die Modelle zu trainieren. Der Hersteller weiß, wann Sie nach Hause kommen, wann Sie im Schlafzimmer das Licht einschalten und wann Sie Ihre abendliche Playlist starten. Für viele Haushalte werden damit zu viele Informationen an zu viele Dritte weitergegeben.

Home Assistant packt das Problem an der Wurzel: Es ist eine Open-Source-Plattform, die auf Ihrer Hardware läuft und lokal mit vernetzten Geräten kommuniziert (Zigbee, Z-Wave, Matter, MQTT). Wenn Sie über Ollama ein lokales LLM hinzufügen, erhalten Sie einen Assistenten, der frei formulierte Sätze versteht („Dreh die Heizung im Wohnzimmer um zwei Grad herunter“, „Schalte alle Lampen im Erdgeschoss aus“), ohne dass Audiodaten oder Befehle das LAN verlassen.

Echte Vertraulichkeit
Keine Nutzungsdaten werden an Dritte gesendet. Auf Grundlage Ihrer Gewohnheiten wird kein Werbeprofil erstellt.
Funktioniert offline
Internetausfall, Ausfall eines Cloud-Anbieters — Ihr Zuhause reagiert weiterhin auf Befehle.
Vorhersehbare Latenz
Keine Datenübertragung zu einem Rechenzentrum und zurück mehr; die Latenz hängt ausschließlich von Ihrem Rechner ab.
Volle Kontrolle
Sie wählen das Modell, aktualisieren es, wann Sie wollen, und ersetzen es, wenn ein besseres erscheint.
i
Home Assistant in zwei Sätzen
Das ist ein Server (Python), der Hunderte von Smart-Home-Integrationen unter einer einzigen Oberfläche bündelt. Er lässt sich in wenigen Minuten auf einem Raspberry Pi, NUC oder Mini-PC oder in einem Docker-Container bereitstellen – und ist für seinen Betrieb auf keinen Online-Dienst angewiesen.

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Home Assistant bereit
Mindestens Version 2024.6 (die die native Ollama-Integration enthält). Idealerweise die neueste stabile Version. HA OS, HA Container und HA Supervised sind alle geeignet.
Eine Maschine für Ollama
Ollama kann auf demselben Rechner wie HA laufen, sofern dieser leistungsstark genug ist, oder auf einem separaten PC im LAN. Ein Mac mini M4, ein NUC i7 oder ein PC mit einer GPU mit mindestens 8 GB Speicher eignen sich dafür sehr gut.
Ollama installiert
Daemon auf Port 11434 aktiv. Prüfen Sie dies mit curl http://localhost:11434 – die Antwort muss Ollama is running lauten. Falls noch nichts eingerichtet ist, folgen Sie zuerst der Ollama-Installationsanleitung auf dieser Website.
Stabiles lokales Netzwerk
Idealerweise befinden sich HA und Ollama im selben VLAN, mit einer festen IP-Adresse für den Ollama-Server. Port 11434 muss zwischen beiden offen sein.
Ein geeignetes Modell
Darauf gehen wir gleich ein. Merken Sie sich zunächst, dass Sie ein Modell benötigen, das Tool Calling (das Aufrufen von Werkzeugen) beherrscht.
!
Reicht der Raspberry Pi 5 allein aus?
Ein Pi 5 mit 8 GB kann Home Assistant UND ein kleines 3B-Modell auf der CPU für kurze Befehle betreiben – die Latenz steigt jedoch schnell an (4–8 Sekunden pro Anfrage). Für eine flüssige Nutzung in der Familie sollten Sie einen eigenen Rechner für Ollama vorsehen und den Pi für HA behalten. Den Leitfaden zu LLMs auf dem Raspberry Pi 5 ansehen, wenn Sie alles auf einem Gerät vereinen möchten.

#Leichte Modelle für Smart-Home-Befehle

Das richtige Modell für die Hausautomation ist nicht unbedingt das größte: Es muss (1) Tool Calling korrekt unterstützen, um die Dienste von Home Assistant aufzurufen, (2) gut Französisch sprechen und (3) schnell antworten. Modelle mit 3B bis 8B in Q4_K_M bieten den idealen Kompromiss.

Qwen 3.5 9B (Q4_K_M, ~6,6 GB VRAM)
Die Referenzwahl für 8 GB im Jahr 2026. Robustes Tool Calling, hervorragendes Französisch, Bildverarbeitung und ein Kontextfenster von 256k, angemessene Latenz auf der GPU. Ein guter Ausgangspunkt für die Hausautomation.
Granite 4.2 8B (Q4_K_M, ~5,3 GB VRAM)
IBM, Apache 2.0, sehr sparsam im Tokenverbrauch bei 128k Kontext. Zuverlässige, sparsame Tool-Aufrufe: eine gute Alternative, wenn Qwen bei Ihren Befehlen vom Gewünschten abweicht.
Granite 4.2 3B (Q4_K_M, ~2,2 GB VRAM)
Für leistungsschwächere Systeme (Pi 5, NUC ohne GPU). Sehr ressourcensparend, Tool-Calling ist vorhanden, bei komplexen Befehlen aber weniger zuverlässig – bleiben Sie bei kurzen und expliziten Sätzen.
Gemma 4 12B (Q4_K_M, ~7,6 GB VRAM)
Wenn Sie eine RTX 3060 mit 12 GB oder eine bessere GPU besitzen. Multimodal, Apache 2.0, deutlicher Gewinn bei mehrdeutigen Befehlen („Sorge im Wohnzimmer für eine gemütliche Atmosphäre“) und beim Kontextverständnis.
Mistral Small 24B (Q4_K_M, ~14 GB VRAM)
Sehr gut im Französischen und vielseitig einsetzbar; für Grafikkarten mit mindestens 16 GB vorsehen. Gut geeignet für ausführliche Dialoge zusätzlich zur reinen Haussteuerung.
→
Empfohlene Quantisierung: Q4_K_M
Für die Hausautomatisierung bietet Q4_K_M den besten Kompromiss zwischen VRAM-Bedarf und Qualität. Ein Wechsel zu Q5 oder Q8 ist unnötig: Bei kurzen, strukturierten Befehlen ist kein Unterschied erkennbar. Verwenden Sie Quantisierungen mit höherer Präzision für freie Dialoge oder RAG.

#1. Ollama mit Home Assistant verbinden

Die Ollama-Integration ist seit Version 2024.6 offiziell in Home Assistant verfügbar. Sie lässt sich vollständig über die Benutzeroberfläche konfigurieren, ohne configuration.yaml zu bearbeiten.

  1. 01
    Das Modell auf dem Ollama-Rechner herunterladen
    Auf der Maschine, die Ollama hostet, führen Sie den folgenden Shell-Befehl aus. Der Download beträgt 3–5 GB je nach gewähltem Modell.
Terminal — Ollama-Rechner
ollama pull qwen3.5:9b
ollama list  # vérifier que le modèle apparaît
  1. 01
    Ollama im LAN zugänglich machen
    Standardmäßig lauscht Ollama nur auf localhost. Damit Home Assistant (möglicherweise auf einem anderen Rechner) den Dienst aufrufen kann, machen Sie ihn auf allen Netzwerkschnittstellen verfügbar.
Linux/macOS — Ollama im LAN verfügbar machen
# systemd (Linux)
sudo systemctl edit ollama
# ajouter dans le bloc [Service]
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl restart ollama

# macOS (lancement manuel ou launchctl)
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# puis relancer Ollama
  1. 01
    Die Integration in Home Assistant hinzufügen
    Einstellungen > Geräte & Dienste > Integration hinzufügen > nach „Ollama“ suchen.
  2. 02
    URL eingeben
    URL: http://IP-DU-SERVEUR-OLLAMA:11434 (z. B. http://192.168.1.42:11434). Wenn Ollama auf derselben Maschine wie HA Container läuft, verwenden Sie http://host.docker.internal:11434.
  3. 03
    Das Modell auswählen
    Home Assistant fragt automatisch Ollama ab und zeigt die Liste der verfügbaren Modelle an. Wählen Sie qwen3.5:9b.
  4. 04
    Steuerung aktivieren (Control Home Assistant)
    Aktivieren Sie in den Optionen der Integration das Kontrollkästchen „Control Home Assistant“. Dadurch darf das LLM Dienste aufrufen (einschalten, ausschalten, Temperatur einstellen). Ohne dieses Häkchen kann es nur chatten.
!
Standardmäßig keine Authentifizierung bei Ollama
Ollama verfügt über keine integrierte Authentifizierung. Wenn Sie Port 11434 im LAN zugänglich machen, stellen Sie sicher, dass Ihr Router ihn nicht vom Internet aus erreichbar macht. Für eine stärker abgesicherte Konfiguration setzen Sie Ollama hinter einen Reverse-Proxy mit Basic Auth (Caddy, nginx) oder beschränken Sie den Zugriff in der Firewall nach IP-Adresse.

#2. Dem Assistenten die richtigen Entitäten zugänglich machen

Home Assistant verwaltet manchmal Hunderte von Entitäten (Sensoren, Steckdosen, Lampen, Ansichten, Automatisierungen …). Sie alle an das LLM zu senden, würde das Kontextfenster überfüllen und das Modell verwirren. Der Trick: Nur das zugänglich machen, was der Assistent tatsächlich steuern muss.

  1. 01
    Einstellungen > Stimme > Exponieren
    Liste aller Entitäten. Aktivieren Sie diejenigen, die vom Assistenten gesteuert werden sollen: Lichter, Thermostate, Steckdosen, Rollläden. Deaktivieren Sie interne Sensoren (RAM des Pi, Zigbee-Signal usw.), die für einen Menschen nichts nützen.
  2. 02
    Mit natürlichsprachlichen Namen umbenennen
    Eine Entität namens light.salon_lampe_principale_zigbee_3 ist unleserlich. Benennen Sie sie in „Hauptlampe im Wohnzimmer“ um. Das LLM wählt die richtige Entität anhand eines verständlichen Namens deutlich zuverlässiger aus.
  3. 03
    Nach Zone gruppieren
    Weisen Sie jeder Entität einen Bereich zu (Wohnzimmer, Küche, Schlafzimmer …). Das LLM kann dann „Schalte das Wohnzimmer aus“ verstehen, ohne dass Sie jede Lampe einzeln auflisten müssen.
  4. 04
    Testen
    Klicken Sie unter Einstellungen > Stimme > Assistenten auf das Chat-Symbol Ihrer Ollama-Pipeline und probieren Sie Folgendes aus: „Wie hoch ist die Temperatur im Schlafzimmer?“ und anschließend „Schalte die Hauptlampe im Wohnzimmer ein“.
→
Sinnvolle Grenze: 30–50 freigegebene Entitäten
Darüber hinaus beginnen Modelle mit 7–8B, ähnliche Entitäten zu verwechseln („Nachttischlampe“ gegenüber „Schreibtischlampe“). Wenn Sie 200 Glühbirnen haben, verwenden Sie die Bereiche und Gruppen von HA, statt jede Entität einzeln zugänglich zu machen.

#3. Sprachpipeline 100 % lokal (optional)

Wenn Sie laut sprechen möchten (statt in der HA-App zu tippen), können Sie mit Assist Spracherkennung → LLM → Sprachsynthese zu einer vollständig lokal laufenden Verarbeitungskette verbinden. Keine Abhängigkeit von Google oder Amazon.

Aktivierungswort — openWakeWord
Offizielles HA-Add-on. Erkennt ein Aktivierungswort („Hey Jarvis“, „Nabu“) auf einem Pi oder einem ESP32-Satelliten (Atom Echo, M5Stack).
STT (Speech-to-Text) — Whisper
Offizielles HA-Add-on auf Basis von faster-whisper. Das Modell tiny oder base reicht für kurze Befehle auf Französisch aus. Etwa 1–2 s für die Transkription auf einer ordentlichen CPU.
LLM — Ollama (bereits konfiguriert)
Empfängt die Transkription, ruft das passende HA-Tool auf und gibt einen Bestätigungssatz zurück.
TTS (text-to-speech) — Piper
Offizielles HA-Add-on. Native französische Stimmen (fr_FR-siwis-medium, fr_FR-tom-medium). Sehr schnell, ca. 200 ms pro Satz.

Sobald die vier Add-ons installiert und gestartet sind, lässt sich unter Einstellungen > Stimme > Assistenten die Pipeline zusammenstellen: Wählen Sie Whisper für STT, Ihre Ollama-Integration als Konversationsagenten und Piper für TTS. Ab diesem Moment lässt sich Ihr Zuhause per Sprache steuern, ohne jede ausgehende Verbindung.

i
Sprachsatellit ohne PC-Mikrofon
Ein ESP32-S3-BOX oder ein M5Stack Atom Echo mit aufgespielter ESPHome-Firmware wird zu einem Assist-Satelliten: Er erkennt das Aktivierungswort, sendet die Audiodaten an HA und spielt die TTS-Antwort ab. Kosten: 20–30 €. Mehrere Satelliten können im selben Haus betrieben werden.

#Latenz: lokal vs. Cloud

Dieses Argument wird oft übersehen. Die Cloud ist keine Zauberei: Jeder Befehl muss zum Rechenzentrum und wieder zurück, hinzu kommt eine Warteschlange auf dem Server. Bei lokaler Ausführung sparen Sie die Hälfte des Weges.

Cloud (Google/Alexa)
STT in der Cloud (~400 ms) + Intent-Erkennung in der Cloud (~300 ms) + HA-Aktion über die Cloud (~200 ms) + TTS (~300 ms) = durchschnittlich 1,2–1,8 s, bei hoher Netzwerklast mehr.
Lokal — Pi 5 + LLM 3B CPU
STT Whisper tiny (~800 ms) + LLM 3B (~3–5 s auf der CPU) + Aktion (~50 ms) + TTS Piper (~200 ms) = 4–6 s. Für einen Befehl akzeptabel, bei intensiver Nutzung frustrierend.
Lokal — PC + 8B-LLM, GPU mit 8 GB
Whisper base (~400 ms) + LLM 8B Q4 (~600–900 ms) + Aktion (~50 ms) + TTS (~200 ms) = 1,3–1,6 s. Genauso schnell wie ein Google Home, ohne Cloud.
Lokal — Mac mini M4 24 GB
Die gesamte Pipeline benötigt etwa 1,1–1,4 s dank der integrierten GPU und des vereinheitlichten Speichers. Das ist wahrscheinlich das beste Verhältnis von Leistung zu Energieverbrauch für LLM-basierte Hausautomation im 24/7-Betrieb.
→
Modell geladen halten
Ollama entlädt inaktive Modelle standardmäßig nach 5 Minuten. Starten Sie Ollama für die Hausautomation mit OLLAMA_KEEP_ALIVE=24h – das Modell bleibt im VRAM, und der erste Befehl nach mehreren Stunden ohne Aktivität erhält genauso schnell eine Antwort wie der hundertste.

#Was das LAN wirklich verlässt (nichts)

Prüfen wir konkret, welche Daten betroffen sind. Bei einem gut konfigurierten Setup aus HA + Ollama + Whisper + Piper:

Audio, das vom Mikrofon aufgenommen wird
Lokal mit Whisper verarbeitet. Keine Audiodaten verlassen das Netzwerk.
Transkribierter Text Ihres Befehls
An die lokale Ollama-Instanz gesendet. Keine Transkription verlässt das Netzwerk.
Liste Ihrer Geräte und Zonen
Mit dem lokal laufenden Ollama geteilt, damit es die richtige Entität aufruft. Bleibt im LAN.
Entscheidung und Aktion in HA
Ausgeführt durch HA, das direkt lokal mit Zigbee/Z-Wave/Matter/MQTT kommuniziert.
Sprachausgabe mit Piper
Das Audio wird lokal synthetisiert. Keine synthetische Stimme wird online abgerufen.

Der einzige mögliche ausgehende Datenverkehr betrifft Updates von HA, Ollama und den Modellen – Sie entscheiden, wann Sie diese starten. Für eine strikt abgeschottete Nutzung lässt sich die Internetverbindung des HA-Rechners nach der Installation trennen: Alles funktioniert weiterhin.

i
Um es selbst zu überprüfen
Filtern Sie auf Ihrem Router (oder mit tcpdump auf dem Host) während der Nutzung des Assistenten den ausgehenden Datenverkehr der IP-Adressen von HA und Ollama. Sie werden nur DNS-Auflösungen und gegebenenfalls NTP-Verkehr sehen – keinen Datenverkehr zu einem KI-Dienst eines Drittanbieters.

#Tipps und Fehlerbehebung

Der LLM antwortet auf Englisch
Fügen Sie in der Ollama-Integration einen Systemprompt hinzu: „Du bist der Smart-Home-Assistent des Hauses. Antworte immer auf Französisch und in einem kurzen Satz.“ Diese Anweisung reicht bei Qwen 3.5 oder Granite 4.2 aus.
Es erfindet nicht existierende Entitäten
Ein Anzeichen für ein zu kleines Modell oder einen mehrdeutigen Entitätsnamen. Benennen Sie die Entitäten in natürlicher Sprache, reduzieren Sie die Anzahl der für das Modell zugänglichen Entitäten oder wechseln Sie zu Gemma 4 12B, wenn genügend VRAM verfügbar ist.
Er ruft den richtigen Dienst auf, aber für den falschen Bereich
Prüfen Sie, ob jeder Entität in HA eine „area“ zugewiesen ist. Ohne Bereich muss das Modell raten und macht bei ähnlichen Namen Fehler.
Latenz, die sich nach einigen Stunden erheblich verringert
Ollama hat das Modell aus dem Speicher entladen. Starten Sie den Dienst mit OLLAMA_KEEP_ALIVE=24h (oder 168h für eine Woche).
Connection refused beim Zugriff von HA aus
Ollama lauscht weiterhin auf 127.0.0.1. Überprüfen Sie OLLAMA_HOST=0.0.0.0:11434 in der systemd-Unit, starten Sie Ollama neu und testen Sie mit curl vom HA-Rechner aus.
Pi 5 wird im CPU-Betrieb heiß
Beim Betrieb auf der CPU lastet das LLM alle 4 Kerne zu 100 % aus. Bauen Sie einen aktiven Lüfter ein (oder verwenden Sie ein Argon ONE V3-Gehäuse für den Pi 5), wenn Sie unbedingt alles auf dem Pi laufen lassen möchten. Andernfalls verlagern Sie Ollama auf einen anderen Host.
Sie möchten Ollama auf das LAN beschränken
Lassen Sie Ollama statt auf 0.0.0.0:11434 auf der konkreten LAN-IP-Adresse lauschen (z. B. OLLAMA_HOST=192.168.1.42:11434). Ollama akzeptiert dann keine Verbindungen mehr über andere Netzwerkschnittstellen.

#Weiterführende Informationen

Sie haben einen funktionierenden lokalen LLM-Assistenten für die Smart-Home-Steuerung. Einige Anregungen für weitere Schritte:

Ollama unter Linux installieren
Wenn Sie eine Linux-Maschine für Ollama reservieren möchten (das sauberste Szenario für eine 24/7-Heimautomatisierung), umfasst der Linux-Installationsleitfaden systemd, GPU NVIDIA/AMD und die Netzwerkkonfiguration.
LLM auf Raspberry Pi 5
Um konkret einzuschätzen, was auf einem Pi 5 mit 8 GB im reinen CPU-Betrieb läuft, mit Benchmarks in Tokens pro Sekunde und einer Auswahl an Modellen mit 1 bis 3 Milliarden Parametern.
Die Quantisierung wählen (Q4, Q5, Q8)
Um zu verstehen, warum Q4_K_M der optimale Kompromiss für die Hausautomation ist und wann es sinnvoll ist, auf Q5_K_M hochzugehen oder auf Q3 herunterzugehen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.