Home Assistant + lokales LLM: privates Smart Home, ohne cloud
Cloudbasierte Hausautomation – Google Home, Alexa, SmartThings – sendet laufend Informationen darüber, was bei Ihnen zu Hause passiert, an entfernte Server. Ein lokales LLM für die Hausautomation zum Schutz Ihrer Privatsphäre kehrt dieses Prinzip um: Ihr Home-Assistant-Server steuert Ihre Lampen und Thermostate, ein Ollama-Modell übersetzt Ihre Wünsche in Aktionen, und nichts verlässt das lokale Netzwerk. Dieser Leitfaden zeigt, wie Sie Ollama konkret mit Home Assistant verbinden, welches ressourcenschonende Modell Sie wählen sollten, um unter zwei Sekunden Latenz zu bleiben, und welchen tatsächlichen Gewinn an Vertraulichkeit Sie erzielen.
#Warum ein lokaler LLM für das vernetzte Zuhause?
Bei einem klassischen Cloud-Lautsprecher wird jeder gesprochene Satz an einen entfernten Server gesendet, um transkribiert, verstanden und ausgeführt zu werden. Die Transkription wird gespeichert und manchmal von externen Dienstleistern angehört, um die Modelle zu trainieren. Der Hersteller weiß, wann Sie nach Hause kommen, wann Sie im Schlafzimmer das Licht einschalten und wann Sie Ihre abendliche Playlist starten. Für viele Haushalte werden damit zu viele Informationen an zu viele Dritte weitergegeben.
Home Assistant packt das Problem an der Wurzel: Es ist eine Open-Source-Plattform, die auf Ihrer Hardware läuft und lokal mit vernetzten Geräten kommuniziert (Zigbee, Z-Wave, Matter, MQTT). Wenn Sie über Ollama ein lokales LLM hinzufügen, erhalten Sie einen Assistenten, der frei formulierte Sätze versteht („Dreh die Heizung im Wohnzimmer um zwei Grad herunter“, „Schalte alle Lampen im Erdgeschoss aus“), ohne dass Audiodaten oder Befehle das LAN verlassen.
- Echte Vertraulichkeit
- Keine Nutzungsdaten werden an Dritte gesendet. Auf Grundlage Ihrer Gewohnheiten wird kein Werbeprofil erstellt.
- Funktioniert offline
- Internetausfall, Ausfall eines Cloud-Anbieters — Ihr Zuhause reagiert weiterhin auf Befehle.
- Vorhersehbare Latenz
- Keine Datenübertragung zu einem Rechenzentrum und zurück mehr; die Latenz hängt ausschließlich von Ihrem Rechner ab.
- Volle Kontrolle
- Sie wählen das Modell, aktualisieren es, wann Sie wollen, und ersetzen es, wenn ein besseres erscheint.
#Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Home Assistant bereit
- Mindestens Version 2024.6 (die die native Ollama-Integration enthält). Idealerweise die neueste stabile Version. HA OS, HA Container und HA Supervised sind alle geeignet.
- Eine Maschine für Ollama
- Ollama kann auf demselben Rechner wie HA laufen, sofern dieser leistungsstark genug ist, oder auf einem separaten PC im LAN. Ein Mac mini M4, ein NUC i7 oder ein PC mit einer GPU mit mindestens 8 GB Speicher eignen sich dafür sehr gut.
- Ollama installiert
- Daemon auf Port 11434 aktiv. Prüfen Sie dies mit curl http://localhost:11434 – die Antwort muss Ollama is running lauten. Falls noch nichts eingerichtet ist, folgen Sie zuerst der Ollama-Installationsanleitung auf dieser Website.
- Stabiles lokales Netzwerk
- Idealerweise befinden sich HA und Ollama im selben VLAN, mit einer festen IP-Adresse für den Ollama-Server. Port 11434 muss zwischen beiden offen sein.
- Ein geeignetes Modell
- Darauf gehen wir gleich ein. Merken Sie sich zunächst, dass Sie ein Modell benötigen, das Tool Calling (das Aufrufen von Werkzeugen) beherrscht.
#Leichte Modelle für Smart-Home-Befehle
Das richtige Modell für die Hausautomation ist nicht unbedingt das größte: Es muss (1) Tool Calling korrekt unterstützen, um die Dienste von Home Assistant aufzurufen, (2) gut Französisch sprechen und (3) schnell antworten. Modelle mit 3B bis 8B in Q4_K_M bieten den idealen Kompromiss.
- Qwen 3.5 9B (Q4_K_M, ~6,6 GB VRAM)
- Die Referenzwahl für 8 GB im Jahr 2026. Robustes Tool Calling, hervorragendes Französisch, Bildverarbeitung und ein Kontextfenster von 256k, angemessene Latenz auf der GPU. Ein guter Ausgangspunkt für die Hausautomation.
- Granite 4.2 8B (Q4_K_M, ~5,3 GB VRAM)
- IBM, Apache 2.0, sehr sparsam im Tokenverbrauch bei 128k Kontext. Zuverlässige, sparsame Tool-Aufrufe: eine gute Alternative, wenn Qwen bei Ihren Befehlen vom Gewünschten abweicht.
- Granite 4.2 3B (Q4_K_M, ~2,2 GB VRAM)
- Für leistungsschwächere Systeme (Pi 5, NUC ohne GPU). Sehr ressourcensparend, Tool-Calling ist vorhanden, bei komplexen Befehlen aber weniger zuverlässig – bleiben Sie bei kurzen und expliziten Sätzen.
- Gemma 4 12B (Q4_K_M, ~7,6 GB VRAM)
- Wenn Sie eine RTX 3060 mit 12 GB oder eine bessere GPU besitzen. Multimodal, Apache 2.0, deutlicher Gewinn bei mehrdeutigen Befehlen („Sorge im Wohnzimmer für eine gemütliche Atmosphäre“) und beim Kontextverständnis.
- Mistral Small 24B (Q4_K_M, ~14 GB VRAM)
- Sehr gut im Französischen und vielseitig einsetzbar; für Grafikkarten mit mindestens 16 GB vorsehen. Gut geeignet für ausführliche Dialoge zusätzlich zur reinen Haussteuerung.
#1. Ollama mit Home Assistant verbinden
Die Ollama-Integration ist seit Version 2024.6 offiziell in Home Assistant verfügbar. Sie lässt sich vollständig über die Benutzeroberfläche konfigurieren, ohne configuration.yaml zu bearbeiten.
- 01Das Modell auf dem Ollama-Rechner herunterladenAuf der Maschine, die Ollama hostet, führen Sie den folgenden Shell-Befehl aus. Der Download beträgt 3–5 GB je nach gewähltem Modell.
- 01Ollama im LAN zugänglich machenStandardmäßig lauscht Ollama nur auf localhost. Damit Home Assistant (möglicherweise auf einem anderen Rechner) den Dienst aufrufen kann, machen Sie ihn auf allen Netzwerkschnittstellen verfügbar.
- 01Die Integration in Home Assistant hinzufügenEinstellungen > Geräte & Dienste > Integration hinzufügen > nach „Ollama“ suchen.
- 02URL eingebenURL: http://IP-DU-SERVEUR-OLLAMA:11434 (z. B. http://192.168.1.42:11434). Wenn Ollama auf derselben Maschine wie HA Container läuft, verwenden Sie http://host.docker.internal:11434.
- 03Das Modell auswählenHome Assistant fragt automatisch Ollama ab und zeigt die Liste der verfügbaren Modelle an. Wählen Sie qwen3.5:9b.
- 04Steuerung aktivieren (Control Home Assistant)Aktivieren Sie in den Optionen der Integration das Kontrollkästchen „Control Home Assistant“. Dadurch darf das LLM Dienste aufrufen (einschalten, ausschalten, Temperatur einstellen). Ohne dieses Häkchen kann es nur chatten.
#2. Dem Assistenten die richtigen Entitäten zugänglich machen
Home Assistant verwaltet manchmal Hunderte von Entitäten (Sensoren, Steckdosen, Lampen, Ansichten, Automatisierungen …). Sie alle an das LLM zu senden, würde das Kontextfenster überfüllen und das Modell verwirren. Der Trick: Nur das zugänglich machen, was der Assistent tatsächlich steuern muss.
- 01Einstellungen > Stimme > ExponierenListe aller Entitäten. Aktivieren Sie diejenigen, die vom Assistenten gesteuert werden sollen: Lichter, Thermostate, Steckdosen, Rollläden. Deaktivieren Sie interne Sensoren (RAM des Pi, Zigbee-Signal usw.), die für einen Menschen nichts nützen.
- 02Mit natürlichsprachlichen Namen umbenennenEine Entität namens light.salon_lampe_principale_zigbee_3 ist unleserlich. Benennen Sie sie in „Hauptlampe im Wohnzimmer“ um. Das LLM wählt die richtige Entität anhand eines verständlichen Namens deutlich zuverlässiger aus.
- 03Nach Zone gruppierenWeisen Sie jeder Entität einen Bereich zu (Wohnzimmer, Küche, Schlafzimmer …). Das LLM kann dann „Schalte das Wohnzimmer aus“ verstehen, ohne dass Sie jede Lampe einzeln auflisten müssen.
- 04TestenKlicken Sie unter Einstellungen > Stimme > Assistenten auf das Chat-Symbol Ihrer Ollama-Pipeline und probieren Sie Folgendes aus: „Wie hoch ist die Temperatur im Schlafzimmer?“ und anschließend „Schalte die Hauptlampe im Wohnzimmer ein“.
#3. Sprachpipeline 100 % lokal (optional)
Wenn Sie laut sprechen möchten (statt in der HA-App zu tippen), können Sie mit Assist Spracherkennung → LLM → Sprachsynthese zu einer vollständig lokal laufenden Verarbeitungskette verbinden. Keine Abhängigkeit von Google oder Amazon.
- Aktivierungswort — openWakeWord
- Offizielles HA-Add-on. Erkennt ein Aktivierungswort („Hey Jarvis“, „Nabu“) auf einem Pi oder einem ESP32-Satelliten (Atom Echo, M5Stack).
- STT (Speech-to-Text) — Whisper
- Offizielles HA-Add-on auf Basis von faster-whisper. Das Modell tiny oder base reicht für kurze Befehle auf Französisch aus. Etwa 1–2 s für die Transkription auf einer ordentlichen CPU.
- LLM — Ollama (bereits konfiguriert)
- Empfängt die Transkription, ruft das passende HA-Tool auf und gibt einen Bestätigungssatz zurück.
- TTS (text-to-speech) — Piper
- Offizielles HA-Add-on. Native französische Stimmen (fr_FR-siwis-medium, fr_FR-tom-medium). Sehr schnell, ca. 200 ms pro Satz.
Sobald die vier Add-ons installiert und gestartet sind, lässt sich unter Einstellungen > Stimme > Assistenten die Pipeline zusammenstellen: Wählen Sie Whisper für STT, Ihre Ollama-Integration als Konversationsagenten und Piper für TTS. Ab diesem Moment lässt sich Ihr Zuhause per Sprache steuern, ohne jede ausgehende Verbindung.
#Latenz: lokal vs. Cloud
Dieses Argument wird oft übersehen. Die Cloud ist keine Zauberei: Jeder Befehl muss zum Rechenzentrum und wieder zurück, hinzu kommt eine Warteschlange auf dem Server. Bei lokaler Ausführung sparen Sie die Hälfte des Weges.
- Cloud (Google/Alexa)
- STT in der Cloud (~400 ms) + Intent-Erkennung in der Cloud (~300 ms) + HA-Aktion über die Cloud (~200 ms) + TTS (~300 ms) = durchschnittlich 1,2–1,8 s, bei hoher Netzwerklast mehr.
- Lokal — Pi 5 + LLM 3B CPU
- STT Whisper tiny (~800 ms) + LLM 3B (~3–5 s auf der CPU) + Aktion (~50 ms) + TTS Piper (~200 ms) = 4–6 s. Für einen Befehl akzeptabel, bei intensiver Nutzung frustrierend.
- Lokal — PC + 8B-LLM, GPU mit 8 GB
- Whisper base (~400 ms) + LLM 8B Q4 (~600–900 ms) + Aktion (~50 ms) + TTS (~200 ms) = 1,3–1,6 s. Genauso schnell wie ein Google Home, ohne Cloud.
- Lokal — Mac mini M4 24 GB
- Die gesamte Pipeline benötigt etwa 1,1–1,4 s dank der integrierten GPU und des vereinheitlichten Speichers. Das ist wahrscheinlich das beste Verhältnis von Leistung zu Energieverbrauch für LLM-basierte Hausautomation im 24/7-Betrieb.
#Was das LAN wirklich verlässt (nichts)
Prüfen wir konkret, welche Daten betroffen sind. Bei einem gut konfigurierten Setup aus HA + Ollama + Whisper + Piper:
- Audio, das vom Mikrofon aufgenommen wird
- Lokal mit Whisper verarbeitet. Keine Audiodaten verlassen das Netzwerk.
- Transkribierter Text Ihres Befehls
- An die lokale Ollama-Instanz gesendet. Keine Transkription verlässt das Netzwerk.
- Liste Ihrer Geräte und Zonen
- Mit dem lokal laufenden Ollama geteilt, damit es die richtige Entität aufruft. Bleibt im LAN.
- Entscheidung und Aktion in HA
- Ausgeführt durch HA, das direkt lokal mit Zigbee/Z-Wave/Matter/MQTT kommuniziert.
- Sprachausgabe mit Piper
- Das Audio wird lokal synthetisiert. Keine synthetische Stimme wird online abgerufen.
Der einzige mögliche ausgehende Datenverkehr betrifft Updates von HA, Ollama und den Modellen – Sie entscheiden, wann Sie diese starten. Für eine strikt abgeschottete Nutzung lässt sich die Internetverbindung des HA-Rechners nach der Installation trennen: Alles funktioniert weiterhin.
#Tipps und Fehlerbehebung
- Der LLM antwortet auf Englisch
- Fügen Sie in der Ollama-Integration einen Systemprompt hinzu: „Du bist der Smart-Home-Assistent des Hauses. Antworte immer auf Französisch und in einem kurzen Satz.“ Diese Anweisung reicht bei Qwen 3.5 oder Granite 4.2 aus.
- Es erfindet nicht existierende Entitäten
- Ein Anzeichen für ein zu kleines Modell oder einen mehrdeutigen Entitätsnamen. Benennen Sie die Entitäten in natürlicher Sprache, reduzieren Sie die Anzahl der für das Modell zugänglichen Entitäten oder wechseln Sie zu Gemma 4 12B, wenn genügend VRAM verfügbar ist.
- Er ruft den richtigen Dienst auf, aber für den falschen Bereich
- Prüfen Sie, ob jeder Entität in HA eine „area“ zugewiesen ist. Ohne Bereich muss das Modell raten und macht bei ähnlichen Namen Fehler.
- Latenz, die sich nach einigen Stunden erheblich verringert
- Ollama hat das Modell aus dem Speicher entladen. Starten Sie den Dienst mit OLLAMA_KEEP_ALIVE=24h (oder 168h für eine Woche).
- Connection refused beim Zugriff von HA aus
- Ollama lauscht weiterhin auf 127.0.0.1. Überprüfen Sie OLLAMA_HOST=0.0.0.0:11434 in der systemd-Unit, starten Sie Ollama neu und testen Sie mit curl vom HA-Rechner aus.
- Pi 5 wird im CPU-Betrieb heiß
- Beim Betrieb auf der CPU lastet das LLM alle 4 Kerne zu 100 % aus. Bauen Sie einen aktiven Lüfter ein (oder verwenden Sie ein Argon ONE V3-Gehäuse für den Pi 5), wenn Sie unbedingt alles auf dem Pi laufen lassen möchten. Andernfalls verlagern Sie Ollama auf einen anderen Host.
- Sie möchten Ollama auf das LAN beschränken
- Lassen Sie Ollama statt auf 0.0.0.0:11434 auf der konkreten LAN-IP-Adresse lauschen (z. B. OLLAMA_HOST=192.168.1.42:11434). Ollama akzeptiert dann keine Verbindungen mehr über andere Netzwerkschnittstellen.
#Weiterführende Informationen
Sie haben einen funktionierenden lokalen LLM-Assistenten für die Smart-Home-Steuerung. Einige Anregungen für weitere Schritte:
- Ollama unter Linux installieren
- Wenn Sie eine Linux-Maschine für Ollama reservieren möchten (das sauberste Szenario für eine 24/7-Heimautomatisierung), umfasst der Linux-Installationsleitfaden systemd, GPU NVIDIA/AMD und die Netzwerkkonfiguration.
- LLM auf Raspberry Pi 5
- Um konkret einzuschätzen, was auf einem Pi 5 mit 8 GB im reinen CPU-Betrieb läuft, mit Benchmarks in Tokens pro Sekunde und einer Auswahl an Modellen mit 1 bis 3 Milliarden Parametern.
- Die Quantisierung wählen (Q4, Q5, Q8)
- Um zu verstehen, warum Q4_K_M der optimale Kompromiss für die Hausautomation ist und wann es sinnvoll ist, auf Q5_K_M hochzugehen oder auf Q3 herunterzugehen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.