Hermes Agent mit Ollama: Gedächtnis, Tools und limites
Ja: Hermes Agent von Nous Research lässt sich mit einer lokalen Ollama-Instanz verbinden, indem Sie einen benutzerdefinierten Anbieter mit der Adresse http://127.0.0.1:11434 und einem leeren API-Schlüssel konfigurieren. Lokale Inferenz bedeutet jedoch nicht, dass der Agent standardmäßig offline arbeitet: Websuche, Sprachsynthese und Cloud-Browser bleiben Dienste von Drittanbietern, solange sie nicht deaktiviert werden. Wählen Sie ein Modell, das ausdrücklich für Tool-Aufrufe ausgewiesen ist. Andernfalls kann es passieren, dass es eine Aktion nur beschreibt, statt sie auszuführen.
Hermes Agent ist das von Nous Research veröffentlichte Framework für autonome Agenten mit Terminal, persistentem Gedächtnis und Schnittstellen zu Messaging-Diensten. Dieser Leitfaden behandelt die Anbindung an eine lokale Ollama-Instanz, die Auswahl eines Modells, das Tools aufrufen kann, die Inhalte, die sein Gedächtnis tatsächlich bewahrt, sowie die Grenzen bei Sicherheit und Zuverlässigkeit, die Sie vor dem täglichen Einsatz kennen sollten.
#Was Hermes Agent ist
Hermes Agent (Repository NousResearch/hermes-agent) ist ein autonomer Kommandozeilenagent mit einer TUI, einem Messaging-Gateway (Telegram, Discord, Slack, WhatsApp, Signal) und einem System von Skills, die durch die Nutzung entstehen und sich verbessern. Er ersetzt nicht Hermes 4, ein Sprachmodell: Hermes Agent ist die Software, die Tool-Aufrufe, Gedächtnis und Terminal orchestriert, unabhängig davon, welches Modell dahinter angebunden ist.
Das Repository wird zügig weiterentwickelt: Die mit v2026.9.24 getaggte Version (Hermes Agent v0.21.5), veröffentlicht am 24. September 2026, umfasst mehrere Hundert Fehlerbehebungen seit der vorherigen Version. Nous Research veröffentlicht das Projekt unter der MIT-Lizenz, die eine berufliche Nutzung ohne Lizenzgebühren erlaubt, auch bei einer Bereitstellung in modifizierter Form.
Der Agent läuft in einem einzigen Gateway-Prozess, der mehrere Kanäle gleichzeitig bedienen kann: Das lokale Terminal, Telegram, Discord, Slack, WhatsApp und Signal teilen sich dasselbe Gedächtnis und denselben Gesprächsverlauf. Dadurch lässt sich eine Aufgabe am Arbeitsplatz starten und anschließend vom Telefon aus verfolgen, ohne die Modellkonfiguration oder das Gedächtnis für jeden Kanal duplizieren zu müssen.
#Ollama lokal anbinden
Agenten, die auf Ihrem Rechner handeln: agentisches Cline, MCP, n8n + Ollama und lokale Automatisierungen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Hermes Agent bindet selbst gehostete, OpenAI-kompatible Anbieter (Ollama, vLLM, llama.cpp) unter ihrem jeweiligen Provider-Namen ein. Die offizielle Dokumentation beschreibt das erwartete Format ausdrücklich: eine base_url, die auf den Server verweist, und ein leerer API-Schlüssel, der lediglich als Platzhalter dient.
Eine base_url, die nur aus host:port besteht (ohne /v1), erhält automatisch das von der OpenAI-kompatiblen API erwartete Suffix: Sie müssen es nicht manuell hinzufügen. Derselbe Mechanismus funktioniert auch für vLLM und llama.cpp, wenn Sie lediglich den Providernamen und den Port ändern.
Derselbe Konfigurationsblock kann für unterschiedliche Rollen verwendet werden: das Hauptmodell für die Unterhaltung, das Modell zur Kontextkomprimierung oder das Modell zur Erstellung eines Sitzungstitels. Jedes Modell kann auf einen anderen Anbieter verweisen — beispielsweise ein lokales Ollama-Modell für die Unterhaltung und ein schnelleres Cloud-Modell, das Hilfsaufgaben vorbehalten ist. So bleibt der Großteil des Austauschs vertraulich, während verhindert wird, dass ein kleines lokales Modell die Nebenaufgaben verlangsamt.
#Welches Modell für Tool-Aufrufe
Hermes Agent stellt mehr als 40 Tools bereit (Terminal, Dateien, Browser, Gedächtnis, Cron), die das Modell über strukturierte Aufrufe aufrufen muss, nicht durch eine bloße Beschreibung in Textform. Ein Ollama-Modell, das nicht für Tool-Calling trainiert wurde – oder eine zu aggressive Quantisierung desselben Modells – antwortet häufig mit einer Erklärung, statt den Aufruf auszulösen.
- Hauptmodell für Gespräche
- Bevorzugen Sie eine Ollama-Variante, die ausdrücklich als mit Tools kompatibel aufgeführt ist (Tag tools auf ollama.com/library), gegenüber einem allgemeinen Chat-Modell.
- Hilfsmodell (Überschriften, Kompression)
- Kann klein bleiben: Bei einem lokalen Provider mit nur einem Slot ruft Hermes Agent es nach der Antwort des Hauptdurchlaufs auf, nicht parallel, damit ein Server mit nur einem Slot die beiden Anfragen nicht vermischt.
- Format der Modellkennung
- Ein benannter Provider kann dem Modellnamen ein Präfix voranstellen, z. B. ollama-local/qwen3.6:27b-q4_k_m; dieses Präfix gilt auch dann, wenn nur die unveränderte Anfrage (ohne Präfix) beim Server ankommt.
Ein Detail, das Sie genau im Blick behalten sollten: Bei einem benutzerdefinierten lokalen Anbieter wird die Anfrage an das Modell zur Titelerzeugung erst nach Eingang der Antwort auf den aktuellen Gesprächsschritt gesendet, nicht gleichzeitig mit ihr. Auf einem lokalen Server mit nur einem Verarbeitungsplatz verhindert das, dass eine Titelanfrage im strukturierten JSON-Format die eigentliche Antwortgenerierung unterbricht – ein Detail der Ablaufplanung, das andernorts selten dokumentiert wird.
#Gedächtnis: Was tatsächlich erhalten bleibt
Das Gedächtnis von Hermes Agent basiert auf einfachen Textdateien, die direkt gelesen und bearbeitet werden können: MEMORY.md und USER.md im Profilverzeichnis. Das Modell entscheidet mithilfe eines speziellen Tools, was es wert ist, dort festgehalten zu werden – Präferenzen, dauerhafte Fakten und erlernte Verfahren.
Die vom Projekt selbst dokumentierte Schwachstelle: Ein kleines lokales Modell kann „Das ist gespeichert“ melden, ohne tatsächlich das Schreibwerkzeug aufgerufen zu haben. Die offizielle Dokumentation empfiehlt, bei einem lokalen Modell mit weniger als etwa 30 Milliarden Parametern oder mit unzuverlässigen Tool-Aufrufen ausdrücklich die Nutzung des Gedächtniswerkzeugs zu verlangen und anschließend die Datei zu überprüfen, statt immer mehr Anweisungen in den Prompt aufzunehmen.
#Sicherheit: acht Schichten, keine Mauer
Nous Research dokumentiert ein Sicherheitsmodell mit acht Schutzebenen: Autorisierung der Benutzer, menschliche Genehmigung gefährlicher Befehle, Schutzmechanismen beim Schreiben von Dateien, Isolierung durch Container (Docker, Singularity, Modal), Filterung der an MCP-Server übermittelten Zugangsdaten, Erkennung von Prompt-Injection in Kontextdateien, Isolierung zwischen Sitzungen und Validierung der Arbeitsverzeichnisse von Terminal-Tools.
Die Genehmigung gefährlicher Befehle lässt sich über approvals.mode in der Konfigurationsdatei einstellen. Es stehen drei Modi zur Verfügung: automatisch, manuell oder intelligent (der empfohlene Standardmodus, der Aktionen mit geringem Risiko genehmigt und alle anderen bis zur Freigabe blockiert).
#Grenzen eines kleinen lokalen Modells für diesen Agenten
Ein Agent mit so vielen Werkzeugen wie Hermes Agent stellt hohe Anforderungen an die Fähigkeit des Modells, Anweisungen zu befolgen: Gedächtnis, Planung, aufeinanderfolgende Werkzeugaufrufe und gelegentlich parallel arbeitende Unteragenten. Bei einem Modell mit 7 bis 14 Milliarden Parametern und Q4_K_M-Quantisierung müssen Sie mit fehlgeschlagenen Werkzeugaufrufen, Bestätigungen ohne tatsächliche Ausführung und häufigerer Kontextkomprimierung in langen Sitzungen rechnen.
| Funktion | Typisches Symptom |
|---|---|
| Gedächtnis (spezielles Tool) | Verbale Bestätigung, ohne die Datei tatsächlich zu schreiben |
| Verkettung von Tools | Das Modell beschreibt den nächsten Schritt, anstatt ihn auszuführen |
| Parallele Unteragenten | Schlecht übermittelte Anweisungen, Ergebnisse manuell gegenprüfen |
| Lange Sitzungen | Häufigere Kontextkompression, Verlust von alten Details |
Nichts davon ist spezifisch für Hermes Agent: Es handelt sich um eine bekannte Einschränkung kleiner quantisierter Modelle beim Umgang mit strukturierten Ausgabeformaten. Die vom Projekt dokumentierte Lösung besteht nicht darin, weitere Anweisungen hinzuzufügen, sondern zumindest für die Ersteinrichtung ein leistungsfähigeres Modell zu verwenden. Sobald die Gedächtniseinträge angelegt sind, kann ein leichteres Modell sie problemlos wieder lesen, da sie direkt in den Systemprompt eingebunden werden.
Die Unteragenten und die Python-Skripte, die Tools über RPC aufrufen – zwei vom Projekt hervorgehobene Funktionen zur Parallelisierung von Aufgaben – beruhen auf derselben Fähigkeit, Anweisungen zu befolgen, wie ein einfacher Tool-Aufruf. Ein Modell, das bereits mit einem einzelnen Aufruf Schwierigkeiten hat, wird umso größere Probleme haben, mehrere Unteragenten zu orchestrieren, ohne deren jeweilige Kontexte zu vermischen: Es ist besser, das grundlegende Verhalten zu überprüfen, bevor diese erweiterten Funktionen aktiviert werden.
#MCP-Server: Katalog und Berechtigungen
Hermes Agent enthält einen Katalog von MCP-Servern, die vom Team von Nous Research geprüft und zusammengeführt wurden (darunter Linear, GitHub, Figma und Asana). Jeder Server bleibt jedoch standardmäßig deaktiviert: Er muss ausdrücklich installiert werden, bevor der Agent darauf zugreifen kann. Sobald die Zugangsdaten eingetragen sind, fragt Hermes Agent den Server ab, um dessen verfügbare Werkzeuge aufzulisten, und zeigt eine Liste mit Kontrollkästchen an. So wird vermieden, sämtliche Funktionen eines noch wenig bekannten Drittanbieter-Servers auf einmal zu aktivieren.
Ein Detail, das nur wenige Tutorials erwähnen: Bei MCP-Servern im stdio-Modus gibt Hermes Agent nicht die vollständige Shell-Umgebung des Rechners an den Unterprozess weiter. Übergeben werden nur die ausdrücklich in der Serverkonfiguration deklarierten Variablen sowie ein minimaler Grundbestand (insbesondere PATH, HOME, USER, LANG, TERM und SHELL); die übrigen Umgebungsvariablen, einschließlich API-Schlüsseln und Tokens, werden herausgefiltert. Dieser Mechanismus verringert das Risiko, dass ein unzureichend geprüfter MCP-Server eines Drittanbieters ein in der Shell vorhandenes Geheimnis abgreift.
#Unteragenten: Was die Delegation ermöglicht
Das Tool delegate_task ermöglicht es Hermes Agent, eine Aufgabe an einen untergeordneten Agenten zu delegieren: Jeder Unteragent beginnt seine eigene Unterhaltung mit einer eigenen Terminalsitzung und übernimmt nur die Tools, die für den übergeordneten Agenten bereits aktiviert sind — er kann sich keine zusätzliche Fähigkeit verschaffen, über die der übergeordnete Agent nicht selbst verfügt. Nur die abschließende Zusammenfassung des Unteragenten gelangt in den Kontext des Hauptagenten; die zwischenzeitlichen Tool-Aufrufe gelangen niemals hinein. Das begrenzt den Kontextverbrauch bei langen Aufgaben und verhindert, dass die Hauptunterhaltung mit Ausführungsdetails überladen wird.
Standardmäßig können bis zu zehn Unteragenten parallel laufen – eine konfigurierbare Grenze, wobei die Software keine hardwarebezogene Obergrenze vorgibt. Die Delegationstiefe bleibt jedoch standardmäßig auf 1 festgelegt: Ein Unteragent kann seinerseits keine weiteren Unteragenten erstellen, solange dieses Verhalten nicht ausdrücklich in der Konfiguration aktiviert wurde. Bei einem lokalen Modell mit 7 bis 14 Milliarden Parametern sollten Sie diese Tiefe besser bei 1 belassen: Jede zusätzliche Delegationsebene vervielfacht die Anzahl der Tool-Aufrufe, die korrekt aufeinander folgen müssen – genau die oben beschriebene Schwachstelle kleiner quantisierter Modelle.
#Troubleshooting: Symptome, Ursache, Lösung
Die meisten Probleme mit einem lokalen Ollama-Endpunkt lassen sich in vier Gruppen von Symptomen einteilen. Für jede lässt sich die Ursache anhand der offiziellen Dokumentation ermitteln, statt sich mit Vermutungen heranzutasten.
| Symptom | Wahrscheinliche Ursache | Korrektur |
|---|---|---|
| Stream-Abbrüche oder Timeout bei langem Kontext | Das standardmäßige Lese-Timeout reicht für die Latenz eines großen lokalen Modells nicht aus | HERMES_STREAM_READ_TIMEOUT (z. B. auf 1800 Sekunden) in der Konfiguration erhöhen |
| Das Modell beschreibt die Aktion, ohne sie auszuführen | Modell, das nicht als mit Tool-Calling kompatibel ausgewiesen ist, oder zu aggressive Quantisierung desselben Modells | Eine Variante auswählen, die auf der Modellseite unter ollama.com/library mit „tools“ gekennzeichnet ist |
| Bestätigung der Speicherung, ohne dass die Datei geschrieben wurde | Lokales Modell mit weniger als etwa 30B Parametern und unzuverlässigen Toolaufrufen | MEMORY.md/USER.md nach jeder Anfrage prüfen; bei Bedarf vorübergehend wieder zu einem leistungsfähigeren Modell wechseln |
| Ein MCP-Server eines Drittanbieters erkennt eine erwartete Variable nicht | Filterung der Prozessumgebung: Nur die deklarierten Variablen und die minimale Grundumgebung werden an den Unterprozess weitergegeben | Die Variable explizit in der Konfiguration dieses MCP-Servers deklarieren |
Hermes Agent erkennt lokale Endpunkte automatisch und verlängert seine Lese-Timeouts entsprechend. Ein umfangreicher Kontext bei einem langsamen Ollama-Modell kann diesen standardmäßigen Timeout dennoch überschreiten; die offizielle Dokumentation empfiehlt, die Variable HERMES_STREAM_READ_TIMEOUT anzupassen, statt den an das Modell gesendeten Kontext willkürlich zu reduzieren.
#In der Praxis installieren
- 01Hermes Agent installierenUnter Linux, macOS oder WSL2: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash, anschließend die Shell neu laden und hermes starten.
- 02Das Ollama-Modell vorbereitenStellen Sie sicher, dass Ollama auf dem Port 11434 läuft und dass der gewählte Modell als tool-calling-kompatibel deklariert ist, bevor Sie ihn als Anbieter deklarieren.
- 03Den lokalen Provider eintragenhermes config set verwenden, um provider: ollama, den Modellnamen und base_url mit http://127.0.0.1:11434 einzutragen und den API-Schlüssel leer zu lassen.
- 04Einen einfachen Tool-Aufruf testenEine überprüfbare Aktion anfordern (ein Verzeichnis auflisten, eine Datei lesen) und im Terminal bestätigen, dass das Tool tatsächlich ausgeführt wurde und die Ausführung nicht nur beschrieben wurde.
- 05Das Gedächtnis überprüfenAusdrücklich darum bitten, etwas im Gedächtnis zu speichern, und anschließend MEMORY.md öffnen, um zu prüfen, ob der Eintrag dort vorhanden ist, bevor man dem Agenten in diesem Punkt vertraut.
- Das Modell Hermes 4 lokal ausführen
- MCP-Server an Ollama anschließen
- KI-Agent: allgemeine Definitionen und Grenzen
- Quelle: offizielles GitHub-Repository von Hermes Agent
- Quelle: Dokumentation der Anbieterkonfiguration
- Quelle: Dokumentation des Sicherheitsmodells
Funktioniert Hermes Agent ohne Internetverbindung nach der Anbindung an Ollama?+
Welches Ollama-Modell für Hermes Agent wählen?+
Ist Hermes Agent dasselbe wie das Hermes 4-Modell?+
Wie können Sie überprüfen, ob das Gedächtnis von Hermes Agent tatsächlich funktioniert?+
Ist die Isolation durch Container automatisch aktiviert?+
Wie aktiviert man einen MCP-Server im Hermes Agent?+
Wie viele parallele Unteragenten kann Hermes Agent starten?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.