Mittelstufe 12 Min.Agenten

Hermes Agent mit Ollama: Gedächtnis, Tools und limites

Direkte Antwort

Ja: Hermes Agent von Nous Research lässt sich mit einer lokalen Ollama-Instanz verbinden, indem Sie einen benutzerdefinierten Anbieter mit der Adresse http://127.0.0.1:11434 und einem leeren API-Schlüssel konfigurieren. Lokale Inferenz bedeutet jedoch nicht, dass der Agent standardmäßig offline arbeitet: Websuche, Sprachsynthese und Cloud-Browser bleiben Dienste von Drittanbietern, solange sie nicht deaktiviert werden. Wählen Sie ein Modell, das ausdrücklich für Tool-Aufrufe ausgewiesen ist. Andernfalls kann es passieren, dass es eine Aktion nur beschreibt, statt sie auszuführen.

Hermes Agent ist das von Nous Research veröffentlichte Framework für autonome Agenten mit Terminal, persistentem Gedächtnis und Schnittstellen zu Messaging-Diensten. Dieser Leitfaden behandelt die Anbindung an eine lokale Ollama-Instanz, die Auswahl eines Modells, das Tools aufrufen kann, die Inhalte, die sein Gedächtnis tatsächlich bewahrt, sowie die Grenzen bei Sicherheit und Zuverlässigkeit, die Sie vor dem täglichen Einsatz kennen sollten.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Was Hermes Agent ist

Hermes Agent (Repository NousResearch/hermes-agent) ist ein autonomer Kommandozeilenagent mit einer TUI, einem Messaging-Gateway (Telegram, Discord, Slack, WhatsApp, Signal) und einem System von Skills, die durch die Nutzung entstehen und sich verbessern. Er ersetzt nicht Hermes 4, ein Sprachmodell: Hermes Agent ist die Software, die Tool-Aufrufe, Gedächtnis und Terminal orchestriert, unabhängig davon, welches Modell dahinter angebunden ist.

Das Repository wird zügig weiterentwickelt: Die mit v2026.9.24 getaggte Version (Hermes Agent v0.21.5), veröffentlicht am 24. September 2026, umfasst mehrere Hundert Fehlerbehebungen seit der vorherigen Version. Nous Research veröffentlicht das Projekt unter der MIT-Lizenz, die eine berufliche Nutzung ohne Lizenzgebühren erlaubt, auch bei einer Bereitstellung in modifizierter Form.

Der Agent läuft in einem einzigen Gateway-Prozess, der mehrere Kanäle gleichzeitig bedienen kann: Das lokale Terminal, Telegram, Discord, Slack, WhatsApp und Signal teilen sich dasselbe Gedächtnis und denselben Gesprächsverlauf. Dadurch lässt sich eine Aufgabe am Arbeitsplatz starten und anschließend vom Telefon aus verfolgen, ohne die Modellkonfiguration oder das Gedächtnis für jeden Kanal duplizieren zu müssen.

i
Unterschied zu Hermes 4
Hermes Agent ist ein Agent-Framework, das jedes beliebige Modell als Backend akzeptiert. Hermes 4 ist eine Modellfamilie, die Sie über Ollama als dieses Backend betreiben können. Beide heißen Hermes, lassen sich aber nicht gegenseitig ersetzen.

#Ollama lokal anbinden

Das Kit für lokale Agenten

Agenten, die auf Ihrem Rechner handeln: agentisches Cline, MCP, n8n + Ollama und lokale Automatisierungen.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Hermes Agent bindet selbst gehostete, OpenAI-kompatible Anbieter (Ollama, vLLM, llama.cpp) unter ihrem jeweiligen Provider-Namen ein. Die offizielle Dokumentation beschreibt das erwartete Format ausdrücklich: eine base_url, die auf den Server verweist, und ein leerer API-Schlüssel, der lediglich als Platzhalter dient.

~/.hermes/config.yaml
auxiliary:
  compression:
    provider: ollama
    model: qwen3.6:27b-q4_k_m
    base_url: http://127.0.0.1:11434

Eine base_url, die nur aus host:port besteht (ohne /v1), erhält automatisch das von der OpenAI-kompatiblen API erwartete Suffix: Sie müssen es nicht manuell hinzufügen. Derselbe Mechanismus funktioniert auch für vLLM und llama.cpp, wenn Sie lediglich den Providernamen und den Port ändern.

Derselbe Konfigurationsblock kann für unterschiedliche Rollen verwendet werden: das Hauptmodell für die Unterhaltung, das Modell zur Kontextkomprimierung oder das Modell zur Erstellung eines Sitzungstitels. Jedes Modell kann auf einen anderen Anbieter verweisen — beispielsweise ein lokales Ollama-Modell für die Unterhaltung und ein schnelleres Cloud-Modell, das Hilfsaufgaben vorbehalten ist. So bleibt der Großteil des Austauschs vertraulich, während verhindert wird, dass ein kleines lokales Modell die Nebenaufgaben verlangsamt.

!
Lokal bedeutet nicht offline
Das Hauptmodell über Ollama laufen zu lassen, schaltet die zusätzlichen Dienste nicht ab. Websuche, Bildgenerierung, Sprachsynthese und Cloud-Browser nutzen externe APIs (Nous Portal oder Ihre eigenen Schlüssel), solange Sie diese Werkzeuge nicht einzeln in der Konfiguration deaktivieren.

#Welches Modell für Tool-Aufrufe

Hermes Agent stellt mehr als 40 Tools bereit (Terminal, Dateien, Browser, Gedächtnis, Cron), die das Modell über strukturierte Aufrufe aufrufen muss, nicht durch eine bloße Beschreibung in Textform. Ein Ollama-Modell, das nicht für Tool-Calling trainiert wurde – oder eine zu aggressive Quantisierung desselben Modells – antwortet häufig mit einer Erklärung, statt den Aufruf auszulösen.

Hauptmodell für Gespräche
Bevorzugen Sie eine Ollama-Variante, die ausdrücklich als mit Tools kompatibel aufgeführt ist (Tag tools auf ollama.com/library), gegenüber einem allgemeinen Chat-Modell.
Hilfsmodell (Überschriften, Kompression)
Kann klein bleiben: Bei einem lokalen Provider mit nur einem Slot ruft Hermes Agent es nach der Antwort des Hauptdurchlaufs auf, nicht parallel, damit ein Server mit nur einem Slot die beiden Anfragen nicht vermischt.
Format der Modellkennung
Ein benannter Provider kann dem Modellnamen ein Präfix voranstellen, z. B. ollama-local/qwen3.6:27b-q4_k_m; dieses Präfix gilt auch dann, wenn nur die unveränderte Anfrage (ohne Präfix) beim Server ankommt.

Ein Detail, das Sie genau im Blick behalten sollten: Bei einem benutzerdefinierten lokalen Anbieter wird die Anfrage an das Modell zur Titelerzeugung erst nach Eingang der Antwort auf den aktuellen Gesprächsschritt gesendet, nicht gleichzeitig mit ihr. Auf einem lokalen Server mit nur einem Verarbeitungsplatz verhindert das, dass eine Titelanfrage im strukturierten JSON-Format die eigentliche Antwortgenerierung unterbricht – ein Detail der Ablaufplanung, das andernorts selten dokumentiert wird.

#Gedächtnis: Was tatsächlich erhalten bleibt

Das Gedächtnis von Hermes Agent basiert auf einfachen Textdateien, die direkt gelesen und bearbeitet werden können: MEMORY.md und USER.md im Profilverzeichnis. Das Modell entscheidet mithilfe eines speziellen Tools, was es wert ist, dort festgehalten zu werden – Präferenzen, dauerhafte Fakten und erlernte Verfahren.

Terminal
cat ~/.hermes/memories/MEMORY.md
cat ~/.hermes/memories/USER.md

Die vom Projekt selbst dokumentierte Schwachstelle: Ein kleines lokales Modell kann „Das ist gespeichert“ melden, ohne tatsächlich das Schreibwerkzeug aufgerufen zu haben. Die offizielle Dokumentation empfiehlt, bei einem lokalen Modell mit weniger als etwa 30 Milliarden Parametern oder mit unzuverlässigen Tool-Aufrufen ausdrücklich die Nutzung des Gedächtniswerkzeugs zu verlangen und anschließend die Datei zu überprüfen, statt immer mehr Anweisungen in den Prompt aufzunehmen.

→
Prüfen statt glauben
Öffnen Sie nach einer Aufforderung, sich etwas zu merken, die Datei MEMORY.md oder USER.md, um zu prüfen, ob der Eintrag dort tatsächlich vorhanden ist. Wenn das Schreiben eine menschliche Freigabe erfordert (write_approval), bleibt der Schreibvorgang ausstehend, bis er ausdrücklich genehmigt wird.

#Sicherheit: acht Schichten, keine Mauer

Nous Research dokumentiert ein Sicherheitsmodell mit acht Schutzebenen: Autorisierung der Benutzer, menschliche Genehmigung gefährlicher Befehle, Schutzmechanismen beim Schreiben von Dateien, Isolierung durch Container (Docker, Singularity, Modal), Filterung der an MCP-Server übermittelten Zugangsdaten, Erkennung von Prompt-Injection in Kontextdateien, Isolierung zwischen Sitzungen und Validierung der Arbeitsverzeichnisse von Terminal-Tools.

Die Genehmigung gefährlicher Befehle lässt sich über approvals.mode in der Konfigurationsdatei einstellen. Es stehen drei Modi zur Verfügung: automatisch, manuell oder intelligent (der empfohlene Standardmodus, der Aktionen mit geringem Risiko genehmigt und alle anderen bis zur Freigabe blockiert).

!
Die Isolation durch Container erfolgt nicht automatisch
Diese acht Schichten sind in der Software vorhanden, aber die Isolation über Docker/Singularity/Modal muss bei der Konfiguration als Terminal-Backend ausgewählt werden. Ein Agent, der mit einem lokalen Backend gestartet wird, führt die Befehle direkt auf Ihrem Rechner aus, ohne Container-Sandbox.

#Grenzen eines kleinen lokalen Modells für diesen Agenten

Ein Agent mit so vielen Werkzeugen wie Hermes Agent stellt hohe Anforderungen an die Fähigkeit des Modells, Anweisungen zu befolgen: Gedächtnis, Planung, aufeinanderfolgende Werkzeugaufrufe und gelegentlich parallel arbeitende Unteragenten. Bei einem Modell mit 7 bis 14 Milliarden Parametern und Q4_K_M-Quantisierung müssen Sie mit fehlgeschlagenen Werkzeugaufrufen, Bestätigungen ohne tatsächliche Ausführung und häufigerer Kontextkomprimierung in langen Sitzungen rechnen.

Was sich bei einem kleinen lokalen Modell zuerst verschlechtert
FunktionTypisches Symptom
Gedächtnis (spezielles Tool)Verbale Bestätigung, ohne die Datei tatsächlich zu schreiben
Verkettung von ToolsDas Modell beschreibt den nächsten Schritt, anstatt ihn auszuführen
Parallele UnteragentenSchlecht übermittelte Anweisungen, Ergebnisse manuell gegenprüfen
Lange SitzungenHäufigere Kontextkompression, Verlust von alten Details

Nichts davon ist spezifisch für Hermes Agent: Es handelt sich um eine bekannte Einschränkung kleiner quantisierter Modelle beim Umgang mit strukturierten Ausgabeformaten. Die vom Projekt dokumentierte Lösung besteht nicht darin, weitere Anweisungen hinzuzufügen, sondern zumindest für die Ersteinrichtung ein leistungsfähigeres Modell zu verwenden. Sobald die Gedächtniseinträge angelegt sind, kann ein leichteres Modell sie problemlos wieder lesen, da sie direkt in den Systemprompt eingebunden werden.

Die Unteragenten und die Python-Skripte, die Tools über RPC aufrufen – zwei vom Projekt hervorgehobene Funktionen zur Parallelisierung von Aufgaben – beruhen auf derselben Fähigkeit, Anweisungen zu befolgen, wie ein einfacher Tool-Aufruf. Ein Modell, das bereits mit einem einzelnen Aufruf Schwierigkeiten hat, wird umso größere Probleme haben, mehrere Unteragenten zu orchestrieren, ohne deren jeweilige Kontexte zu vermischen: Es ist besser, das grundlegende Verhalten zu überprüfen, bevor diese erweiterten Funktionen aktiviert werden.

#MCP-Server: Katalog und Berechtigungen

Hermes Agent enthält einen Katalog von MCP-Servern, die vom Team von Nous Research geprüft und zusammengeführt wurden (darunter Linear, GitHub, Figma und Asana). Jeder Server bleibt jedoch standardmäßig deaktiviert: Er muss ausdrücklich installiert werden, bevor der Agent darauf zugreifen kann. Sobald die Zugangsdaten eingetragen sind, fragt Hermes Agent den Server ab, um dessen verfügbare Werkzeuge aufzulisten, und zeigt eine Liste mit Kontrollkästchen an. So wird vermieden, sämtliche Funktionen eines noch wenig bekannten Drittanbieter-Servers auf einmal zu aktivieren.

Ein Detail, das nur wenige Tutorials erwähnen: Bei MCP-Servern im stdio-Modus gibt Hermes Agent nicht die vollständige Shell-Umgebung des Rechners an den Unterprozess weiter. Übergeben werden nur die ausdrücklich in der Serverkonfiguration deklarierten Variablen sowie ein minimaler Grundbestand (insbesondere PATH, HOME, USER, LANG, TERM und SHELL); die übrigen Umgebungsvariablen, einschließlich API-Schlüsseln und Tokens, werden herausgefiltert. Dieser Mechanismus verringert das Risiko, dass ein unzureichend geprüfter MCP-Server eines Drittanbieters ein in der Shell vorhandenes Geheimnis abgreift.

#Unteragenten: Was die Delegation ermöglicht

Das Tool delegate_task ermöglicht es Hermes Agent, eine Aufgabe an einen untergeordneten Agenten zu delegieren: Jeder Unteragent beginnt seine eigene Unterhaltung mit einer eigenen Terminalsitzung und übernimmt nur die Tools, die für den übergeordneten Agenten bereits aktiviert sind — er kann sich keine zusätzliche Fähigkeit verschaffen, über die der übergeordnete Agent nicht selbst verfügt. Nur die abschließende Zusammenfassung des Unteragenten gelangt in den Kontext des Hauptagenten; die zwischenzeitlichen Tool-Aufrufe gelangen niemals hinein. Das begrenzt den Kontextverbrauch bei langen Aufgaben und verhindert, dass die Hauptunterhaltung mit Ausführungsdetails überladen wird.

Standardmäßig können bis zu zehn Unteragenten parallel laufen – eine konfigurierbare Grenze, wobei die Software keine hardwarebezogene Obergrenze vorgibt. Die Delegationstiefe bleibt jedoch standardmäßig auf 1 festgelegt: Ein Unteragent kann seinerseits keine weiteren Unteragenten erstellen, solange dieses Verhalten nicht ausdrücklich in der Konfiguration aktiviert wurde. Bei einem lokalen Modell mit 7 bis 14 Milliarden Parametern sollten Sie diese Tiefe besser bei 1 belassen: Jede zusätzliche Delegationsebene vervielfacht die Anzahl der Tool-Aufrufe, die korrekt aufeinander folgen müssen – genau die oben beschriebene Schwachstelle kleiner quantisierter Modelle.

#Troubleshooting: Symptome, Ursache, Lösung

Die meisten Probleme mit einem lokalen Ollama-Endpunkt lassen sich in vier Gruppen von Symptomen einteilen. Für jede lässt sich die Ursache anhand der offiziellen Dokumentation ermitteln, statt sich mit Vermutungen heranzutasten.

Häufige Symptome bei einem lokalen Ollama-Endpunkt
SymptomWahrscheinliche UrsacheKorrektur
Stream-Abbrüche oder Timeout bei langem KontextDas standardmäßige Lese-Timeout reicht für die Latenz eines großen lokalen Modells nicht ausHERMES_STREAM_READ_TIMEOUT (z. B. auf 1800 Sekunden) in der Konfiguration erhöhen
Das Modell beschreibt die Aktion, ohne sie auszuführenModell, das nicht als mit Tool-Calling kompatibel ausgewiesen ist, oder zu aggressive Quantisierung desselben ModellsEine Variante auswählen, die auf der Modellseite unter ollama.com/library mit „tools“ gekennzeichnet ist
Bestätigung der Speicherung, ohne dass die Datei geschrieben wurdeLokales Modell mit weniger als etwa 30B Parametern und unzuverlässigen ToolaufrufenMEMORY.md/USER.md nach jeder Anfrage prüfen; bei Bedarf vorübergehend wieder zu einem leistungsfähigeren Modell wechseln
Ein MCP-Server eines Drittanbieters erkennt eine erwartete Variable nichtFilterung der Prozessumgebung: Nur die deklarierten Variablen und die minimale Grundumgebung werden an den Unterprozess weitergegebenDie Variable explizit in der Konfiguration dieses MCP-Servers deklarieren

Hermes Agent erkennt lokale Endpunkte automatisch und verlängert seine Lese-Timeouts entsprechend. Ein umfangreicher Kontext bei einem langsamen Ollama-Modell kann diesen standardmäßigen Timeout dennoch überschreiten; die offizielle Dokumentation empfiehlt, die Variable HERMES_STREAM_READ_TIMEOUT anzupassen, statt den an das Modell gesendeten Kontext willkürlich zu reduzieren.

#In der Praxis installieren

  1. 01
    Hermes Agent installieren
    Unter Linux, macOS oder WSL2: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash, anschließend die Shell neu laden und hermes starten.
  2. 02
    Das Ollama-Modell vorbereiten
    Stellen Sie sicher, dass Ollama auf dem Port 11434 läuft und dass der gewählte Modell als tool-calling-kompatibel deklariert ist, bevor Sie ihn als Anbieter deklarieren.
  3. 03
    Den lokalen Provider eintragen
    hermes config set verwenden, um provider: ollama, den Modellnamen und base_url mit http://127.0.0.1:11434 einzutragen und den API-Schlüssel leer zu lassen.
  4. 04
    Einen einfachen Tool-Aufruf testen
    Eine überprüfbare Aktion anfordern (ein Verzeichnis auflisten, eine Datei lesen) und im Terminal bestätigen, dass das Tool tatsächlich ausgeführt wurde und die Ausführung nicht nur beschrieben wurde.
  5. 05
    Das Gedächtnis überprüfen
    Ausdrücklich darum bitten, etwas im Gedächtnis zu speichern, und anschließend MEMORY.md öffnen, um zu prüfen, ob der Eintrag dort vorhanden ist, bevor man dem Agenten in diesem Punkt vertraut.
Häufig gestellte Fragen
Funktioniert Hermes Agent ohne Internetverbindung nach der Anbindung an Ollama?+
Standardmäßig nicht. Das Hauptmodell für Gespräche läuft tatsächlich lokal, sobald Ollama als Anbieter konfiguriert ist. Die Websuche, die Sprachsynthese, die Bildgenerierung und der Cloud-Browser bleiben jedoch externe Dienste, solange Sie sie nicht ausdrücklich in der Werkzeugkonfiguration deaktivieren. Für einen wirklich vollständig offline möglichen Betrieb müssen Sie diese Werkzeuge einzeln deaktivieren, statt sich allein auf das Routing des Hauptmodells zu verlassen.
Welches Ollama-Modell für Hermes Agent wählen?+
Wählen Sie ein Modell, das auf seiner Seite unter ollama.com/library ausdrücklich als mit Tool-Calling kompatibel ausgewiesen ist, etwa qwen3.6:27b-q4_k_m, das in der offiziellen Dokumentation genannt wird. Ein allgemeines Chat-Modell antwortet auch bei großer Modellgröße oft in natürlicher Sprache, statt den vom Framework erwarteten strukturierten Tool-Aufruf auszulösen. Dadurch werden ganze Funktionen wie das Gedächtnis, das Terminal oder die installierten MCP-Server blockiert.
Ist Hermes Agent dasselbe wie das Hermes 4-Modell?+
Nein. Hermes Agent ist die Orchestrierungssoftware: Terminal, Gedächtnis, Tool-Aufrufe, MCP-Server und Delegation an Unteragenten. Hermes 4 ist ein Sprachmodell, das Sie über Ollama oder einen anderen Anbieter im Hintergrund dieses Agenten betreiben können, genau wie jedes andere mit Tool-Calling kompatible Modell. Beide tragen denselben Namen, erfüllen aber unterschiedliche Aufgaben.
Wie können Sie überprüfen, ob das Gedächtnis von Hermes Agent tatsächlich funktioniert?+
Bitten Sie ausdrücklich darum, eine Information im Gedächtnis zu speichern, und öffnen Sie anschließend ~/.hermes/memories/MEMORY.md oder USER.md, um zu bestätigen, dass der Eintrag tatsächlich in der Datei auf dem Datenträger steht. Bei einem kleinen lokalen Modell mit weniger als etwa 30 Milliarden Parametern ist eine bloße verbale Bestätigung ohne tatsächliches Schreiben der Datei ein Szenario, das selbst die Projektdokumentation als häufig anerkennt. Deshalb lohnt es sich, dies zu überprüfen, statt der Antwort des Agenten zu vertrauen.
Ist die Isolation durch Container automatisch aktiviert?+
Nein. Für Sandboxing mit Containern (Docker, Singularity, Modal) muss bei der Konfiguration ausdrücklich ein entsprechendes Terminal-Backend ausgewählt werden. Zur Auswahl stehen sieben Backends, darunter eines für die lokale Ausführung. Ein Agent, der mit dem standardmäßigen lokalen Backend gestartet wird, führt die Befehle direkt auf dem Host aus, ohne diese Isolation; um tatsächlich davon zu profitieren, muss ein containerisiertes Backend ausgewählt werden.
Wie aktiviert man einen MCP-Server im Hermes Agent?+
Die MCP-Server im Katalog von Nous Research sind standardmäßig deaktiviert: Sie müssen einzeln in der Konfiguration installiert werden, bevor sie für den Agenten zugänglich sind. Sobald die Zugangsdaten eingetragen sind, fragt Hermes Agent den Server ab, um die von ihm bereitgestellten Werkzeuge aufzulisten, und zeigt eine Liste mit Kontrollkästchen an. So wird vermieden, dass alle Funktionen eines wenig bekannten Drittanbieter-Servers auf einmal aktiviert werden.
Wie viele parallele Unteragenten kann Hermes Agent starten?+
Standardmäßig können bis zu zehn Unteragenten gleichzeitig über das Tool delegate_task laufen. Diese Grenze ist konfigurierbar, ohne dass die Software eine Obergrenze vorgibt. Die Delegationstiefe ist jedoch standardmäßig auf 1 festgelegt: Ein Unteragent kann keine weiteren Unteragenten erstellen, solange dieses Verhalten nicht ausdrücklich aktiviert wird. Das verhindert ein unkontrolliertes Anwachsen der Agentenzahl und des Tokenverbrauchs.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.