Hermes 4 lokal (Ollama): das Modell von Nous Research
Hermes 4 ist die vierte Generation der Modelle von Nous Research, einem Labor, das für seine Fine-Tunes bekannt ist, die den Systemprompt buchstabengetreu befolgen und nur selten eine legitime Aufgabe ablehnen. Dieser Leitfaden erklärt, wie Sie Hermes 4 mit Ollama installieren, welche Variante Sie je nach Ihrer Grafikkarte wählen sollten und wie Sie seine beiden Stärken nutzen: die genaue Befolgung der Systemanweisungen und strukturierte Ausgaben für Agenten. Wir setzen das Modell selbst im Produktivbetrieb auf einer RTX 5070 Ti mit 12 GB ein; die Zahlen stammen aus diesem Einsatz.
#Warum Hermes 4 statt eines Qwen- oder Llama-Basismodells
Nous Research führt kein Vortraining von Modellen durch. Das Labor nimmt ein bestehendes Open-Weight-Modell und unterzieht es einem umfangreichen Nachtraining: Für Hermes 4 werden etwa 5 Millionen Beispiele und 60 Milliarden Tokens synthetischer Daten verwendet, die von seiner DataForge-Pipeline erzeugt wurden, mit einem hohen Anteil an überprüften Gedankengängen. Das Ergebnis ist bei Benchmarks zum Allgemeinwissen nicht „intelligenter“ als das zugrunde liegende Modell, verhält sich im Alltag aber anders: Es tut, was man von ihm verlangt, im gewünschten Format und ohne überflüssige Kommentare.
Drei Eigenschaften erklären die Beliebtheit von Hermes bei Nutzern selbst gehosteter LLMs. Erstens wird der Systemprompt als maßgebliche Grundlage behandelt: Persona, Ton und Formatvorgaben werden während des gesamten Gesprächs eingehalten. Zweitens ist das Alignment bewusst neutral: Das Modell fügt keine unaufgeforderten Warnhinweise hinzu und verweigert Antworten zu gewöhnlichen Themen (Medizin, Recht, IT-Sicherheit, Erwachsenenfiktion) deutlich seltener als Assistenten für die breite Öffentlichkeit. Schließlich ist das Tool-Aufrufformat von Nous mit seinen speziellen Tags zu einem De-facto-Standard geworden, den viele Agenten-Frameworks übernommen haben.
Hermes 4 ergänzt dies um einen von DeepHermes übernommenen hybriden Denkmodus: Das Modell kann vor der Antwort zwischen think-Tags nachdenken oder direkt antworten, je nachdem, was Sie ihm im System-Prompt vorgeben. Sie entscheiden für jede einzelne Anfrage, ob Sie den zusätzlichen Token-Aufwand für das Nachdenken in Kauf nehmen.
#Die Varianten von Hermes 4 und der benötigte VRAM
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Hermes 4 ist Ende August 2025 in drei Größen erschienen, die jeweils auf einem anderen Basismodell aufbauen. Dieses Detail ist wichtig: Die Lizenz, die maximale Kontextlänge und das Verhalten auf Französisch stammen vom jeweiligen Basismodell, nicht von Nous Research.
- Hermes 4 14B
- Basis: Qwen3-14B. Etwa 9 GB VRAM in Q4_K_M, großzügiges natives Kontextfenster, sehr gutes Französisch. Das ist die Variante, die Sie auf einer Karte mit 12 bis 16 GB installieren sollten und die wir im Produktivbetrieb verwenden. Von Qwen3 übernommene Lizenz: Apache 2.0.
- Hermes 4 70B
- Basiert auf Llama 3.1 70B. Etwa 40 GB in Q4_K_M: zwei RTX 3090/4090, ein Mac Studio oder ein MacBook Pro mit mindestens 48 GB gemeinsamem Arbeitsspeicher (Unified Memory). Deutlich besser bei langen Schlussfolgerungsketten und beim Befolgen komplexer Anweisungen. Llama 3.1 Community-Lizenz.
- Hermes 4 405B
- Basierend auf Llama 3.1 405B. Selbst in Q4 mehr als 200 GB: zu viel für einen privaten Rechner, daher Servern mit mehreren GPUs oder API-Anbietern vorbehalten. Wir erwähnen es der Vollständigkeit halber.
- Und unter 12 GB?
- Hermes 4 gibt es nicht in den Größen 3B oder 8B. Verwenden Sie auf einer Karte mit 8 GB hermes3:8b (auf Basis von Llama 3.1 8B, etwa 5 GB in Q4_K_M): gleiche Philosophie, gleiches Tool-Format, ohne Reasoning-Modus.
Die Wahl der Quantisierung folgt den üblichen Regeln der Website: Q4_K_M ist standardmäßig ein guter Kompromiss; Q5_K_M oder Q8_0 kommen infrage, wenn der VRAM ausreicht und Sie strukturierte Extraktion durchführen, bei der jedes Bit an Präzision Formatfehler reduziert. Auf unserer RTX 5070 Ti mit 12 GB belegt hermes4:14b in Q4_K_M mit einem Kontext von 8 192 Tokens 9,4 GB VRAM. Damit bleibt Platz für ein parallel geladenes Embedding-Modell.
#Voraussetzungen
- Ollama aktuell
- Die Qwen3-Basis des 14B-Modells erfordert eine Ollama-Version, die nach April 2025 erschienen ist. Prüfen Sie die Version mit ollama --version und aktualisieren Sie Ollama bei Bedarf, sonst erhalten Sie beim Laden eine Fehlermeldung wegen einer unbekannten Architektur.
- GPU oder vereinheitlichter Speicher
- 12 GB VRAM für das 14B-Modell in Q4_K_M mit einem Kontext von 8k. Mit 8 GB wird das Modell teilweise auf die CPU ausgelagert, und die Geschwindigkeit sinkt auf wenige Tokens pro Sekunde: Wechseln Sie zu hermes3:8b.
- Festplattenspeicher
- Rechnen Sie mit 9 GB für das 14B-Modell in Q4_K_M, 15 GB in Q8_0 und 40 GB für das 70B-Modell in Q4_K_M.
- Eine Benutzeroberfläche (optional)
- Open WebUI oder LM Studio für komfortable Chats. Open WebUI klappt die Denkblöcke automatisch ein, was bei Hermes 4 angenehm ist.
#Hermes 4 mit Ollama in 4 Schritten installieren
- 01Die für Ihren Rechner passende Variante herunterladenIn der Ollama-Bibliothek ist der Tag hermes4 in verschiedenen Größen verfügbar. Wählen Sie für eine Karte mit 12 bis 16 GB die 14B-Variante; diesen Tag verwenden wir täglich.
- 02Oder das offizielle GGUF von Hugging Face importierenNous Research veröffentlicht eigene GGUF-Quantisierungen. Mit Ollamas hf.co-Syntax lässt sich die Quantisierungsstufe (Q4_K_M, Q5_K_M, Q8_0) gezielt auswählen, ohne ein Modelfile zu verwenden. Diesen Weg sollten Sie bevorzugen, wenn Sie Q8_0 möchten oder der Bibliotheks-Tag die gewünschte Quantisierung nicht anbietet.
- 03Das Laden und die Verteilung auf GPU und CPU überprüfenDer Befehl ollama ps zeigt den belegten Speicher und den auf die GPU geladenen Anteil in Prozent. Streben Sie 100 % GPU an: Sobald ein Teil auf die CPU ausgelagert wird, bricht die Geschwindigkeit ein.
- 04Erster Test mit einem SystempromptTesten Sie Hermes nicht ohne Systemprompt, sonst verpassen Sie das, was ihn interessant macht. Geben Sie ihm eine Rolle, ein Ausgabeformat und eine Vorgabe und beobachten Sie dann, wie genau er sich daran hält.
#Was Hermes von auf breite Nutzergruppen ausgerichteten Modellen mit Alignment unterscheidet
Ein Assistent für die breite Öffentlichkeit wird darauf trainiert, einem anonymen Nutzer zu gefallen und den Anbieter zu schützen. Daraus entstehen Verhaltensweisen, die man irgendwann nicht mehr bemerkt: eine Einleitung, die die Frage umformuliert, ein Warnhinweis am Ende der Antwort, eine höfliche Ablehnung, sobald ein sensibles Schlüsselwort auftaucht, und eine Tendenz, Aussagen abzumildern. Für Gespräche ist das akzeptabel. Bei einer automatisierten Pipeline, die JSON, eine Rangfolge oder eine Neufassung erwartet, bringt jede Abweichung die nachgelagerte Verarbeitung zum Scheitern.
Hermes 4 ist für den Betreiber trainiert, nicht für den Endnutzer. Nous Research hat diese Entscheidung mit einem eigenen Benchmark namens RefusalBench untersucht, bei dem Hermes 4 deutlich seltener Anfragen ablehnt als geschlossene Modelle und die meisten auf menschliche Vorgaben abgestimmten Open-Weights-Modelle. Konkret: Bei einem Korpus aus Support-Tickets, aus dem der Beschwerdegrund extrahiert werden soll, antwortet ein Modell für die breite Öffentlichkeit manchmal mit „Ich kann keine Rechtsberatung geben“, während Hermes das angeforderte Feld zurückgibt. Bei einer Umschreibungsaufgabe fügt es nicht „Zögern Sie nicht, sich bei weiteren Fragen zu melden“ hinzu.
- Kein Einleitungstext oder Schlussabsatz
- Wenn der Systemprompt sagt „Antworten Sie ausschließlich im JSON-Format“, beginnt die Antwort mit einer geschweiften Klammer. Bei vielen Modellen benötigt man drei Beispiele und eine Nachbearbeitung, um das gleiche Ergebnis zu erhalten.
- Stabile Persona
- Eine im Systemprompt festgelegte Rolle bleibt über Dutzende Gesprächsrunden erhalten, ohne zu verwässern, selbst wenn der Nutzer versucht, das Modell aus dieser Rolle zu bringen.
- Weniger unaufgeforderte Ablehnungen
- Medizinische und juristische Themen, IT-Sicherheit, düstere Fiktion: Hermes bearbeitet die Anfrage. Die Grenzen sind diejenigen, die Sie schriftlich festlegen.
- Neutraler Ton
- Keine schmeichelnden Kommentare zur Qualität der Frage, keine Emojis, kein künstlicher Enthusiasmus. Der Stil lässt sich vollständig über den Systemprompt einstellen.
Die Kehrseite ist offensichtlich: Wenn Sie Hermes Unbekannten zugänglich machen, etwa über einen öffentlichen Chatbot, müssen Sie selbst die Schutzvorkehrungen implementieren. Ein System-Prompt, der auflistet, was der Assistent nicht tun darf, und ein anwendungsseitiger Ausgabefilter für kritische Fälle sind unerlässlich. Bei persönlicher oder interner Nutzung ist diese Verantwortung gerade der gewünschte Vorteil.
#Der System-Prompt: Hier glänzt Hermes 4
Mit Hermes 4 ist der Systemprompt kein Vorschlag, sondern ein Vertrag. Das verändert die Art, wie Sie ihn formulieren: Seien Sie präzise und vollständig, und verlassen Sie sich nicht darauf, dass das Modell Lücken mit dem „gesunden Menschenverstand“ eines Assistenten füllt. Drei Regeln reichen aus, um zuverlässige Ergebnisse zu erzielen.
- Die Rolle in einem Satz beschreiben
- „Du bist der Schreibassistent des Marketingteams von X“ ist besser als drei Absätze Kontext. Hermes verwässert die Informationen nicht, aber eine kurze Rollenbeschreibung ist stabiler.
- Das Ausgabeformat explizit festlegen
- Länge, Sprache, Struktur, was ausgelassen werden soll. Hermes hält eine Vorgabe wie „keine Einleitung, kein Schluss, maximal 120 Wörter“ ein, ohne dass sie wiederholt werden muss.
- Verbote schriftlich festhalten
- Da das Modell selbst keine Verbote hinzufügt, listen Sie Ihre eigenen auf: Themen außerhalb des vorgesehenen Bereichs, Informationen, die niemals preisgegeben werden dürfen, und das Verhalten bei einer mehrdeutigen Frage.
Am praktischsten ist es, diesen Systemprompt in einem Modelfile festzuhalten: Sie erhalten einen einsatzbereiten Alias, bei dem Kontext und Temperatur bereits eingestellt sind und den Sie in Open WebUI, in Ihren Skripten und über das Terminal verwenden können.
#Den Denkmodus aktivieren oder deaktivieren
Hermes 4 ist ein Modell mit hybridem Reasoning: Standardmäßig antwortet es direkt, wie ein klassisches Instruct-Modell. Um den Denkprozess zu aktivieren, fügt man dem System-Prompt eine spezielle Anweisung hinzu, die Nous Research auf der Modellseite dokumentiert. Das Modell gibt dann seinen Denkprozess zwischen think-Tags aus und anschließend seine Antwort.
Sie können sie mit Ihren eigenen Anweisungen auf Französisch kombinieren, indem Sie diese anschließend hinzufügen. Das Reasoning ist für Mathematik, nicht trivialen Code, die Planung eines Agenten oder die Analyse eines langen Dokuments nützlich. Für die Extraktion von Feldern, die Klassifizierung oder das Umschreiben ist es unnötig und kostspielig: Lassen Sie bei diesen Aufgaben den direkten Modus aktiviert. Rechnen Sie pro Anfrage mit 500 bis mehreren Tausend Reasoning-Tokens; deshalb ist ein großzügig bemessener num_ctx wichtig.
- Direkter Modus (Standard)
- Keine spezielle Anweisung. Sofortige Antwort, ideal für Pipelines und alltägliche Chats. Diesen Modus verwenden wir für die automatisierte Auswertung unseres Monitorings.
- Reasoning-Modus
- Fügen Sie die obige Anweisung am Anfang des Systemprompts ein. Open WebUI klappt den think-Block ein; filtern Sie ihn in Ihren Skripten heraus, bevor Sie die Antwort anzeigen oder parsen.
- Zwei Aliase
- Am einfachsten ist es, zwei Modelfiles zu erstellen, hermes-direct und hermes-think, und je nach Aufgabe eines davon auszuwählen, statt den Prompt bei jedem Aufruf zu ändern.
#Anwendungsfälle: Agenten und strukturierte Extraktion
Das Format für Tool-Aufrufe von Nous Research, bei dem das Modell die Liste der verfügbaren Funktionen im Systemprompt erhält und seine Aufrufe als JSON mit umgebenden Tags ausgibt, wird von Ollama über den Parameter tools seiner Chat-API genutzt. Mit Hermes 4 müssen Sie nichts konfigurieren: Beschreiben Sie Ihre Funktionen, senden Sie die Konversation, und das Modell gibt bei Bedarf einen strukturierten Aufruf zurück, andernfalls eine Textantwort.
Für die strukturierte Extraktion ergänzen sich zwei Ansätze. Beim ersten wird über Ollamas Parameter format ein JSON-Schema vorgegeben: Die Engine schränkt die Generierung ein, sodass das Modell nicht vom Schema abweichen kann. Der zweite beruht allein auf dem Systemprompt, und hier macht Hermes den Unterschied: Selbst ohne Einschränkungen beim Dekodieren gibt es in der überwiegenden Mehrheit der Fälle gültiges JSON ohne Kommentare zurück. Das vereinfacht die Integration mit Tools, die kein eingeschränktes Dekodieren unterstützen.
Die Antwort enthält ein Feld tool_calls mit dem Namen der Funktion und ihren Argumenten. Sie müssen die Funktion ausführen und das Ergebnis in einer Nachricht mit der Rolle tool zurücksenden, damit das Modell seine endgültige Antwort formulieren kann. Diese Schleife implementieren LangChain, CrewAI, n8n oder Hermes Agent, das von Nous Research selbst veröffentlichte Agenten-Framework, das mit jedem Modell funktioniert, aber um dieses Format herum konzipiert wurde.
- Klassifikation und Routing
- E-Mails, Tickets oder Artikel nach definierten Kategorien sortieren. Niedrige Temperatur, direkter Modus, verbindliches JSON-Schema: Das 14B-Modell verarbeitet mehrere hundert Elemente pro Stunde auf einer Grafikkarte mit 12 GB.
- Extraktion von Feldern
- Rechnungen, Lebensläufe, Produktdatenblätter, Berichte: Hermes liefert genau die angeforderten Felder und setzt null, wenn eine Information fehlt, sofern Sie dies im System-Prompt angeben.
- Automatische Bewertung
- Texte anhand eines Bewertungsrasters bewerten (das macht unsere Pipeline zur täglichen Beobachtung mit hermes4:14b). Das stabile Format und das Ausbleiben von Gefälligkeitsbewertungen machen die Bewertungen verwertbar.
- Agent mit Werkzeugen
- Suche in einer Datenbank, Aufruf einer internen API, Ausführung von Befehlen, die von einem Menschen freigegeben wurden. Der Reasoning-Modus hilft bei mehrstufigen Plänen.
#Empfohlene Einstellungen
Die folgenden Werte sind diejenigen, die wir im Produktivbetrieb verwenden. Sie stammen nicht aus der Modellbeschreibung, die zu diesem Thema nur wenige Angaben enthält, sondern aus mehreren Monaten täglichen Einsatzes auf einer Grafikkarte mit 12 GB.
- num_ctx
- 8.192 für Chat und Extraktion, 16.384 für Agenten und den Reasoning-Modus. Jede Verdoppelung des Kontexts benötigt zusätzlichen VRAM: Mit 12 GB passen 16k bei quantisiertem KV-Cache (siehe unten), mehr jedoch nicht.
- temperature
- 0,6 bis 0,7 für Gespräche und Texterstellung. 0,1 bis 0,2 für Extraktion, Klassifizierung und alles, was reproduzierbar sein muss.
- top_p und repeat_penalty
- 0,95 und 1,05. Eine stärkere Wiederholungsstrafe verschlechtert die JSON-Ausgaben, bei denen Wiederholungen von Schlüsseln normal sind.
- Quantisierung
- Q4_K_M für alle alltäglichen Anwendungen. Q8_0, wenn Sie Datenextraktion in großem Umfang betreiben und über 16 GB verfügen: Formatfehler treten dann fast überhaupt nicht mehr auf.
Auf der Serverseite sparen zwei Ollama-Umgebungsvariablen Speicherplatz auf einer Karte mit 12 GB: Flash Attention und die Quantisierung des KV-Caches auf 8 Bit. Sie werden unter Linux in der systemd-Dienstdatei, unter Windows in den Umgebungsvariablen des Benutzers oder unter macOS über launchctl festgelegt.
Der KV-Cache in q8_0 halbiert den Speicherbedarf des Kontexts, ohne messbare Qualitätseinbußen bei Extraktions- und Chat-Aufgaben. Diese Einstellung ermöglicht es, hermes4:14b mit 16k Kontext in 12 GB unterzubringen. Ein Keep-Alive von 24 Stunden verhindert, dass bei jedem Aufruf nach einer längeren Pause erneut 9 GB geladen werden müssen – nützlich für einen Server, der den ganzen Tag über Anfragen von Skripten beantwortet.
#Fehlerbehebung
- Die think-Tags erscheinen in der Antwort
- Das ist im Reasoning-Modus im Terminal oder bei direkter Nutzung der API normal. Open WebUI klappt sie ein; entfernen Sie in Ihren Skripten vor dem Parsen alles, was vor dem schließenden Tag steht. Wenn Sie kein Reasoning wollten, entfernen Sie die entsprechende Anweisung aus dem Systemprompt.
- Das Modell antwortet auf Englisch
- Hermes 4 wurde zum weit überwiegenden Teil mit englischsprachigen Daten trainiert. Fügen Sie dem System-Prompt „Du antwortest immer auf Französisch“ hinzu: Diese eine Zeile genügt in nahezu allen Fällen, gerade weil das Modell den System-Prompt befolgt.
- Fehler beim Laden: unbekannte Architektur
- Ihre Ollama-Version ist zu alt für die Qwen3-Basis des 14B-Modells. Aktualisieren Sie Ollama und starten Sie anschließend den Pull erneut.
- Geschwindigkeit von einigen Token pro Sekunde
- ollama ps montre un pourcentage CPU : le modèle ne tient pas en VRAM. Réduisez num_ctx, activez le cache KV q8_0, ou passez à hermes3:8b.
- Gelegentlich ungültiges JSON
- Verwenden Sie den Parameter format mit einem Schema: Dadurch wird die Generierung eingeschränkt. Falls das nicht möglich ist, senken Sie die Temperatur auf 0,1 und fügen Sie dem Systemprompt ein Beispiel für die erwartete Ausgabe hinzu.
- Das Modell vergisst seine Anweisungen nach mehreren Runden
- Das Kontextfenster ist voll. Erhöhen Sie num_ctx oder kürzen Sie den Verlauf auf Anwendungsseite, wobei der Systemprompt immer am Anfang stehen bleiben muss.
- Unerwartete Ablehnung
- Selten, aber beim 14B-Modell möglich, wenn die Formulierung einem Angriffsszenario ähnelt. Formulieren Sie die Anfrage um und präzisieren Sie im System-Prompt den legitimen Rahmen (autorisierter Test, beruflicher Kontext): Hermes folgt dem Rahmen, den Sie vorgeben.
#Weiterführende Informationen
Hermes 4 entfaltet seinen vollen Nutzen, sobald man die Bausteine rund um das Modell beherrscht. Diese Leitfäden auf dieser Website ergänzen den vorliegenden Leitfaden:
- System-Prompts beherrschen
- Die Methode zum Schreiben eines vollständigen System-Prompts, mit Beispielen für verschiedene Anwendungsfälle. Die passende Ergänzung zu diesem Leitfaden, denn über den System-Prompt wird Hermes gesteuert.
- Function Calling und strukturierte JSON-Ausgaben mit Ollama
- Details zum Parameter format, zu JSON-Schemata und zur Schleife für Werkzeugaufrufe, mit vollständigen Python-Beispielen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um zwischen Q4_K_M und Q8_0 zu wählen, je nach Ihrer VRAM und Ihrer Toleranz gegenüber Formatfehlern.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.