v0.4.0

Hermes Agent v0.4.0 — Das Plattform-Erweiterungs-Release


Überblick

v0.4.0 — The Platform Expansion Release. Veröffentlicht am 23. März 2026. Nur 11 Tage nach v0.2.0 (erste öffentliche Version) und v0.3.0 (Streaming + Plugin-Architektur) erhob diese Version Hermes Agent von einem großartigen CLI-Agenten zu einem echten Plattformprodukt — mit einer API, plattformübergreifender Messaging-Abdeckung, MCP-Ökosystem-Management und Sicherheit auf Unternehmensniveau.

Wenn v0.2.0 der Welt zeigte, was Hermes kann, und v0.3.0 die Erfahrung nahtlos machte, dann machte v0.4.0 Hermes in jedes System einbettbar. Von diesem Punkt an ist Hermes nicht nur ein Agent in deinem Terminal — es kann dein API-Backend, dein Chatbot, dein Automatisierungszentrum sein.

Die Schlagzeile in einem Satz: Verwandle Hermes in einen API-Server, der über /v1/chat/completions aufrufbar ist, und verbinde ihn gleichzeitig mit nahezu jeder großen Messaging-Plattform auf dem Markt.


Hauptfunktionen

1. OpenAI-kompatibler API-Server — Hermes als Backend-Dienst

Dies ist die strategisch bedeutendste Funktion von v0.4.0: Hermes kann nun als standardmäßiger /v1/chat/completions-Endpunkt bereitgestellt werden. Jeder OpenAI-API-kompatible Client — andere Agenten, Automatisierungsskripte, Webanwendungen — kann Hermes direkt aufrufen.

Starten des API-Servers:

# Starte den Hermes API-Server
hermes serve

# Externe Systeme können Hermes nun über das standardmäßige OpenAI SDK aufrufen
# Jeder Code, der das OpenAI SDK verwendet, kann sich mit Hermes verbinden
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1")

response = client.chat.completions.create(
    model="hermes",
    messages=[{"role": "user", "content": "Überprüfe diesen Code auf Sicherheitsprobleme"}]
)

Die begleitende /api/jobs REST-API ermöglicht die Verwaltung von Cron-Jobs über HTTP — erstellen, anzeigen, löschen — alles über standardmäßige REST-Endpunkte.

Sicherheit wurde von Anfang an mitkonzipiert, nicht nachträglich hinzugefügt:

  • Eingabelimits + Feld-Whitelists: verhindern bösartige Anfrageangriffe
  • SQLite-gestützte Antwortpersistenz: übersteht Neustarts
  • CORS-Ursprungsschutz: blockiert nicht autorisierten browserbasierten Zugriff
  • Diese Schutzmaßnahmen wurden von Tag eins an in den API-Server integriert

2. Sechs Neue Messaging-Adapter — Chat Überall

v0.4.0 fügt 6 neue Messaging-Plattformen auf einmal hinzu. Zusammen mit der bestehenden Unterstützung für Telegram, Discord und WhatsApp bietet Hermes Gateway nun eine einheitliche Messaging-Abdeckung über 9 große Plattformen:

Plattform Highlights
Signal Vollständiger Adapter mit Anhangsverarbeitung, Gruppennachrichtenfilterung und „Notiz an mich selbst“-Echoschutz
DingTalk Gateway-Integration + Einrichtungsdokumentation, native Unterstützung für chinesische Unternehmensworkflows
SMS (Twilio) SMS-Kanal für Offline-/Niedrigkonnektivitätsszenarien
Mattermost @-Erwähnungs-Kanalfilter, ideal für selbst gehostete Teams
Matrix Dezentrales Kommunikationsprotokoll, Vision-Unterstützung und Bild-Caching
Webhook Universeller Webhook-Adapter für beliebige externe Ereignisauslöser

Gateway-Kern-Upgrades:

  • Automatische Wiederverbindung mit exponentiellem Backoff: erholt sich stillschweigend von Plattform-Trennungen
  • Antwortnachricht-Kontext: fügt automatisch den ursprünglichen Nachrichtenkontext für sitzungsfremde Antworten hinzu
  • Nicht autorisierte DMs ignorieren: konfigurierbare Filterung von DMs nicht autorisierter Benutzer
# hermes.config.yaml — Beispiel für Multi-Plattform-Konfiguration
gateway:
  platforms:
    - signal
    - dingtalk
    - telegram
    - discord
  auto_reconnect: true
  ignore_unauthorized_dms: true

3. @-Kontextreferenzen — Interaktion im Claude-Code-Stil

Gib @ in der CLI ein und verwende Tab zur Autovervollständigung von Dateipfaden oder URLs. Hermes fügt den referenzierten Inhalt automatisch in den Gesprächskontext ein.

# @file-Referenz — Dateiinhalt in das Gespräch einfügen
> @src/auth/handler.ts Überprüfe diese Authentifizierungslogik

# @url-Referenz — Webseiteninhalt in das Gespräch einfügen
> @https://docs.example.com/api Schreibe einen Client basierend auf dieser API-Dokumentation

Dies entlehnt sich vom Interaktionsmodell von Claude Code, aber Hermes implementiert es als Tab-Vervollständigung + native CLI-Integration — kein Editor-Plugin erforderlich. Besonders nützlich in reinen Terminalumgebungen ohne IDE, wie SSH-Sitzungen auf entfernten Servern.

4. Vier Neue Inferenz-Provider — Freiheit der Modellwahl

Das Provider-System von Hermes wurde in v0.4.0 weiter ausgebaut:

GitHub Copilot (OAuth + Token-Validierung)

  • Vollständiger OAuth-Authentifizierungsablauf, keine hartcodierten API-Schlüssel
  • 400K Kontextfenster für ultra-lange Codeanalyse
  • Automatische Token-Validierung und Ablaufbehandlung Beigetragen von @mchzimm

Alibaba Cloud / DashScope

  • Vollständige DashScope v1 Runtime-Integration
  • Unterstützung für die gesamte Qwen-Modellfamilie (qwen-*)
  • Punkterhaltende Modellnamen (z.B. qwen-plus-v2)

Kilo Code

  • Für Coding-Szenarien optimierter Inferenz-Provider

OpenCode Zen / Go

  • Leichtgewichtige Provider-Backends Zen-bezogene Korrekturen beigetragen von @0xbyt4

Provider-System-Verbesserungen:

  • Automatische Degradierung bei Ratenlimit: automatischer Wechsel zum Backup-Modell bei Ratenlimit-Fehlern — Gespräche werden nie unterbrochen
  • Überholung der Kontextlängenerkennung: models.dev-Integration, provider-bewusste Auflösung, Fuzzy-Matching für benutzerdefinierte Endpunkte, llama.cpp /v1/props-Unterstützung
  • Modellkatalog-Aktualisierungen: hinzugefügt: gpt-5.4-mini, gpt-5.4-nano, haiku-4.5, claude 4.6 (1M Kontext), minimax-m2.7 und mehr
  • Verbesserungen bei benutzerdefinierten Endpunkten: model.base_url-Konfigurationsunterstützung, API-Schlüssel-lose lokale Endpunkte, schnelles Fehlschlagen bei fehlenden Schlüsseln statt stillem Versagen

5. MCP-Server-Management-CLI — Vollständiger OAuth 2.1 PKCE-Workflow

Das MCP-Ökosystem (Model Context Protocol) machte in v0.4.0 einen qualitativen Sprung: von manuellen Konfigurationsdateien zu einer vollständigen CLI-Management-Erfahrung.

# Einen MCP-Server installieren
hermes mcp install <server-name>

# Einen MCP-Server konfigurieren
hermes mcp configure <server-name>

# OAuth 2.1 PKCE-Authentifizierung (vollständig geführt)
hermes mcp auth <server-name>
  • Vollständiger OAuth 2.1 PKCE-Workflow: Browser-Weiterleitung, Callback-Behandlung, Token-Erneuerung — alles von der CLI geführt
  • MCP-Server als eigenständige Toolsets bereitgestellt: jeder MCP-Server ist ein umschaltbares Toolset
  • Interaktive MCP-Tool-Konfiguration: konfiguriere MCP-Tools direkt in hermes tools, kein YAML-Editing erforderlich

6. Gateway Prompt-Caching — Dramatische Kostenreduktion für Lange Gespräche

Im Gateway-Modus werden AIAgent-Instanzen jetzt pro Sitzung zwischengespeichert, wodurch der Anthropic Prompt-Cache über Runden hinweg erhalten bleibt.

Was bedeutet das?

  • Für lange Gespräche wird der Anthropic Prompt-Cache nicht mehr jede Runde ungültig und neu aufgebaut
  • Massive Kostenreduktion (der Preisunterschied zwischen Schreiben und Lesen des Anthropic Prompt-Cache beträgt Größenordnungen)
  • Der Cache wird zusammen mit der Sitzungswiederaufnahme wiederhergestellt
# Automatisch aktiv im Gateway-Modus, keine Konfiguration erforderlich
# Die AIAgent-Instanz jeder Sitzung wird im Speicher zwischengespeichert
# Der Prompt-Cache bleibt über Runden hinweg erhalten

7. Vollständige Überarbeitung der Kontextkomprimierung — Kein Gespräch Ist Zu Lang

Der Kontextkomprimierungsmechanismus wurde in v0.4.0 vollständig neu geschrieben:

  • Strukturierte Zusammenfassungen: kein einfaches Abschneiden mehr — iterative, strukturierte Zusammenfassungsaktualisierungen
  • Token-Budget-Endeschutz: bewahrt den aktuellsten Gesprächsinhalt während der Komprimierung
  • Konfigurierbarer Zusammenfassungs-Endpunkt: summary_base_url ermöglicht die Verwendung eines selbst gehosteten Modells zur Zusammenfassung und spart API-Kosten
  • Backup-Modell-Unterstützung: automatischer Wechsel zu einem Backup-Modell, wenn der primäre Zusammenfasser nicht verfügbar ist

8. Streaming Standardmäßig Aktiviert — Was Du Siehst, Ist Was Du Bekommst

CLI-Streaming ist ab v0.4.0 standardmäßig aktiviert, mit umfangreichen Verbesserungen:

  • Korrekte Anzeige von Spinner und Tool-Fortschritt während des Streaming-Modus
  • Behobener Whitespace-Verlust bei der Verkettung von Stream-Chunks
  • Behobene Zeilenumbruchprobleme an Iterationsgrenzen, die Stream-Korruption verursachten
  • Automatische Unterdrückung der Spinner-Animation in Nicht-TTY-Umgebungen
  • Unterstützung für die Anzeige von Reasoning-/Denkblöcken (show_reasoning)

Neue CLI-Befehle

Befehl Funktion Verwendung
/statusbar Persistente Statusleiste umschalten (Modell + Provider-Info) /statusbar
/queue Prompts in Warteschlange stellen, ohne den laufenden Agenten zu unterbrechen /queue <nachricht>
/permission Genehmigungsmodus während einer Sitzung dynamisch wechseln /permission
/browser Interaktive Browser-Sitzung von der CLI aus starten /browser
/cost Echtzeit-Kosten- und Nutzungsverfolgung im Gateway-Modus /cost
/approve / /deny Explizite Genehmigen/Ablehnen-Befehle im Gateway /approve oder /deny

Verbesserungen der Konfigurationsverwaltung

# Echtzeit-Konfigurationsneuladen — bearbeite config.yaml ohne Neustart
# Wird automatisch wirksam, kein manueller Eingriff erforderlich

# Umgebungsvariablen-Substitution — verwende ${ENV_VAR} in config.yaml
# Beispiel:
# api_key: ${OPENAI_API_KEY}

# Benutzerdefinierte Modelle — custom_models.yaml
# Füge deine eigenen Modelle außerhalb des offiziellen Katalogs hinzu
  • ${ENV_VAR}-Substitution: verweise direkt auf Umgebungsvariablen in config.yaml
  • Echtzeit-Konfigurationsneuladen: Änderungen an config.yaml werden ohne Neustart übernommen
  • custom_models.yaml: benutzerverwaltete Modellhinzufügungen
  • Verschachtelte YAML-Zusammenführung: tiefe Zusammenführung bei Konfigurationsaktualisierung statt grobem Ersetzen
  • Prioritätsbasierte Kontextdateiauswahl + CLAUDE.md-Unterstützung

Neue Werkzeuge

Werkzeug Beschreibung Verwendung
IMAP E-Mail E-Mails über IMAP-Protokoll lesen und senden Agent kann direkt E-Mails bearbeiten
STT (Sprache-zu-Text) Spracherkennung über Whisper API Audiodateien transkribieren
Tavily Web-Suche/Extraktion/Crawling-Backend hermes tools enable tavily
Parallel Alternatives Web-Suche/Extraktion-Backend hermes tools enable parallel
Konfigurierbares Web-Backend Auswahl zwischen Firecrawl / BeautifulSoup / Playwright Nach Bedarf konfigurieren
Routenerkennende Preisgestaltung Präzise Kostenschätzungen pro Provider-Route Automatische Berechnung

TTS-Verbesserungen

  • NeuTTS: lokaler TTS-Provider mit integriertem Einrichtungsablauf, ersetzt den alten optionalen Skill
  • OpenAI TTS benutzerdefinierte base_url-Unterstützung

Verbesserungen der Vision-Tools

  • Konfigurierbarer Timeout
  • Tilde-Erweiterung in Dateipfaden
  • Gateway DM Multi-Image + base64-Fallback

Sicherheit und Zuverlässigkeit

Sicherheitshärtung

  • SSRF-Schutz: umfassend für vision_tools und web_tools
  • Shell-Injection-Prävention: ~user-Pfadsuffixe werden nicht mehr von der Shell interpretiert
  • Browser-Ursprungsschutz: blockiert nicht autorisierten browserbasierten Zugriff auf den API-Server
  • Sandbox-Credential-Isolierung: Sandbox-Backend-Credentials gelangen nie in Subprozess-Umgebungsvariablen
  • @-Referenz-Pfadbeschränkung: blockiert das Lesen sensibler Dateien außerhalb des Arbeitsbereichs (beigetragen von @Gutslabs)
  • Bösartiger Code Pre-Execution-Scanner: scannt terminal_tool-Befehle vor der Ausführung auf bösartige Muster
  • SQL-Injection-Eliminierung: alle execute()-Aufrufe auf parametrisierte Abfragen umgestellt (beigetragen von @dusterbloom)
  • Jobs-API-Härtung: Eingabelimits + Feld-Whitelist + Startprüfungen

Zuverlässigkeitsverbesserungen

  • Thread-Sperren bei 4 kritischen SessionDB-Methoden
  • Dateisperren für gleichzeitige Speicherschreibvorgänge
  • Elegante OpenRouter-Fehlerbehandlung
  • Agent-Schleifen-Robustheit erheblich verbessert: automatische Wiederherstellung von provider-abgelehntem tool_choice, korrekte Behandlung leerer Tool-Ergebnisse, JSON-Parse-Fehler werden an das Modell zurückgegeben statt mit leeren Argumenten ausgeführt zu werden, Verhinderung von stillem Tool-Ergebnisverlust

Cron-System-Verbesserungen

  • [SILENT]-Antworten: Cron-Agenten können still ausgeführt werden, ohne Ergebnisse zu senden
  • Das Toleranzfenster für verpasste Jobs skaliert mit der Planungsfrequenz
  • Kürzliche einmalige Jobs wiederherstellen
  • Korrektur der ISO-Zeitstempel-Normalisierung (zuvor verursachten zeitzonenlose Zeitstempel, dass Jobs zu falschen Zeiten ausgeführt wurden)

Skills-Ökosystem

Neue Skills

Skill Beschreibung
OCR-and-documents OCR für PDF/DOCX/XLS/PPTX/Bilder mit optionaler GPU-Beschleunigung
Huggingface-hub Integrierte HuggingFace Hub-Interaktion
Sherlock OSINT Plattformübergreifende Benutzernamensuche
Meme-generation Bildgenerierung mit Pillow
Bioinformatics Gateway-Skill, der über 400 Bioinformatik-Skills indexiert
3D-model-viewer 3D-Modellbetrachter
FastMCP Schnellentwicklungs-Skill für MCP
Base blockchain Blockchain-Interaktion

Verbesserungen des Skills-Systems

  • Agent-erstellte Skills: Caution-Level-Funde erlaubt, gefährliche Skills fragen statt zu blockieren
  • --yes-Flag: Bestätigung bei Skill-Installation/Deinstallation überspringen
  • Deaktivierte Skills global respektiert: nicht vorhanden in Banner, System-Prompt und Slash-Befehlen

Plugin-System-Verbesserungen

  • TUI-Erweiterungs-Hooks: baue benutzerdefinierte CLIs auf Hermes auf
  • hermes plugins install/remove/list: vollständiges Plugin-Lebenszyklus-Management
  • Slash-Befehl-Registrierung: Plugins können ihre eigenen Slash-Befehle registrieren
  • session:end-Lebenszyklus-Ereignis: Plugins können sich in Sitzungsend-Ereignisse einklinken

Aktualisierung

hermes update

Für Neuinstallationen besuche die Installationsanleitung.


Vollständiges Changelog auf GitHub

← Hermes Agent Changelog