Hermes v0.19.0 Quicksilver: 80 % schnellerer Ersttoken und 11 Funktionen, die du kennen solltest

Hermes Agent v0.19.0, Codename Quicksilver, wurde am 20. Juli 2026 veröffentlicht. Es ist eines der größten Releases von Nous Research bisher: Seit v0.18.0 kamen etwa 2.245 Commits, 1.065 gemergte PRs, 3.300 geschlossene Issues und Beiträge von über 450 Personen zusammen. Die v0.19.0 Release Notes auf dieser Seite fassen es so zusammen: “Hermes ist der Götterbote, und in diesem Fenster haben wir ihn so schnell gemacht, wie er sein sollte.”
Dieser Artikel ist kein Copy-Paste des Changelogs. Ich breche das Update in die 11 Funktionen auf, die normale Entwickler am meisten interessieren sollten, erkläre, warum sie wichtig sind, wie man sie nutzt und welchen praktischen Einfluss sie haben. Für die vollständige technische Liste der Änderungen siehe die v0.19.0 Release Notes.
1. Erst-Token-Latenz um ~80 % überall gesenkt
Die wichtigste Zahl: Die Time-to-First-Token (TTFT) fiel von ~4,3 s auf ~0,9 s, ein Rückgang von ~80 %. Und das gilt für CLI, Gateway, TUI, Desktop und Cron.
Wie wurde das erreicht? Das Team entfernte mehrere Engpässe aus dem Cold-Start-Pfad:
- Die Discord-Fähigkeitserkennung wurde aus dem kritischen Pfad herausgenommen und durch einen 24-Stunden-Disk-Cache plus Hintergrundaktualisierung ersetzt
- Der Ollama-Probe wird für bekannte Nicht-Ollama-Provider übersprungen
- Blockierende Agent-Init-Arbeiten wurden aus dem Cold Start entfernt
- Prompt-Build-Caching und mtime-caching der Zeitzonenauflösung wurden hinzugefügt
Das ist keine einzelne Optimierung, sondern Dutzende kleiner Schnitte, die zusammen die “Initializing agent…”-Wartezeit beseitigen. Wenn Hermes sich bisher wie ein tiefer Atemzug vor der Antwort anfühlte, ist dieser Atemzug jetzt weg.
2. Reasoning-Modelle streamen ihr Denken live
display.show_reasoning ist jetzt standardmäßig EIN. Bei Reasoning-Modellen wie Claude 3.7 Sonnet oder der o3/o4-Familie starrt man nicht mehr 30 Sekunden auf einen Spinner. Man sieht das Modell Schritt für Schritt denken. Die Antwortbox wird auch tokenweise statt zeilenweise gezeichnet, was die Interaktion flüssiger wirken lässt.
3. Desktop-App bekommt 20+ Performance-PRs
Hermes Desktop wurde einem gezielten Geschwindigkeits- und Flüssigkeitssprint unterzogen:
- Streaming-Markdown-Rendering verbraucht 14× weniger CPU durch inkrementelles Block-Lexing
- Riesige Diffs werden virtualisiert, sodass der Review-Bereich nicht mehr bei vollständigem Shiki-Freeze hängt
- Sitzungswechsel sind selbst bei riesigen Transkripten sofort; die Layout-Thrash-Kaskade wurde eliminiert
- Start-Serialisierung und pro-Runde REST-Verstärkung wurden reduziert
- Profil-Backends werden bei Hover-Intent vorgewärmt; beim Start versteckte Panels werden im Leerlauf geladen
- Seitenleiste und Tool-Zeilen werden während des Streamings nicht mehr pro Token neu gerendert
Das Ergebnis ist ein Desktop-Erlebnis, das sich selbst unter Last nativ anfühlt, auch mit beschäftigten Agenten und großen Gesprächen.
4. Nous-Plan direkt im Terminal verwalten: /subscription und /topup
Früher bedeutete ein Abonnementwechsel einen Besuch auf der Billing-Website. Jetzt geht das direkt in der TUI oder klassischen CLI:
/subscription
/topup
/subscription zeigt den aktuellen Plan, verbleibende Kontingente, die genauen Upgrade-Kosten (z. B. „Pay $46.30 & upgrade now“), das Datum, an dem ein Downgrade wirksam wird, und erlaubt es, Änderungen anzuwenden oder rückgängig zu machen. Die Desktop-App erhielt eine passende Billing-Einstellungsseite. Für Power-User ist das ein erheblicher Qualitätsgewinn.
5. Smart Approvals: Ein LLM beurteilt markierte Befehle
Hermes hat vor dem Ausführen markierter Befehle bereits um Bestätigung gebeten. In v0.19.0 sind Smart Approvals der Standard. Ein unabhängiger LLM-Reviewer klassifiziert den Befehl als sicher, gefährlich oder unsicher. Sichere Befehle werden automatisch genehmigt, gefährliche abgelehnt, unsichere an den Menschen eskaliert. Jeder Befehl wird einzeln geprüft, sodass spätere Übereinstimmungen nicht automatisch passieren.
Zusammen mit benutzerdefinierten Deny-Regeln, die Befehle selbst im Yolo-Modus blockieren, und /deny <reason>, das dem Modell mitteilt, warum du abgelehnt hast, sinkt die Alltags-Ermüdung durch Genehmigungen, ohne die Kontrolle aufzugeben.
approvals:
deny:
- "rm -rf *"
- "DROP DATABASE *"
- "DROP TABLE *"
6. Passwort-Manager einbinden: Bitwarden und 1Password
API-Keys müssen nicht mehr in einer Klartext-.env-Datei leben. Ein neues pluggable SecretSource-Interface lässt Hermes Secrets zur Ladezeit aus Bitwarden und 1Password (op://-Referenzen) beziehen.
secret_sources:
- provider: bitwarden
vault: "dev-creds"
priority: 1
- provider: onepassword
vault: "Production"
priority: 2
Mehrere Vaults können gleichzeitig mit deterministischer Priorität, Konfliktwarnungen und Provenance pro Variable aktiv sein. Zukünftige Vault-Anbieter müssen nur dasselbe Interface implementieren.
7. Subagenten live beobachten plus durable Hintergrund-Delegation
delegate_task-Dispatches geben jetzt Live-Transkript-Dateien zurück, die man mit tail -f verfolgen kann, sobald die Subagenten starten. Jeder Tool-Call, jedes Ergebnis und jeder gestreamte Reply ist pro Kind sichtbar. Wichtiger: Hintergrund-Delegationen sind jetzt durable. Wenn der Hauptprozess mitten im Lauf neu startet, werden Ergebnisse wiederhergestellt und über ein ownership-geprüftes Ledger zugestellt, statt zu verschwinden.
Das macht es praktisch, eine Flotte von Subagenten zu starten und den Fortschritt jederzeit nachzuschauen, ohne das Terminal bewachen zu müssen.
8. Finale Antworten können nicht mehr durch einen Gateway-Absturz verloren gehen
Das ist ein solider Zuverlässigkeitsupgrade. Wenn das Gateway zwischen der Generierung der Antwort und der Bestätigung der Plattform-Zustellung abstürzte, ging die Antwort bisher stillschweigend verloren, obwohl man bereits für die Tokens bezahlt hatte. Finale Antworten werden jetzt in einem dauerhaften Delivery-Obligation-Ledger in state.db aufgezeichnet und beim nächsten Start erneut zugestellt.
Für Telegram, Discord, Slack und andere Gateway-Kanäle bewegt das die Zustellung von „Best Effort“ zu „At-Least-Once-Erfolg“.
9. Ein Gateway, viele Profile: Profil-basiertes Routing
Ein einzelnes Gateway mit einem Bot-Token kann jetzt bestimmte Server, Kanäle oder Threads zu verschiedenen Profilen routen. Jedes Profil hat vollständig isolierte Konfiguration, Skills, Memory und Secrets.
Zum Beispiel:
- Dein Arbeits-Discord-Server → Arbeitsprofil
- Dein persönlicher Discord-Server → persönliches Profil
- Alles über denselben Bot-Token
Eine zweite Multiplex-Härtungswelle bedeutet, dass ein falsch konfiguriertes Profil das gesamte Gateway nicht mehr zum Absturz bringen kann.
10. Neue Provider und neueste Frontier-Modelle
Der Modell-Support wurde erweitert um:
- GPT-5.6-Familie (Sol / Terra / Luna und Pro-Varianten)
- grok-4.5 (GA)
- moonshotai/kimi-k3 (1M Kontext auf Kimi-Coding-Endpunkten)
- claude-fable-5 / claude-sonnet-5
- tencent/hy3 GA
- GLM-5.2, Upstage Solar und mehr
Neue Provider:
- Fireworks AI als First-Class-Provider mit Kostenschätzung und Platz #2 im Modell-Picker
- Gehärtete DeepInfra-Integration
- LM Studio JIT-Load-Modus
- Bedrock-Katalog-Verbesserungen: Live-Kontextfenster-Sondierung, 1M-Kontext-Zeilen, Geo-Prefix-Parität
Wenn du häufig zwischen Spitzenmodellen wechselst, holt dich dieses Release auf den neuesten Stand.
11. Reasoning-Effort ist jetzt ein Regler: max, ultra und Overrides pro Modell
reasoning_effort erhält die Stufen max und ultra, auf allen Oberflächen und Routen wählbar. Außerdem kann man:
- Pro-Modell-Reasoning-Effort-Overrides in der Config festpinnen
- Pro-Slot-Effort in MoA-Presets setzen
- Pro-Task-Effort für Hilfsmodelle setzen
Denktiefe wird damit zu einem Drehknopf, nicht zu einem globalen Schalter.
Weitere erwähnenswerte Verbesserungen
- Sitzungs-Export:
hermes sessions exportschreibt Markdown, Quarto, HTML, Prompt-only und HF-Trace-Formate, mit Filtern für Alter/Workspace und optionalem--redact-Durchlauf - Desktop Capabilities-Seite: Skills, Tools, MCP und Hub an einem Ort, mit Test/Toggle und Log-Filterung
- Web Dashboard: sicherer Sitzungsimport, WhatsApp-Pairing, Discord-Toolset-Verwaltung, Terminal-Keep-Alive und mehr
- Security-Härtung: Vertex-Credential-Scoping, sechs P1-Härtungs-PRs für Browser/MEDIA/.env, Webhook-Body-Size-Limits, CI-Schutz gegen untrusted refs
- CLI-Hilfsmittel:
/model --oncefür einmaligen Modell-Override, gestapelte Skill-Aufrufe (/skill-a /skill-b) und--safe-modefür Troubleshooting
Upgrade
Wenn du Hermes bereits installiert hast:
hermes update
# oder
npm update -g @nousresearch/hermes-agent
Danach ein schneller Gesundheitscheck:
hermes config doctor
hermes plugins list
hermes mcp list
Zusammenfassung
Die entscheidende Veränderung in Hermes v0.19.0 Quicksilver ist, dass er schneller wurde und zuverlässig bleibt. ~80 % schnellerer Erst-Token, 14× schnelleres Desktop-Streaming-Markdown und absturzsichere Gateway-Zustellung sind keine aufsehenerregenden Features; sie sind das Fundament, das entscheidet, ob ein autonomer KI-Agent Teil des täglichen Workflows wird.
Darauf baut v0.19.0 unternehmenstaugliche Fähigkeiten auf: Terminal-Billing, Passwort-Manager-Integration, Smart Approvals, Subagenten-Monitoring, ein Delivery-Ledger und Multi-Profile-Routing. Wenn du Hermes bereits in Produktion oder als Team-Gateway betreibst, ist dieses Release ein starkes Upgrade.
Wenn du es noch nicht probiert hast, starte mit /subscription und einem hermes update, und lass die neue Geschwindigkeit deine nächste Aufgabe erledigen.