Hermes v0.19.0 Quicksilver : premier token 80 % plus rapide et 11 fonctionnalités incontournables

Hermes Agent v0.19.0, nom de code Quicksilver, a été publié le 20 juillet 2026. C’est l’une des plus importantes versions de Nous Research à ce jour : depuis v0.18.0, la communauté a accumulé environ 2 245 commits, 1 065 PR fusionnés, 3 300 issues fermées et les contributions de plus de 450 personnes. Les notes de publication v0.19.0 sur ce site résument cela ainsi : « Hermes est le messager des dieux, et dans cette fenêtre, nous l’avons fait bouger comme tel. »
Cet article n’est pas un copier-coller du changelog. Je décompose la mise à jour en 11 fonctionnalités que les développeurs ordinaires devraient connaître, pourquoi elles comptent, comment les utiliser et quel impact pratique elles ont. Pour la liste technique complète des changements, consultez les notes de publication v0.19.0.
1. La latence du premier token chute d’environ 80 % partout
Le chiffre clé : le temps jusqu’au premier token (TTFT) est passé de ~4,3 s à ~0,9 s, soit une baisse d’environ 80 %. Et cela s’applique à la CLI, la passerelle, la TUI, le bureau et les tâches cron.
Comment cela a-t-il été réalisé ? L’équipe a supprimé plusieurs goulots d’étranglement du chemin de démarrage à froid :
- La détection des capacités Discord a été sortie du chemin critique grâce à un cache disque de 24 heures et une actualisation en arrière-plan
- La sonde Ollama est sautée pour les fournisseurs connus comme n’étant pas Ollama
- Le travail bloquant d’initialisation de l’agent a été retiré du démarrage à froid
- Mise en cache de la construction des prompts et résolution de fuseau horaire avec cache mtime
Ce n’est pas une seule optimisation ; ce sont des dizaines de petites coupures qui éliminent ensemble l’attente de « Initializing agent… ». Si Hermes avait l’air de prendre une grande respiration avant de répondre, cette respiration a disparu.
2. Les modèles de raisonnement diffusent leur réflexion en direct
display.show_reasoning est maintenant ACTIVÉ par défaut. Avec les modèles de raisonnement comme Claude 3.7 Sonnet ou la famille o3/o4, vous ne fixez plus un spinner pendant 30 secondes. Vous voyez le modèle penser étape par étape. La boîte de réponse se peint également par token au lieu de par ligne, ce qui rend l’interaction plus fluide.
3. L’application de bureau gagne une vague de 20+ PR de performance
Hermes Desktop a fait l’objet d’un sprint ciblé sur la vitesse et la fluidité :
- Le rendu Markdown en streaming utilise 14× moins de CPU grâce à l’analyse lexicale incrémentale par blocs
- Les diffs géants sont virtualisés, le panneau de révision ne gèle plus sur le Shiki complet
- Le changement de session est instantané même avec d’énormes transcriptions ; la cascade de layout-thrash a été éliminée
- La sérialisation au démarrage et l’amplification REST par tour ont été réduites
- Les backends de profil se préchauffent au survol ; les panneaux cachés se montent en période d’inactivité
- La barre latérale et les lignes d’outils ne se re-rendent plus à chaque token pendant le streaming
Le résultat est une expérience de bureau qui se sent native sous charge, même avec des agents occupés et de grandes conversations.
4. Gérez votre plan Nous depuis le terminal : /subscription et /topup
Changer d’abonnement signifiait auparavant se rendre sur le site de facturation. Maintenant, cela se fait dans la TUI ou la CLI classique :
/subscription
/topup
/subscription affiche votre plan actuel, l’allocation restante, le coût exact de la mise à niveau (par exemple, « Pay $46.30 & upgrade now »), la date d’effet de la rétrogradation, et permet d’appliquer ou d’annuler les changements. L’application de bureau a également reçu un onglet de facturation correspondant. Pour les utilisateurs avancés, c’est un gain de confort de vie significatif.
5. Approbations intelligentes : laissez un LLM juger les commandes signalées
Hermes demandait déjà une approbation avant d’exécuter des commandes signalées. En v0.19.0, les approbations intelligentes sont par défaut. Un réviseur LLM indépendant classe la commande comme sûre, dangereuse ou incertaine. Les commandes sûres sont approuvées automatiquement, les dangereuses refusées, les incertaines escaladées vers vous. Chaque commande est examinée individuellement, donc une correspondance ultérieure ne passe pas automatiquement.
Combiné avec les règles de refus définies par l’utilisateur qui bloquent les commandes même en mode yolo, et /deny <reason> qui dit au modèle pourquoi vous avez refusé, cela réduit la fatigue d’approbation quotidienne sans perdre le contrôle.
approvals:
deny:
- "rm -rf *"
- "DROP DATABASE *"
- "DROP TABLE *"
6. Intégrez votre gestionnaire de mots de passe : Bitwarden et 1Password
Les clés API n’ont plus à vivre dans un fichier .env en clair. Une nouvelle interface SecretSource permet à Hermes de récupérer les secrets depuis Bitwarden et 1Password (références op://) au chargement.
secret_sources:
- provider: bitwarden
vault: "dev-creds"
priority: 1
- provider: onepassword
vault: "Production"
priority: 2
Plusieurs coffres peuvent être actifs simultanément avec une priorité déterministe, des avertissements de conflit et une provenance par variable. Les futurs fournisseurs n’ont qu’à implémenter la même interface.
7. Observez vos sous-agents en direct, avec une délégation durable en arrière-plan
Les dispatches delegate_task retournent maintenant des fichiers de transcription en direct que vous pouvez suivre avec tail -f dès le lancement des sous-agents. Chaque appel d’outil, résultat et réponse en streaming est visible par enfant. Plus important : les délégations en arrière-plan sont maintenant durables. Si le processus principal redémarre en cours d’exécution, les résultats sont restaurés et livrés via un registre vérifié par propriété, au lieu de disparaître.
Cela rend pratique de déployer une flotte de sous-agents et de consulter leur progression quand vous voulez, sans surveiller le terminal.
8. Les réponses finales ne peuvent plus être perdues par un crash de passerelle
C’est une amélioration de fiabilité solide. Si la passerelle mourait entre la génération de votre réponse et la confirmation de livraison à la plateforme, la réponse était auparavant silencieusement perdue, même si vous aviez déjà payé les tokens. Les réponses finales sont maintenant enregistrées dans un registre d’obligation de livraison durable dans state.db et redélivrées au prochain démarrage.
Pour Telegram, Discord, Slack et autres canaux de passerelle, cela passe la livraison de « meilleur effort » à « au moins une fois réussie ».
9. Une passerelle, plusieurs profils : routage basé sur les profils
Une seule passerelle partageant un token de bot peut maintenant router des serveurs, canaux ou threads spécifiques vers différents profils. Chaque profil a une configuration, des skills, une mémoire et des secrets complètement isolés.
Par exemple :
- Votre serveur Discord professionnel → profil travail
- Votre serveur Discord personnel → profil personnel
- Tout cela via le même token de bot
Une deuxième vague de durcissement du multiplex signifie qu’un profil mal configuré ne peut plus faire tomber toute la passerelle.
10. Nouveaux fournisseurs et modèles frontière les plus récents
Le support de modèles ajouté inclut :
- Famille GPT-5.6 (Sol / Terra / Luna et variantes Pro)
- grok-4.5 (GA)
- moonshotai/kimi-k3 (1M de contexte sur les endpoints Kimi Coding)
- claude-fable-5 / claude-sonnet-5
- tencent/hy3 GA
- GLM-5.2, Upstage Solar et plus
Les ajouts de fournisseurs incluent :
- Fireworks AI comme fournisseur de première classe avec estimation de coûts et position #2 dans le sélecteur de modèles
- Intégration renforcée de DeepInfra
- Mode de chargement JIT de LM Studio
- Améliorations du catalogue Bedrock : sondage du contexte en direct, lignes de 1M de contexte, parité des préfixes géographiques
Si vous changez fréquemment entre les modèles de pointe, cette version vous remet à niveau.
11. L’effort de raisonnement devient un curseur : max, ultra et overrides par modèle
reasoning_effort gagne les niveaux max et ultra, sélectionnables sur toutes les surfaces et routes. Vous pouvez aussi :
- Épingler des overrides de reasoning_effort par modèle dans la config
- Définir un effort par slot dans les presets MoA
- Définir un effort par tâche pour les modèles auxiliaires
La profondeur de réflexion devient un curseur que vous pouvez tourner, pas un interrupteur global.
Autres améliorations notables
- Export de sessions :
hermes sessions exportécrit Markdown, Quarto, HTML, prompt-only et formats de traces prêts pour Hugging Face, avec filtres par âge/espace de travail et un passage optionnel--redact - Page Capabilities du bureau : Skills, Tools, MCP et Hub au même endroit, avec test/activation et filtrage de logs
- Web Dashboard : import sécurisé de sessions, appairage WhatsApp, gestion des toolsets Discord, keep-alive du terminal et plus
- Durcissement de sécurité : scope des credentials Vertex, six PRs P1 de durcissement browser/MEDIA/.env, limites de taille de body webhook, protection CI contre les refs non fiables
- Utilitaires CLI :
/model --oncepour un override de modèle sur un seul tour, appels de skills empilés (/skill-a /skill-b) et--safe-modepour le dépannage
Mise à jour
Si vous avez déjà installé Hermes :
hermes update
# ou
npm update -g @nousresearch/hermes-agent
Puis une vérification rapide :
hermes config doctor
hermes plugins list
hermes mcp list
Résumé
Le changement déterminant de Hermes v0.19.0 Quicksilver est qu’il est devenu plus rapide tout en restant fiable. Une amélioration d’environ 80 % du premier token, un rendu Markdown en streaming 14× plus rapide sur le bureau, et une livraison de passerelle résistante aux crashes ne sont pas des fonctionnalités tape-à-l’œil ; ce sont les fondations qui décident si un agent IA autonome devient partie intégrante de votre flux de travail quotidien.
Sur cette base, v0.19.0 ajoute des capacités de niveau entreprise : facturation en terminal, intégration de gestionnaire de mots de passe, approbations intelligentes, surveillance des sous-agents, un registre de livraison et le routage multi-profil. Si vous exécutez déjà Hermes en production ou comme passerelle d’équipe, cette version est une mise à niveau forte.
Si vous ne l’avez pas encore essayé, commencez par /subscription et un hermes update, puis laissez la nouvelle vitesse gérer votre prochaine tâche.