Hermes v0.19.0 Quicksilver: primeiro token 80% mais rápido e 11 recursos essenciais

Hermes Agent v0.19.0, codinome Quicksilver, foi lançado em 20 de julho de 2026. É um dos maiores lançamentos da Nous Research até hoje: desde v0.18.0, a comunidade acumulou aproximadamente 2.245 commits, 1.065 PRs mergeados, 3.300 issues fechadas e contribuições de mais de 450 pessoas. As notas de lançamento do v0.19.0 neste site resumem assim: “Hermes é o mensageiro dos deuses, e nesta janela fizemos ele se mover como tal.”
Este artigo não é um copia-cola do changelog. Vou dividir a atualização em 11 recursos que desenvolvedores comuns devem conhecer, por que importam, como usar e qual impacto prático esperar. Se precisar da lista técnica completa, consulte as notas de lançamento do v0.19.0.
1. Latência do primeiro token cai ~80% em todas as plataformas
O número de destaque: o tempo até o primeiro token (TTFT) caiu de ~4,3s para ~0,9s, uma redução de ~80%. E isso vale para CLI, gateway, TUI, desktop e cron.
Como foi alcançado? A equipe removeu vários gargalos do caminho de inicialização fria:
- A detecção de capacidades do Discord saiu do caminho crítico, com cache em disco de 24 horas + atualização em segundo plano
- A sonda Ollama é ignorada para provedores conhecidos que não são Ollama
- O trabalho bloqueante de inicialização do agente foi removido do cold start
- Foi adicionado cache de construção de prompts e resolução de fuso horário com mtime cacheado
Não é uma única otimização; são dezenas de pequenos cortes que juntos eliminam a espera de “Initializing agent…”. Se Hermes antes parecia dar uma respiração profunda antes de responder, essa respiração desapareceu.
2. Modelos de raciocínio mostram seu pensamento ao vivo
display.show_reasoning agora está LIGADO por padrão. Com modelos de raciocínio como Claude 3.7 Sonnet ou a família o3/o4, você não fica mais olhando para um spinner por 30 segundos. Você vê o modelo pensar passo a passo. A caixa de resposta também é pintada por token em vez de por linha, tornando a interação mais fluida.
3. Desktop recebe onda de 20+ PRs de performance
O Hermes Desktop passou por um sprint focado em velocidade e fluidez:
- Renderização de Markdown em streaming usa 14× menos CPU com análise léxica incremental por blocos
- Diffs enormes são virtualizados, então o painel de revisão não congela mais no Shiki completo
- Troca de sessões é instantânea mesmo com transcrições enormes; a cascata de layout-thrash foi eliminada
- Serialização de inicialização e amplificação REST por turno foram reduzidas
- Backends de perfil são pré-aquecidos ao detectar intenção de hover; painéis ocultos são montados em idle
- Barra lateral e linhas de ferramenta não são mais re-renderizadas a cada token durante o streaming
O resultado é uma experiência de desktop que se sente nativa sob carga, mesmo com agentes ocupados e conversas grandes.
4. Gerencie seu plano Nous pelo terminal: /subscription e /topup
Mudar de assinatura antes exigia uma visita ao site de faturamento. Agora isso está na TUI ou CLI clássica:
/subscription
/topup
/subscription mostra seu plano atual, saldo restante, custo exato de upgrade (por exemplo, “Pay $46.30 & upgrade now”), data de vigência do downgrade, e permite aplicar ou desfazer mudanças. O desktop também ganhou uma aba correspondente de configurações de faturamento. Para usuários avançados, isso é um grande ganho de qualidade de vida.
5. Aprovações inteligentes: deixe um LLM julgar comandos sinalizados
Hermes já pedia aprovação antes de executar comandos sinalizados. Em v0.19.0, as aprovações inteligentes são o padrão. Um revisor LLM independente classifica o comando como seguro, perigoso ou incerto. Comandos seguros são aprovados automaticamente; perigosos são negados; incertos são escalados para você. Cada comando é revisado individualmente, então uma correspondência posterior não passa de graça.
Junto com as regras de negação definidas pelo usuário que bloqueiam comandos mesmo no modo yolo, e /deny <reason> que diz ao modelo por que você recusou, isso reduz a fadiga de aprovação diária sem abrir mão do controle.
approvals:
deny:
- "rm -rf *"
- "DROP DATABASE *"
- "DROP TABLE *"
6. Conecte seu gerenciador de senhas: Bitwarden e 1Password
Chaves de API não precisam mais viver em um arquivo .env em texto plano. Uma nova interface SecretSource permite que o Hermes busque segredos do Bitwarden e 1Password (referências op://) no carregamento.
secret_sources:
- provider: bitwarden
vault: "dev-creds"
priority: 1
- provider: onepassword
vault: "Production"
priority: 2
Vários cofres podem estar ativos simultaneamente com precedência determinística, avisos de conflito e proveniência por variável. Futuros provedores de cofre só precisam implementar a mesma interface.
7. Assista seus subagentes trabalhando ao vivo, com delegação durável em segundo plano
Os dispatches de delegate_task agora retornam arquivos de transcrição ao vivo que você pode acompanhar com tail -f desde o lançamento dos subagentes. Cada chamada de ferramenta, resultado e resposta em streaming é visível por filho. Mais importante: as conclusões de delegação em segundo plano são agora duráveis. Se o processo principal reiniciar no meio da execução, os resultados são restaurados e entregues por meio de um ledger verificado por propriedade, em vez de desaparecerem.
Isso torna prático lançar uma frota de subagentes e verificar o progresso quando quiser, sem ficar vigiando o terminal.
8. Respostas finais não podem mais ser perdidas por crash do gateway
Esta é uma melhoria sólida de confiabilidade. Se o gateway morresse entre gerar sua resposta e confirmar a entrega à plataforma, a resposta costumava ser silenciosamente perdida, mesmo que você já tivesse pago pelos tokens. As respostas finais agora são registradas em um ledger de obrigação de entrega durável em state.db e reenviadas na próxima inicialização.
Para Telegram, Discord, Slack e outros canais de gateway, isso move a entrega de “melhor esforço” para “pelo menos uma vez bem-sucedida”.
9. Um gateway, muitos perfis: roteamento baseado em perfil
Um único gateway compartilhando um token de bot pode agora rotear servidores, canais ou threads específicos para diferentes perfis. Cada perfil tem configuração, skills, memória e segredos completamente isolados.
Por exemplo:
- Seu servidor Discord de trabalho → perfil de trabalho
- Seu servidor Discord pessoal → perfil pessoal
- Tudo pelo mesmo token de bot
Uma segunda onda de endurecimento do multiplex significa que um perfil mal configurado não pode mais derrubar o gateway inteiro.
10. Novos provedores e os modelos de fronteira mais recentes
O suporte a modelos adicionado inclui:
- Família GPT-5.6 (Sol / Terra / Luna e variantes Pro)
- grok-4.5 (GA)
- moonshotai/kimi-k3 (1M de contexto nos endpoints Kimi Coding)
- claude-fable-5 / claude-sonnet-5
- tencent/hy3 GA
- GLM-5.2, Upstage Solar e mais
Adições de provedores incluem:
- Fireworks AI como provedor de primeira classe com estimativa de custos e posição #2 no seletor de modelos
- Integração endurecida da DeepInfra
- Modo de carregamento JIT do LM Studio
- Melhorias no catálogo Bedrock: sondagem de contexto ao vivo, linhas de 1M de contexto, paridade de prefixos geográficos
Se você muda frequentemente entre modelos de ponta, este lançamento o atualiza.
11. Esforço de raciocínio virou um botão: max, ultra e overrides por modelo
reasoning_effort ganha níveis max e ultra, selecionáveis em todas as superfícies e rotas. Você também pode:
- Fixar overrides de reasoning_effort por modelo na configuração
- Definir esforço por slot em presets MoA
- Definir esforço por tarefa para modelos auxiliares
A profundidade de pensamento se torna um botão que você gira, não um interruptor global.
Outras melhorias notáveis
- Exportação de sessões:
hermes sessions exportgera Markdown, Quarto, HTML, somente prompts e formatos de trace prontos para Hugging Face, com filtros por idade/workspace e passagem opcional--redact - Página Capabilities do desktop: Skills, Tools, MCP e Hub em um só lugar, com teste/toggle e filtragem de logs
- Web Dashboard: importação segura de sessões, pareamento WhatsApp, gerenciamento de toolsets do Discord, keep-alive do terminal e mais
- Endurecimento de segurança: escopo de credenciais Vertex, seis PRs P1 de endurecimento de browser/MEDIA/.env, limites de tamanho de body de webhook, proteção de CI contra refs não confiáveis
- Utilitários CLI:
/model --oncepara override de modelo por um turno, invocações de skills empilhadas (/skill-a /skill-b) e--safe-modepara diagnóstico
Como atualizar
Se você já tem Hermes instalado:
hermes update
# ou
npm update -g @nousresearch/hermes-agent
Depois, execute uma verificação rápida:
hermes config doctor
hermes plugins list
hermes mcp list
Resumo
A mudança definidora do Hermes v0.19.0 Quicksilver é que ele ficou mais rápido e permaneceu confiável. Uma melhoria de ~80% no primeiro token, renderização de Markdown em streaming 14× mais rápida no desktop e entrega de gateway à prova de falhas não são recursos chamativos; são a base que decide se um agente de IA autônomo se torna parte do seu fluxo diário.
Sobre essa base, v0.19.0 adiciona capacidades de nível empresarial: faturamento no terminal, integração com gerenciador de senhas, aprovações inteligentes, monitoramento de subagentes, um ledger de entrega e roteamento multi-perfil. Se você já executa Hermes em produção ou como gateway de equipe, este lançamento é um upgrade forte.
Se ainda não experimentou, comece com /subscription e um hermes update, depois deixe a nova velocidade lidar com sua próxima tarefa.