Last updated on

Hermes v0.19.0 Quicksilver: primeiro token 80% mais rápido e 11 recursos essenciais


Hermes Agent v0.19.0, codinome Quicksilver, foi lançado em 20 de julho de 2026. É um dos maiores lançamentos da Nous Research até hoje: desde v0.18.0, a comunidade acumulou aproximadamente 2.245 commits, 1.065 PRs mergeados, 3.300 issues fechadas e contribuições de mais de 450 pessoas. As notas de lançamento do v0.19.0 neste site resumem assim: “Hermes é o mensageiro dos deuses, e nesta janela fizemos ele se mover como tal.”

Este artigo não é um copia-cola do changelog. Vou dividir a atualização em 11 recursos que desenvolvedores comuns devem conhecer, por que importam, como usar e qual impacto prático esperar. Se precisar da lista técnica completa, consulte as notas de lançamento do v0.19.0.

1. Latência do primeiro token cai ~80% em todas as plataformas

O número de destaque: o tempo até o primeiro token (TTFT) caiu de ~4,3s para ~0,9s, uma redução de ~80%. E isso vale para CLI, gateway, TUI, desktop e cron.

Como foi alcançado? A equipe removeu vários gargalos do caminho de inicialização fria:

  • A detecção de capacidades do Discord saiu do caminho crítico, com cache em disco de 24 horas + atualização em segundo plano
  • A sonda Ollama é ignorada para provedores conhecidos que não são Ollama
  • O trabalho bloqueante de inicialização do agente foi removido do cold start
  • Foi adicionado cache de construção de prompts e resolução de fuso horário com mtime cacheado

Não é uma única otimização; são dezenas de pequenos cortes que juntos eliminam a espera de “Initializing agent…”. Se Hermes antes parecia dar uma respiração profunda antes de responder, essa respiração desapareceu.

2. Modelos de raciocínio mostram seu pensamento ao vivo

display.show_reasoning agora está LIGADO por padrão. Com modelos de raciocínio como Claude 3.7 Sonnet ou a família o3/o4, você não fica mais olhando para um spinner por 30 segundos. Você vê o modelo pensar passo a passo. A caixa de resposta também é pintada por token em vez de por linha, tornando a interação mais fluida.

3. Desktop recebe onda de 20+ PRs de performance

O Hermes Desktop passou por um sprint focado em velocidade e fluidez:

  • Renderização de Markdown em streaming usa 14× menos CPU com análise léxica incremental por blocos
  • Diffs enormes são virtualizados, então o painel de revisão não congela mais no Shiki completo
  • Troca de sessões é instantânea mesmo com transcrições enormes; a cascata de layout-thrash foi eliminada
  • Serialização de inicialização e amplificação REST por turno foram reduzidas
  • Backends de perfil são pré-aquecidos ao detectar intenção de hover; painéis ocultos são montados em idle
  • Barra lateral e linhas de ferramenta não são mais re-renderizadas a cada token durante o streaming

O resultado é uma experiência de desktop que se sente nativa sob carga, mesmo com agentes ocupados e conversas grandes.

4. Gerencie seu plano Nous pelo terminal: /subscription e /topup

Mudar de assinatura antes exigia uma visita ao site de faturamento. Agora isso está na TUI ou CLI clássica:

/subscription
/topup

/subscription mostra seu plano atual, saldo restante, custo exato de upgrade (por exemplo, “Pay $46.30 & upgrade now”), data de vigência do downgrade, e permite aplicar ou desfazer mudanças. O desktop também ganhou uma aba correspondente de configurações de faturamento. Para usuários avançados, isso é um grande ganho de qualidade de vida.

5. Aprovações inteligentes: deixe um LLM julgar comandos sinalizados

Hermes já pedia aprovação antes de executar comandos sinalizados. Em v0.19.0, as aprovações inteligentes são o padrão. Um revisor LLM independente classifica o comando como seguro, perigoso ou incerto. Comandos seguros são aprovados automaticamente; perigosos são negados; incertos são escalados para você. Cada comando é revisado individualmente, então uma correspondência posterior não passa de graça.

Junto com as regras de negação definidas pelo usuário que bloqueiam comandos mesmo no modo yolo, e /deny <reason> que diz ao modelo por que você recusou, isso reduz a fadiga de aprovação diária sem abrir mão do controle.

approvals:
  deny:
    - "rm -rf *"
    - "DROP DATABASE *"
    - "DROP TABLE *"

6. Conecte seu gerenciador de senhas: Bitwarden e 1Password

Chaves de API não precisam mais viver em um arquivo .env em texto plano. Uma nova interface SecretSource permite que o Hermes busque segredos do Bitwarden e 1Password (referências op://) no carregamento.

secret_sources:
  - provider: bitwarden
    vault: "dev-creds"
    priority: 1
  - provider: onepassword
    vault: "Production"
    priority: 2

Vários cofres podem estar ativos simultaneamente com precedência determinística, avisos de conflito e proveniência por variável. Futuros provedores de cofre só precisam implementar a mesma interface.

7. Assista seus subagentes trabalhando ao vivo, com delegação durável em segundo plano

Os dispatches de delegate_task agora retornam arquivos de transcrição ao vivo que você pode acompanhar com tail -f desde o lançamento dos subagentes. Cada chamada de ferramenta, resultado e resposta em streaming é visível por filho. Mais importante: as conclusões de delegação em segundo plano são agora duráveis. Se o processo principal reiniciar no meio da execução, os resultados são restaurados e entregues por meio de um ledger verificado por propriedade, em vez de desaparecerem.

Isso torna prático lançar uma frota de subagentes e verificar o progresso quando quiser, sem ficar vigiando o terminal.

8. Respostas finais não podem mais ser perdidas por crash do gateway

Esta é uma melhoria sólida de confiabilidade. Se o gateway morresse entre gerar sua resposta e confirmar a entrega à plataforma, a resposta costumava ser silenciosamente perdida, mesmo que você já tivesse pago pelos tokens. As respostas finais agora são registradas em um ledger de obrigação de entrega durável em state.db e reenviadas na próxima inicialização.

Para Telegram, Discord, Slack e outros canais de gateway, isso move a entrega de “melhor esforço” para “pelo menos uma vez bem-sucedida”.

9. Um gateway, muitos perfis: roteamento baseado em perfil

Um único gateway compartilhando um token de bot pode agora rotear servidores, canais ou threads específicos para diferentes perfis. Cada perfil tem configuração, skills, memória e segredos completamente isolados.

Por exemplo:

  • Seu servidor Discord de trabalho → perfil de trabalho
  • Seu servidor Discord pessoal → perfil pessoal
  • Tudo pelo mesmo token de bot

Uma segunda onda de endurecimento do multiplex significa que um perfil mal configurado não pode mais derrubar o gateway inteiro.

10. Novos provedores e os modelos de fronteira mais recentes

O suporte a modelos adicionado inclui:

  • Família GPT-5.6 (Sol / Terra / Luna e variantes Pro)
  • grok-4.5 (GA)
  • moonshotai/kimi-k3 (1M de contexto nos endpoints Kimi Coding)
  • claude-fable-5 / claude-sonnet-5
  • tencent/hy3 GA
  • GLM-5.2, Upstage Solar e mais

Adições de provedores incluem:

  • Fireworks AI como provedor de primeira classe com estimativa de custos e posição #2 no seletor de modelos
  • Integração endurecida da DeepInfra
  • Modo de carregamento JIT do LM Studio
  • Melhorias no catálogo Bedrock: sondagem de contexto ao vivo, linhas de 1M de contexto, paridade de prefixos geográficos

Se você muda frequentemente entre modelos de ponta, este lançamento o atualiza.

11. Esforço de raciocínio virou um botão: max, ultra e overrides por modelo

reasoning_effort ganha níveis max e ultra, selecionáveis em todas as superfícies e rotas. Você também pode:

  • Fixar overrides de reasoning_effort por modelo na configuração
  • Definir esforço por slot em presets MoA
  • Definir esforço por tarefa para modelos auxiliares

A profundidade de pensamento se torna um botão que você gira, não um interruptor global.

Outras melhorias notáveis

  • Exportação de sessões: hermes sessions export gera Markdown, Quarto, HTML, somente prompts e formatos de trace prontos para Hugging Face, com filtros por idade/workspace e passagem opcional --redact
  • Página Capabilities do desktop: Skills, Tools, MCP e Hub em um só lugar, com teste/toggle e filtragem de logs
  • Web Dashboard: importação segura de sessões, pareamento WhatsApp, gerenciamento de toolsets do Discord, keep-alive do terminal e mais
  • Endurecimento de segurança: escopo de credenciais Vertex, seis PRs P1 de endurecimento de browser/MEDIA/.env, limites de tamanho de body de webhook, proteção de CI contra refs não confiáveis
  • Utilitários CLI: /model --once para override de modelo por um turno, invocações de skills empilhadas (/skill-a /skill-b) e --safe-mode para diagnóstico

Como atualizar

Se você já tem Hermes instalado:

hermes update
# ou
npm update -g @nousresearch/hermes-agent

Depois, execute uma verificação rápida:

hermes config doctor
hermes plugins list
hermes mcp list

Resumo

A mudança definidora do Hermes v0.19.0 Quicksilver é que ele ficou mais rápido e permaneceu confiável. Uma melhoria de ~80% no primeiro token, renderização de Markdown em streaming 14× mais rápida no desktop e entrega de gateway à prova de falhas não são recursos chamativos; são a base que decide se um agente de IA autônomo se torna parte do seu fluxo diário.

Sobre essa base, v0.19.0 adiciona capacidades de nível empresarial: faturamento no terminal, integração com gerenciador de senhas, aprovações inteligentes, monitoramento de subagentes, um ledger de entrega e roteamento multi-perfil. Se você já executa Hermes em produção ou como gateway de equipe, este lançamento é um upgrade forte.

Se ainda não experimentou, comece com /subscription e um hermes update, depois deixe a nova velocidade lidar com sua próxima tarefa.