GLM-5.3-Flash Chega ao Hermes: Uma Opção de 1M de Contexto no Model Picker


Já lhe aconteceu isto? A OpenRouter lança um modelo novo com excelente relação preço/desempenho e os críticos elogiam a sua janela de contexto enorme — abre o model picker do Hermes, percorre a lista… nada. Fica preso à espera que o catálogo oficial apanhe o ritmo, ou a configurar tudo à mão para o forçar a entrar. O PR fundido a 26 de agosto (#95621) adiciona mais um membro ao picker: z-ai/glm-5.3-flash, ativo nos catálogos da OpenRouter e do Nous Portal — e a sua funcionalidade principal é exatamente o que os utilizadores de sessões longas querem: uma janela de contexto de 1.048.576 tokens (~1M).

O Perfil do Novo Modelo

O GLM-5.3-Flash é o membro «rápido, de janela grande» da família GLM-5.3 da Zhipu. Nos catálogos do Hermes fica abaixo do glm-5.3 e acima do glm-5.2 (ordenação do mais novo para o mais antigo). Especificações principais (dos metadados ao vivo da OpenRouter):

Item Valor
Model ID z-ai/glm-5.3-flash
Janela de contexto 1.048.576 tokens
Preço de input $0,075 / M tokens
Preço de output $0,25 / M tokens
Output máximo por chamada 131.072 tokens

Totais do catálogo após a atualização: 43 modelos na OpenRouter, 32 no Nous Portal.

Como Usá-lo no Hermes

Três formas — interativa, CLI, ou em sessão:

Forma 1: o picker interativo

hermes model

Siga as instruções para escolher um provider (OpenRouter ou Nous Portal) e o modelo. Se já abriu o picker antes e a cache é anterior à atualização, atualize primeiro:

hermes model --refresh

O --refresh apaga a cache em disco do picker e volta a obter a lista ao vivo /v1/models de cada provider — a forma de ver modelos novos no momento em que chegam.

Forma 2: especificar no arranque

hermes -m z-ai/glm-5.3-flash

Apenas para sessões pontuais; não altera o seu padrão.

Forma 3: mudar em sessão

Use o comando /model para procurar e mudar; escrever glm-5.3 faz fuzzy-match com z-ai/glm-5.3-flash. Combinado com o filtro /model da command palette, a troca leva segundos.

O Que 1M de Contexto Realmente Significa

  • As sessões maratona deixam de stressar: uma conversa de 500K tokens usa metade da janela; combinado com o novo padrão de compaction lean, a compaction só entra em ação perto dos 900K — mal pensa nisso a meio da execução;
  • Alimente o agente com o repositório inteiro: uma base de código grande cabe no contexto em vez de andar a gerir ficheiros — um parceiro natural para max_turns ilimitados;
  • Faça as contas ao custo: uma janela grande não é grátis — os tokens são medidos, e um input completo de 1M de tokens custa ~$75 por disparo. O padrão racional é tratar a janela como um buffer, não como um armazém, e apoiar-se na compressão para manter os inputs reais controlados.

Uma Nota de Cautela

No catálogo, o glm-5.3-flash resolve os seus metadados de contexto através de uma chave fuzzy herdada do glm-5.3 (1.048.576), coincidindo com os dados ao vivo da OpenRouter. Se não tiver a certeza das capacidades reais do modelo no mundo real, execute-o numa tarefa pequena antes da produção. Para afinar o comportamento (por exemplo, limitar o comprimento do output), o guia de model_overrides explica as overrides por modelo para context_window, max_output_tokens e afins.

Para Concluir

A entrada do GLM-5.3-Flash nos catálogos é uma opção genuinamente útil para utilizadores de sessões longas: contexto de um milhão de tokens, preços sensatos, selecionável diretamente no picker oficial. Os catálogos de modelos mudam depressa — correr hermes model --refresh de vez em quando para ver o que há de novo já faz parte da rotina diária dos power users do Hermes.