GLM-5.3-Flash Chega ao Hermes: Uma Opção de 1M de Contexto no Model Picker

Já lhe aconteceu isto? A OpenRouter lança um modelo novo com excelente relação preço/desempenho e os críticos elogiam a sua janela de contexto enorme — abre o model picker do Hermes, percorre a lista… nada. Fica preso à espera que o catálogo oficial apanhe o ritmo, ou a configurar tudo à mão para o forçar a entrar. O PR fundido a 26 de agosto (#95621) adiciona mais um membro ao picker: z-ai/glm-5.3-flash, ativo nos catálogos da OpenRouter e do Nous Portal — e a sua funcionalidade principal é exatamente o que os utilizadores de sessões longas querem: uma janela de contexto de 1.048.576 tokens (~1M).
O Perfil do Novo Modelo
O GLM-5.3-Flash é o membro «rápido, de janela grande» da família GLM-5.3 da Zhipu. Nos catálogos do Hermes fica abaixo do glm-5.3 e acima do glm-5.2 (ordenação do mais novo para o mais antigo). Especificações principais (dos metadados ao vivo da OpenRouter):
| Item | Valor |
|---|---|
| Model ID | z-ai/glm-5.3-flash |
| Janela de contexto | 1.048.576 tokens |
| Preço de input | $0,075 / M tokens |
| Preço de output | $0,25 / M tokens |
| Output máximo por chamada | 131.072 tokens |
Totais do catálogo após a atualização: 43 modelos na OpenRouter, 32 no Nous Portal.
Como Usá-lo no Hermes
Três formas — interativa, CLI, ou em sessão:
Forma 1: o picker interativo
hermes model
Siga as instruções para escolher um provider (OpenRouter ou Nous Portal) e o modelo. Se já abriu o picker antes e a cache é anterior à atualização, atualize primeiro:
hermes model --refresh
O --refresh apaga a cache em disco do picker e volta a obter a lista ao vivo /v1/models de cada provider — a forma de ver modelos novos no momento em que chegam.
Forma 2: especificar no arranque
hermes -m z-ai/glm-5.3-flash
Apenas para sessões pontuais; não altera o seu padrão.
Forma 3: mudar em sessão
Use o comando /model para procurar e mudar; escrever glm-5.3 faz fuzzy-match com z-ai/glm-5.3-flash. Combinado com o filtro /model da command palette, a troca leva segundos.
O Que 1M de Contexto Realmente Significa
- As sessões maratona deixam de stressar: uma conversa de 500K tokens usa metade da janela; combinado com o novo padrão de compaction lean, a compaction só entra em ação perto dos 900K — mal pensa nisso a meio da execução;
- Alimente o agente com o repositório inteiro: uma base de código grande cabe no contexto em vez de andar a gerir ficheiros — um parceiro natural para max_turns ilimitados;
- Faça as contas ao custo: uma janela grande não é grátis — os tokens são medidos, e um input completo de 1M de tokens custa ~$75 por disparo. O padrão racional é tratar a janela como um buffer, não como um armazém, e apoiar-se na compressão para manter os inputs reais controlados.
Uma Nota de Cautela
No catálogo, o glm-5.3-flash resolve os seus metadados de contexto através de uma chave fuzzy herdada do glm-5.3 (1.048.576), coincidindo com os dados ao vivo da OpenRouter. Se não tiver a certeza das capacidades reais do modelo no mundo real, execute-o numa tarefa pequena antes da produção. Para afinar o comportamento (por exemplo, limitar o comprimento do output), o guia de model_overrides explica as overrides por modelo para context_window, max_output_tokens e afins.
Para Concluir
A entrada do GLM-5.3-Flash nos catálogos é uma opção genuinamente útil para utilizadores de sessões longas: contexto de um milhão de tokens, preços sensatos, selecionável diretamente no picker oficial. Os catálogos de modelos mudam depressa — correr hermes model --refresh de vez em quando para ver o que há de novo já faz parte da rotina diária dos power users do Hermes.