GLM-5.3-Flash llega a Hermes: una opción de contexto 1M en el selector de modelos


¿Te ha pasado alguna vez? OpenRouter saca un modelo nuevo con una relación precio/rendimiento estupenda y las reseñas alaban su enorme ventana de contexto — abres el selector de modelos de Hermes, te desplazas por la lista… nada. Te quedas esperando a que el catálogo oficial se ponga al día, o maquetando una config a mano para forzar su entrada. El PR fusionado el 26 de agosto (#95621) añade otro miembro al selector: z-ai/glm-5.3-flash, activo tanto en el catálogo de OpenRouter como en el de Nous Portal — y su característica estrella es exactamente lo que quieren los usuarios de sesiones largas: una ventana de contexto de 1,048,576 tokens (~1M).

El perfil del nuevo modelo

GLM-5.3-Flash es el miembro «rápido, de ventana grande» de la familia GLM-5.3 de Zhipu. En los catálogos de Hermes se sitúa debajo de glm-5.3 y por encima de glm-5.2 (orden del más nuevo al más antiguo). Especificaciones clave (de los metadatos en vivo de OpenRouter):

Elemento Valor
Model ID z-ai/glm-5.3-flash
Ventana de contexto 1,048,576 tokens
Precio de entrada $0.075 / M tokens
Precio de salida $0.25 / M tokens
Salida máxima por llamada 131,072 tokens

Totales del catálogo tras la actualización: 43 modelos en OpenRouter, 32 en Nous Portal.

Cómo usarlo en Hermes

Tres formas — interactiva, por CLI o dentro de la sesión:

Forma 1: el selector interactivo

hermes model

Sigue las indicaciones para elegir un provider (OpenRouter o Nous Portal) y el modelo. Si ya habías abierto el selector antes y la caché es anterior a la actualización, actualízala primero:

hermes model --refresh

--refresh borra la caché en disco del selector y vuelve a descargar la lista en vivo /v1/models de cada provider — la forma de ver los modelos nuevos en cuanto llegan.

Forma 2: especifícalo al arrancar

hermes -m z-ai/glm-5.3-flash

Solo para sesiones puntuales; no cambia tu default.

Forma 3: cambia en mitad de la sesión

Usa el comando /model para buscar y cambiar; escribir glm-5.3 hace fuzzy-match con z-ai/glm-5.3-flash. Combinado con el filtro /model de la paleta de comandos, el cambio lleva segundos.

Qué significa realmente 1M de contexto

  • Las sesiones maratón dejan de estresar: una conversación de 500K tokens usa la mitad de la ventana; combinado con el nuevo default de compactación lean, la compactación solo se activa cerca de 900K — apenas piensas en ello a mitad de la ejecución;
  • Dale todo el repo al agente: un codebase grande cabe como contexto en lugar de ir apañándote con archivos — un compañero natural para max_turns ilimitados;
  • Haz las cuentas del coste: una ventana grande no es gratis — los tokens se contabilizan, y una entrada completa de 1M de tokens cuesta ~$75 por cada vez. El patrón racional es tratar la ventana como un buffer, no como un almacén, y apoyarse en la compresión para mantener las entradas reales bajo control.

Una nota de precaución

En el catálogo, glm-5.3-flash resuelve sus metadatos de contexto a través de una clave fuzzy heredada de glm-5.3 (1,048,576), que coincide con los datos en vivo de OpenRouter. Si no estás seguro de las capacidades reales del modelo, pruébalo con una tarea pequeña antes de producción. Para ajustar su comportamiento (por ejemplo, limitar la longitud de salida), la guía de model_overrides explica las overrides por modelo para context_window, max_output_tokens y compañía.

Para terminar

La entrada de GLM-5.3-Flash en los catálogos es una opción realmente útil para los usuarios de sesiones largas: contexto de un millón de tokens, precios razonables y seleccionable directamente desde el selector oficial. Los catálogos de modelos se mueven rápido — ejecutar hermes model --refresh de vez en cuando para ver las novedades ya forma parte de la rutina diaria de los power users de Hermes.