GLM-5.3-Flash débarque dans Hermes : une option à contexte 1M dans le sélecteur de modèles


Déjà vécu ? OpenRouter sort un nouveau modèle au rapport qualité/prix excellent et les critiques s’extasient sur son énorme fenêtre de contexte — vous ouvrez le sélecteur de modèles de Hermes, vous parcourez la liste… rien. Vous voilà coincé à attendre que le catalogue officiel suive, ou à bricoler une config à la main pour le forcer. Le PR fusionné le 26 août (#95621) ajoute un nouveau membre au sélecteur : z-ai/glm-5.3-flash, disponible dans les catalogues OpenRouter et Nous Portal — et sa fonctionnalité vedette est exactement ce que veulent les utilisateurs de longues sessions : une fenêtre de contexte de 1 048 576 tokens (~1M).

Le profil du nouveau modèle

GLM-5.3-Flash est le membre « rapide, grande fenêtre » de la famille GLM-5.3 de Zhipu. Dans les catalogues de Hermes, il se place sous glm-5.3 et au-dessus de glm-5.2 (classement du plus récent au plus ancien). Spécifications clés (d’après les métadonnées en direct d’OpenRouter) :

Élément Valeur
ID du modèle z-ai/glm-5.3-flash
Fenêtre de contexte 1 048 576 tokens
Prix d’entrée 0,075 $ / M tokens
Prix de sortie 0,25 $ / M tokens
Sortie max par appel 131 072 tokens

Totaux des catalogues après la mise à jour : 43 modèles sur OpenRouter, 32 sur Nous Portal.

Comment l’utiliser dans Hermes

Trois façons — interactive, CLI, ou en session :

Méthode 1 : le sélecteur interactif

hermes model

Suivez les invites pour choisir un provider (OpenRouter ou Nous Portal) et le modèle. Si vous avez déjà ouvert le sélecteur et que le cache date d’avant la mise à jour, rafraîchissez d’abord :

hermes model --refresh

--refresh vide le cache disque du sélecteur et récupère la liste en direct /v1/models de chaque provider — le moyen de voir les nouveaux modèles dès leur arrivée.

Méthode 2 : spécifier au démarrage

hermes -m z-ai/glm-5.3-flash

Uniquement pour des sessions ponctuelles ; ne change pas votre défaut.

Méthode 3 : basculer en session

Utilisez la commande /model pour rechercher et basculer ; taper glm-5.3 fait une correspondance floue avec z-ai/glm-5.3-flash. Combiné au filtre /model de la palette de commandes, le changement prend quelques secondes.

Ce que 1M de contexte signifie concrètement

  • Les sessions marathon cessent de stresser : une conversation de 500K tokens utilise la moitié de la fenêtre ; combiné au nouveau défaut de compaction lean, la compaction ne se déclenche qu’aux alentours de 900K — vous n’y pensez presque plus en cours de route ;
  • Donnez tout le repo à manger à l’agent : un gros codebase tient dans le contexte au lieu de jongler avec les fichiers — un partenaire naturel pour les max_turns illimités ;
  • Faites le calcul du coût : une grande fenêtre n’est pas gratuite — les tokens sont comptés, et une entrée complète de 1M tokens coûte environ 75 $ par appel. La démarche rationnelle est de traiter la fenêtre comme un tampon, pas un entrepôt, et de s’appuyer sur la compression pour maîtriser les entrées réelles.

Une note de prudence

Dans le catalogue, glm-5.3-flash résout ses métadonnées de contexte via une clé floue héritée de glm-5.3 (1 048 576), en accord avec les données en direct d’OpenRouter. Si vous n’êtes pas sûr des capacités réelles du modèle, testez-le sur une petite tâche avant la production. Pour affiner le comportement (par exemple plafonner la longueur de sortie), le guide des model_overrides explique les overrides par modèle pour context_window, max_output_tokens et compagnie.

Pour conclure

L’entrée de GLM-5.3-Flash dans les catalogues est une option vraiment utile pour les utilisateurs de longues sessions : contexte d’un million de tokens, prix raisonnables, sélectionnable directement depuis le sélecteur officiel. Les catalogues de modèles évoluent vite — lancer hermes model --refresh de temps en temps pour voir les nouveautés fait déjà partie du quotidien des utilisateurs avancés de Hermes.