GLM-5.3-Flash kommt zu Hermes: Eine 1M-Kontext-Option im Modell-Picker


Kennst du das? OpenRouter veröffentlicht ein neues Modell mit starkem Preis-Leistungs-Verhältnis, und die Reviews schwärmen vom riesigen Kontextfenster – du öffnest den Modell-Picker von Hermes, scrollst durch die Liste … nichts. Du bleibst hängen, bis der offizielle Katalog aufholt, oder schreibst von Hand eine Config, um es reinzuzwingen. Der am 26. August gemergte PR (#95621) fügt dem Picker ein weiteres Mitglied hinzu: z-ai/glm-5.3-flash, live in beiden Katalogen (OpenRouter und Nous Portal) – und sein wichtigstes Feature ist genau das, was Long-Session-Nutzer wollen: ein Kontextfenster von 1.048.576 (~1M) Tokens.

Das Profil des neuen Modells

GLM-5.3-Flash ist das „schnell, großes Fenster“-Mitglied der GLM-5.3-Familie von Zhipu. In den Hermes-Katalogen sitzt es unter glm-5.3 und über glm-5.2 (Sortierung neueste zuerst). Wichtige Spezifikationen (aus den Live-Metadaten von OpenRouter):

Eigenschaft Wert
Modell-ID z-ai/glm-5.3-flash
Kontextfenster 1.048.576 Tokens
Input-Preis 0,075 $ / M Tokens
Output-Preis 0,25 $ / M Tokens
Max. Output pro Aufruf 131.072 Tokens

Katalog-Summen nach dem Update: 43 Modelle bei OpenRouter, 32 bei Nous Portal.

So nutzt du es in Hermes

Drei Wege – interaktiv, per CLI oder mitten in der Session:

Weg 1: der interaktive Picker

hermes model

Folge den Prompts, um einen Provider (OpenRouter oder Nous Portal) und das Modell zu wählen. Falls du den Picker schon früher geöffnet hast und der Cache älter ist als das Update, aktualisiere zuerst:

hermes model --refresh

--refresh löscht den Disk-Cache des Pickers und holt die Live-/v1/models-Liste jedes Providers neu – so siehst du neue Modelle in dem Moment, in dem sie landen.

Weg 2: beim Start angeben

hermes -m z-ai/glm-5.3-flash

Nur für Einmal-Sessions; ändert deinen Default nicht.

Weg 3: mitten in der Session wechseln

Nutze den /model-Befehl zum Suchen und Wechseln; die Eingabe von glm-5.3 matcht per Fuzzy-Suche z-ai/glm-5.3-flash. Zusammen mit dem /model-Filter der Befehls-Palette dauert der Wechsel nur Sekunden.

Was 1M Kontext wirklich bedeutet

  • Marathonsessions hören auf zu stressen: Eine Konversation mit 500K Tokens nutzt die Hälfte des Fensters; zusammen mit dem neuen schlanken Compaction-Default greift die Kompression erst bei fast 900K – du denkst mitten im Lauf kaum darüber nach;
  • Füttere das ganze Repo an den Agenten: Eine große Codebasis passt als Kontext, statt Dateien hin- und herzureichen – ein natürlicher Partner für unbegrenzte max_turns;
  • Rechne die Kosten durch: Ein großes Fenster ist nicht gratis – Tokens werden gemessen, und ein voller 1M-Token-Input kostet ~75 $ pro Aufruf. Das rationale Muster ist, das Fenster als Puffer zu behandeln, nicht als Lagerhaus, und sich auf die Kompression zu verlassen, um die tatsächlichen Inputs im Rahmen zu halten.

Ein Wort der Vorsicht

Im Katalog löst glm-5.3-flash seine Kontext-Metadaten über einen Fuzzy-Key auf, der von glm-5.3 (1.048.576) geerbt wird – passend zu den Live-Daten von OpenRouter. Wenn du dir bei den realen Fähigkeiten des Modells unsicher bist, teste es vor der Produktion an einer kleinen Aufgabe. Zum Feintuning des Verhaltens (z. B. Begrenzen der Output-Länge) erklärt der model_overrides-Guide die Per-Modell-Overrides für context_window, max_output_tokens und Co.

Fazit

GLM-5.3-Flash im Katalog ist eine wirklich nützliche Option für Long-Session-Nutzer: Millionen-Token-Kontext, vernünftige Preise, direkt aus dem offiziellen Picker wählbar. Modellkataloge bewegen sich schnell – ab und zu hermes model --refresh laufen zu lassen, um Neues zu sehen, gehört für Hermes-Power-User längst zur täglichen Routine.