1M 上下文的 GLM-5.3-Flash 上线 Hermes:模型选择器里的长会话新选项


你有没有遇到过这种尴尬:OpenRouter 上新出了一个性价比不错的模型,评测都夸它上下文窗口巨大,结果你打开 Hermes 的模型选择器翻了一圈——没有。只能等官方目录更新,或者自己写配置硬塞。8 月 26 日合并的 PR #95621 又给选择器补了一位新成员:z-ai/glm-5.3-flash,同时进入 OpenRouter 和 Nous Portal 两个目录,而且它最突出的卖点恰好就是长会话党最需要的——1,048,576(约 100 万)token 的上下文窗口

新模型档案

GLM-5.3-Flash 是智谱 GLM-5.3 家族里定位“快速、大窗口”的成员。在 Hermes 目录中的位置排在 glm-5.3 之下、glm-5.2 之上(按最新优先排序)。关键参数(来自 OpenRouter 实时元数据):

项目
模型 ID z-ai/glm-5.3-flash
上下文窗口 1,048,576 token
输入价格 $0.075 / 百万 token
输出价格 $0.25 / 百万 token
单次最大输出 131,072 token

目录更新后:OpenRouter 侧共 43 个模型,Nous Portal 侧 32 个。

怎么在 Hermes 里用它

三种方式,从交互到命令行任选:

方式一:交互式选择器

hermes model

按提示选择 provider(OpenRouter 或 Nous Portal)和模型即可。如果之前打开过选择器、缓存里还没有新模型,先刷新:

hermes model --refresh

--refresh 会清掉模型选择器的磁盘缓存,重新拉取每个 provider 的实时 /v1/models 列表——目录更新后想立刻看到新模型,用它。

方式二:启动时指定

hermes -m z-ai/glm-5.3-flash

单次会话临时用,不改变默认设置。

方式三:会话内切换

在会话里用 /model 命令搜索并切换,输入 glm-5.3 就能模糊匹配到 z-ai/glm-5.3-flash。配合 命令面板/model 过滤,几秒钟就能换过去。

1M 上下文到底意味着什么

  • 长会话不焦虑:50 万 token 的会话在这个窗口下只占一半,配合新的 lean 压缩默认策略,跑到 90 万 token 才开始触发压缩,中途几乎不用管;
  • 整仓喂给 Agent:大代码库可以直接作为上下文的一部分,不用反复切文件——这正是 max_turns 无限 场景的最佳搭档;
  • 价格要算清楚:窗口大不等于免费——token 是按量计费的,1M 窗口的输入如果喂满,单次就是 $75。理性用法是让窗口当“缓冲区”而不是“仓库”,配合压缩策略控制实际输入量。

一点提醒

模型目录里 glm-5.3-flash 的上下文等元数据是通过 fuzzy key 从 glm-5.3 继承解析的(1,048,576),跟 OpenRouter 实时数据一致;如果你对这个模型的真实能力边界有疑问,先小规模试跑再上生产任务。想微调它的行为(比如限制输出长度),model_overrides 配置指南 讲了怎么按模型覆盖 context_windowmax_output_tokens 等字段。

小结

GLM-5.3-Flash 进目录,对长会话用户是个实惠的新选项:百万级上下文、合理的价格、在官方选择器里就能直接选。模型的更新是高频的,隔三差五跑一次 hermes model --refresh 看看有没有新面孔,已经是 Hermes 玩家的日常了。