模型供应商又添三家:Ramp Router、Nebius Token Factory、腾讯 TokenPlan

模型供应商这件事,体验正在快速分裂:有人想要“一个 API Key 访问所有模型、账单统一”,有人想要“按量付费、不用锁月费”,还有人已经买了某个平台的订阅、只想把它接进 Hermes。8 月 29 日,三个新供应商在同一天进厂:Ramp Router(router.com 的 LLM 网关)、Nebius Token Factory(Nebius 按量推理服务)、腾讯 TokenPlan(腾讯云混元 TokenPlan 订阅),其中腾讯这个还顺带把 hy4-preview 模型带进了官方目录。三条 PR(#97915、#97916、#97917)都已合入 main 分支。
三家用一句话概括
| 供应商 | 是什么 | 适合谁 |
|---|---|---|
| Ramp Router | 一个 OpenAI Responses 兼容端点,服务端路由到 OpenAI/Anthropic/xAI/Fireworks 等多家上游,统一回退和成本控制 | 想一个 Key 管所有模型、账单集中看的团队 |
| Nebius Token Factory | Nebius 的按量付费(pay-as-you-go)推理服务,OpenAI 兼容 | 用量波动大、不想锁订阅的开发者 |
| 腾讯 TokenPlan | 腾讯云混元 TokenPlan 订阅(Anthropic 兼容端点),按套餐包月 | 已购腾讯云 TokenPlan 的用户 |
1. Ramp Router:网关型供应商
Ramp(那家金融科技公司)做的 LLM 网关。一个端点 https://api.router.com/v1,一个 Key,请求在服务端自动路由到 OpenAI、Anthropic、xAI、Fireworks 等上游,回退和成本控制都在服务端做——你不用在自己这边维护多家 API Key 和回退逻辑。
Hermes 接入时的一些细节值得知道:
- 原生走 Responses API(
api_mode="codex_responses"被强制指定):Router 的/v1/responses是原生接口,/v1/chat/completions只是 8 月才加的兼容垫片,所以 Hermes 强制走原生线路; - 模型目录按账号返回:Router 的模型列表来自你 Key 的
GET /v1/models(自带 Key 的 BYOK 账号能看到更多条目),所以官方不硬编码任何 fallback 模型——你在 picker 里看到的都是实时拉取的; - 推理强度(reasoning effort)校验很严:Router 会按每个模型声明的能力校验
reasoning.effort,不支持推理字段的模型收到它会直接 400。Hermes 端把 Router 的目录能力缓存下来,用于请求前钳制(clamp); - 请求带
Hermes-AgentUser-Agent。
插件作者是 Ramp 的 Neel Patel,插件名 router-provider。官方 Wire 验证于 2026 年 8 月实测通过。
2. Nebius Token Factory:按量付费推理
Nebius 的 “Token Factory” 是它家的按量付费推理服务,OpenAI 兼容。插件 nebius-token-factory-provider 由 Nous Research 官方维护。
一个值得注意的实现细节:Nebius 部分模型带推理强度(reasoning effort)能力,但不是所有模型都有。Hermes 端维护了一份保守白名单,只有名单内的模型(deepseek-r1/v4、deepseek-reasoner、gpt-oss、glm-5、kimi-k2、minimax-m2 等)才允许走 reasoning effort 参数,其余模型自动降级——避免对不支持该参数的模型传参导致报错。
3. 腾讯 TokenPlan:订阅制 + hy4-preview
腾讯云混元 TokenPlan 是按月订阅的 Token 套餐,端点走 Anthropic 消息格式(anthropic_messages transport)。Hermes 里它作为内置 overlay provider 存在:
- 内部 id:
tencent-tokenplan,别名tokenplan/tencent-lkeap; - 基础地址:
https://api.lkeap.cloud.tencent.com/plan/anthropic; - 环境变量:
TOKENPLAN_BASE_URL(套餐的访问地址/凭证通过这个注入); - picker 里显示名:“Tencent TokenPlan”。
同一条 PR 还把 tencent/hy4-preview(腾讯混元 4 预览版)注册进了官方模型目录——订阅了 TokenPlan 的用户在模型选择器里直接就能选到它。
怎么用
这些供应商都不需要手改配置——hermes setup 的模型选择器(select_provider_and_model)会自动识别 plugins/model-providers/ 下的新插件并走标准的 API Key 配置流程:
hermes setup # 进入模型配置
# 选择 Ramp Router / Nebius Token Factory / Tencent TokenPlan 之一
# 按提示粘贴对应服务的 API Key / 访问凭证
hermes model # 之后随时切换
内置的腾讯 TokenPlan 也一样:设置好 TOKENPLAN_BASE_URL(和套餐凭证)后,在 picker 里选 Tencent TokenPlan,模型选 tencent/hy4-preview 即可。
注意事项
- 三条 PR 都是 8 月 29 日合并的,目前在 main 分支,尚未进入正式 release(v0.20.6 是 8 月 27 日打的),先
hermes update到最新代码才能看到这些供应商; - Ramp Router 的模型列表完全依赖你 Key 的实时目录,首次使用前建议先在 picker 里刷新一次模型列表;
- TokenPlan 这类订阅制套餐注意核对额度口径——是包月 Token 数还是按量叠加,以腾讯云官方页面为准。
小结
网关型(Ramp Router)、按量型(Nebius Token Factory)、订阅型(腾讯 TokenPlan)——三家刚好覆盖三种最常见的模型采购方式,加上 hy4-preview 进目录,模型选择器又宽了一圈。接入全部走 hermes setup 标准流程,不用手写配置。想深入了解模型侧的配置能力,可以看看模型覆盖配置指南和GLM-5.3-Flash 模型指南;hermes model 命令的完整参考在命令文档页。