Tres nuevos providers de modelos: Ramp Router, Nebius Token Factory y Tencent TokenPlan

La experiencia con los providers de modelos se está dividiendo rápido: unos quieren «una API key para todos los modelos y una sola factura», otros quieren pay-as-you-go puro sin compromiso mensual, y algunos ya compraron una suscripción en algún sitio y solo quieren enchufarla a Hermes. El 29 de agosto, tres nuevos providers se unieron a la fiesta el mismo día: Ramp Router (el gateway LLM de router.com), Nebius Token Factory (la inferencia pay-as-you-go de Nebius) y Tencent TokenPlan (la suscripción token-plan de Tencent Cloud Hunyuan) — este último además trae el modelo hy4-preview al catálogo oficial. Los tres PRs (#97915, #97916, #97917) están fusionados en main.
Los tres, en una línea cada uno
| Provider | Qué es | Para quién |
|---|---|---|
| Ramp Router | Un endpoint compatible con OpenAI Responses; enrutado del lado del servidor a OpenAI/Anthropic/xAI/Fireworks y más, con fallbacks unificados y controles de gasto | Equipos que quieren una sola key para todos los modelos y una única factura |
| Nebius Token Factory | Inferencia pay-as-you-go de Nebius, compatible con OpenAI | Desarrolladores con uso irregular que no quieren suscripciones |
| Tencent TokenPlan | Suscripción token-plan de Tencent Cloud Hunyuan (endpoint compatible con Anthropic), facturada por plan mensual | Usuarios que ya tienen un TokenPlan de Tencent Cloud |
1. Ramp Router: el provider gateway
El gateway LLM construido por Ramp (sí, la empresa fintech). Un solo endpoint — https://api.router.com/v1 — y una sola key; las peticiones se enrutan del lado del servidor a OpenAI, Anthropic, xAI, Fireworks y otros, con fallbacks y controles de gasto que el servicio gestiona por ti. Se acabó mantener varias upstream keys y lógica de fallback por tu cuenta.
Detalles que merece la pena conocer de la integración con Hermes:
- La API Responses es el cable nativo (se exige
api_mode="codex_responses"): el/v1/responsesde Router es la interfaz real;/v1/chat/completionses solo un shim de compatibilidad mínimo añadido en agosto, así que Hermes se mantiene en la línea nativa; - El catálogo de modelos está acotado por cuenta: los IDs de modelo válidos vienen del
GET /v1/modelsde tu key (las cuentas BYOK ven entradas extra), así que el perfil oficial no incluye ningún modelo fallback hardcodeado — lo que ves en el picker se obtiene en vivo; - Validación estricta del reasoning effort: Router valida
reasoning.effortcontra el vocabulario declarado de cada modelo y rechaza combinaciones no soportadas con HTTP 400. Hermes cachea las capacidades del catálogo de Router y ajusta (clampa) antes de enviar; - Las peticiones llevan el User-Agent
Hermes-Agent.
El plugin (router-provider) está escrito por Neel Patel, de Ramp, con verificación en vivo contra api.router.com realizada en agosto de 2026.
2. Nebius Token Factory: inferencia pay-as-you-go
La «Token Factory» de Nebius es su servicio de inferencia pay-as-you-go, compatible con OpenAI. El plugin nebius-token-factory-provider lo mantiene la propia Nous Research.
Un detalle de implementación que merece la pena saber: algunos modelos de Nebius exponen soporte de reasoning effort, pero no todos. Hermes incluye una allowlist conservadora — solo los modelos que están en ella (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) pueden llevar parámetros de reasoning effort; todo lo demás se ajusta automáticamente, de modo que nunca te encuentras errores por pasar parámetros no soportados.
3. Tencent TokenPlan: suscripción + hy4-preview
Tencent Cloud Hunyuan TokenPlan es una suscripción mensual de tokens, servida sobre el formato de mensajes de Anthropic (transporte anthropic_messages). En Hermes existe como provider overlay integrado:
- Id interno:
tencent-tokenplan; aliasestokenplan/tencent-lkeap; - Base URL:
https://api.lkeap.cloud.tencent.com/plan/anthropic; - Variable de entorno:
TOKENPLAN_BASE_URL(el endpoint y las credenciales de acceso del plan se inyectan a través de ella); - Nombre en el picker: «Tencent TokenPlan».
El mismo PR también registra tencent/hy4-preview (Tencent Hunyuan 4 preview) en el catálogo oficial de modelos — los suscriptores de TokenPlan pueden elegirlo directamente en el selector de modelos.
Cómo usarlos
Ninguno requiere editar la configuración a mano — el flujo de modelos de hermes setup (select_provider_and_model) detecta automáticamente los plugins nuevos en plugins/model-providers/ y despacha a la configuración estándar de API key:
hermes setup # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model # switch providers anytime afterwards
El Tencent TokenPlan integrado funciona igual: define TOKENPLAN_BASE_URL (y la credencial del plan), elige Tencent TokenPlan en el selector y escoge tencent/hy4-preview como modelo.
Advertencias
- Los tres PRs aterrizaron el 29 de agosto y hoy solo están en
main— todavía sin release tag (v0.20.6 se etiquetó el 27 de agosto); ejecutahermes updateprimero para ver estos providers; - La lista de modelos de Ramp Router depende por completo del catálogo en vivo de tu key — refresca la lista de modelos del picker antes del primer uso;
- Para planes de suscripción como TokenPlan, revisa bien la semántica de cuotas (tope mensual de tokens frente a recarga medida) en las páginas oficiales de Tencent Cloud.
Resumen
Un provider gateway (Ramp Router), un provider pay-as-you-go (Nebius Token Factory) y un provider de suscripción (Tencent TokenPlan) — tres de las formas más comunes en que los equipos compran acceso a modelos, más hy4-preview sumándose al catálogo. Cada integración pasa por el flujo estándar de hermes setup, sin configuración escrita a mano. Para profundizar en la configuración del lado de los modelos, consulta nuestra guía de overrides de modelos y la guía de GLM-5.3-Flash; la referencia completa de hermes model vive en la página de documentación del comando.