Drei neue Modell-Provider: Ramp Router, Nebius Token Factory und Tencent TokenPlan


Die Erfahrung mit Modell-Providern spaltet sich rasant: Manche wollen „einen API-Key für jedes Modell und eine Rechnung“, manche wollen reines Pay-as-you-go ohne monatliche Bindung, und manche haben irgendwo bereits ein Abo gekauft und wollen es einfach an Hermes anschließen. Am 29. August kamen am selben Tag drei neue Provider dazu: Ramp Router (das LLM-Gateway von router.com), Nebius Token Factory (Nebius-Pay-as-you-go-Inference) und Tencent TokenPlan (das Hunyuan-Token-Plan-Abo von Tencent Cloud) – der letzte bringt zugleich das Modell hy4-preview in den offiziellen Katalog. Alle drei PRs (#97915, #97916, #97917) sind auf main gemerged.

Die drei in je einem Satz

Provider Was es ist Für wen es gedacht ist
Ramp Router Ein OpenAI-Responses-kompatibler Endpoint; serverseitiges Routing zu OpenAI/Anthropic/xAI/Fireworks und mehr, mit einheitlichen Fallbacks und Ausgabenkontrollen Teams, die einen Key für alle Modelle und eine einzige Rechnung wollen
Nebius Token Factory Nebius-Pay-as-you-go-Inference, OpenAI-kompatibel Entwickler mit stark schwankender Nutzung, die keine Abos wollen
Tencent TokenPlan Tencent-Cloud-Hunyuan-Token-Plan-Abo (Anthropic-kompatibler Endpoint), nach Monatsplan abgerechnet Nutzer, die bereits einen Tencent-Cloud-TokenPlan besitzen

1. Ramp Router: der Gateway-Provider

Das LLM-Gateway von Ramp (ja, dem Fintech-Unternehmen). Ein Endpoint – https://api.router.com/v1 – und ein Key; Requests werden serverseitig an OpenAI, Anthropic, xAI, Fireworks und andere weitergeleitet, mit Fallbacks und Ausgabenkontrollen, um die sich gekümmert wird. Kein Pflegen mehr von mehreren Upstream-Keys und Fallback-Logik auf deiner Seite.

Wissenswerte Details zur Hermes-Integration:

  • Die Responses-API ist die native Leitung (api_mode="codex_responses" ist vorgeschrieben): /v1/responses von Router ist die echte Schnittstelle; /v1/chat/completions ist nur ein minimaler Kompatibilitäts-Shim, der im August ergänzt wurde, damit Hermes auf der nativen Linie bleibt;
  • Der Modell-Katalog ist kontobezogen: Gültige Modell-IDs stammen aus GET /v1/models deines Keys (BYOK-Konten sehen zusätzliche Einträge), daher bringt das offizielle Profil keine hartkodierten Fallback-Modelle mit – was du im Picker siehst, wird live abgerufen;
  • Strenge Reasoning-Effort-Validierung: Router prüft reasoning.effort gegen das deklarierte Vokabular jedes Modells und lehnt nicht unterstützte Kombinationen mit HTTP 400 ab. Hermes cached die Katalog-Fähigkeiten von Router und begrenzt vor dem Senden;
  • Requests tragen den Hermes-Agent-User-Agent.

Das Plugin (router-provider) stammt von Neel Patel von Ramp, mit Live-Verifikation gegen api.router.com im August 2026.

2. Nebius Token Factory: Pay-as-you-go-Inference

Die „Token Factory“ von Nebius ist sein Pay-as-you-go-Inference-Dienst, OpenAI-kompatibel. Das Plugin nebius-token-factory-provider wird von Nous Research selbst gepflegt.

Ein Implementierungsdetail, das du kennen solltest: Einige Nebius-Modelle unterstützen Reasoning-Effort, aber nicht alle. Hermes bringt eine konservative Allowlist mit – nur Modelle darauf (deepseek-r1/v4, deepseek-reasoner, gpt-oss, glm-5, kimi-k2, minimax-m2, …) dürfen Reasoning-Effort-Parameter tragen; alles andere wird automatisch begrenzt, sodass du nie Fehler durch nicht unterstützte Parameter erlebst.

3. Tencent TokenPlan: Abo + hy4-preview

Tencent Cloud Hunyuan TokenPlan ist ein monatliches Token-Abo, ausgeliefert über das Anthropic-Nachrichtenformat (anthropic_messages-Transport). In Hermes existiert es als eingebauter Overlay-Provider:

  • Interne id: tencent-tokenplan; Aliase tokenplan / tencent-lkeap;
  • Basis-URL: https://api.lkeap.cloud.tencent.com/plan/anthropic;
  • Umgebungsvariable: TOKENPLAN_BASE_URL (der Zugriffs-Endpoint bzw. die Zugangsdaten des Plans werden darüber injiziert);
  • Anzeigename im Picker: „Tencent TokenPlan“.

Dieselbe PR registriert außerdem tencent/hy4-preview (Tencent Hunyuan 4 Preview) im offiziellen Modell-Katalog – TokenPlan-Abonnenten können es direkt im Modell-Selektor wählen.

So verwendest du sie

Keiner davon erfordert Hand-Editieren der Konfiguration – der Modell-Flow von hermes setup (select_provider_and_model) erkennt neue Plugins unter plugins/model-providers/ automatisch und leitet zur Standard-API-Key-Konfiguration weiter:

hermes setup        # enter model configuration
# choose Ramp Router / Nebius Token Factory / Tencent TokenPlan
# paste the service's API key / access credential when prompted
hermes model        # switch providers anytime afterwards

Der eingebaute Tencent TokenPlan funktioniert genauso: TOKENPLAN_BASE_URL setzen (sowie die Plan-Zugangsdaten), Tencent TokenPlan im Selektor wählen und tencent/hy4-preview als Modell auswählen.

Einschränkungen

  • Alle drei PRs landeten am 29. August und sind derzeit nur auf main – in keinem Release-Tag (v0.20.6 wurde am 27. August getaggt); führe zuerst hermes update aus, um diese Provider zu sehen;
  • Die Modellliste von Ramp Router hängt vollständig vom Live-Katalog deines Keys ab – aktualisiere die Modellliste im Picker vor der ersten Verwendung;
  • Bei Abo-Plänen wie TokenPlan solltest du die Quota-Semantik (monatliches Token-Kontingent vs. gemessener Nachkauf) auf den offiziellen Tencent-Cloud-Seiten gegenprüfen.

Zusammenfassung

Ein Gateway-Provider (Ramp Router), ein Pay-as-you-go-Provider (Nebius Token Factory) und ein Abo-Provider (Tencent TokenPlan) – drei der häufigsten Arten, wie Teams Modellzugang kaufen, plus hy4-preview im Katalog. Jede Integration läuft über den Standard-hermes setup-Flow, ohne handgeschriebene Konfiguration. Wer tiefer in die Modell-Konfiguration eintauchen will, findet unseren Guide zu Modell-Overrides und den GLM-5.3-Flash-Guide; die vollständige hermes model-Referenz liegt auf der Command-Dokumentationsseite.