La barra de estado se renueva: tasa de cache-hit, latencia y tokens/seg de un vistazo


Te quedas mirando la barra de estado al pie de tu terminal: nombre del modelo, porcentaje de contexto, un icono de compresión. Mucha información — pero lo que de verdad quieres saber es “¿está este modelo rápido ahora mismo? ¿Está acertando mi caché? ¿Cuántos tokens por segundo está produciendo?” — porque la tasa de cache-hit decide si tu factura de API cuesta una décima parte o el precio completo. Una actualización fusionada el 30 de agosto (PR #98250) pone las tres respuestas directamente en la barra de estado: tasa de cache-hit (◎), latencia media móvil (◷) y tokens de salida por segundo (↑) — y cada campo se puede activar y desactivar desde la configuración.

Qué hay de nuevo en la barra

En una terminal ancha, la barra actualizada tiene este aspecto:

⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s │ 2m

De izquierda a derecha: nombre del modelo, contexto al 3%, tasa de cache-hit del 87.4%, latencia media de 3.2s, 50 tokens de salida por segundo, duración de la sesión de 2 minutos. Las tres métricas nuevas son estadísticas móviles: la latencia y el rendimiento usan la media móvil de las últimas ~10 llamadas a la API en lugar de una media desde el arranque, así que reflejan el estado actual del modelo.

Unos cuantos detalles cuidados:

  • La tasa de cache-hit reinicia su línea base al cambiar de modelo y al comprimir el contexto — refleja el régimen de caché actual, no un número diluido por el historial;
  • Cuando no existe ninguna lectura de caché, el campo se oculta en lugar de mostrar un 0% alarmante — sin señales engañosas;
  • La latencia negativa o NaN está protegida — una sola llamada temblorosa no puede contaminar las estadísticas.

Interruptores de campos: display.status_bar.fields

Las métricas nuevas no se te imponen — cada campo se puede habilitar o deshabilitar de forma independiente. La clave de configuración es display.status_bar.fields; una lista vacía significa “todos los campos predeterminados”:

display:
  status_bar:
    fields: []   # vacío = valores predeterminados integrados (todos los campos)

Digamos que solo te importan la caché y la velocidad — deja solo estos:

display:
  status_bar:
    fields: [model, ctx, cache_hit, latency, tps]

Tu barra queda así: ⚕ model │ 3% │ ◎ 87.4% │ ◷ 3.2s │ ↑ 50 t/s. Frente al código fuente (hermes_cli/config_defaults.py), la lista completa de campos es: cache_hit, latency, tps, compressions, bg_tasks, bg_processes, bg_subagents, goal, duration, prompt_elapsed, idle_since, focus, yolo, stash, battery, title, total_tokens. Dos salvedades:

  • total_tokens (tokens acumulados de la sesión) es solo opt-in — nunca aparece salvo que lo añadas a la lista;
  • Las terminales estrechas eliminan los campos exclusivos del modo ancho (context_detail, prompt_elapsed, idle_since) independientemente de la configuración.

Por qué merece la pena vigilar la tasa de cache-hit

Es la más “valiosa” de las tres métricas nuevas. Los grandes proveedores de API (Anthropic, OpenAI, DeepSeek y otros) suelen cobrar las lecturas de caché del prompt a 1/10 del precio normal de entrada, o menos. La tasa de aciertos de la barra de estado es un panel en vivo para tu estrategia de ahorro: si se mantiene baja durante mucho tiempo, la estructura de tu sesión está en constante movimiento (el system prompt cambia a menudo, las descripciones de herramientas son inestables) y la caché falla una y otra vez; si se mantiene por encima del 80%, tu dinero se está gastando donde cuenta.

Cómo obtenerlo

El PR #98250 se fusionó el 30 de agosto de 2026 y está solo en main — v0.20.6 no lo tiene. Actualiza a la última versión de main y los campos nuevos aparecen en el hermes normal; para ajustarlos, edita display.status_bar.fields con hermes config edit.

La barra de estado es el panel de control de la CLI, y estas métricas nuevas la convierten de decoración en datos operativos. Para el manual completo de ahorro de tokens y caché, combínalo con la guía de los 5 canales de búsqueda gratuitos y la guía de optimización de tokens de contexto; más triunfos ocultos de eficiencia en la CLI están en la guía de la paleta de comandos.