Hermes Agent no solo es más inteligente: ahora demuestra que terminó

El modo de fallo más común de los agentes de IA no es que no puedan hacer el trabajo, sino que no puedes estar seguro de que el trabajo esté realmente hecho. Declaran con confianza que terminaron, pero olvidan un archivo. Ejecutan un script sin revisar la salida. Siguen adelante como si el paso anterior no hubiera fallado.
Hermes Agent v0.18.0 —conocido como “The Judgment Release”— se construye en torno a una idea: hacer que el agente demuestre que terminó.
Consulta las notas de lanzamiento completas de v0.18.0 para ver todos los cambios.
De “siente que terminó” a “la evidencia dice que terminó”
Tradicionalmente, un modelo se detiene cuando decide que ha respondido lo suficiente. Esa decisión es subjetiva. Sentir que terminó no es lo mismo que cumplir con las expectativas.
Hermes v0.18.0 introduce dos mecanismos complementarios que convierten la finalización de una corazonada en un objeto verificable:
- Standing Goals: una condición objetivo persistente contra la que el agente verifica continuamente el progreso.
- Completion Contracts: un acuerdo comprobable que define qué significa “terminado”, incluyendo evidencia y pasos de validación.
En resumen: en lugar de pedirle que haga algo y confiar cuando dice que terminó, le dices qué significa terminar y él trae la evidencia.
Por qué importa la auto-verificación
Hermes ya podía invocar herramientas, escribir código, ejecutar pruebas y gestionar archivos. Pero todo eso dejaba una brecha: no verificaba activamente su propio trabajo.
v0.18.0 cambia esto. Después de actuar, el agente intenta verificar que el resultado cumple las condiciones establecidas. Suena menor, pero transforma a Hermes de mero ejecutor a un ejecutor responsable:
- Comprueba si un archivo existe y coincide con lo esperado tras editarlo.
- Inspecciona códigos de salida, registros y efectos secundarios tras ejecutar comandos.
- Repasa los criterios de finalización antes de decirte que la tarea terminó.
No es una garantía perfecta, pero reduce notablemente el caso de “parece hecho, pero no lo está”.
Standing Goals: la condición de finalización como contrato a largo plazo
Los Standing Goals permiten declarar un objetivo a largo plazo y hacer que el agente mida el progreso continuamente. Usos típicos:
- “Convierte todas las rutas hardcodeadas en
src/utils.pya variables de entorno.” - “Resuelve todos los comentarios TODO del repositorio.”
- “Asegúrate de que toda llamada a API tenga lógica de reintentos.”
Estas tareas rara vez se resuelven en una sola acción. Requieren revisar, editar y volver a revisar. Los Standing Goals obligan al agente a preguntarse tras cada paso: “¿Me acerqué al objetivo? ¿Ya se cumple?”
Tú defines el objetivo; el agente planifica, actúa, verifica e itera hasta alcanzarlo o hasta encontrar un bloqueo que requiera intervención humana.
Completion Contracts: hacer que “terminado” sea comprobable
Si los Standing Goals responden “cuál es el objetivo”, los Completion Contracts responden “cómo sabemos que terminó”.
Un Completion Contract puede incluir:
- Criterios de finalización: condiciones que deben cumplirse, como existencia de archivos, pruebas aprobadas, formato de salida correcto o builds exitosos.
- Método de verificación: la herramienta o comando para validar, como
pytest,curl,grepodiff. - Manejo de fallos: qué hacer si la verificación falla —reintentar, revertir o pausar y reportar al usuario.
Esta estructura hace transparente el comportamiento del agente. Puedes ver exactamente qué estándar usó para juzgar la finalización y auditar ese juicio después.
Ejemplo: deja que el agente verifique su propia corrección
Supón que pides a Hermes que corrija un bug de manejo de nulos en utils/parser.py y que pase las pruebas antes de reportar finalización. Un Completion Contract podría verse así:
Objetivo: Corregir la excepción de análisis de valores nulos en utils/parser.py
Criterios de finalización:
1. El caso fallido ya no lanza TypeError
2. pytest tests/test_parser.py pasa por completo
3. Se agrega una prueba de regresión que cubra la excepción
Método de verificación:
- Ejecutar pytest tests/test_parser.py
- Comprobar que el Git diff incluye cambios en parser.py y test_parser.py
Manejo de fallos:
- Si fallan las pruebas, analizar el log, modificar el código y reintentar hasta 3 veces
- Si aún falla, pausar y reportar al usuario
Hermes ejecutará el contrato: modificará el código, ejecutará las pruebas, inspeccionará el diff y solo reportará finalización cuando se cumplan los tres criterios. Es mucho más fiable que “código cambiado, tarea hecha”.
Combinado con Mixture-of-Agents: verificación más cuidadosa
v0.18.0 también refuerza Mixture-of-Agents (MoA): varios modelos actúan como un panel, razonando independientemente, mientras un agregador produce la respuesta final.
Para la auto-verificación, MoA aporta valor al:
- Hacer que varios modelos inspectonen la misma evidencia de forma independiente.
- Mostrarte el razonamiento de cada modelo de referencia.
- Convertir la respuesta final en una conclusión cruzada, no en la suposición más confiante.
Es como añadir una revisión por pares al juicio de finalización del agente.
Lo que los usuarios notarán
Para los usuarios cotidianos, v0.18.0 trae tres mejoras concretas:
- Menos finalizaciones falsas: el agente se verifica a sí mismo en lugar de apresurarse a terminar.
- Decisiones más transparentes: puedes ver los criterios y la evidencia que usó.
- Tareas largas más estables: los objetivos persistentes y los contratos de finalización mantienen la automatización en rumbo.
Estos cambios no aparecen como una función llamativa, sino en la forma en que el agente se comporta.
Limitaciones y recomendaciones
La auto-verificación no es mágica. Está limitada por:
- Qué tan completos sean tus criterios de finalización.
- Si tus herramientas de verificación cubren el uso real.
- Qué tan precisamente el modelo interprete los resultados de la verificación.
Por eso, al usarlo:
- Escribe criterios de finalización específicos y comprobables.
- Prefiere métodos de verificación con salidas claras y códigos de salida.
- Mantén una revisión humana para tareas críticas en lugar de delegar completamente el juicio al agente.
Conclusiones clave
- Hermes Agent v0.18.0 “The Judgment Release” se centra en la auto-verificación y la finalización demostrable.
- Los Standing Goals mantienen al agente verificando el progreso contra un objetivo a largo plazo.
- Los Completion Contracts descomponen “terminado” en criterios comprobables, métodos de verificación y manejo de fallos.
- El agente ya no se detiene por una corazonada; juzga la finalización contra la evidencia.
- Con la validación cruzada de Mixture-of-Agents, los juicios de finalización son más cuidadosos y transparentes.
- Los usuarios deben escribir criterios específicos y comprobables, y conservar revisión humana para trabajo crítico.
Referencias: