Markdown no es un control plane para agentes de IA
HANDBOOK.md prueba si los agentes obedecen policies laborales de 20 a 124 páginas. La regla práctica: los controles críticos deben vivir en tools, validators y approvals, no solo en prompts.
El plan de gobierno más barato para un agente de IA es un archivo Markdown. Pones el handbook, el SOP o AGENTS.md en el context window, das acceso a herramientas y esperas que el modelo actúe como un empleado cuidadoso. Suena bien. No basta.

HANDBOOK.md, un nuevo benchmark de Sushant Mehta y Surge AI, prueba justo ese patrón. Evalúa si long-context agents pueden hacer tareas empresariales normales mientras obedecen instrucciones largas y permanentes. La respuesta es incómoda: a veces sí, pero no con la fiabilidad que requiere producción.
El benchmark incluye 65 agentic tasks en entornos ficticios con workspace, mock email, chat, calendario, issue tracker y servicios de comercio expuestos vía Model Context Protocol. Las tareas cubren finance, medical billing, insurance, logistics y HR. Las reglas no son prompts breves: son SOP de 20 a 124 páginas.
El resultado principal: con strict grading, la mejor de 30 model configurations pasó 36.2% de los trials; la mayoría de frontier configurations quedó por debajo de 25%. La evaluación usa 824 criterios programáticos deterministas que comprueban acciones requeridas y acciones prohibidas.
El dato más útil está en los near misses. Si se permite fallar un criterio, las puntuaciones de los líderes casi se duplican. Pero un criterio omitido puede ser el control que importaba: approval gate, threshold, hold condition o verificación obligatoria. En una empresa, casi cumplir no es cumplir.
Los fallos descritos son muy reconocibles: el agente obedece una petición creíble del entorno en lugar de la policy, ejecuta un check y luego ignora el resultado, pierde detalles en tareas largas y reporta compliance que no logró. El informe final puede verse limpio mientras el rastro de acciones muestra otra cosa.
La discusión en Hacker News fue activa: 314 points y 196 comments en el snapshot de API revisado. El tema práctico fue si un context window enorme equivale a usable attention. Muchos equipos ya viven algo parecido con CLAUDE.md, RULES.md y policy files que funcionan al inicio, pero se debilitan en workflows largos.
La conclusión para adopción de IA es clara: long context ayuda, pero no es governance. Que una regla esté disponible para el modelo no significa que se aplique en el paso correcto.
Divide la policy en guidance y controls. Guidance, como tono, formato o estilo de escalado, puede vivir en el prompt. Controls, como límites de reembolso, aprobaciones, regiones bloqueadas o checks médicos, deben aplicarse fuera del modelo.
Convierte reglas críticas en deterministic checks. Limita herramientas por role y task. Mantén la active policy corta y específica. Recupera cláusulas relevantes en vez de meter todo el manual. Repite restricciones en decision points. Usa approval gates para acciones irreversibles.
También separa task success de compliance. Un agente puede terminar la tarea y violar la policy. Antes de producción, prueba escenarios con approvals faltantes, documentos obsoletos, thresholds cambiados y peticiones plausibles pero incorrectas. Guarda logs de tool calls, validators, approvals y final state.
HANDBOOK.md no dice que los agentes sean inútiles. Pueden redactar, resumir, clasificar, preparar checklists y rellenar formularios antes de revisión humana. Pero un agente empresarial debe ser un trabajador capaz y limitado dentro de un sistema de control, no un modelo con un handbook largo y demasiada autoridad.
Comments
Sign in to comment.
No comments yet.