Nuevos Desarrollos

HANDBOOK.md: nuevo benchmark para evaluar seguimiento de instrucciones en contexto prolongado en agentes de IA

Fuente: Edwin Chen (X)29/07/2026, 22:57
HANDBOOK.md es un nuevo benchmark diseñado para medir cómo los agentes de inteligencia artificial siguen instrucciones complejas y detalladas, modelado según cómo los profesionales corporativos cumplen con políticas en su trabajo diario. El sistema estructura cada tarea como un entorno único de aprendizaje por refuerzo con herramientas internas y servidores MCP externos distribuidos en cinco dominios empresariales. El benchmark proporciona una forma de evaluar el desempeño de los agentes en la comprensión y ejecución de instrucciones extendidas con precisión.
HANDBOOK.md: nuevo benchmark para evaluar seguimiento de instrucciones en contexto prolongado en agentes de IA — lupAI