Novos Desenvolvimentos

HANDBOOK.md: novo benchmark para avaliar seguimento de instruções em contexto longo em agentes de IA

Fonte: Edwin Chen (X)29/07/2026, 22:57
HANDBOOK.md é um novo benchmark criado para medir como agentes de inteligência artificial conseguem seguir instruções complexas e detalhadas, baseado no modelo de como profissionais cumprem políticas corporativas no seu trabalho diário. O sistema estrutura cada tarefa como um ambiente único de aprendizagem por reforço, utilizando ferramentas internas e servidores MCP externos distribuídos por cinco domínios empresariais. O benchmark oferece uma abordagem para avaliar a capacidade dos agentes em compreender e executar instruções prolongadas com precisão.
HANDBOOK.md: novo benchmark para avaliar seguimento de instruções em contexto longo em agentes de IA — lupAI