Shepherd permite que agentes de IA façam fork e replay de estados de execução mais rápido que Docker
Investigadores das Universidades Northeastern e Stanford lançaram Shepherd, um substrato de runtime Python open-source desenhado para resolver um desafio crítico em sistemas de agentes IA de longa duração: a capacidade de se recuperar eficientemente de erros sem recomputação custosa.
As abordagens tradicionais para recuperação de erros em agentes são caras: corrigir erros para frente aumenta o tamanho do contexto e consumo de tokens, enquanto reiniciar do zero requer reproduzir todas as interações anteriores de modelo e ferramentas. Shepherd resolve isto registando a execução do agente como um trace Git-like de eventos tipados, permitindo aos engenheiros fazer fork de qualquer estado passado e retomar a partir daí.
O framework registra cada interação agente-ambiente como um evento tipado, criando um trace de execução completo onde cada interação funciona como um commit. Ao contrário de Git, que rastreia apenas ficheiros, os commits de Shepherd capturam tanto o estado do processo do agente quanto do sistema de ficheiros através de mecanismos copy-on-write. Isto permite que um branch carregue estado vivo completo, habilitando forks instantâneos para pontos de execução anteriores.
O desempenho é uma vantagem chave: Shepherd faz fork de processos de agentes e sistemas de ficheiros 5 vezes mais rápido que contentores Docker. Mais criticamente, porque o prefixo da prompt até um ponto de branch permanece inalterado, fazer replay a partir de um fork consegue reutilização de cache de prompt superior a 95%, reduzindo dramaticamente custos de inferência.
O framework está atualmente disponível em alfa inicial como um pacote licenciado MIT instalável via pip install shepherd-ai. Requer Python 3.11 ou posterior e inclui enforcement de nível do SO em macOS e Linux. A equipa de investigação também formalizou operações principais no assistente de provas Lean e fornece documentação completa, código-fonte e dados experimentais.