Supabase abre código do Evals, benchmark para testar agentes de IA
Supabase disponibilizou como código aberto o Supabase Evals, framework para avaliar agentes de IA em tarefas práticas do seu ecossistema. O benchmark executa modelos como Claude Code, Codex e OpenCode contra cenários reais, desde construção de schemas de bases de dados até correção de políticas RLS e depuração de Edge Functions.
O projeto organiza os testes em três dimensões: produtos (base de dados, autenticação, armazenamento, edge functions, etc.), tópicos (segurança, migrações SQL, SDK) e fases (construção, deployment, investigação e resolução). Cada cenário roda em ambientes de produção realistas, com agentes executando chamadas reais aos servidores MCP e ferramentas CLI.
Os resultados iniciais mostram que Opus 5 e Kimi K3 atingem 100% na fase de construção sem skills auxiliares. Sonnet 5 passou de 78% para 100% com skills, enquanto GPT-5.6 Sol subiu de 89% para 100%. O framework identificou três padrões recorrentes de fraqueza: agentes escrevendo migrações manualmente ao invés de usar schemas declarativos, verificação manual de autenticação ignorando bibliotecas especializadas, e variação significativa no uso de documentação entre modelos diferentes.