Supabase abre el código de Evals, benchmark para probar agentes de IA
Supabase lanzó Supabase Evals como software de código abierto, un framework para evaluar agentes de IA en tareas prácticas dentro de su ecosistema. El benchmark ejecuta modelos como Claude Code, Codex y OpenCode contra escenarios reales, desde creación de esquemas de bases de datos hasta reparación de políticas RLS y depuración de Edge Functions.
El proyecto organiza las pruebas en tres dimensiones: productos (base de datos, autenticación, almacenamiento, edge functions, etc.), temas (seguridad, migraciones SQL, SDKs) y etapas (construir, desplegar, investigar, resolver). Cada escenario se ejecuta en entornos realistas similares a producción, con agentes realizando llamadas reales a servidores MCP verdaderos y herramientas CLI.
Los resultados iniciales muestran que Opus 5 y Kimi K3 logran 100% en la etapa de construcción sin skills auxiliares. Sonnet 5 mejoró de 78% a 100% cuando se cargaron skills, mientras que GPT-5.6 Sol pasó de 89% a 100%. El framework identificó tres debilidades recurrentes: agentes escribiendo migraciones manualmente en lugar de usar esquemas declarativos, verificación manual de autenticación ignorando bibliotecas especializadas, y variación significativa en patrones de uso de documentación entre diferentes modelos.