Nuevas Apps y Productos

Una herramienta compacta para evaluar modelos y prompts de inteligencia artificial

smevalsFuente: Simon Willison31/07/2026, 18:15
Simon Willison ha desarrollado smevals, un conjunto de evaluación ligero diseñado para probar diferentes configuraciones de modelos de IA. La herramienta permite a los usuarios crear conjuntos de pruebas estructurados mediante archivos YAML y ejecutarlos contra múltiples modelos, con calificación automatizada basada en criterios personalizables. El framework separa la fase de ejecución de la calificación, ofreciendo flexibilidad en la gestión del flujo de trabajo. Los resultados pueden visualizarse a través de una interfaz web local o exportarse como reportes HTML estáticos para alojar en cualquier servidor. Willison demostró las capacidades de la herramienta con un ejemplo práctico evaluando cómo diferentes modelos generan haikus. El proyecto surge de tres años de experimentación con frameworks de evaluación, desarrollado en asociación con el laboratorio de investigación aplicada Prime Radiant.
Una herramienta compacta para evaluar modelos y prompts de inteligencia artificial — lupAI