Claude Opus 5 incorpora tres nuevos benchmarks de evaluación
Anthropic ha integrado nuevas pruebas de desempeño en la tarjeta del sistema de Claude Opus 5. Los benchmarks—Riemann-bench, Chartography y GDP.pdf—evalúan capacidades específicas del asistente de IA en diversos dominios técnicos.
La adición de estos criterios de evaluación amplía el marco de medición disponible para valorar el rendimiento del modelo en múltiples contextos de aplicación.