Bilibili lanza plataforma de evaluación de modelos de IA con gpt-6 liderando las clasificaciones
Bilibili ha lanzado una plataforma de evaluación de modelos de IA llamada 'AI Infinite Arena', que incluye un ranking para modelos de lenguaje grandes (LLMs). La primera ronda de clasificaciones mostró que GPT-6 Astra lideraba con una puntuación de 10 sobre 10, superando a GLM-5.3. Tres modelos chinos lograron entrar en los cinco primeros. La plataforma recopila evaluaciones de creadores de Bilibili, que cubren diversas aplicaciones del mundo real, como la programación, el razonamiento y la colaboración. A diferencia de las pruebas tradicionales, la plataforma permite a los creadores establecer sus propios desafíos, mostrando el rendimiento práctico de diferentes modelos. El ranking incluye modelos como DeepSeek, Kimi, ChatGPT y Qwen, con actualizaciones en tiempo real. Bilibili ha notado un aumento del 72% interanual en el consumo de contenido de IA, con más de 190 millones de usuarios que consumen contenido relacionado con la IA.
La plataforma está abierta a todos los creadores de Bilibili, fomentando la participación y las actualizaciones continuas. Bilibili ha destacado el creciente interés en la IA, con una amplia gama de contenido que abarca desde la creación hasta la interacción del usuario. La plataforma tiene como objetivo proporcionar una visión completa de las capacidades de los modelos de IA a través de diversos y escenarios del mundo real.