Bilibili lança plataforma de avaliação de modelos de IA com gpt-6 liderando
A Bilibili lançou uma plataforma de avaliação de modelos de IA chamada 'AI Infinite Arena', que inclui um ranking para modelos de linguagem grandes (LLMs). A primeira rodada de rankings mostrou que o GPT-6 Astra liderava com uma pontuação de 10 de 10, superando o GLM-5.3. Três modelos chineses também entraram no top cinco. A plataforma agrega avaliações de criadores da Bilibili, abrangendo várias aplicações do mundo real, como codificação, raciocínio e colaboração. Ao contrário dos testes de benchmark tradicionais, a plataforma permite que os criadores definam seus próprios desafios, demonstrando o desempenho prático de diferentes modelos. O ranking inclui modelos como DeepSeek, Kimi, ChatGPT e Qwen, com atualizações em tempo real. A Bilibili observou um aumento de 72% em relação ao ano anterior no consumo de conteúdo de IA, com mais de 190 milhões de usuários mensais assistindo a conteúdo relacionado à IA.
A plataforma está aberta a todos os criadores da Bilibili, incentivando a participação e atualizações contínuas. A Bilibili destacou o crescente interesse em IA, com uma ampla gama de conteúdo, desde a criação até a interação do usuário. A plataforma visa fornecer uma visão abrangente das capacidades dos modelos de IA por meio de diversos e cenários do mundo real.