Novos benchmarks e organização de alignment redefinem avaliação de sistemas de IA
A semana trouxe avanços significativos em múltiplas frentes da pesquisa em inteligência artificial. A organização sem fins lucrativos Sequent foi lançada por investigadores britânicos e colaboradores para desenvolver técnicas de alignment mais confiáveis para sistemas superinteligentes, argumentando que o trabalho atual em labs de fronteira não está adequadamente preparado para garantir segurança antes do desenvolvimento de ASI. A organização pretende crescer para 40-80 funcionários e angariar entre $100-150 milhões inicialmente.
Entretanto, Cognition apresentou FrontierCode, um benchmark de codificação extremamente desafiador que avalia se modelos de IA conseguem realmente escrever código de qualidade produção. O Claude Opus 4.8 alcança apenas 13.4% na dificuldade máxima, sugerindo que o benchmark terá utilidade de longo prazo para medir progresso futuro.
Por fim, Xiaomi apresentou um modelo de 1 trilião de parâmetros capaz de gerar 1000 tokens por segundo, demonstrando como a otimização conjunta de software e arquitetura de modelos pode alcançar velocidades impressionantes utilizando hardware convencional.