NVIDIA Lança Alpamayo 2 Super, Modelo Aberto de Visão-Linguagem-Ação para Condução Autónoma
A NVIDIA apresentou Alpamayo 2 Super, um modelo de visão-linguagem-ação com 34 mil milhões de parâmetros concebido para condução autónoma e robotáxis. O modelo combina uma espinha dorsal VLM de 32B baseada no NVIDIA Cosmos 3 Super Reasoner com um descodificador de ação baseado em difusão de 2,3B, lançado sob a licença permissiva OpenMDW-1.1. Treinado com 115 mil horas de vídeo de condução multi-câmara com egomotion e anotações de trajetória, mais de um mil milhões de imagens, o modelo aborda cenários de condução de cauda longa que os sistemas convencionais de deteção tratam mal. Produz trajetórias planeadas, explicações causais de decisões e meta-ações. Em testes de desempenho, Alpamayo 2 Super registou 79,2 em LingoQA, superando modelos comparáveis por margens significativas. O lançamento inclui raços de Causação em Cadeia que fornecem explicações estruturadas das decisões de condução, apoiando fluxos de trabalho de segurança de IA alinhados com ISO/PAS 8800. A NVIDIA relata que o modelo pode comprimir ciclos de anotação de meses para dias quando usado como autolabeler.