NVIDIA Lanza Alpamayo 2 Super, Modelo Abierto de Visión-Lenguaje-Acción para Conducción Autónoma
NVIDIA presentó Alpamayo 2 Super, un modelo de visión-lenguaje-acción con 34 mil millones de parámetros diseñado para conducción autónoma y robotaxis. El modelo combina una columna vertebral VLM de 32B basada en NVIDIA Cosmos 3 Super Reasoner con un decodificador de acción basado en difusión de 2,3B, lanzado bajo la licencia permisiva OpenMDW-1.1. Entrenado con 115 mil horas de vídeo de conducción multicanal con egomotion y anotaciones de trayectoria, más de mil millones de imágenes, el modelo aborda escenarios de conducción de cola larga que los sistemas convencionales de detección manejan mal. Produce trayectorias planificadas, explicaciones causales de decisiones y metaacciones. En puntos de referencia, Alpamayo 2 Super puntuó 79,2 en LingoQA, superando modelos comparables por márgenes significativos. El lanzamiento incluye trazos de Causalidad en Cadena que proporcionan explicaciones estructuradas de decisiones de conducción, apoyando flujos de trabajo de seguridad de IA alineados con ISO/PAS 8800. NVIDIA informa que el modelo puede comprimir ciclos de anotación de meses a días cuando se utiliza como autolabeler.