Nuevos Desarrollos

AMD Lanza Instella-MoE: Modelo Mixture-of-Experts Totalmente Abierto Entrenado en GPUs Instinct

AMD + Instella-MoE-16B-A3BFuente: MarkTechPost01/08/2026, 16:01
AMD ha lanzado Instella-MoE-16B-A3B, un modelo Mixture-of-Experts totalmente abierto entrenado desde cero en GPUs Instinct MI300X y MI325X. Con 16 mil millones de parámetros totales, el modelo activa solo 2.8 mil millones por token. AMD está publicando pesos de cada etapa de entrenamiento junto con mezclas de datos, configuraciones de entrenamiento y código de inferencia, distribuidos bajo una licencia ResearchRAIL para fines académicos e investigación. El modelo introduce dos innovaciones estructurales significativas. Gated Multi-head Latent Attention añade un gate de salida aprendido a la atención latente multi-cabeza, mejorando la modulación de salida. FarSkip-Collective pasa activaciones desactualizadas y parciales a través de capas MoE y de atención, sobreposicionando comunicación paralela de expertos con computación. AMD informa de una aceleración de pre-entrenamiento del 12.7% y una reducción de hasta el 39.2% en tiempo para el primer token al servir con paralelismo de expertos. El pre-entrenamiento abarcó 7.1 billones de tokens de corpora abiertos, seguido de una etapa de contexto largo que extiende la ventana de 4K a 64K tokens. El post-entrenamiento incluye SFT, DPO y RL en el framework Miles, logrando una puntuación media base de 76.7 en benchmarks, superando a otros modelos totalmente abiertos como Moonlight y SmolLM3.
AMD Lanza Instella-MoE: Modelo Mixture-of-Experts Totalmente Abierto Entrenado en GPUs Instinct — lupAI