Nueva arquitectura de entrenamiento distribuido permite el desarrollo resiliente de modelos de IA
Google presentó Decoupled DiLoCo, una arquitectura distribuida para entrenar modelos de lenguaje grandes en centros de datos distantes con requisitos reducidos de ancho de banda y resiliencia de hardware mejorada. Al dividir el entrenamiento en islas de computación desacopladas con flujo de datos asíncrono, el enfoque aísla las fallas de hardware y permite entrenamiento flexible en infraestructura distribuida globalmente, abordando los desafíos de escalabilidad del entrenamiento de modelos de frontera.