lupAI
novos-desenvolvimentos

Nunchux AI lanza vc-attention: un nuevo kernel de atención de bajo bit para modelos de difusión de vídeo

Nunchux AIFuente: MarkTechPost16/09/2026, 23:16
Nunchux AI ha presentado VC-Attention, un nuevo kernel de atención de bajo bit, sin necesidad de entrenamiento, diseñado para mejorar la eficiencia de los transformadores de difusión de vídeo (DiTs). La tecnología aborda dos desafíos clave: el error de cuantificación de los valores y la lenta etapa de softmax en los cálculos de atención. Al aprovechar los núcleos de tensor de bajo bit, VC-Attention acelera los productos de matriz QK y PV, que son críticos para las operaciones de atención. El método introduce V-Smooth, que reduce la energía de bloque en el orden de la secuencia, y ExpCast-FP8, que escribe directamente bytes de la puntuación del dominio logarítmico con una operación de multiplicación-suma fusionada. Estas innovaciones mejoran significativamente el rendimiento, con VC-Attention logrando una aceleración de 6,02× sobre SageAttention2 en B200 y 1,16× en H200. La técnica también mantiene una alta fidelidad, con puntuaciones de PSNR de 20,2 dB en MiniMax-H3. Nunchux Attention, la extensión propietaria de la empresa, mejora aún más el rendimiento en B200 y B300. El método es compatible con la atención dispersa y la ejecución en múltiples GPU, y la empresa ofrece acceso gratuito a MiniMax-H3 a través de su lista de espera Modelverse.
Nunchux AI lanza vc-attention: un nuevo kernel de atención de bajo bit para modelos de difusión de vídeo — lupAI