Nunchux AI lança o vc-attention: um novo kernel de atenção de baixo bit para modelos de difusão de vídeo
A Nunchux AI revelou o VC-Attention, um novo kernel de atenção de baixo bit, sem necessidade de treinamento, projetado para melhorar a eficiência dos transformadores de difusão de vídeo (DiTs). A tecnologia aborda dois desafios-chave: o erro de quantização de valor e a etapa lenta de softmax nas operações de atenção. Ao utilizar núcleos de tensor de baixo bit, o VC-Attention acelera os produtos de matriz QK e PV, que são críticos para as operações de atenção.
A metodologia introduz o V-Smooth, que reduz a energia do bloco em ordem sequencial, e o ExpCast-FP8, que escreve diretamente bytes da pontuação do domínio logarítmico com uma operação de multiplicação-adição fundida. Essas inovações melhoram significativamente o desempenho, com o VC-Attention alcançando um aumento de velocidade de 6,02× em relação ao SageAttention2 no B200 e 1,16× no H200. A técnica também mantém alta fidelidade, com pontuações PSNR de 20,2 dB no MiniMax-H3.
A Nunchux Attention, a extensão proprietária da empresa, impulsiona ainda mais o desempenho no B200 e B300. A metodologia é compatível com atenção esparsa e execução multi-GPU, e a empresa está oferecendo acesso gratuito ao MiniMax-H3 através da sua lista de espera Modelverse.