Otimização de Inferência em Modelos Transformers Grandes
Fonte: Lilian Weng10/01/2023, 14:00
Os modelos transformers de grande escala produziram avanços significativos em múltiplas tarefas de IA, mas o seu elevado custo computacional durante a inferência constitui um obstáculo importante para a sua aplicação em cenários reais de larga escala. O artigo examina diversas estratégias para tornar a inferência mais eficiente, tanto em velocidade como em consumo de memória.
A destilação de conhecimento permite treinar modelos menores que replicam o comportamento de modelos maiores pré-treinados, reduzindo significativamente o custo de inferência. O modelo DistilBERT exemplifica esta abordagem, alcançando redução de 40% nos parâmetros enquanto mantém 97% do desempenho original e executa 71% mais rapidamente.
A quantização reduz a precisão dos pesos e ativações da rede, diminuindo requisitos de memória e acelerando computações. Métodos como GPTQ conseguem reduzir para 3-4 bits sem perda substancial de desempenho, enquanto SmoothQuant utiliza transformações matemáticas para suavizar características extremas e permitir quantização simultânea de pesos e ativações.
A poda identifica e remove pesos não-essenciais, reduzindo o tamanho do modelo sem comprometer significativamente a sua capacidade. Estas técnicas combinam-se entre si e com o treinamento consciente de quantização para otimizar a inferência em larga escala.