Mejora de la Eficiencia de Inferencia en Modelos Transformers de Gran Escala
Fuente: Lilian Weng10/01/2023, 14:00
Los modelos transformers de gran escala han impulsado avances significativos en inteligencia artificial, aunque sus elevados costos computacionales durante la inferencia representan un obstáculo importante para el despliegue en aplicaciones del mundo real a escala masiva. El artículo examina múltiples estrategias para reducir los costos de inferencia en términos de velocidad de procesamiento y consumo de memoria.
La destilación de conocimiento permite entrenar modelos compactos que replican el comportamiento de modelos mayores preentrenados, reduciendo drásticamente los gastos de inferencia. DistilBERT ejemplifica este enfoque, logrando una reducción del 40% de parámetros mientras mantiene el 97% del rendimiento original y se ejecuta 71% más rápido.
Las técnicas de cuantización reducen la precisión de los pesos y activaciones de la red, disminuyendo requisitos de memoria y acelerando los cálculos. Métodos como GPTQ logran precisión de pesos de 3-4 bits con degradación mínima, mientras que SmoothQuant utiliza transformaciones matemáticas para suavizar características extremas y permitir cuantización simultánea de pesos y activaciones.
La poda elimina pesos no esenciales de los modelos, reduciendo el tamaño de la red mientras preserva el rendimiento. Combinadas con entrenamiento consciente de cuantización y otras técnicas de compresión, la poda contribuye a estrategias integrales de optimización de inferencia.