Pesquisa & Papers

Uma análise da matemática por trás do Kernel Tangente Neural

Fonte: Lilian Weng08/09/2022, 14:00
O artigo apresenta uma exploração profunda sobre o Kernel Tangente Neural (NTK), um conceito teórico fundamental para compreender como as redes neurais aprendem durante o processo de otimização por descida de gradiente. A pesquisa aborda por que redes neurais sobreparametrizadas conseguem generalizar bem mesmo quando o número de parâmetros supera o número de exemplos de treino. A teoria do NTK oferece explicações sobre a convergência de redes neurais suficientemente largas para um mínimo global ao serem treinadas. O texto mergulha em conceitos matemáticos preliminares como matrizes jacobianas, equações diferenciais, teorema do limite central e expansão de Taylor, estabelecendo as bases necessárias para a compreensão do kernel. O núcleo da análise demonstra como o NTK funciona como uma função de similaridade que descreve como atualizações de parâmetros em uma amostra de dados afetam as predições para outras amostras. Quando as redes possuem largura infinita, o kernel converge para um limite determinístico independente da inicialização, garantindo um aprendizado consistente. A conexão entre redes neurais e processos gaussianos é explorada, mostrando que as saídas de redes profundas podem ser aproximadas por distribuições gaussianas quando as camadas ocultas tornam-se muito largas. Esta conexão teórica fornece garantias matemáticas sobre o comportamento de redes neurais durante o treinamento.
Uma análise da matemática por trás do Kernel Tangente Neural — lupAI