Pesquisa & Papers

As Leis de Escala no Treinamento de Modelos de IA

Chinchilla + GopherFonte: Lilian Weng23/06/2026, 21:00
As leis de escala constituem um dos achados empíricos mais importantes no deep learning, demonstrando que a perda de treino diminui de forma previsível conforme se aumenta o tamanho do modelo, a quantidade de dados e a capacidade de processamento disponível. Esta previsibilidade permite aos pesquisadores extrapolar resultados de treinos pequenos para estimar os recursos necessários em modelos maiores. O conceito evoluiu ao longo de décadas. Estudos iniciais de Hestness et al. (2017) já haviam mapeado a relação entre tamanho do modelo e quantidade de dados. Trabalhos posteriores de Rosenfeld et al. (2020) e Kaplan et al. (2020) formalizaram estas relações em equações matemáticas, confirmando que o erro segue uma lei de potência em vários domínios da IA. Kaplan et al. extraiu uma conclusão particular: o tamanho do modelo deveria crescer mais rapidamente que a quantidade de dados de treino. Contudo, o trabalho Chinchilla (Hoffmann et al., 2022) questionou esta recomendação através de metodologia experimental mais rigorosa, argumentando que a maioria dos grandes modelos da época estava subtreinada. Para demonstrar o argumento, os pesquisadores treinaram o Chinchilla — um modelo 4 vezes menor que o Gopher — utilizando 4 vezes mais dados de treino, conseguindo superar o Gopher em todas as avaliações. O estudo também aborda como detalhes técnicos, como a contagem de parâmetros de embedding, modificam os resultados obtidos em escalas diferentes.
As Leis de Escala no Treinamento de Modelos de IA — lupAI