Investigación y Papers

Las Leyes de Escalado en el Entrenamiento de Modelos de IA

Chinchilla + GopherFuente: Lilian Weng23/06/2026, 21:00
Las leyes de escalado representan uno de los hallazgos empíricos más importantes en aprendizaje profundo, demostrando que la pérdida de entrenamiento disminuye de manera predecible conforme aumentan el tamaño del modelo, la cantidad de datos y los recursos computacionales disponibles. Esta relación predecible permite a los investigadores extrapolar resultados de experimentos pequeños para estimar los recursos necesarios en modelos más grandes. El concepto evolucionó a través de múltiples esfuerzos de investigación durante varias décadas. Los primeros estudios de Hestness et al. (2017) mapearon la relación entre el tamaño del modelo y la cantidad de datos, mientras que trabajos posteriores de Rosenfeld et al. (2020) y Kaplan et al. (2020) formalizaron estas relaciones matemáticamente, confirmando que el error sigue un patrón de ley de potencia en varios dominios de la IA. Kaplan et al. concluyó que el tamaño del modelo debería crecer más rápidamente que el volumen de datos de entrenamiento. El paper Chinchilla (Hoffmann et al., 2022) cuestionó esta recomendación con experimentación más rigurosa, argumentando que la mayoría de los modelos grandes de esa época estaban poco entrenados. Los investigadores demostraron su argumento entrenando Chinchilla—un modelo cuatro veces más pequeño que Gopher—con cuatro veces más datos de entrenamiento, logrando un rendimiento superior en todas las métricas comparado con Gopher. El estudio también examina cómo detalles técnicos, como el conteo de parámetros de embedding, afectan los resultados obtenidos en diferentes escalas.
Las Leyes de Escalado en el Entrenamiento de Modelos de IA — lupAI