Volver al archivo

Tamaño crítico del lote

Tamaño crítico del batch

Quieres acelerar el aprendizaje mostrando al modelo más ejemplos a la vez. Al principio ayuda. Sin embargo, a partir de cierto punto procesas muchos más datos y el número de pasos necesarios para lograr un resultado solo disminuye ligeramente. ¿Dónde deja de compensar ampliar el grupo?

Critical Batch Size es una escala característica del batch por encima de la cual se debilitan las ventajas de seguir aumentando el grupo de datos de cada paso. Un batch son los ejemplos o tokens —fragmentos de texto— con los que calculamos conjuntamente una corrección de los pesos del modelo.

Promediar más ejemplos reduce el azar de la orientación sobre cómo mejorar los pesos. Pero, con una cantidad fija de datos, un batch mayor significa menos correcciones. Pasar de 100 a 200 ejemplos puede ahorrar muchos pasos; duplicar de nuevo no tiene por qué aportar una mejora proporcional. Es una ilustración del compromiso, no unos valores universales del límite.

McCandlish y colaboradores, §2–3, modelan esta relación mediante la escala de ruido del gradiente. El límite depende de la tarea y de la fase de entrenamiento. Procesar los datos más deprisa en el hardware no tiene por qué significar un aprendizaje igual de eficiente por cada token leído.

Relaciones

¿Podemos construir una teoría física del proceso de aprendizaje que prediga el comportamiento macroscópico de las redes? [Polski]