Leyes de escalado
Leyes de escalado
Tienes un presupuesto para entrenar un modelo. Puedes construir uno mayor o mostrar más texto a uno pequeño. Comprobar completamente cada combinación sería costoso. Necesitas una forma de estimar qué aportará la escala adicional antes de gastar todo el presupuesto.
Scaling Laws son relaciones empíricas entre el tamaño del modelo, la cantidad de datos, los cálculos y el resultado del entrenamiento. «Empíricas» significa que se descubrieron mediante mediciones. A menudo describen una reducción del error de predicción del texto al aumentar los recursos.
Los investigadores entrenan varios modelos pequeños y ajustan una curva. A partir de ella intentan predecir el resultado de un entrenamiento mayor. Duplicar el número de parámetros, es decir, los números aprendidos del modelo, no tiene por qué duplicar la calidad: la ventaja también depende de la cantidad de datos. Kaplan y colaboradores, §3–6, describen estas relaciones; el trabajo Chinchilla estudia el reparto del presupuesto entre el modelo y los datos.
Es una herramienta de planificación, no una ley que garantice que un modelo mayor resolverá mejor todas las tareas. Una pérdida de predicción del texto menor no hace automáticamente más verdaderas las respuestas. Cambiar los datos, la arquitectura o el objetivo del entrenamiento puede requerir nuevas mediciones.