Cuantización posterior al entrenamiento
Ya tienes un modelo entrenado, pero ocupa demasiada memoria para ejecutarlo en el ordenador elegido. Gran parte del espacio corresponde a los números que controlan los cálculos. ¿Se pueden guardar con menos precisión y así reducir el modelo?
Post-training quantization (PTQ) reduce la precisión de los números después de terminar el entrenamiento principal. En la variante aplicada a los pesos, sustituye los valores aprendidos por números de un conjunto más pequeño, que pueden almacenarse con menos bits.
En un formato simplificado con un paso de 0,1, el peso 0,73 se convierte en 0,7. Ahorramos espacio, pero añadimos un error de −0,03. Los métodos más elaborados usan muestras de datos para elegir redondeos o escalas que deterioren menos el resultado. GPTQ, §3, describe uno de esos métodos.
Menos bits no significa automáticamente un consumo proporcionalmente menor de toda la memoria ni una ejecución más rápida. Se necesita un motor compatible con el formato; también existe el coste de las escalas y otros elementos. PTQ no es cualquier reentrenamiento del modelo. El artículo sobre la propagación de diferencias entre capas explica cómo afectan los errores a la respuesta.