Volver al archivo
#ai#papers#aigen#llm#inference

Los errores de cuantización se compensan parcialmente entre las capas del modelo

Quieres ejecutar un modelo de lenguaje en tu propia tarjeta gráfica, pero sus pesos ocupan demasiada memoria. Una solución es la cuantización posterior al entrenamiento: sustituyes los números guardados en el modelo ya entrenado por valores de un conjunto más pequeño. Ahorras espacio a costa de la precisión de la representación.

Sin embargo, esos números participan en los cálculos de cada fragmento posterior de la respuesta. El modelo predice el siguiente token, es decir, una unidad de texto, utilizando el texto anterior y sus pesos. Después de la cuantización dispone de aproximaciones de esos pesos. El error puede cambiar la elección del token y, entonces, el resto de la respuesta se genera con un historial distinto.

Por ello cabe esperar que las desviaciones se acumulen al atravesar las capas sucesivas. Sin embargo, el modelo comprimido suele conservar una calidad útil. Saber que cada redondeo es pequeño no explica por sí solo qué ocurre con sus efectos decenas de operaciones después.

Dentro del modelo, los errores tienen direcciones. La desviación producida por el bloque actual puede cancelar parcialmente la desviación heredada de los cálculos anteriores. El preprint «Why Does Post-Training Quantization Work?» estudia esta relación en el ámbito de la compresión de modelos y la inferencia de LLM, es decir, su ejecución después del entrenamiento. Los autores también comprueban qué ocurre cuando eliminan deliberadamente esa compensación.

El bloque procesa una entrada ya modificada por las capas anteriores

Un Transformer mantiene el resultado intermedio del cálculo como un vector, es decir, una lista ordenada de números. El vector describe el texto procesado hasta ese momento y pasa por los bloques sucesivos. Gracias a una conexión residual, el bloque suma su propio resultado a la entrada recibida. Por tanto, transmite la suma: la entrada más la actualización calculada.

Comparemos dos ejecuciones para el mismo texto: el modelo con los pesos originales y su versión cuantizada. Al entrar en un bloque determinado, sus vectores ya son distintos. El bloque también calcula dos actualizaciones diferentes porque tiene tanto pesos como entradas diferentes. La diferencia entre actualizaciones incluye ambos efectos; no puede identificarse únicamente con un nuevo error de redondeo de los pesos.

Después de la suma, la diferencia de las salidas es la suma de la diferencia de las entradas y la diferencia de las actualizaciones. Es una consecuencia normal de la conexión residual. Si las dos diferencias tienen direcciones parcialmente opuestas, su suma puede ser menor que el error heredado de la entrada. Durante su funcionamiento normal, el modelo no calcula estas diferencias ni se compara con una copia más precisa. Los investigadores realizan esa comparación ejecutando ambas versiones una junto a otra.

El mismo tamaño de error puede producir otra suma

Tomemos un ejemplo didáctico con vectores de dos números. Son números preparados, no mediciones del trabajo. El signo de cada coordenada indica en qué dirección se desvía el resultado del valor de referencia.

Etapa de un bloquePesos originalesDespués de cuantizarDiferencia: cuantizado menos original
Entrada(10, 10)(13, 10)(3, 0)
Actualización calculada por el bloque(0, 2)(-1, 3)(-1, 1)
Salida: entrada más actualización(10, 12)(12, 13)(2, 1)

En el estudio, la entrada es el estado oculto en el límite entre bloques, y la actualización es el resultado añadido mediante la conexión residual. Las dos columnas corresponden a ejecuciones del mismo modelo antes y después de cuantizarlo. La diferencia de las entradas (3, 0) y la diferencia de las actualizaciones (-1, 1) suman (2, 1). La primera coordenada se acerca al resultado de referencia, aunque en la segunda aparece una nueva desviación.

Calcularemos el tamaño de la desviación como la suma de los cuadrados de las coordenadas. Antes del bloque es 3² + 0² = 9, y después, 2² + 1² = 5. Aquí, un valor menor significa una diferencia menor entre las ejecuciones. Es una medida del error interno, sin conversión directa al porcentaje de respuestas correctas.

Ahora cambiemos solo la dirección de la diferencia de las actualizaciones. Sustituyamos (-1, 1) por (0, √2), donde √2 representa la raíz cuadrada de dos. Ambos vectores tienen la misma suma de cuadrados, igual a 2, pero el nuevo es perpendicular a la diferencia de las entradas. Al sumar obtenemos (3, √2), con una suma de cuadrados de 9 + 2 = 11. Hemos eliminado la componente que reducía la primera desviación, conservando el tamaño de la diferencia añadida.

Esta última operación corresponde a la intervención de los autores: eliminan de la diferencia de las actualizaciones la componente paralela al error de entrada y después restablecen su longitud original. En el modelo real, los vectores tienen muchas coordenadas y la intervención abarca una serie de bloques. En cada paso se vuelve a calcular la actualización a partir de la entrada ya modificada. Nuestro único paso omite esos cálculos posteriores y los cambios de longitud del vector de referencia.

Eliminar la compensación aumenta el error con los mismos pesos

En el experimento principal, los autores utilizan un Qwen3-32B ya entrenado y redondean determinados pesos a un formato de cuatro bits. No ajustan el modelo ni eligen los redondeos con datos de calibración. La cuantización normal reduce la exactitud media en seis pruebas de elección de respuestas en 0,43 puntos porcentuales respecto a los pesos originales. Las tareas exactas y el método de evaluación se describen en el apéndice de abajo.

Un experimento separado examina la causa del crecimiento lento de los errores. Con fragmentos de texto de Internet del conjunto C4, los autores aplican la intervención anterior manteniendo el mismo modelo entrenado y los mismos pesos cuantizados. El error relativo final del estado oculto resulta 2,94 veces mayor que con la cuantización normal. «Relativo» significa la longitud de la diferencia entre los vectores dividida por la longitud del vector de referencia. En ambas comparaciones, la referencia para el error es el modelo sin cuantizar.

Es una intervención diagnóstica: los investigadores modifican los cálculos internos para comprobar el papel de la dirección del error. El resultado respalda la idea de que la cancelación parcial de las diferencias limita su crecimiento posterior. No significa un cambio de casi tres veces en la exactitud de las respuestas. La propia intervención también requiere una ejecución adicional de referencia, por lo que no se propone como técnica de inferencia barata.

Los autores observan cómo aumenta esta compensación durante el entrenamiento al analizar sucesivos archivos de pesos. Sin embargo, no determinan qué propiedad del entrenamiento la causa. Suponer que cada nuevo modelo aprenderá automáticamente a compensar los errores igual de bien iría más allá del resultado del trabajo.

El vector de salida y la elección del token son dos mediciones distintas

El último vector pasa a la cabeza del modelo de lenguaje, la capa que calcula una puntuación numérica para cada token del vocabulario. Cada token tiene su propio vector de pesos. Su puntuación se obtiene multiplicando las coordenadas correspondientes y sumando los resultados. Por eso, el efecto del cambio del estado oculto también depende de su orientación respecto a los pesos de cada token.

En los modelos estudiados, las puntuaciones de los tokens mejor clasificados son más estables tras la cuantización que las de los tokens en posiciones inferiores. Los autores explican esta observación mediante la geometría de los vectores y contrastan las aproximaciones teóricas con las mediciones. Sin embargo, la derivación supone una dirección de rotación del estado oculto elegida de forma uniforme y aleatoria. No ofrece una garantía para cualquier dirección del error real.

Incluso pequeños cambios de puntuación pueden intercambiar dos candidatos cercanos. Una calidad media estable y un texto de respuesta idéntico son requisitos diferentes. En una aplicación que espera una llamada concreta a una herramienta, el segundo también importa.

Antes del despliegue hay que evaluar las respuestas completas generadas

La limitación principal del estudio procede del historial de texto compartido. En los análisis de tokens, ambas versiones del modelo reciben los mismos tokens anteriores. El experimento no sigue cómo la primera elección diferente modifica una respuesta larga generada libremente. Del mismo modo, el análisis geométrico describe un comportamiento medio; no excluye grandes desviaciones poco frecuentes.

Detalles del experimento

Fuente y checkpoint. Yuxiang Chen, Michael Beyer, Jun Zhu y Jianfei Chen, «Why Does Post-Training Quantization Work?», arXiv:2609.11716v1, presentado por primera vez el 10 de septiembre de 2026. El trabajo es un preprint. La comparación principal utiliza el checkpoint entrenado y publicado de Qwen3-32B, un modelo de 32 mil millones de parámetros. No hay una etapa de entrenamiento posterior a la cuantización ni una selección del mejor checkpoint según sus resultados. Las comparaciones con pesos aleatorios y etapas anteriores del entrenamiento son análisis diagnósticos separados.

Formato de los pesos. La referencia es BF16 [Polski], un formato de coma flotante de dieciséis bits. La variante W4 usa NVFP4 y RTN, es decir, el redondeo al valor representable más cercano. La cuantización abarca las matrices de proyección de self-attention, el mecanismo de intercambio de información entre posiciones del texto, y de MLP, la red que procesa el vector de cada posición. Los vectores de entrada asignados a los tokens, las capas de normalización, los resultados intermedios y la LM head permanecen en su precisión original. NVFP4 combina valores de cuatro bits con una escala adicional para cada grupo de 16 elementos y una escala para toda la matriz. Los autores simulan el redondeo y reconstruyen los pesos para los cálculos. No miden la aceleración ni la memoria de un motor que opere sobre pesos de cuatro bits empaquetados.

Textos y agregación. El análisis estándar de tokens abarca 64 secuencias elegidas aleatoriamente, con 512 posiciones de predicción, por cada conjunto: C4 (textos de Internet), WikiText-103 (Wikipedia) y GSM8K (problemas matemáticos con soluciones de referencia). En GSM8K, el modelo predice el siguiente token del texto correcto proporcionado, así que el resultado no mide la resolución autónoma de los problemas. Las estadísticas se promedian primero por posiciones y luego por entradas. Las barras de error de los análisis de tokens muestran la desviación estándar entre entradas completas, no la incertidumbre de la media.

Intervención. El resultado de 2,94× procede de Qwen3-32B en C4, con RTN NVFP4, eliminando la compensación en los bloques 17–48; la comparación es W4 normal y la medida es el error relativo final del estado oculto (fig. 3A, sección 3.3, apéndice E.7). La longitud de la diferencia de las actualizaciones se conserva localmente al modificarla. Los bloques posteriores reciben el estado cambiado, así que sus diferencias ya pueden tener una longitud distinta de la ejecución sin intervención. El estudio completo también incluye invertir la dirección cuando la interacción es negativa y medir los cambios de la distribución de probabilidad de los tokens. Para construir estas ejecuciones hacen falta cálculos de referencia, cuantizados y pasadas adicionales con intervenciones; la publicación no indica el coste total en horas de GPU.

Filtros. En el cálculo de los componentes del error de la fig. 2 se omitieron la primera posición de la secuencia y las trayectorias en las que la diferencia relativa de longitud entre estados superaba 0,5 a cualquier profundidad. El segundo filtro eliminó el 0,08% de las posiciones de Qwen3-32B en C4. El apéndice también muestra resultados sin ese filtro. No debe trasladarse esta selección a las pruebas de exactitud de respuestas ni tratar el análisis de las trayectorias típicas como una garantía para casos extremos.

Pruebas de respuestas. La caída media de 0,43 puntos porcentuales corresponde a Qwen3-32B, W4 frente a BF16, sin ejemplos de la tarea en el prompt ni plantilla de chat. Se utilizaron los conjuntos de prueba completos de ARC-Challenge, ARC-Easy y MMLU, y los de validación de HellaSwag, WinoGrande y TruthfulQA. Incluyen preguntas de conocimiento, elección de finales de texto, resolución de referencias pronominales y elección de respuestas verdaderas. ARC y HellaSwag evalúan la probabilidad de los candidatos normalizada por el número de caracteres; MMLU, las letras de las respuestas; WinoGrande, el final común de la frase condicionado al candidato; y TruthfulQA utiliza la exactitud MC1. Es una evaluación separada del análisis de estados ocultos. En C4, W4 normal cambia el token mejor puntuado en el 10,7% de las posiciones estudiadas, a pesar de los pequeños cambios medios de calidad (apéndice C.6).

Alcance de las comprobaciones adicionales. El trabajo incluye Qwen3-4B, 8B, 14B, 30B-A3B y 32B, OLMo3-7B y 32B, OLMoE-1B-7B, Gemma3-4B y Pythia-1.4B y 2.8B. El análisis del crecimiento de los errores compara Qwen3-32B con diez inicializaciones aleatorias; la referencia aleatoria para la geometría de la cabeza del modelo de lenguaje utiliza tres. También se estudiaron seis checkpoints de OLMo3-7B Stage-1 y etapas del entrenamiento de Pythia. Los apéndices contienen cuantización solo de activaciones, cuantización conjunta de pesos y activaciones, y GPTQ y AWQ, métodos que ajustan la cuantización con datos de calibración. No son las configuraciones del resultado de 2,94×. En la comparación de GPTQ y AWQ se utilizaron 64 entradas de calibración de C4 y ocho entradas de evaluación separadas; RTN no requiere calibración.

Yuxiang Chen, Michael Beyer, Jun Zhu, Jianfei Chen, Why Does Post-Training Quantization Work?, texto completo v1. Mecanismo: secciones 3–4; configuraciones: apéndice D.3; intervenciones: E.7; limitaciones: 5.4. Metadatos e historial de versiones, DOI: 10.48550/arXiv.2609.11716. La fuente se publicó bajo la licencia CC BY 4.0. El texto original es una explicación en polaco con un ejemplo numérico propio.

Mi recomendación al elegir una versión comprimida del modelo: medir el éxito de la tarea completa con prompts representativos, incluidas respuestas largas y llamadas a herramientas. Comparar solo los pesos o la exactitud media de pruebas cortas no comprueba los efectos de la divergencia del historial de generación. Conviene comparar por separado la corrección de las llamadas a herramientas y de las respuestas finales con el mismo método de generación.