La votación miente. El desacuerdo normalmente no
En AIME 2026, la pseudoetiqueta obtenida por votación con Qwen3-1.7B es errónea en alrededor del 85% de las tareas. Aun así se puede aprender de ella, porque entre las respuestas que no coinciden con el grupo, alrededor del 79% también son erróneas.
Quieres que el modelo mejore en una tarea difícil ahora, mientras responde. No hay etiqueta. Esto es entrenamiento en tiempo de inferencia: entrenar con el mismo conjunto en el que el modelo debe responder.
On-policy self-distillation (OPSD) entrena token a token. Una segunda pasada del mismo modelo recibe la respuesta correcta en la consulta y, a partir de ella, mejora cada paso. Sin etiqueta, esa respuesta no está disponible. GRPO recibe una única recompensa por toda la solución, así que un resultado incorrecto de la votación estropea la actualización una vez. Si introduces la misma respuesta errónea en la destilación, el error entra en cada token.
Lo que había hasta ahora y TTPO
Un truco natural: muestrear K soluciones y tomar el grupo más numeroso como pseudoetiqueta. El artículo de TTPO (Wang et al., arXiv 2608.27448) lo llama majority voting. El algoritmo 1 utiliza la pluralidad. 3/8 o 4/8 no es una mayoría.
TTRL utiliza ese grupo como una recompensa para toda la solución. Si sustituyes la etiqueta de OPSD por el mismo grupo y destilas todas las soluciones, el error entra en cada token.
TTPO divide el grupo entre acuerdo con el grupo más numeroso (P) y desacuerdo (N). Destila solo P. Penaliza solo N. El peso de los tokens forma parte del método; no es una corrección añadida al final.
Ejemplo
En el experimento, el modelo muestrea K = 64 soluciones. Para la actualización toma ocho trayectorias (K_train = 8, la mitad de P y la mitad de N). Las ocho tarjetas de abajo son una analogía de este segundo paso, no de toda la votación.
7, 7, 7, 12, 19, 42, 4, 31
El grupo más numeroso es 7 (3/8). La respuesta verdadera es 42. 3/8 no es una mayoría. El grupo es incorrecto.
Acuerdo: los tres sietes. Desacuerdo: 12, 19, 42, 4, 31. Cuatro de los cinco desacuerdos son incorrectos. Uno es correcto. La penalización por «no 7» suele acertar, por tanto (en el artículo, alrededor del 79% de los desacuerdos son incorrectos cuando el grupo también lo es), pero aquí reduciría el peso de la única solución correcta.
Correspondencia con el algoritmo
| Tarjetas | Elemento de TTPO |
|---|---|
| 8 tarjetas | K_train = 8, después de muestrear K = 64 |
| 7 con una frecuencia de 3 | grupo más numeroso |
| tres sietes | conjunto P, pérdida OPSD |
| 12, 19, 42, 4, 31 | conjunto N, pérdida GRPO |
| 42 entre N | penalización errónea: solución correcta en el conjunto negativo |
El profesor de OPSD recibe en la consulta el mismo 7 que las tres soluciones concordantes ya produjeron. El gradiente no las arrastra hacia una respuesta ajena. Se reduce a destilar el modo con razonamiento en el modo sin razonamiento.
Pesos de los tokens: OPSD reduce el peso de las posiciones en las que el estudiante ya coincide con el profesor (entropía y divergencia KL, Soft-OR). GRPO conserva el 50% superior de los tokens según −log p multiplicado por la confianza y penaliza los errores seguros y poco probables. La mitad inferior, incluidos los pasos localmente correctos, no recibe penalización. En esta rama no hay una ventaja positiva que compense esa penalización.
Abajo aparece el mismo grupo de ocho. Verde: P. Rojo: N.
En una tarea fácil, el grupo más numeroso suele ser correcto y ambas acciones ayudan. En una difícil, donde hace falta TTT, lo importante es la división: destila solo el acuerdo, penaliza el desacuerdo y ten en cuenta que en N puede estar el 42.
Resultados
Tres configuraciones separadas.
OpenThoughts. TTPO no utiliza etiquetas; OPSD sí. Media en cinco benchmarks con Qwen3-1.7B: TTPO 40.1, OPSD 39.7.
TTT puro, entrenamiento con el conjunto de prueba, sin anotaciones. Qwen3-1.7B en AIME 2026, HMMT 2026 y BRUMO 2025: 38.0% → 45.2%.
Evaluación sin thinking mode tras entrenar con OpenThoughts, no tras TTT puro. Mejora respecto al modelo base: +25.2 (1.7B), +30.6 (4B), +36.4 (8B).
Los autores presentan el mejor checkpoint. TTPO: 100 pasos, medición cada 25.
Ablación en el difícil AIME: cuando casi ninguna solución muestreada acierta, la división según la verdad de referencia deja P vacío y una ventaja GRPO de cero. La división según el grupo más numeroso siempre tiene un P no vacío. Esto no significa que una etiqueta errónea enseñe mejor que una verdadera. Significa que, en este benchmark, la escasez de respuestas verdaderas estropea el routing, mientras que el grupo no lo estropea.
Qué no demuestra
Es un preprint reciente. Las tareas son problemas de matemáticas con una respuesta que se puede extraer y comparar automáticamente. El código sin pruebas o el texto abierto no proporcionan un grupo así.
Cuando K es pequeño o ninguna solución muestreada es correcta, la pluralidad es ruido. La penalización por desacuerdo a veces afecta a la única solución correcta.
Conclusión práctica: no introduzcas el contenido del grupo en todas las soluciones. Utilízalo solo para dividir entre P y N. Destila el acuerdo. Penaliza el desacuerdo. Ten presente que la pluralidad no es una mayoría y que entre N puede haber una respuesta correcta.
Conceptos
src: https://arxiv.org/abs/2608.27448 TTPO: Test-Time Policy Optimization (Wang, Lu, Wang, Lv et al.)