El mismo ranking produce decisiones distintas al cambiar el orden
Un sistema que responde preguntas a partir de documentos suele funcionar en cuatro pasos. El buscador encuentra candidatos, el modelo de puntuación asigna a cada uno un número que indica su utilidad, un umbral descarta las puntuaciones demasiado bajas y el modelo lector prepara la respuesta a partir de los documentos restantes. El usuario ve la respuesta, no el ranking intermedio.
Si el modelo de puntuación recibe los mismos documentos en otro orden y cambia varios valores cercanos al umbral, el lector puede recibir otro material de referencia. La consulta y el conjunto de candidatos permanecen iguales. Solo cambia su lugar en el prompt y, aun así, el sistema toma otra decisión.
Reordenar los candidatos es hacer reranking. Suele evaluarse mediante la calidad del orden de los documentos, pero una métrica así puede apenas reaccionar al intercambio de dos posiciones de relevancia similar. El umbral responde a sus puntuaciones absolutas y puede dejar pasar un conjunto distinto.
Un prompt compartido hace que la puntuación dependa de la posición y de los documentos vecinos
Un modelo de puntuación pointwise clásico evalúa un documento en una pasada hacia delante. La puntuación pointwise por lotes coloca varios documentos en un prompt compartido y obtiene una puntuación separada para cada uno. La instrucción, la consulta y la rúbrica se procesan entonces una sola vez para todo el grupo, lo que reduce el coste de inferencia.
Sin embargo, el prompt compartido cambia el propio cálculo. La puntuación del documento depende de su contenido, de su posición en la ventana y de los demás documentos de esa ventana. El efecto de la posición corresponde a la sensibilidad del modelo al lugar de la información en un contexto largo [Polski]. Aquí se añade el efecto de los candidatos vecinos.
En el sistema estudiado, el modelo no generaba las puntuaciones como texto. Se leía la distribución de probabilidad de cuatro tokens de evaluación y se calculaba a partir de ella una puntuación continua. No se sorteaban tokens y la temperatura no intervenía en el cálculo. Lo que cambiaba era el orden de los candidatos en el prompt.
El umbral convierte un pequeño cambio de puntuación en otro conjunto de documentos
Los seis documentos siguientes son un ejemplo preparado para la explicación, no datos del estudio. Los documentos C y D tienen la misma valoración real de relevancia. El modelo de puntuación recibe dos veces los mismos objetos; solo cambia el orden en el prompt. El umbral es fijo y vale 0,50.
| Documento | Valoración real | Puntuación en el orden 1 | Puntuación en el orden 2 | Decisión 1 | Decisión 2 |
|---|---|---|---|---|---|
| A | 3 | 0,83 | 0,81 | conservar | conservar |
| B | 3 | 0,80 | 0,78 | conservar | conservar |
| C | 2 | 0,52 | 0,49 | conservar | descartar |
| D | 2 | 0,48 | 0,51 | descartar | conservar |
| E | 1 | 0,29 | 0,30 | descartar | descartar |
| F | 0 | 0,08 | 0,07 | descartar | descartar |
nDCG@10 mide si los documentos con una valoración alta de relevancia ocupan posiciones altas en el ranking, dando más peso a las primeras posiciones. Intercambiar C y D no reduce esta métrica, porque ambos documentos tienen una valoración de 2. Sin embargo, el umbral conserva unas veces A, B y C, y otras A, B y D.
El coeficiente de Jaccard divide el número de elementos comunes por el número de elementos de la unión de los conjuntos. Aquí, la intersección contiene A y B, y la unión, A, B, C y D, así que el resultado es 2/4 = 0,50. Las seis filas corresponden a los candidatos, cada columna de puntuación corresponde a una permutación, el umbral de 0,50 corresponde al cutoff congelado y los dos conjuntos elegidos corresponden a los retained sets que se entregan al siguiente componente.
Permutar los candidatos revela un error invisible para nDCG@10
Los autores repetían la puntuación de los mismos candidatos después de permutarlos aleatoriamente. Para cada colección, habían ajustado previamente el umbral según F1 y lo habían congelado antes de la medición principal. Los modelos lectores y el mecanismo de selección del par chosen–rejected también permanecían sin cambios. Así, las salidas sucesivas diferían por el comportamiento del modelo de puntuación, no por volver a ajustar el componente posterior.
En el experimento principal de reranking de pasajes sobre 18 colecciones, Qwen3-4B evaluaba ventanas de 20 documentos en 10 permutaciones. Los resultados eran la media de tres semillas, y el checkpoint de cada variante se elegía en una partición reservada según la calidad del ranking. Las cinco variantes entrenadas diferían como máximo en 0,010 puntos de nDCG@10. El solapamiento de los retained sets era 0,656 para SFT con un solo orden y 0,835 para OC-SFT. Un solapamiento mayor significa que el umbral dejaba pasar con más frecuencia los mismos documentos después de cambiar el orden de entrada.
Este resultado se refiere a modelos de puntuación concretos con un prompt compartido. Muestra la separación entre dos mediciones: nDCG@10 comprueba el orden, y el solapamiento de los conjuntos conservados comprueba la decisión del umbral. En QA con múltiples documentos y en ranking de respuestas, tras OC-SFT cambiaban con menor frecuencia, respectivamente, la respuesta del lector y el par de entrenamiento; las configuraciones y los valores completos están en el apéndice técnico.
OC-SFT penaliza la divergencia de puntuaciones entre dos órdenes
El SFT habitual con un solo orden adapta el modelo estudiante a las puntuaciones del modelo profesor para un orden. No contiene una condición que vincule la puntuación de un documento con su puntuación después de permutar la ventana.
El SFT con consistencia de orden (OC-SFT) presenta al estudiante dos permutaciones de la misma ventana. Para cada candidato calcula la media de las dos puntuaciones, y la pérdida de consistencia penaliza la desviación de ambos valores respecto a esa media. La primera vista conserva la pérdida estándar respecto a la valoración del modelo profesor, por lo que el entrenamiento sigue requiriendo una valoración correcta de relevancia.
En el ejemplo, el documento C recibió 0,52 y 0,49. La media es 0,505, así que la pérdida de consistencia desplaza ambas puntuaciones hacia ella. El SFT normal ve uno de estos valores; OC-SFT recibe ambos y reduce directamente su divergencia. Realiza el mismo cálculo por separado para cada candidato de la ventana.
Dos vistas requieren aproximadamente el doble de pasadas hacia delante por paso de entrenamiento que una sola vista. Después del entrenamiento, el modelo sigue procesando un único orden en cada consulta. La alternativa en tiempo de inferencia, batched self-consistency, repite la puntuación para varias permutaciones al atender cada consulta.
El método reduce el error, pero no garantiza la invariancia
OC-SFT reduce la dependencia del orden, pero no la elimina. Promediar varias permutaciones durante la inferencia seguía mejorando la repetibilidad de los modelos después del entrenamiento. El método traslada parte del coste al entrenamiento, pero no da una garantía matemática de puntuaciones idénticas.
El estudio abarca datos en inglés, un único esquema de respuesta, modelos de puntuación sin cadena de pensamiento y ventanas de como máximo 20 candidatos. No evalúa recuperación que requiera razonamiento intensivo ni configuraciones de prompt más largas. El umbral, el lector y el modelo de preferencias estaban congelados; un componente posterior entrenado junto con el modelo de puntuación podría aprender a compensar parte de la variabilidad. Dos colecciones jurídicas son propietarias.
El peso de la consistencia y el checkpoint se elegían por separado para cada tarea en una partición reservada, exclusivamente según la calidad del ranking. Por tanto, los resultados no proceden de un único checkpoint y un único peso aplicados sin ajuste a todas las configuraciones.
La fuente es el preprint arXiv v1 Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers, de Markus Frohmann, Mahdiyar Alavi, Elizabeth Lingg y Navid Rekabsaz, publicado por primera vez el 27 de agosto de 2026. Áreas: computación y lenguaje, recuperación de información y aprendizaje automático; arXiv:2608.26762, DOI: 10.48550/arXiv.2608.26762.
Detalles del experimento
- Reranking de pasajes. El entrenamiento utilizó MS MARCO: unas 30 mil consultas y 3 millones de valoraciones de documentos. La evaluación abarcó DL19–DL23; once colecciones de BEIR: NFCorpus, FiQA, Touche-2020, ArguAna, Climate-FEVER, TREC-COVID, DBPedia, SciFact, Signal-1M, TREC-NEWS y Robust04; y las propietarias Legal-A y Legal-B. Las listas públicas de candidatos procedían de BM25, mientras que los conjuntos jurídicos tenían grupos ya preparados.
- QA con múltiples documentos. El entrenamiento se realizó con HotpotQA, y la transferencia zero-shot, con 2WikiMultiHopQA y MuSiQue. Cada pregunta tenía 10 fragmentos, de los que 2 sustentaban la respuesta.
- Ranking de respuestas. El entrenamiento utilizó unos 30,7 mil prompts de UltraFeedback. La evaluación abarcó RewardBench-2, Nectar, PPE-MATH, PPE MMLU-Pro y RM-Bench.
- Puntuación y coste de medición. En el reranking, 100 candidatos se dividían en cinco ventanas de 20. Una permutación requería cinco pasadas hacia delante por lotes; 10 permutaciones requerían 50. La inferencia normal con un solo orden realizaba cinco llamadas de ese tipo. Con una anchura de 20, el procesamiento por lotes era aproximadamente un 45% más rápido por consulta que la variante pointwise.
- Entrenamiento. El modelo principal era Qwen3-4B. Los autores utilizaron LoRA con rango 16, alpha 32 y dropout 0,05. OC-SFT utilizaba dos vistas. Los pesos objetivo de consistencia eran 5 para reranking, 3 para QA y 1 para ranking de respuestas; cada peso y checkpoint se elegían en una partición reservada según la calidad del ranking. Los resultados entrenados son la media de tres semillas.
- Prueba más amplia de modelos. La comparación incluyó 11 modelos base densos de 1,7B a 32B de las familias Qwen3, Gemma 4 y Granite 4.1, además del modelo disperso Mixture-of-Experts Gemma-4 26B-A4B. OC-SFT tenía un τ-PSI medio menor que la destilación promediada por orden en los 12 modelos.
- Coste del estudio. Entrenar al estudiante para el resultado principal con las silver labels publicadas llevó unas 90 horas de GPU en un nodo con ocho A100-40GB. La evaluación pública completa requiere 60–90 horas en una L40S-48GB; todo el estudio, incluidas las pruebas no publicadas, consumió unas 100 mil horas de GPU.
| Tarea | SFT con un solo orden | OC-SFT |
|---|---|---|
| reranking de pasajes, 18 colecciones, B = 20 | nDCG@10 0,449; τ-PSI 0,209; retained-set overlap 0,656 | nDCG@10 0,459; τ-PSI 0,083; retained-set overlap 0,835 |
| QA con múltiples documentos, 3 colecciones, B = 10 | nDCG@10 0,951; τ-PSI 0,159; answer flip 0,177 | nDCG@10 0,961; τ-PSI 0,096; answer flip 0,125 |
| ranking de respuestas, 5 colecciones, B = 4 | nDCG@1 0,684; τ-PSI 0,333; pair flip 0,869 | nDCG@1 0,701; τ-PSI 0,201; pair flip 0,661 |
τ-PSI mide el desacuerdo de los rankings entre pares de permutaciones: 0 significa rankings idénticos; 0,5, ausencia de correlación; y 1, un ranking invertido. Para τ-PSI, answer flip y pair flip, un valor menor es mejor; para nDCG y retained-set overlap, es mejor un valor mayor.
En un sistema que utiliza un umbral, un lector o la selección de pares de entrenamiento, la prueba previa al despliegue debería permutar el mismo conjunto de candidatos y comprobar retained-set overlap, answer flip o pair flip. Si cambia la decisión del componente posterior, un nDCG@10 parecido no basta como criterio para elegir el modelo de puntuación.