Zurück zum Archiv
#ai#papers#aigen#llm#information-retrieval#training

Gleiche Rankingqualität, andere Entscheidungen nach einer Änderung der Reihenfolge

Ein System, das Fragen anhand von Dokumenten beantwortet, arbeitet häufig in vier Schritten. Eine Suchmaschine findet Kandidaten, ein Scorer weist jedem eine Zahl für seine Nützlichkeit zu, ein Schwellenwert verwirft zu niedrige Ergebnisse, und ein Reader-Modell erstellt aus den verbliebenen Dokumenten die Antwort. Der Nutzer sieht die Antwort, nicht das zwischenzeitliche Ranking.

Erhält der Scorer dieselben Dokumente in einer anderen Reihenfolge und verändert einige Scores nahe dem Schwellenwert, kann der Reader anderes Quellenmaterial bekommen. Anfrage und Kandidatenmenge bleiben gleich. Nur ihre Position im Prompt unterscheidet sich, trotzdem trifft das System eine andere Entscheidung.

Die erneute Sortierung von Kandidaten heißt Reranking. Meist bewertet man sie anhand der Qualität der Dokumentreihenfolge. Eine solche Metrik kann aber kaum auf den Tausch zweier ähnlich relevanter Positionen reagieren. Der Schwellenwert reagiert auf ihre absoluten Scores und kann eine andere Menge passieren lassen.

Ein gemeinsamer Prompt macht den Score von Position und Nachbardokumenten abhängig

Ein klassischer Pointwise Scorer bewertet ein Dokument in einem Forward Pass. Batched Pointwise Scoring setzt mehrere Dokumente in einen gemeinsamen Prompt und liest für jedes einen eigenen Score aus. Anweisung, Anfrage und Bewertungsrubrik werden dann einmal für die gesamte Gruppe verarbeitet. Das senkt die Inferenzkosten.

Der gemeinsame Prompt verändert jedoch die Berechnung selbst. Der Score eines Dokuments hängt von seinem Inhalt, seiner Position im Fenster und den übrigen Dokumenten in diesem Fenster ab. Der Positionseinfluss entspricht der Empfindlichkeit des Modells gegenüber der Informationsposition in langen Kontexten [Polski]. Hier kommt der Einfluss benachbarter Kandidaten hinzu.

Im untersuchten System erzeugte das Modell die Bewertungen nicht als Text. Die Wahrscheinlichkeitsverteilung von vier Bewertungs-Tokens wurde ausgelesen und daraus ein kontinuierlicher Score berechnet. Es wurden keine Tokens gezogen, und die Temperatur ging nicht in die Berechnung ein. Verändert wurde die Reihenfolge der Kandidaten im Prompt.

Ein Schwellenwert macht aus einer kleinen Scoreänderung eine andere Dokumentmenge

Die folgenden sechs Dokumente sind ein eigens zur Erklärung erstelltes Beispiel, keine Studiendaten. C und D haben dieselbe wahre Relevanzbewertung. Der Scorer erhält zweimal dieselben Objekte; nur die Reihenfolge im Prompt ändert sich. Der Schwellenwert ist fest und beträgt 0,50.

DokumentWahre BewertungScore in Reihenfolge 1Score in Reihenfolge 2Entscheidung 1Entscheidung 2
A30,830,81behaltenbehalten
B30,800,78behaltenbehalten
C20,520,49behaltenverwerfen
D20,480,51verwerfenbehalten
E10,290,30verwerfenverwerfen
F00,080,07verwerfenverwerfen

nDCG@10 misst, ob Dokumente mit hoher Relevanzbewertung weit oben im Ranking stehen, und gewichtet die ersten Positionen stärker. Der Tausch von C und D senkt diese Metrik nicht, denn beide haben die Bewertung 2. Der Schwellenwert behält aber einmal A, B und C, ein anderes Mal A, B und D.

Der Jaccard-Koeffizient teilt die Anzahl gemeinsamer Elemente durch die Anzahl der Elemente in der Vereinigungsmenge. Hier enthält die Schnittmenge A und B, die Vereinigung A, B, C und D. Das Ergebnis beträgt also 2/4 = 0,50. Die sechs Zeilen entsprechen den Kandidaten, jede Score-Spalte einer Permutation, der Schwellenwert 0,50 dem eingefrorenen Cutoff und die zwei ausgewählten Mengen den Retained Sets, die an die nächste Komponente weitergegeben werden.

Das Mischen der Kandidaten zeigt einen für nDCG@10 unsichtbaren Fehler

Die Autoren wiederholten das Scoring derselben Kandidaten nach zufälligen Permutationen. Für jede Sammlung hatten sie den Schwellenwert vorher anhand von F1 abgestimmt und vor der eigentlichen Messung eingefroren. Auch die Reader-Modelle und der Mechanismus zur Wahl eines Chosen–Rejected-Paars blieben gleich. So unterschieden sich die aufeinanderfolgenden Ausgaben wegen des Scorers und nicht wegen einer erneuten Abstimmung einer nachgelagerten Komponente.

Im Hauptexperiment zum Passage Reranking auf 18 Sammlungen bewertete Qwen3-4B Fenster mit jeweils 20 Dokumenten in 10 Permutationen. Die Ergebnisse wurden über drei Seeds gemittelt. Der Checkpoint jeder Variante wurde auf einem zurückgehaltenen Datensplit nach Rankingqualität gewählt. Die fünf trainierten Varianten unterschieden sich um höchstens 0,010 nDCG@10-Punkte. Die Überlappung der Retained Sets betrug 0,656 bei Single-Order SFT und 0,835 bei OC-SFT. Eine höhere Überlappung bedeutet, dass nach einer Änderung der Eingabereihenfolge häufiger dieselben Dokumente den Schwellenwert passierten.

Dieses Ergebnis betrifft konkrete Scorer mit gemeinsamem Prompt. Es zeigt die Trennung zweier Messungen: nDCG@10 prüft die Reihenfolge, Retained-Set Overlap die Entscheidung des Schwellenwerts. Bei Multi-Document QA und Response Ranking änderten sich nach OC-SFT die Reader-Antwort beziehungsweise das Trainingspaar seltener. Die vollständigen Einstellungen und Werte stehen im technischen Anhang.

OC-SFT bestraft Scoreabweichungen zwischen zwei Reihenfolgen

Gewöhnliches Single-Order SFT passt das Schülermodell für eine Reihenfolge an die Bewertungen des Lehrermodells an. Es enthält keine Bedingung, die den Score eines Dokuments mit seinem Score nach einer Permutation des Fensters verbindet.

Order-Consistency SFT (OC-SFT) zeigt dem Schüler zwei Permutationen desselben Fensters. Für jeden Kandidaten berechnet es den Mittelwert aus den zwei Scores. Der Konsistenzverlust bestraft die Abweichung beider Werte von diesem Mittelwert. Die erste Ansicht behält den gewöhnlichen Verlust gegenüber der Lehrerbewertung. Daher benötigt das Training weiterhin eine korrekte Relevanzbewertung.

Im Beispiel erhielt Dokument C 0,52 und 0,49. Der Mittelwert ist 0,505, und der Konsistenzverlust bewegt beide Scores in diese Richtung. Gewöhnliches SFT sieht einen dieser Werte; OC-SFT erhält beide und verringert ihre Abweichung unmittelbar. Dieselbe Rechnung wird für jeden Kandidaten im Fenster separat durchgeführt.

Zwei Ansichten benötigen pro Trainingsschritt ungefähr doppelt so viele Forward Passes wie eine Ansicht. Nach dem Training verarbeitet das Modell weiterhin eine Reihenfolge pro Anfrage. Die Alternative während der Inferenz, Batched Self-Consistency, wiederholt das Scoring für viele Permutationen bei jeder Anfrage.

Die Methode begrenzt den Fehler, garantiert aber keine Invarianz

OC-SFT verringert die Abhängigkeit von der Reihenfolge, beseitigt sie aber nicht. Das Mitteln mehrerer Permutationen während der Inferenz verbesserte weiterhin die Wiederholbarkeit der trainierten Modelle. Die Methode verschiebt einen Teil der Kosten ins Training, gibt aber keine mathematische Garantie für identische Scores.

Die Studie umfasst englische Daten, ein Antwortschema, Scorer ohne Chain-of-Thought und Fenster mit höchstens 20 Kandidaten. Sie prüft weder Retrieval mit intensiven Schlussfolgerungen noch längere Prompt-Konfigurationen. Schwellenwert, Reader und Präferenzmodell waren eingefroren. Eine gemeinsam mit dem Scorer trainierte nachgelagerte Komponente könnte lernen, einen Teil der Schwankungen auszugleichen. Zwei juristische Sammlungen sind proprietär.

Konsistenzgewicht und Checkpoint wurden für jede Aufgabe separat auf einem zurückgehaltenen Split ausschließlich anhand der Rankingqualität gewählt. Die Ergebnisse stammen somit nicht aus einem einzigen Checkpoint und einem einzigen Gewicht, die ohne Abstimmung auf alle Konfigurationen angewendet wurden.

Die Quelle ist der arXiv-v1-Preprint Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers von Markus Frohmann, Mahdiyar Alavi, Elizabeth Lingg und Navid Rekabsaz, erstmals veröffentlicht am 27. August 2026. Fachgebiete: Computation and Language, Information Retrieval und Machine Learning; arXiv:2608.26762, DOI: 10.48550/arXiv.2608.26762.

Einzelheiten des Experiments
  • Passage Reranking. Das Training nutzte MS MARCO: ungefähr 30 Tausend Anfragen und 3 Millionen Dokumentbewertungen. Die Evaluation umfasste DL19–DL23; elf BEIR-Sammlungen: NFCorpus, FiQA, Touche-2020, ArguAna, Climate-FEVER, TREC-COVID, DBPedia, SciFact, Signal-1M, TREC-NEWS und Robust04; sowie die proprietären Legal-A und Legal-B. Öffentliche Kandidatenlisten stammten von BM25; die juristischen Datensätze hatten vorbereitete Kandidatenmengen.
  • Multi-Document QA. Das Training erfolgte auf HotpotQA, der Zero-Shot-Transfer auf 2WikiMultiHopQA und MuSiQue. Jede Frage hatte 10 Textstücke, von denen 2 die Antwort stützten.
  • Response Ranking. Das Training nutzte ungefähr 30,7 Tausend UltraFeedback-Prompts. Die Evaluation umfasste RewardBench-2, Nectar, PPE-MATH, PPE MMLU-Pro und RM-Bench.
  • Scoring und Messkosten. Beim Reranking wurden 100 Kandidaten in fünf Fenster mit je 20 aufgeteilt. Eine Permutation benötigte fünf Batched Forward Passes, 10 Permutationen benötigten 50. Gewöhnliche Inferenz mit einer Reihenfolge führte fünf solcher Aufrufe aus. Bei einer Breite von 20 war Batching pro Anfrage ungefähr 45% schneller als die Pointwise-Variante.
  • Training. Das Hauptmodell ist Qwen3-4B. Die Autoren verwendeten LoRA mit Rang 16, Alpha 32 und Dropout 0,05. OC-SFT nutzte zwei Ansichten. Die Zielgewichte der Konsistenz betrugen 5 für Reranking, 3 für QA und 1 für Response Ranking. Jedes Gewicht und jeder Checkpoint wurde auf einem zurückgehaltenen Split anhand der Rankingqualität gewählt. Die trainierten Ergebnisse sind Mittelwerte über drei Seeds.
  • Breiterer Modelltest. Der Vergleich umfasste 11 dichte Basismodelle von 1,7B bis 32B aus den Familien Qwen3, Gemma 4 und Granite 4.1 sowie das dünn besetzte Mixture-of-Experts-Modell Gemma-4 26B-A4B. OC-SFT hatte bei allen 12 Modellen ein niedrigeres mittleres τ-PSI als die über Reihenfolgen gemittelte Destillation.
  • Aufwand der Studie. Das Schülertraining für das Hauptergebnis anhand veröffentlichter Silver Labels benötigte ungefähr 90 GPU-Stunden auf einem Knoten mit acht A100-40GB. Die vollständige öffentliche Evaluation benötigt 60–90 Stunden auf einer L40S-48GB; die gesamte Studie einschließlich nicht berichteter Versuche verbrauchte ungefähr 100 Tausend GPU-Stunden.
AufgabeSingle-Order SFTOC-SFT
Passage Reranking, 18 Sammlungen, B = 20nDCG@10 0,449; τ-PSI 0,209; Retained-Set Overlap 0,656nDCG@10 0,459; τ-PSI 0,083; Retained-Set Overlap 0,835
Multi-Document QA, 3 Sammlungen, B = 10nDCG@10 0,951; τ-PSI 0,159; Answer Flip 0,177nDCG@10 0,961; τ-PSI 0,096; Answer Flip 0,125
Response Ranking, 5 Sammlungen, B = 4nDCG@1 0,684; τ-PSI 0,333; Pair Flip 0,869nDCG@1 0,701; τ-PSI 0,201; Pair Flip 0,661

τ-PSI misst die Abweichung von Rankings zwischen Permutationspaaren: 0 bedeutet identische Rankings, 0,5 keine Korrelation und 1 ein umgekehrtes Ranking. Bei τ-PSI, Answer Flip und Pair Flip ist ein niedrigerer Wert besser; bei nDCG und Retained-Set Overlap ein höherer.

In einem System, das einen Schwellenwert, einen Reader oder die Auswahl von Trainingspaaren verwendet, sollte der Test vor der Bereitstellung dieselbe Kandidatenmenge mischen und Retained-Set Overlap, Answer Flip oder Pair Flip prüfen. Ändert sich die nachgelagerte Entscheidung, reicht ein ähnlicher nDCG@10-Wert als Auswahlkriterium für den Scorer nicht aus.

KI [Polski]