Abstimmungen lügen. Abweichungen meist nicht
Auf AIME 2026 ist das Pseudolabel aus der Abstimmung von Qwen3-1.7B bei ungefähr 85% der Aufgaben falsch. Trotzdem lässt sich daraus lernen, denn unter den Antworten, die vom Cluster abweichen, sind ungefähr 79% ebenfalls falsch.
Das Modell soll bei einer schwierigen Aufgabe jetzt, während der Antwort, besser werden. Ein Label gibt es nicht. Das ist Test-Time Training: Training auf demselben Datensatz, auf dem das Modell antworten soll.
On-policy Self-distillation (OPSD) trainiert Token für Token. Ein zweiter Durchlauf desselben Modells erhält die richtige Antwort in der Anfrage und verbessert auf dieser Grundlage jeden Schritt. Ohne Etikett ist diese Antwort nicht vorhanden. GRPO erhält eine einzige Belohnung für die gesamte Lösung; ein falsches Abstimmungsergebnis verdirbt die Aktualisierung daher einmal. Wenn du dieselbe falsche Antwort in die Destillation einfügst, gelangt der Fehler in jedes Token.
Bisherige Ansätze und TTPO
Ein naheliegender Trick: K Lösungen ziehen und den größten Cluster als Pseudolabel nehmen. Das TTPO-Paper (Wang et al., arXiv 2608.27448) nennt dies Majority Voting. Algorithmus 1 verwendet eine relative Mehrheit. 3/8 oder 4/8 sind keine absolute Mehrheit.
TTRL verwendet diesen Cluster als eine einzige Belohnung für die gesamte Lösung. Setzt man denselben Cluster an die Stelle des OPSD-Labels und destilliert alle Lösungen, geht der Fehler in jedes Token ein.
TTPO teilt die Gruppe in Übereinstimmung mit dem Cluster (P) und Abweichung (N). Es destilliert nur P und bestraft nur N. Die Tokengewichtung gehört zur Methode und ist keine nachträgliche Korrektur.
Beispiel
Im Experiment zieht das Modell K = 64 Lösungen. Zur Aktualisierung verwendet es acht Trajektorien (K_train = 8, je zur Hälfte aus P und N). Die acht Zettel unten veranschaulichen diesen zweiten Schritt, nicht die gesamte Abstimmung.
7, 7, 7, 12, 19, 42, 4, 31
Der größte Cluster ist 7 (3/8). Die richtige Antwort lautet 42. 3/8 sind keine absolute Mehrheit. Der Cluster ist falsch.
Übereinstimmung: drei Siebenen. Abweichung: 12, 19, 42, 4, 31. Vier der fünf abweichenden Antworten sind falsch. Eine ist korrekt. Die Strafe für „nicht 7“ trifft also meistens eine falsche Antwort (im Paper sind ungefähr 79% der abweichenden Antworten falsch, wenn auch der Cluster falsch ist). Hier würde sie aber das Gewicht der einzigen korrekten Lösung senken.
Übertragung auf den Algorithmus
| Zettel | TTPO-Element |
|---|---|
| 8 Zettel | K_train = 8, nach dem Ziehen von K = 64 |
| 7 mit einer Häufigkeit von 3 | größter Cluster |
| drei Siebenen | Menge P, OPSD-Verlust |
| 12, 19, 42, 4, 31 | Menge N, GRPO-Verlust |
| 42 unter N | falsche Strafe: korrekte Lösung in der negativen Menge |
Der OPSD-Lehrer erhält im Prompt dieselbe 7, die die drei übereinstimmenden Lösungen bereits geliefert haben. Der Gradient zieht sie nicht zu einer anderen Antwort. Es läuft auf eine Destillation vom Modus mit Denken in den Modus ohne Denken hinaus.
Tokengewichte: OPSD verringert das Gewicht an Positionen, an denen der Schüler bereits mit dem Lehrer übereinstimmt (Entropie und KL-Abweichung, Soft-OR). GRPO behält die oberen 50% der Tokens nach −log p mal Sicherheit und bestraft sichere, wenig wahrscheinliche Fehler. Die untere Hälfte, einschließlich lokal korrekter Schritte, erhält keine Strafe. In diesem Zweig gibt es keinen positiven Vorteil, der eine solche Strafe ausgleichen würde.
Unten dieselben acht Antworten. Grün: P. Rot: N.
Bei einer leichten Aufgabe ist der größte Cluster meistens korrekt, und beide Schritte helfen. Bei einer schwierigen Aufgabe, also dort, wo TTT gebraucht wird, zählt die Aufteilung: Nur Übereinstimmungen destillieren, Abweichungen bestrafen und damit rechnen, dass sich unter N eine 42 befinden kann.
Ergebnisse
Drei getrennte Versuchsanordnungen.
OpenThoughts. TTPO verwendet keine Labels, OPSD schon. Durchschnitt über fünf Benchmarks mit Qwen3-1.7B: TTPO 40.1, OPSD 39.7.
Reines TTT, Training auf dem Testdatensatz, ohne Annotationen. Qwen3-1.7B auf AIME 2026, HMMT 2026 und BRUMO 2025: 38.0% → 45.2%.
Evaluation ohne Thinking Mode nach dem Training auf OpenThoughts, nicht nach reinem TTT. Verbesserung gegenüber der Basis: +25.2 (1.7B), +30.6 (4B), +36.4 (8B).
Die Autoren berichten den besten Checkpoint. TTPO: 100 Schritte, Messung alle 25 Schritte.
Ablation auf dem schwierigen AIME: Wenn fast keine gezogene Lösung die richtige Antwort trifft, hinterlässt eine Aufteilung nach Ground Truth ein leeres P und einen GRPO-Vorteil von null. Die Aufteilung nach dem Cluster hat immer ein nichtleeres P. Das bedeutet nicht, dass ein falsches Label besser lehrt als ein richtiges. Es bedeutet, dass die seltene richtige Antwort auf diesem Benchmark das Routing beeinträchtigt, der Cluster dagegen nicht.
Was das nicht zeigt
Dies ist ein neuer Preprint. Die Aufgaben sind mathematische Probleme mit einer Antwort, die sich automatisch extrahieren und vergleichen lässt. Code ohne Tests oder offener Text liefern keinen solchen Cluster.
Wenn K klein ist oder keine gezogene Lösung korrekt ist, ist die relative Mehrheit Rauschen. Eine Strafe für Abweichung trifft manchmal die einzige korrekte Lösung.
Praktische Folgerung: Den Clusterinhalt nicht in alle Lösungen übertragen. Den Cluster nur zur Aufteilung in P und N verwenden. Übereinstimmung destillieren. Abweichung bestrafen. Dabei berücksichtigen, dass eine relative Mehrheit keine absolute Mehrheit ist und sich unter N eine korrekte Antwort befinden kann.
Begriffe
src: https://arxiv.org/abs/2608.27448 TTPO: Test-Time Policy Optimization (Wang, Lu, Wang, Lv et al.)