Test-Time Scaling
Das Modell beantwortet eine schwierige Aufgabe falsch. Statt sofort ein größeres Modell zu bauen, gibst du ihm mehr Zeit: Es kann mehrere Lösungen vorbereiten, vergleichen oder zusätzlich prüfen. Verbessert ein größeres Arbeitsbudget das Ergebnis?
Test-time Scaling ist das Erhöhen der Berechnungen beim Lösen einer Aufgabe durch ein bereits trainiertes System. Die aufeinanderfolgenden Arbeitsschritte können verlängert oder mehr Versuche parallel ausgeführt werden. Es betrifft die Nutzung des Budgets an Test-time Compute.
Beispiel: Statt einer Antwort auf eine Mathematikaufgabe entstehen acht Vorschläge, und ein Prüfprogramm wählt denjenigen, der die Bedingungen erfüllt. Mehr Versuche erhöhen die Chance auf eine gute Lösung nur dann, wenn das Modell eine solche Lösung erzeugen kann und die Auswahl sie tatsächlich erkennt. Acht identische Fehler helfen wenig.
Snell und Mitautoren, §3–5, untersuchen die Aufteilung eines solchen Budgets. Der Nutzen hängt von der Aufgabe und dem Verfahren ab; eine längere Antwort allein belegt kein besseres Schlussfolgern. In dieser Unterscheidung bleiben die Modellgewichte konstant. Ihr Training während einer neuen Aufgabe ist Test-time Training.
Verbindungen
Prefix Sliding. Das Denken darf lang sein, der Speicher nicht [Polski]