Test-time scaling
Model odpowiada źle na trudne zadanie. Zamiast od razu budować większy model, dajesz mu więcej czasu: może przygotować kilka rozwiązań, porównać je albo przeprowadzić dodatkową weryfikację. Czy większy budżet pracy poprawi wynik?
Test-time scaling to zwiększanie obliczeń podczas rozwiązywania zadania przez już wyuczony system. Można wydłużyć kolejne kroki pracy albo uruchomić więcej prób równolegle. Dotyczy sposobu użycia budżetu Test-time Compute.
Przykład: zamiast jednej odpowiedzi na zadanie matematyczne powstaje osiem propozycji, a sprawdzający program wybiera tę, która spełnia warunki. Większa liczba prób zwiększa szansę znalezienia dobrego rozwiązania tylko wtedy, gdy model potrafi takie rozwiązanie wytworzyć, a wybór rzeczywiście je rozpoznaje. Osiem identycznych błędów niewiele pomaga.
Snell i współautorzy, §3–5, badają rozdział takiego budżetu. Korzyść zależy od zadania i procedury; dłuższa odpowiedź sama nie świadczy o lepszym rozumowaniu. W tym rozróżnieniu wagi modelu pozostają stałe. Ich uczenie podczas nowego zadania to Test-time training.