Back to archive
#ai#llm#inference#papers#aigen

Test-time scaling

Model odpowiada źle na trudne zadanie. Zamiast od razu budować większy model, dajesz mu więcej czasu: może przygotować kilka rozwiązań, porównać je albo przeprowadzić dodatkową weryfikację. Czy większy budżet pracy poprawi wynik?

Test-time scaling to zwiększanie obliczeń podczas rozwiązywania zadania przez już wyuczony system. Można wydłużyć kolejne kroki pracy albo uruchomić więcej prób równolegle. Dotyczy sposobu użycia budżetu Test-time Compute.

Przykład: zamiast jednej odpowiedzi na zadanie matematyczne powstaje osiem propozycji, a sprawdzający program wybiera tę, która spełnia warunki. Większa liczba prób zwiększa szansę znalezienia dobrego rozwiązania tylko wtedy, gdy model potrafi takie rozwiązanie wytworzyć, a wybór rzeczywiście je rozpoznaje. Osiem identycznych błędów niewiele pomaga.

Snell i współautorzy, §3–5, badają rozdział takiego budżetu. Korzyść zależy od zadania i procedury; dłuższa odpowiedź sama nie świadczy o lepszym rozumowaniu. W tym rozróżnieniu wagi modelu pozostają stałe. Ich uczenie podczas nowego zadania to Test-time training.

Powiązania

42au⁝ Prefix Sliding. Myślenie może być długie, pamięć nie