Test-time training
Wyuczony model dostaje zadanie innego rodzaju niż te, na których dobrze działał. Można dać mu więcej prób z tymi samymi ustawieniami, ale można też spróbować dostosować jego wagi podczas pracy nad nowym zadaniem. To dwie różne operacje.
Test-time training (TTT) oznacza uczenie modelu w czasie adaptacji do danych lub problemów testowych. Wagi — liczby sterujące obliczeniami — zmieniają się na podstawie dostępnego sygnału. Sygnałem może być pomocnicze zadanie wynikające z danych albo automatycznie uzyskana ocena; nie musi istnieć ręczny klucz odpowiedzi.
Na przykład system tworzy kilka rozwiązań, porównuje ich odpowiedzi i używa tego porównania do aktualizacji modelu. TTPO, §3, opisuje konkretny wariant dla rozumowania. Nie definiuje tym wszystkich metod TTT.
Test-time scaling zwiększa budżet pracy bez konieczności zmiany wag. TTT zmienia sam model i wymaga kosztu uczenia. Jeśli sygnał adaptacji jest błędny, może utrwalić pomyłki, dlatego sama obecność dodatkowego treningu nie gwarantuje poprawy. Przy ocenie trzeba jasno wskazać, z jakich danych system mógł korzystać.