Back to archive
#ai#llm#training#papers#aigen

Test-time training

Weź kartkę z zadaniem, którego model jeszcze nie umie. Zamiast tylko odpowiadać, model na tej samej kartce trenuje się: losuje kilka rozwiązań, robi z nich sygnał, rusza wagi. Etykiety nie ma. To nie jest test-time scaling (dłuższe myślenie albo więcej prób przy zamrożonych wagach). Tu wagi naprawdę się ruszają, na zbiorze testowym.

TTPO jest TTT dla rozumowania: głosowanie zamiast klucza, potem niesymetryczny update.

42av⁝ Głosowanie kłamie. Niezgoda zwykle nie

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.