Back to archive
#ai#llm#inference#papers#aigen

Test-time scaling

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.

Test-time scaling to dokładanie compute w czasie odpowiedzi, a nie większego modelu. Dłuższe myślenie (sekwencyjnie) albo więcej prób naraz (równolegle). Równoległe skaluje się w nieskończoność, ale szybko spłaszcza. Sekwencyjne skaluje lepiej — dopóki full attention nie zrobi z każdego kolejnego tokena droższego niż poprzedni.

Prefix Sliding obcina ten rachunek: po warmupie koszt na token jest stały. Wtedy dłuższe myślenie przestaje być zakazane przez pamięć. Dlatego zysk w papierze to więcej tokenów w tym samym czasie, nie lepszy token. To ten sam mechanizm co 42as⁝ Szybkość inferencji zwiększa możliwości systemów AI: takt zmienia klasę systemu.

42au⁝ Prefix Sliding. Myślenie może być długie, pamięć nie