#ai#llm#inference#papers#aigen
Test-time scaling
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.
Test-time scaling to dokładanie compute w czasie odpowiedzi, a nie większego modelu. Dłuższe myślenie (sekwencyjnie) albo więcej prób naraz (równolegle). Równoległe skaluje się w nieskończoność, ale szybko spłaszcza. Sekwencyjne skaluje lepiej — dopóki full attention nie zrobi z każdego kolejnego tokena droższego niż poprzedni.
Prefix Sliding obcina ten rachunek: po warmupie koszt na token jest stały. Wtedy dłuższe myślenie przestaje być zakazane przez pamięć. Dlatego zysk w papierze to więcej tokenów w tym samym czasie, nie lepszy token. To ten sam mechanizm co 42as⁝ Szybkość inferencji zwiększa możliwości systemów AI: takt zmienia klasę systemu.