Back to archive
#ai#papers#aigen#llm#training

Sharpening Tax

Model może lepiej wykonywać pojedynczą próbę, a jednocześnie mniej zyskiwać z ponawiania zadania. Sharpening Tax to zaproponowana w Sharpening Tax in Post-Training miara zmiany korzyści z powtórek po dalszym treningu modelu. Jej mechanizm i ograniczenia opisuje notatka o skuteczności powtórek agenta.

Punktem wyjścia jest pass@k: prawdopodobieństwo uzyskania przynajmniej jednego poprawnego wykonania wśród k prób. Dla kolejnych budżetów powstaje krzywa. Nie wskazuje ona, którą odpowiedź należy wybrać; do praktycznego wykorzystania udanej próby potrzebny jest weryfikator.

Pole pod różnicą względem końcowego wyniku

Oznaczmy skuteczność przy budżecie k przez C(k), a maksymalny rozpatrywany budżet przez K. Autorzy definiują:

A(K)=∑k=1K−1[C(K)−C(k)].A(K)=\sum_{k=1}^{K-1}\left[C(K)-C(k)\right].

Dla każdego mniejszego budżetu odejmujemy aktualną skuteczność od wyniku przy pełnym budżecie. Dodajemy te różnice. Duża wartość oznacza, że sukcesy pojawiają się dopiero po dołożeniu prób. W rachunku skuteczność zapisujemy jako prawdopodobieństwo od zera do jednego.

Poniższy rachunek jest przykładem dydaktycznym, nie wynikiem papera. Przy budżetach jednej, dwóch i trzech prób skuteczność wynosi odpowiednio 0,2, 0,4 i 0,6. Dla K = 3 suma wynosi (0,6 − 0,2) + (0,6 − 0,4), czyli 0,6. Jeżeli inny model osiąga 0,6 już w jednej próbie i zachowuje ten wynik, suma wynosi zero. Brak dalszego przyrostu może więc wynikać z szybszego osiągnięcia tego samego wyniku, nie z jego pogorszenia.

Normalizacja i porównanie modeli

Wersja znormalizowana uwzględnia odsetek zadań nieudanych w pojedynczej próbie:

S(K)=A(K)(K−1)[1−C(1)].S(K)=\frac{A(K)}{(K-1)\left[1-C(1)\right]}.

W podanym przykładzie mianownik wynosi 2 razy 0,8, czyli 1,6; S(3) wynosi 0,375. K musi być liczbą całkowitą nie mniejszą niż dwa. Gdy C(1) wynosi jeden, mianownik jest zerowy i ten wariant miary nie jest określony.

Znormalizowany Sharpening Tax jest różnicą między skalowalnością wersji bazowej a skalowalnością po dalszym treningu:

TaxS(K)=Sbase(K)−Spost(K).\mathrm{Tax}_{S}(K)=S_{\mathrm{base}}(K)-S_{\mathrm{post}}(K).

Porównanie wymaga tych samych zadań, budżetu i reguł wyznaczania skuteczności. Dodatnia wartość oznacza mniejsze korzyści z dokładania prób po treningu według tej miary. Nie dowodzi sama w sobie, że końcowy pass@K jest niższy.

Zerowy wynik może opisywać sukces albo całkowitą porażkę

Jeśli model zawsze odnosi sukces, wszystkie różnice w A(K) są zerowe. Tak samo jest, jeśli nie odnosi sukcesu przy żadnym budżecie. Dlatego A(K), S(K) i ich różnice trzeba odczytywać razem z krzywą pass@k i jej końcowym punktem.

W pracy autorzy szacują krzywe z liczby sukcesów osobno dla każdego zadania, a następnie uśredniają zadania z równymi wagami. Skończona liczba prób nie pozwala utożsamić braku zaobserwowanego sukcesu z zerowym prawdopodobieństwem sukcesu. W zastosowaniu porównuj zmianę korzyści z powtórek z końcową skutecznością oraz kosztem uzyskania sprawdzonego rezultatu.

Źródło: Changdae Oh i współautorzy, Sharpening Tax in Post-Training, §4 i dodatki B.1–B.2, preprint arXiv:2610.01509v1 z 1 października 2026, na licencji CC BY 4.0.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.