Sharpening Tax
Model może lepiej wykonywać pojedynczą próbę, a jednocześnie mniej zyskiwać z ponawiania zadania. Sharpening Tax to zaproponowana w Sharpening Tax in Post-Training miara zmiany korzyści z powtórek po dalszym treningu modelu. Jej mechanizm i ograniczenia opisuje notatka o skuteczności powtórek agenta.
Punktem wyjścia jest pass@k: prawdopodobieństwo uzyskania przynajmniej jednego poprawnego wykonania wśród k prób. Dla kolejnych budżetów powstaje krzywa. Nie wskazuje ona, którą odpowiedź należy wybrać; do praktycznego wykorzystania udanej próby potrzebny jest weryfikator.
Pole pod różnicą względem końcowego wyniku
Oznaczmy skuteczność przy budżecie k przez C(k), a maksymalny rozpatrywany budżet przez K. Autorzy definiują:
Dla każdego mniejszego budżetu odejmujemy aktualną skuteczność od wyniku przy pełnym budżecie. Dodajemy te różnice. Duża wartość oznacza, że sukcesy pojawiają się dopiero po dołożeniu prób. W rachunku skuteczność zapisujemy jako prawdopodobieństwo od zera do jednego.
Poniższy rachunek jest przykładem dydaktycznym, nie wynikiem papera. Przy budżetach jednej, dwóch i trzech prób skuteczność wynosi odpowiednio 0,2, 0,4 i 0,6. Dla K = 3 suma wynosi (0,6 − 0,2) + (0,6 − 0,4), czyli 0,6. Jeżeli inny model osiąga 0,6 już w jednej próbie i zachowuje ten wynik, suma wynosi zero. Brak dalszego przyrostu może więc wynikać z szybszego osiągnięcia tego samego wyniku, nie z jego pogorszenia.
Normalizacja i porównanie modeli
Wersja znormalizowana uwzględnia odsetek zadań nieudanych w pojedynczej próbie:
W podanym przykładzie mianownik wynosi 2 razy 0,8, czyli 1,6; S(3) wynosi 0,375. K musi być liczbą całkowitą nie mniejszą niż dwa. Gdy C(1) wynosi jeden, mianownik jest zerowy i ten wariant miary nie jest określony.
Znormalizowany Sharpening Tax jest różnicą między skalowalnością wersji bazowej a skalowalnością po dalszym treningu:
Porównanie wymaga tych samych zadań, budżetu i reguł wyznaczania skuteczności. Dodatnia wartość oznacza mniejsze korzyści z dokładania prób po treningu według tej miary. Nie dowodzi sama w sobie, że końcowy pass@K jest niższy.
Zerowy wynik może opisywać sukces albo całkowitą porażkę
Jeśli model zawsze odnosi sukces, wszystkie różnice w A(K) są zerowe. Tak samo jest, jeśli nie odnosi sukcesu przy żadnym budżecie. Dlatego A(K), S(K) i ich różnice trzeba odczytywać razem z krzywą pass@k i jej końcowym punktem.
W pracy autorzy szacują krzywe z liczby sukcesów osobno dla każdego zadania, a następnie uśredniają zadania z równymi wagami. Skończona liczba prób nie pozwala utożsamić braku zaobserwowanego sukcesu z zerowym prawdopodobieństwem sukcesu. W zastosowaniu porównuj zmianę korzyści z powtórek z końcową skutecznością oraz kosztem uzyskania sprawdzonego rezultatu.
Źródło: Changdae Oh i współautorzy, Sharpening Tax in Post-Training, §4 i dodatki B.1–B.2, preprint arXiv:2610.01509v1 z 1 października 2026, na licencji CC BY 4.0.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.