Back to archive
#ai#papers#aigen#llm#agents#benchmarks

Dłuższy horyzont METR nie oznacza proporcjonalnie trudniejszych zadań

Zespół chce ustalić, czy kolejnej wersji agenta można powierzyć dłuższe zadania programistyczne. Porównuje więc wyniki benchmarku opisane czasem, którego na wykonanie pracy potrzebował człowiek. Taki wynik łatwo potraktować jako wskazówkę, ile pracy można już oddać agentowi.

Ta interpretacja wymaga jednak sprawdzenia, czy dłuższa praca człowieka rzeczywiście oznacza odpowiednio trudniejsze zadanie dla AI. Jeśli w pewnym zakresie zadania mają podobną trudność dla agenta, niewielka poprawa jego skuteczności może przesunąć wynik przez duży zakres minut.

Przy wyborze agenta potrzebujemy wtedy dodatkowej informacji: jak zmieniła się szansa wykonania tych samych zadań. Sam mnożnik czasu może przeceniać różnicę między wersjami, jeśli akurat porównujemy fragment benchmarku, w którym czas słabo rozróżnia trudność.

METR nazywa taki pomiar time horizon. W wariancie z progiem 50% jest to czas pracy człowieka, przy którym dopasowana krzywa przewiduje połowę udanych prób agenta. To średnia dla zadań o danym czasie, nie gwarancja dla każdego z nich. Nie mierzymy tu czasu działania samego AI.

W preprincie On the estimation and validity of AI time horizons—a statistical look at the METR plot Drew T. Nguyen i William Fithian analizują właśnie przeliczenie czasu na trudność. Praca z dziedziny ewaluacji AI i statystyki, opublikowana po raz pierwszy 8 października 2026 roku, wskazuje w danych METR niemal płaski odcinek między 2 a 30 minutami pracy człowieka. Zadania z tego zakresu miały przeciętnie zbliżoną trudność dla badanych agentów.

Mała zmiana szans może daleko przesunąć próg

Poniższy przykład jest własnym uproszczeniem dydaktycznym, nie wynikiem badania. Mamy trzy zadania: A, B i C, zajmujące człowiekowi odpowiednio 3, 10 i 30 minut. Każdy z dwóch agentów wykonuje każde zadanie 100 razy w tym samym środowisku. Zapisujemy sukces albo porażkę.

ZadanieCzas człowiekaSukcesy starszego agentaSukcesy nowszego agenta
A3 minuty50 ze 10052 ze 100
B10 minut49 ze 10051 ze 100
C30 minut48 ze 10050 ze 100

Dla przejrzystości potraktujmy te częstości jak dokładnie znane szanse i połączmy punkty malejącymi krzywymi. Starszy agent przecina 50% przy 3 minutach, nowszy przy 30. Horyzont rośnie dziesięciokrotnie, choć na każdym zadaniu skuteczność wzrosła tylko o 2 punkty procentowe. W 300 próbach na agenta liczba sukcesów zmieniła się ze 147 na 153.

Wszystkie trzy zadania i wszystkie porażki pozostają w pomiarze. Wybieramy tylko miejsce przecięcia krzywej z progiem; niczego nie filtrujemy ani nie nagradzamy. Koszt tego umownego testu to 600 pełnych prób agenta. W rzeczywistym eksperymencie takie liczności nie pozwalają traktować różnicy 2 punktów procentowych jako pewnej. Trzeba dopasować krzywą i oszacować niepewność.

Przykład pokazuje operację odczytu horyzontu z prawie płaskiej krzywej. W badaniu jej kształt trzeba dopiero ustalić z wielu zadań i systemów. Jeśli krzywa w innym zakresie opada znacznie szybciej, taki sam mnożnik horyzontu wymaga większego wzrostu szans sukcesu. Dlatego przejścia od 3 do 30 minut i od 30 minut do 5 godzin nie są z definicji równymi porcjami postępu.

Czas człowieka trzeba dopasować do trudności dla AI

Punktem wyjścia jest tabela wyników: które zadanie wykonywał dany agent, ile razy i z jakim skutkiem. Znamy także czas człowieka oraz rodzinę zadania. Nie znamy jednej obiektywnej liczby opisującej jego trudność dla AI.

Baseline autorów zakłada, że każde kolejne podwojenie czasu człowieka zwiększa trudność o taki sam krok. Używa wspólnego nachylenia krzywych dla wszystkich agentów; różnią się one poziomem możliwości. To mocniejszy punkt odniesienia niż osobna regresja dla każdego systemu, którą stosowano pierwotnie.

Pierwsza propozycja zastępuje stały krok uczoną, monotoniczną krzywą typu spline: gładko połączonymi fragmentami, które mogą rosnąć szybciej albo wolniej. Dłuższy czas nadal nie obniża przewidywanej trudności, lecz wzrost nie musi być równomierny.

Druga propozycja, nazwana w pracy Model 2, wykorzystuje item response theory, IRT. Z wzorca sukcesów i porażek wspólnie szacuje możliwości agentów oraz trudność zadań. Uwzględnia też podobieństwo zadań należących do jednej rodziny i dodatkowe zróżnicowanie wyników prób. Dzięki temu wiele powtórek tej samej pary agent–zadanie nie jest traktowanych jak równie wiele nowych, niezależnych informacji o całym benchmarku.

Pierwszy krok, w którym baseline i nowe metody się różnią, to przeliczenie czasu człowieka na trudność. Wejściowe wyniki agentów pozostają te same. Nowe dopasowanie może więc zmienić horyzont bez zmiany choćby jednej odpowiedzi AI.

Te same wyniki GPT-4o dały inny horyzont

Autorzy ponownie analizują zapisane wyniki METR Time Horizon 1.1: 228 zadań i 26 systemów AI. Na rysunku 1 horyzont GPT-4o wynosi 7,2 minuty według baseline ze wspólnym nachyleniem i 4,4 minuty według Modelu 2. To dwa oszacowania z tych samych prób, nie pogorszenie działania GPT-4o ani porównanie kosztu jego inferencji.

Bardziej elastyczna krzywa mogłaby po prostu lepiej dopasować się do szumu. Autorzy sprawdzają więc przewidywanie wyników na całych rodzinach zadań niewykorzystanych podczas dopasowania. W pięcioczęściowej walidacji dzielą 79 rodzin, a nie pojedyncze próby tego samego zadania. Obie nowe metody mają lepsze oszacowania punktowe we wszystkich 12 kombinacjach miary i sposobu ważenia wyników. Oznacza to mniejszy błąd przewidywania sukcesu, nie wzrost skuteczności samych agentów. §2.4–2.5 i rysunek 2

Przewaga nie rozkłada się równo. Najwięcej poprawia się dopasowanie dla systemów z epoki GPT-4, których horyzonty przechodzą przez wskazany płaski zakres. Dla najmocniejszych systemów porównywane krzywe prawie się pokrywają. Oszacowania dla pojedynczych systemów są też znacznie mniej rozstrzygające niż wynik zbiorczy. Dodatek A

Szczegóły eksperymentu

Dane i ustawienie. To ponowna analiza publicznych wyników METR, nie nowa seria uruchomień agentów. Zadania dotyczą pracy nad oprogramowaniem i mają automatyczną ocenę sukcesu. Czas człowieka jest zwykle średnią geometryczną czasów udanych wykonań; część wartości pochodzi z ocen ekspertów. Czas inferencji AI nie jest zmienną mierzonego horyzontu.

Wybór modelu i checkpointu. Autorzy nie trenują nowych LLM ani nie wybierają ich najlepszego checkpointu. Wykorzystują zapisane wyniki wcześniejszych ewaluacji METR. GPT-4o jest modelem API o nieujawnionej liczbie parametrów. Ta analiza nie ustala jego wewnętrznego protokołu wyboru wag. Dopasowania statystyczne wykorzystują metodę największej wiarygodności; Model 2 stosuje algorytm EM i numeryczne przybliżanie całek. Wykresy kształtu krzywych wykorzystują pełne dane, a porównanie jakości predykcji opisane wyżej wykorzystuje podział według rodzin.

Miary. Zestaw obejmuje marginal log score, czyli binarną cross-entropy, Brier score oraz wygładzone miary błędu w pobliżu progów 50% i 80%. Cross-entropy mocno karze pewne, błędne przewidywania; Brier score mierzy kwadrat różnicy między szansą a wynikiem sukces/porażka. Niższa wartość jest lepsza. Każdą z czterech miar obliczono przy trzech sposobach ważenia: równych zadaniach, równych rodzinach i wariancie pośrednim używanym przez METR. Nie sumujemy ich w jedną poprawę procentową.

Koszt i niepewność. Nowa analiza wymaga dopasowań statystycznych, także osobno dla podziałów walidacyjnych, ale nie dodatkowych wywołań ocenianych LLM. Praca nie raportuje oszczędności czasu ani pieniędzy wynikających z wdrożenia estymatora. Przedziały niepewności głównego porównania liczone są po rodzinach zadań. Lepszy punktowy wynik każdej miary nie oznacza, że każdy osobny kontrast jest statystycznie rozstrzygający.

Dłuższe zadania wymagają ponownego sprawdzenia skali

Praca nie ustala przyczyny płaskiego odcinka i nie pokazuje, że pojawi się on w każdym benchmarku. Nie dowodzi też, że zadania METR reprezentują całą pracę programisty. Autorzy nie kwestionują obserwowanego wykładniczego trendu postępu; badają, co oznaczają odstępy na osi czasu pracy człowieka.

Praktycznym zastosowaniem jest uzupełnienie horyzontu wykresem szans sukcesu dla stałych zakresów zadań. To pozwala zobaczyć, czy jego skok odpowiada wyraźnej zmianie niezawodności. Przy dodawaniu dłuższych zadań do własnego benchmarku warto sprawdzić na odłożonych rodzinach, czy ich czas nadal przewiduje trudność dla agenta, zanim przedłużymy dotychczasową krzywą.

Źródła

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.