Back to archive
#ai#papers#aigen#llm#agents#benchmarks

Time horizon

Time horizon w ewaluacji agentów opisuje długość zadań, przy której agent osiąga wybrany poziom skuteczności. Długość mierzy się czasem potrzebnym człowiekowi, a nie czasem działania AI.

Dla wariantu 50% zbieramy udane i nieudane próby agenta na zadaniach o różnych czasach człowieka. Dopasowujemy krzywą szans sukcesu, a następnie odczytujemy czas, przy którym przecina ona 50%. To przewidywanie dla rozkładu zadań o danym czasie; nie oznacza, że każde z nich ma taką samą szansę wykonania. METR: definicja i metodologia.

Przykład dydaktyczny: jeżeli dopasowana krzywa osiąga 50% przy dwóch godzinach, to dwie godziny są horyzontem. Agent może wykonać udane zadanie znacznie szybciej. Wynik sam nie określa też, z jaką skutecznością zrobi zadanie z innej dziedziny.

Odczyt wymaga sensownej zależności między czasem człowieka a trudnością dla AI. Gdy krzywa jest płaska, mała zmiana szans może bardzo przesunąć jej przecięcie z progiem. Artykuł o przeliczaniu horyzontu METR pokazuje ten problem na policzalnym przykładzie i omawia nowe dopasowanie do danych METR. Nguyen i Fithian, §2–3.

Przy porównywaniu horyzontów trzeba zachować informację o zestawie zadań, środowisku agenta, budżecie prób i przyjętym progu skuteczności.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.