Time horizon
Time horizon w ewaluacji agentów opisuje długość zadań, przy której agent osiąga wybrany poziom skuteczności. Długość mierzy się czasem potrzebnym człowiekowi, a nie czasem działania AI.
Dla wariantu 50% zbieramy udane i nieudane próby agenta na zadaniach o różnych czasach człowieka. Dopasowujemy krzywą szans sukcesu, a następnie odczytujemy czas, przy którym przecina ona 50%. To przewidywanie dla rozkładu zadań o danym czasie; nie oznacza, że każde z nich ma taką samą szansę wykonania. METR: definicja i metodologia.
Przykład dydaktyczny: jeżeli dopasowana krzywa osiąga 50% przy dwóch godzinach, to dwie godziny są horyzontem. Agent może wykonać udane zadanie znacznie szybciej. Wynik sam nie określa też, z jaką skutecznością zrobi zadanie z innej dziedziny.
Odczyt wymaga sensownej zależności między czasem człowieka a trudnością dla AI. Gdy krzywa jest płaska, mała zmiana szans może bardzo przesunąć jej przecięcie z progiem. Artykuł o przeliczaniu horyzontu METR pokazuje ten problem na policzalnym przykładzie i omawia nowe dopasowanie do danych METR. Nguyen i Fithian, §2–3.
Przy porównywaniu horyzontów trzeba zachować informację o zestawie zadań, środowisku agenta, budżecie prób i przyjętym progu skuteczności.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.