Item response theory
Item response theory (IRT) to rodzina metod, które z odpowiedzi na poszczególne zadania wspólnie szacują możliwości wykonawców i trudność zadań. W ewaluacji AI wykonawcą jest agent, a odpowiedzią może być sukces albo porażka pełnej próby.
Załóżmy, że dwóch agentów rozwiązuje te same trzy zadania. Pierwszy zwykle radzi sobie z A i B, drugi także z C. Sam procent sukcesów daje ranking. IRT próbuje dodatkowo oszacować, jak trudne jest C względem pozostałych zadań i jaka różnica możliwości wyjaśnia wzorzec odpowiedzi. To przykład dydaktyczny; tak mała tabela nie wystarcza do wiarygodnego dopasowania.
W prostym modelu Rascha szansa sukcesu rośnie, gdy możliwości agenta są większe względem trudności zadania. Obie wielkości są ukryte: wnioskujemy o nich z wyników, zamiast od razu utożsamiać trudność z długością instrukcji albo czasem człowieka. Różne warianty IRT dodają kolejne parametry i założenia.
W analizie horyzontów METR autorzy wiążą ukrytą trudność z czasem pracy człowieka za pomocą uczonej krzywej. Dodają efekty rodzin zadań i zróżnicowanie wyników powtórek. Pozwala to sprawdzić, w którym zakresie czas rzeczywiście rozróżnia zadania trudne i łatwe dla AI. Nguyen i Fithian, §2.3 i §3.1.
Dobre przewidywanie odpowiedzi nie dowodzi, że wyuczony parametr obejmuje wszystkie rodzaje możliwości agenta. Przy interpretacji trzeba sprawdzać założenia modelu i wyniki na zadaniach niewykorzystanych podczas dopasowania.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.