pass@k
Model przygotował dziesięć programów, a jeden przeszedł testy. Czy to oznacza dobrą skuteczność pojedynczej odpowiedzi? Potrzebujesz oddzielić „udało się za pierwszym razem” od „wśród wielu prób znaleźliśmy sukces”.
pass@k mierzy szansę, że co najmniej jedna z k prób wykonania zadania przejdzie ustalone sprawdzenie. Wynik podsumowuje się po zadaniach. Liczba k jest częścią znaczenia metryki, bo określa budżet prób.
W puli czterech wykonań z jednym sukcesem oszacowanie pass@1 wynosi 1/4. Spośród sześciu możliwych par trzy zawierają sukces, więc oszacowanie pass@2 z tej puli wynosi 1/2. Nie należy mylić liczby prób zebranych do estymacji z liczbą prób dopuszczonych w mierzonej sytuacji.
Wysokie pass@10 nie obiecuje równie dobrego pass@1. Nie mówi też, czy użytkownik potrafi wskazać poprawną próbę bez testera. Chen i współautorzy, §3.1, opisują estymację pass@k; praca o agentach stosuje tę metrykę w innym kontekście.