pass@k
Ein Modell hat zehn Programme erstellt, von denen eines die Tests bestanden hat. Bedeutet das eine hohe Erfolgsquote für eine einzelne Antwort? Du musst „beim ersten Versuch gelungen“ von „unter vielen Versuchen einen Erfolg gefunden“ unterscheiden.
pass@k misst die Wahrscheinlichkeit, dass mindestens einer von k Versuchen zur Lösung einer Aufgabe eine festgelegte Prüfung besteht. Das Ergebnis wird über die Aufgaben zusammengefasst. Die Zahl k gehört zur Bedeutung der Metrik, weil sie das Budget an Versuchen bestimmt.
In einer Menge von vier Ausführungen mit einem Erfolg beträgt die Schätzung von pass@1 1/4. Von den sechs möglichen Paaren enthalten drei den Erfolg, also beträgt die Schätzung von pass@2 aus dieser Menge 1/2. Die Zahl der zur Schätzung gesammelten Versuche darf nicht mit der Zahl der in der gemessenen Situation erlaubten Versuche verwechselt werden.
Ein hohes pass@10 verspricht kein ebenso gutes pass@1. Es sagt auch nicht, ob der Nutzer den richtigen Versuch ohne Prüfer erkennen kann. Chen und Mitautoren, §3.1, beschreiben die Schätzung von pass@k; die Arbeit über Agenten verwendet diese Metrik in einem anderen Kontext.