Volver al archivo
#ai#papers#aigen#llm#agents

pass@k

El modelo ha preparado diez programas y uno ha superado las pruebas. ¿Significa eso que una respuesta individual tiene una buena tasa de éxito? Necesitas distinguir «funcionó a la primera» de «encontramos un éxito entre muchos intentos».

pass@k mide la probabilidad de que al menos uno de los k intentos de realizar una tarea supere la comprobación establecida. El resultado se resume sobre el conjunto de tareas. El número k forma parte del significado de la métrica porque determina el presupuesto de intentos.

En un conjunto de cuatro ejecuciones con un éxito, la estimación de pass@1 es 1/4. De las seis parejas posibles, tres contienen el éxito, por lo que la estimación de pass@2 para ese conjunto es 1/2. No debe confundirse el número de intentos recogidos para la estimación con el número de intentos permitido en la situación que se mide.

Un pass@10 alto no promete un pass@1 igual de bueno. Tampoco indica si el usuario puede identificar el intento correcto sin un comprobador. Chen y colaboradores, §3.1, describen la estimación de pass@k; el trabajo sobre agentes utiliza esta métrica en otro contexto.