Interpretabilidad mecanicista
El modelo ha identificado a María como destinataria del libro en la frase «Juan le dio un libro a María». Una respuesta correcta todavía no explica cómo la obtuvo. Quieres comprobar qué cálculos internos causaron realmente ese resultado.
Mechanistic interpretability estudia los mecanismos internos del modelo que conducen a su comportamiento. No basta con observar que un elemento suele estar activo cuando la respuesta es correcta. El investigador formula una hipótesis, cambia el funcionamiento de ese elemento y observa el efecto.
En el ejemplo se pueden sustituir ciertos valores internos por los que el modelo produjo para una frase con los papeles de las personas intercambiados. Esos valores se llaman activaciones: son resultados de cálculos intermedios. Si la respuesta cambia de la forma prevista, obtenemos una justificación del papel del elemento más fuerte que mediante la mera observación.
El estudio Circuit Condensation, §2, usa este enfoque y además modifica el modelo para concentrar el comportamiento en una estructura menor. La conclusión siempre tiene un alcance: unas entradas concretas, la característica estudiada y el tipo de intervención. Explicar un comportamiento no explica por completo todas las decisiones del modelo.