Zurück zum Archiv
#ai#papers#aigen#llm

Mechanistische Interpretierbarkeit

Das Modell hat Maria im Satz „Jan gab Maria ein Buch“ als Empfängerin des Buches bestimmt. Die richtige Antwort sagt noch nicht, wie es dazu kam. Du möchtest prüfen, welche internen Berechnungen dieses Ergebnis tatsächlich verursacht haben.

Mechanistic Interpretability untersucht Mechanismen innerhalb des Modells, die zu seinem Verhalten führen. Es genügt nicht festzustellen, dass ein Element bei richtigen Antworten häufig aktiv ist. Der Forscher stellt eine Hypothese auf, verändert die Arbeitsweise des Elements und beobachtet die Wirkung.

Im Beispiel können ausgewählte interne Werte durch solche ersetzt werden, die das Modell für einen Satz mit vertauschten Personenrollen erzeugt hat. Diese Werte heißen Aktivierungen — sie sind Ergebnisse von Zwischenberechnungen. Ändert sich die Antwort wie vorhergesagt, erhalten wir eine stärkere Begründung für die Rolle des Elements als durch bloße Beobachtung.

Die Studie Circuit Condensation, §2, verwendet dieses Vorgehen und verändert das Modell zusätzlich, um das Verhalten in einer kleineren Struktur zu konzentrieren. Die Schlussfolgerung hat immer einen Geltungsbereich: konkrete Eingaben, das untersuchte Merkmal und die Art der Intervention. Die Erklärung eines Verhaltens ist keine vollständige Erklärung aller Modellentscheidungen.