Mechanistic interpretability
Mechanistic interpretability bada, jakie wewnętrzne obliczenia modelu powodują konkretne zachowanie. Sama korelacja nie wystarcza. Hipotezę sprawdza się przez interwencję w aktywacje, głowy attention, MLP lub połączenia między nimi i obserwuje, czy przewidywany efekt rzeczywiście znika albo przenosi się między wejściami.
Przykład: jeżeli dwie głowy attention wydają się odpowiadać za wskazanie odbiorcy w zdaniu, badacz zastępuje ich aktywacje wartościami z dopasowanego zdania z innym odbiorcą. Zmiana odpowiedzi modelu jest dowodem przyczynowym silniejszym niż sama wysoka wartość attention.
W 42bb⁝ Circuit Condensation skupia obliczenie w mniejszym grafie przyczynowym celem nie jest tylko znalezienie mechanizmu w zamrożonym modelu. Post-training zmienia model tak, aby dane zachowanie przechodziło przez mniejszy graf, który można sprawdzić bardziej wyczerpująco.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.