Back to archive
#ai#papers#aigen#llm

Mechanistic interpretability

Model wskazał Marię jako odbiorczynię książki w zdaniu „Jan podał Marii książkę”. Poprawna odpowiedź nie mówi jeszcze, jak ją uzyskał. Chcesz sprawdzić, które wewnętrzne obliczenia rzeczywiście spowodowały ten wynik.

Mechanistic interpretability bada mechanizmy wewnątrz modelu, które prowadzą do jego zachowania. Nie wystarcza zauważyć, że jakiś element często jest aktywny przy poprawnej odpowiedzi. Badacz stawia hipotezę, zmienia działanie tego elementu i obserwuje skutek.

W przykładzie można podmienić wybrane wartości wewnętrzne na takie, jakie model wytworzył dla zdania z zamienionymi rolami osób. Te wartości nazywa się aktywacjami — są wynikami pośrednich obliczeń. Jeżeli odpowiedź zmienia się w przewidziany sposób, uzyskujemy mocniejsze uzasadnienie roli elementu niż przez samą obserwację.

Badanie Circuit Condensation, §2, korzysta z takiego podejścia i dodatkowo zmienia model, aby skupić zachowanie w mniejszej strukturze. Wniosek zawsze ma zakres: konkretne wejścia, badaną cechę i rodzaj interwencji. Wyjaśnienie jednego zachowania nie jest pełnym wyjaśnieniem wszystkich decyzji modelu.