Back to archive
#ai#papers#aigen#llm#training

Circuit Condensation skupia obliczenie w mniejszym grafie przyczynowym

Zamrożony model może wymagać setek krawędzi do wyjaśnienia jednego zachowania

W 30 z 32 kombinacji zadania i modelu, dla mediany z trzech seedów, Circuit Condensation zwrócił mniejszy circuit na poziomie głów attention niż EAP-IG na zamrożonym modelu. W obu metodach wybierano najmniejszy circuit, którego validation accuracy pozostawała w granicy 0,05 od wyniku własnego pełnego grafu. Średnia geometryczna redukcji, liczona po 96 uruchomieniach obejmujących cztery zachowania, osiem modeli i trzy seedy, wyniosła 8,1 razy. Największa redukcja wyniosła 316 razy.

To wynik z dziedziny mechanistic interpretability, która próbuje wskazać wewnętrzne elementy modelu potrzebne do wykonania konkretnego obliczenia. Jednym z obiektów takiej analizy jest causal circuit, czyli skierowany podgraf połączeń między elementami Transformera, wystarczający do zachowania badanego wyniku.

Dokładne pytanie brzmi: które połączenia przenoszą obliczenie potrzebne na przykład do wskazania odbiorcy w zdaniu? Badacz ma parę prawie identycznych promptów z różnymi poprawnymi odpowiedziami oraz aktywacje modelu dla obu promptów. Nie zna jednak najmniejszego podgrafu, który nadal daje poprawny token. Dotychczasowe metody pozostawiają wagi bez zmian, oceniają znaczenie krawędzi i usuwają te najsłabsze. Jeżeli obliczenie jest rozproszone, lepsze wyszukiwanie nadal może zwrócić setki krawędzi. Dla grafu z 400 krawędziami nie da się praktycznie sprawdzić wszystkich podzbiorów, bo jest ich 2 do potęgi 400.

Nowa praca zmienia warunek zadania: zamiast wyłącznie szukać obliczenia w zamrożonym modelu, pozwala niewielkiemu adapterowi zmienić wagi tak, aby to samo zachowanie przechodziło przez mniejszą liczbę połączeń.

Algorytm usuwa krawędzie, doucza adapter i cofa nieudany krok

Transformer jest reprezentowany jako graf. Zapisującymi węzłami są embedding tokenu, wyjścia poszczególnych głów attention i wyjścia MLP. Odczytującymi węzłami są późniejsze attention, MLP oraz warstwa tworząca logits. Pełny graf ma od 2041 krawędzi w GPT-2 small do 43 993 w Qwen3-4B.

Zamknięcie krawędzi nie zeruje aktywacji. Metoda stosuje interchange ablation: wstawia na tej krawędzi aktywację z dopasowanego, zmienionego promptu. Ogranicza to ryzyko, że model zawiedzie tylko dlatego, że dostał wewnętrzną wartość spoza znanego mu zakresu.

Jedna iteracja wykonuje cztery operacje:

  1. EAP-IG ocenia wpływ każdej otwartej krawędzi na wynik i tworzy ranking.
  2. Kontroler proponuje usunięcie 30% najsłabszych krawędzi. Po nieudanej próbie zmniejsza cięcie o połowę, nie schodząc poniżej 5%.
  3. Przy stałej masce trenuje przez 500 kroków wyłącznie adapter LoRA. Celem nie jest etykieta zadania, lecz dopasowanie pełnego rozkładu następnego tokenu do oryginalnego modelu przez KL divergence. Wagi bazowe pozostają zamrożone.
  4. Usunięcie zostaje zaakceptowane tylko wtedy, gdy zamaskowany graf i pełny model z adapterem zachowują accuracy w granicy 0,05 od wyniku pełnego grafu, a perplexity na 320 promptach spoza zadania nie rośnie o więcej niż 5%. W przeciwnym razie maska i adapter wracają do ostatniego zaakceptowanego stanu.

EAP-IG mówi, co obecnie wygląda na zbędne. LoRA przenosi część obliczenia na pozostawione ścieżki. Bramka accuracy i perplexity sprawdza, czy ta zmiana nie zniszczyła badanego zachowania ani ogólnej zdolności językowej.

Osiem krawędzi pokazuje różnicę między wyszukiwaniem a zmianą wag

Rozważmy dydaktyczny graf z ośmioma krawędziami e1e8. Model ma wybrać odbiorcę w zdaniu „Jan podał Marii książkę”. Pełny graf osiąga accuracy 0,96, więc najniższy dopuszczalny wynik wynosi 0,91. Liczby poniżej są przykładem mechanizmu, a nie wynikiem eksperymentu z pracy.

StanOtwarte krawędzieOperacja i jej odpowiednik w algorytmieAccuracyWzględna perplexityDecyzja
Pełny grafe1e8punkt startowy z otwartymi bramkami0,961,00zachowaj
Zamrożone wagie1e6EAP-IG usuwa e7, e8; brak healing0,891,00cofnij
Zamrożone wagie1e7mniejsze cięcie usuwa tylko e80,931,00zachowaj 7 krawędzi
Circuit Condensatione1e6to samo pierwsze cięcie, potem 500 kroków healing przez LoRA0,951,02zachowaj
Circuit Condensatione1e4kolejne cięcie i healing0,931,04zachowaj
Circuit Condensatione1e3próba usunięcia e4 po healing0,861,03cofnij do 4 krawędzi

Osiem krawędzi odpowiada kandydatom w grafie residual stream. Zdanie i jego wersja ze zmienionymi osobami odpowiadają parze clean–corrupted. Wybrany odbiorca odpowiada tokenowi ocenianemu przez restricted-choice accuracy. Usunięcie e7 i e8 oznacza przekazanie na tych połączeniach aktywacji z corrupted promptu. Healing jest treningiem adaptera na KL divergence, a dwa progi w tabeli odpowiadają bramkom accuracy i ogólnej perplexity. Cofnięcie ostatniego wiersza jest backtrackingiem kontrolera.

Pierwsza różnica między starym i nowym podejściem pojawia się po identycznym cięciu e7, e8: zamrożony model nie może zmienić trasy obliczenia, a adapter może. W prawdziwym eksperymencie nie ma ośmiu krawędzi. Są ich tysiące, ranking jest ponawiany po każdym zaakceptowanym cięciu, a każda propozycja wymaga kolejnych 500 kroków treningu. Autor wykonał 96 uruchomień, każde na jednym NVIDIA A100 80 GB. Prostota końcowego grafu nie oznacza małego kosztu jego wytworzenia.

Mniejszy graf wynika ze zmiany wag, a nie tylko z innego rankingu

Główne porównanie obejmowało cztery zachowania token-level: indirect object identification, subject–verb agreement, repeated-token induction i uzupełnianie docstringu Pythona. Testowano GPT-2 small, dwa modele Llama-3.2, dwa Gemma-3 oraz trzy Qwen3, od 0,6B do 4B parametrów. Dla każdej kombinacji przygotowano 2000 przykładów treningowych, 2000 walidacyjnych i 1000 w zamkniętym teście. Najmniejszy circuit spełniający próg na walidacji był wybranym checkpointem; test odczytano raz po wyborze. Z 96 wybranych endpointów 91 ponownie zmieściło się w tolerancji 0,05 na tym teście. Pozostałe pięć przekroczyło próg o medianę 0,009.

Najważniejsza kontrola używała tego samego rankingu, harmonogramu cięć, bramek i backtrackingu, ale nie aktualizowała wag. Ten wariant C0 był większy od wariantu z healing C1 w 29 z 32 kombinacji, średnio 7,4 razy. Wynik izoluje wpływ aktualizacji wag: sam kontroler nie wyjaśnia redukcji.

Mały circuit pozwolił wykonać testy, które wcześniej były niepraktyczne. Dla 19 uruchomień z co najwyżej 13 krawędziami sprawdzono wszystkie podzbiory, łącznie 5952 maski. W 11 przypadkach nie istniał mniejszy wierny podzbiór. W siedmiu z pozostałych ośmiu można było usunąć jeszcze od jednej do trzech krawędzi. Osobny test 169 476 ablacji par wykazał interakcje w każdym badanym circuit. Kondensacja umożliwiła pełne sprawdzenie zależności, ale nie sprawiła, że krawędzie działają niezależnie.

W precyzyjnie dopasowanym przypadku indirect object identification na GPT-2 small oba warianty osiągały accuracy 0,95. Circuit Condensation zachował medianę 58 krawędzi i 24 głowy attention; zamrożony EAP-IG potrzebował 256 krawędzi i 61 głów. Wartość KL divergence względem oryginalnego modelu wyniosła odpowiednio 0,056 i 0,50. Mniejszy graf lepiej odtwarzał pełny rozkład następnego tokenu w tym jednym, nazwanym ustawieniu.

Metoda upraszcza audyt jednego zachowania, ale nie zmniejsza modelu

Circuit Condensation bezpośrednio wyjaśnia model po adaptacji, nie model oryginalny. W całej siatce mediana odsetka przykładów z testu, dla których circuit i niezmodyfikowany model wybierały tego samego kandydata, wyniosła 96,5%. Mediana token-level KL wyniosła 0,215. To bliskość, nie tożsamość mechanizmu.

Liczba krawędzi nie obejmuje obliczenia wewnątrz pozostawionych węzłów ani adaptera obejmującego cały model. Adapter LoRA miał od 0,9% do 1,9% liczby parametrów modelu bazowego. Zamknięte krawędzie służą do analizy przez interchange ablation; nie są usuwane z normalnej inferencji. Praca nie pokazuje więc mniejszego checkpointu, niższej latencji ani tańszego serwowania.

Wniosek zależy też od konwencji interwencji. Małe circuits, zarówno kondensowane, jak i zamrożone, mogły stracić accuracy po zastąpieniu interchange ablation zerowaniem lub średnią aktywacją. Badano tylko cztery proste zachowania na modelach do 4B parametrów. Bramka ogólnej zdolności prawie nie ograniczała Gemma, a dla agreement i docstringu czasem to ona, a nie accuracy zadania, zatrzymywała pruning.

Praktyczny wniosek jest wąski: gdy zespół planuje wiele kosztownych testów przyczynowych tego samego zachowania, może potraktować łatwość znalezienia circuit jako cel post-training. Raport musi jednak podać regułę ablacji, bramkę zachowania i ogólnej zdolności oraz osobny pomiar zgodności z modelem przed adaptacją.

Praca Sai Aditha Senthila Kumara jest preprintem arXiv v1 z dziedziny machine learning, opublikowanym po raz pierwszy 27 sierpnia 2026 roku: Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit, arXiv:2608.27254, DOI: 10.48550/arXiv.2608.27254.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.