Elastic Weight Consolidation
Model kieruje pytania klientów do działów „dostawa” i „zwroty”. Teraz ma się nauczyć rozpoznawania reklamacji, ale dawnych wiadomości nie wolno już przechowywać. Nie da się więc ich powtarzać podczas nauki. Jedyne, co zostało po starym zadaniu, to sam model: miliony liczb ustawionych w trakcie wcześniejszego uczenia, nazywanych wagami.
Można uczyć model reklamacji bez żadnych ograniczeń. Wtedy wagi przesuwają się tam, gdzie pomaga to nowemu zadaniu, również te, od których zależało rozpoznawanie dostawy i zwrotów. Można też ukarać każdą zmianę jednakowo, ale wtedy model trzyma się starych ustawień tak mocno, że słabo uczy się nowego. Potrzebna jest odpowiedź na pytanie: które wagi wolno ruszać, a których lepiej nie?
Elastic Weight Consolidation (EWC) dodaje do nauki nowego zadania karę za oddalanie się wag od wartości po starym zadaniu, przy czym kara jest tym większa, im ważniejsza była dana waga dla starego zadania. Autorzy porównują to do sprężyny przypiętej do każdej wagi: sztywnej przy wagach ważnych, luźnej przy pozostałych (Kirkpatrick et al., Overcoming catastrophic forgetting in neural networks, §2).

Dwie wagi, jedno nowe zadanie
Weźmy tylko dwie wagi. Po nauce dostawy i zwrotów obie mają wartość 1. Pierwsza jest dla starych działów bardzo ważna (ważność 10), druga prawie obojętna (ważność 0,1). Nowe zadanie wymaga jedynie, żeby suma obu wag wyniosła 4. Spełnia to wiele ustawień: (2, 2), ale też (1, 3).
- Bez ochrony nauka przesuwa obie wagi po równo, do (2, 2). Nowe zadanie jest opanowane, ale ważna waga odjechała o 1 i strata na starym zadaniu rośnie od 0 do 5,05.
- Jednakowa kara dla obu wag zatrzymuje je w pół drogi, przy (1,67, 1,67). Stare zadanie cierpi mniej, ale suma to 3,33 zamiast 4.
- EWC przenosi prawie cały ruch na mało ważną wagę: (1,02, 2,80). Suma wynosi 3,82, a strata na starym zadaniu to tylko 0,16.
Strata to liczba mówiąca, jak bardzo model się myli; im mniejsza, tym lepiej. W eksperymencie poniżej możesz zmieniać siłę kary λ i sposób ochrony. Wynik jest liczony dokładnie dla tego dwuwagowego przykładu; to nie symulacja prawdziwej sieci.
Skąd wiadomo, która waga jest ważna
W prawdziwej sieci nikt nie podaje ważności z góry. Szacuje się ją po zakończeniu starego zadania, dopóki jego dane są jeszcze dostępne: sprawdza się, jak mocno drobna zmiana danej wagi zmienia odpowiedzi modelu na starych przykładach. Praca używa do tego przekątnej macierzy informacji Fishera, czyli jednej liczby ważności na każdą wagę. Potem dane można usunąć; zostają stare wartości wag i ich ważności.
Podczas nowej nauki minimalizowana jest suma dwóch składników (równanie 3 w pracy):
to strata na nowym zadaniu, to bieżąca wartość wagi numer , jej wartość po starym zadaniu, jej ważność, a mówi, jak bardzo stare zadanie liczy się wobec nowego. W naszym przykładzie i .
Granice metody
Ważność jest przybliżeniem liczonym w jednym punkcie, osobno dla każdej wagi. Sami autorzy pokazują, że ich oszacowanie bywa zbyt pewne co do tego, które wagi są nieistotne, i nazywają to główną słabością metody (§2.2 i §3). W ich eksperymentach z grami Atari agent z EWC uczył się wielu gier po kolei, ale nie dorównał osobnym sieciom uczonym dla każdej gry. Wyniki dotyczą rozpoznawania cyfr i gier, nie dużych modeli językowych. Nasze dwie wagi i wiadomości od klientów są własnym uproszczeniem.
- Catastrophic Forgetting to znaczne pogorszenie dawnych umiejętności po nowej nauce; EWC próbuje je ograniczyć bez dostępu do starych danych.
- Experience Replay rozwiązuje ten sam problem inaczej: przechowuje część dawnych przykładów zamiast ważności wag.
- Continual Learning określa cel, czyli naukę kolejnych zadań z zachowaniem wcześniejszych; EWC jest jedną z metod.
- Fine-tuning to dalsze uczenie gotowego modelu; EWC zmienia jego cel, dodając karę za ruszanie ważnych wag.
Tekst i ilustrację przygotowano z pomocą AI. Dwie wagi, ich ważności i demonstracja są własnym uproszczonym przykładem edukacyjnym; ilustracja jest metaforą, nie schematem budowy modelu.