Back to archive
#ai#llm#glossary#aigen

Catastrophic Forgetting

Wyobraź sobie model wyceny paczek. Umie już podać poprawną cenę małej paczki: 2 zł. Teraz uczysz go wyceniać dużą na 4 zł, pokazując wyłącznie duże paczki. Nowe odpowiedzi stają się coraz lepsze, ale mała paczka zaczyna kosztować według modelu 3 zł. Sam test nowego zadania nie ujawni tej straty.

Catastrophic Forgetting to znaczne pogorszenie wcześniej wyuczonych umiejętności podczas uczenia kolejnych zadań. Wagi, czyli liczby sterujące obliczeniami modelu, mogą służyć wielu zadaniom naraz. Poprawki korzystne dla nowego zadania mogą naruszyć ustawienia potrzebne do starego. Ten mechanizm opisują Kirkpatrick et al., Overcoming catastrophic forgetting in neural networks, §1.

Dwie ceny korzystają ze wspólnego ustawienia

W naszym wymyślonym, celowo małym modelu mała paczka kosztuje a, a duża a + b. a i b są uczonymi liczbami, jak dwa pokrętła. Początkowo a = 2, b = 0: mała paczka jest wyceniona dobrze, duża zbyt tanio.

Uczenie dużych paczek zwiększa oba ustawienia. Po pierwszym kroku dostajemy a = 2,5, b = 0,5. Cena dużej rośnie z 2 do 3 zł, bliżej celu. Cena małej też rośnie — mimo że nie miała się zmienić. Po wielu krokach duża zbliża się do 4 zł, a mała do błędnych 3 zł.

Nie brakuje tu miejsca na obie umiejętności: a = 2, b = 2 daje obie poprawne ceny. Problem polega na tym, które ustawienia zmienia dalsze uczenie. Gdy zachowamy a = 2 i uczymy tylko b, możemy poprawić dużą paczkę bez psucia małej. To idealizowana ochrona przy znanej roli każdego ustawienia, a nie gotowa recepta dla ogromnego modelu językowego.

Na jednej glinianej tabliczce nowy zygzak przecina i częściowo zaciera wcześniejszy okrągły wzór: metafora uczenia zmieniającego wspólne ustawienia.

Co to zmienia przy douczaniu LLM

Fine-tuning oznacza dalsze uczenie modelu na nowych przykładach. Wyobraź sobie model dobrze tłumaczący tekst, który douczasz wyłącznie pisania zapytań do bazy danych. Lepsze zapytania nie gwarantują zachowania jakości tłumaczeń. Trzeba sprawdzać oba zadania na tych samych zestawach testowych, nieużywanych do uczenia, przed i po treningu. To przykład zastosowania mechanizmu, nie wynik eksperymentu z paczkami.

W badaniu LLM pogorszenie wcześniejszych zdolności zaobserwowali Luo et al., §5.1. Domieszanie ogólnych przykładów do nowej nauki ograniczało ten problem w ich eksperymentach (§5.4), lecz nie usuwało go całkowicie. Inną metodą jest ostrożniejsze zmienianie wag ważnych dla starych zadań, opisane przez Kirkpatrick et al. w §2. Zachowanie wcześniejszej wiedzy i swoboda nowej nauki wymagają kompromisu.

Nie każda pomyłka oznacza Catastrophic Forgetting. Potrzebne jest porównanie zachowania po zmianie wyuczonych ustawień. Jeśli informacja jedynie wypadła z tekstu dostępnego w rozmowie, to inny problem. Poniższy model pokazuje współdzielenie ustawień; nie mierzy skali zapominania w LLM ani nie dowodzi trwałego wymazania wiedzy.

Sprawdź, co traci stara umiejętność

Zwiększ liczbę kroków. Czy malejący błąd dużej paczki wystarczy, by uznać cały model za lepszy? Następnie zaznacz ochronę a i porównaj obie ceny przy tej samej liczbie kroków.

Jak liczymy kroki: błąd uczenia dużej paczki to połowa kwadratu różnicy a + b − 4. Gradient — wskazówka, jak zmiana każdej liczby zmieni ten błąd — wynosi tutaj a + b − 4 dla obu ustawień. W każdym kroku odejmujemy od zmienianych ustawień ćwierć tej wartości, obliczonej przed aktualizacją. To prosta reguła zejścia po gradiencie, pokrewna mechanizmowi Stochastic Gradient Descent; używamy jednego stałego przykładu, bez losowania danych. Przy ochronie a zmieniamy tylko b.

Powiązania

  • Pre-training daje wcześniejsze umiejętności, które dalsze uczenie może naruszyć.
  • LoRA uczy dodatki do bazowego modelu; zachowanie bazowych wag samo w sobie nie dowodzi zachowania wcześniejszych umiejętności modelu z aktywnymi dodatkami.

Tekst, ilustrację i demonstrację przygotowano z pomocą AI; ceny i model dwóch liczb są własnym przykładem edukacyjnym.