Back to archive
#ai#llm#glossary#aigen

Experience Replay

Model nauczył się kierować pytania klientów do działów „dostawa” i „zwroty”. Teraz douczasz go rozpoznawania reklamacji, na przykład „Produkt dotarł uszkodzony”. Jeśli w kolejnych ćwiczeniach widzi wyłącznie reklamacje, może gorzej obsługiwać dawniej znane „Gdzie jest paczka?”. Pełne stare archiwum jest niedostępne. Czy można wracać choć do kilku zachowanych wiadomości?

Experience Replay (ER) polega na przechowywaniu części wcześniejszych przykładów i ponownym używaniu ich do uczenia. W prostym wariancie do porcji nowych danych domieszamy przykłady z pamięci, nazywanej replay buffer. To pojemnik na dane do powtórek, nie zapis całej wiedzy modelu. Takie wspólne uczenie opisują Chaudhry et al., Continual Learning with Tiny Episodic Memories, §2, algorytm 1.

Zachowane granatowe i ochrowe karty wracają z niewielkiej kasety do szeregu nowych czerwonych kart: metafora powtórek podczas dalszej nauki.

Co trafia do kolejnego ćwiczenia

Przed utratą archiwum zapisaliśmy cztery wiadomości wraz z poprawnymi działami. Teraz mamy cztery nowe reklamacje. Bez powtórek model uczy się na czterech nowych wiadomościach. Z powtórkami ćwiczy również na czterech dawnych: otrzymuje ponownie sygnał, że „Gdzie jest paczka?” należy do dostawy. W tym małym przykładzie wykorzystujemy cały bufor; większe bufory zwykle dostarczają losowaną porcję.

Nie wystarczy jednak policzyć miejsc w pamięci. Cztery zapisane pytania o dostawę nie zawierają ani jednego przykładu zwrotu. Po zamianie dwóch z nich na „Jak odesłać zakup?” i „Chcę zwrócić koszulę” liczba powtórek pozostaje taka sama, ale obejmuje oba wcześniejsze działy. Poniższy eksperyment liczy przykłady w porcji danych; nie przewiduje trafności modelu.

Powtórki pomagają tylko na dostępnych danych

Model dostaje okazję ćwiczenia wcześniejszych odpowiedzi, lecz nie gwarancję zachowania wszystkich umiejętności. Losowa mała próbka może całkiem pominąć rzadką kategorię; taki problem badacze obserwowali przy bardzo małych buforach (§4.4 tej samej pracy). Nasze wiadomości są własnym przykładem, nie wynikiem tych eksperymentów. Skutek nauki trzeba sprawdzić na osobnych starych i nowych wiadomościach, nieużywanych do treningu. Bufor zajmuje też pamięć i wymaga zachowania wybranych danych.

W grach, w Reinforcement Learning — uczeniu działań na podstawie nagród — zachowuje się sytuację, działanie, nagrodę i następną sytuację. Losowanie takich zapisów ogranicza zależność od bezpośrednio następujących po sobie zdarzeń (Mnih et al., Human-level control through deep reinforcement learning, Methods, „Training algorithm for deep Q-networks”). To inne dane niż wiadomość z poprawnym działem; wyników z Atari nie należy przenosić wprost na LLM.

  • Continual Learning określa cel dalszej nauki z zachowaniem wcześniejszych zdolności; ER jest jednym ze sposobów jego realizacji.
  • Catastrophic Forgetting opisuje znaczne pogorszenie dawnych umiejętności, które powtórki mogą ograniczać.
  • Fine-tuning jest dalszym uczeniem modelu; replay zmienia dobór jego danych. Samo wklejenie dawnych wiadomości do rozmowy nie jest taką aktualizacją modelu.

Tekst i ilustrację przygotowano z pomocą AI. Wiadomości i demonstracja są własnym uproszczonym przykładem edukacyjnym; ilustracja jest metaforą, nie schematem budowy modelu.