Back to archive
#ai#llm#glossary#aigen

Knowledge Distillation

Knowledge Distillation to rodzina metod uczenia modelu studenta z wykorzystaniem przewidywań lub wyjść modelu nauczyciela. Klasycznym zastosowaniem jest przeniesienie części zachowania dużego modelu albo zespołu modeli do mniejszej sieci. Student uczy własne parametry; samo wywołanie nauczyciela nie wykonuje tego treningu.

W Distilling the Knowledge in a Neural Network, §2 Hinton, Vinyals i Dean opisują uczenie na miękkich rozkładach prawdopodobieństwa. Zwiększona Temperature ujawnia więcej informacji o relacjach między kandydatami. Ten sam parametr stosuje się po stronie nauczyciela i studenta przy porównywaniu rozkładów. Autorzy łączą taki cel z uczeniem na poprawnych etykietach, gdy są dostępne.

Więcej informacji niż jedna odpowiedź

Własny przykład: nauczyciel przypisuje umownym tokenom A, B i C szanse 0,60; 0,35; 0,05. Etykieta „A” wskazuje tylko zwycięzcę. Cały rozkład mówi także, że B było znacznie bardziej prawdopodobne niż C. Student może próbować odtworzyć te proporcje za pomocą Cross-entropy albo odpowiednio skierowanej KL Divergence. To dodatkowy sygnał treningowy, nie dowód poprawności etykiet nauczyciela.

W modelach generujących tekst trzeba odróżnić porównywanie rozkładów kolejnego tokena od uczenia na całych wygenerowanych sekwencjach. Kim i Rush, Sequence-Level Knowledge Distillation, §2.2–3.2 opisują oba podejścia dla tłumaczenia maszynowego. W wariancie sekwencyjnym student trenuje na wyjściach znalezionych przez beam search nauczyciela. Sam tekst takiej odpowiedzi nie zawiera pełnych prawdopodobieństw wszystkich alternatywnych tokenów.

Wynik zależy od nauczyciela, danych i możliwości studenta. Nie oznacza skopiowania wszystkich umiejętności ani zagwarantowanej poprawy w każdym zadaniu. Osobna notatka On-policy self-distillation opisuje szczególny wariant w TTPO; jej warunki nie są ogólną definicją Knowledge Distillation.