Fine-tuning
Wyuczony model potrafi przetwarzać język, ale chcesz, żeby klasyfikował firmowe wiadomości jako „zwrot”, „dostawa” albo „płatność”. Ogólna umiejętność nie daje jeszcze oczekiwanego sposobu pracy. Przygotowujesz przykłady wiadomości z poprawnymi kategoriami.
Fine-tuning to dalsze uczenie istniejącego modelu lub jego parametrów adaptacji na nowych danych. Zmienia liczby sterujące działaniem, dzięki czemu dopasowanie może utrzymać się również przy kolejnych zapytaniach.
W przykładzie model porównuje swoje przewidywania z zadanymi kategoriami, a trening modyfikuje parametry. Wklejenie kilku przykładów do pojedynczego promptu, czyli tekstu wejściowego, jest inną operacją: samo w sobie nie zmienia wag.
Można uczyć wszystkie wagi lub tylko niewielkie dodatki, np. LoRA. Fine-tuning nie gwarantuje poprawy w każdym zadaniu; słabe dane mogą utrwalać błędy, a dostosowanie do jednej dziedziny może zmienić inne zachowania. Punkt wyjścia zwykle pochodzi z Pre-training.
Mechanizm i szczegóły
W pierwotnym GPT po uczeniu na tekście następował trening na przykładach z etykietami dla konkretnych zadań. Optymalizowano parametry modelu i dodanej warstwy wyjściowej. Ten podział opisuje Improving Language Understanding by Generative Pre-Training, §3.2.
Co faktycznie się zmienia
W pełnym fine-tuningu aktualizowane są wszystkie parametry modelu objętego treningiem. Można też uczyć tylko wybrane parametry lub niewielkie moduły adaptacji. Przykładowo LoRA pozostawia bazowe wagi zamrożone i uczy macierze opisujące ich zmianę; szczegóły podają Hu et al., §2 i §4.1. Zatem zamrożenie wag bazowych nie wyklucza uczenia — trzeba sprawdzić, czy optymalizowane są inne parametry.
Własny przykład: zbiór zawiera wiadomości klientów oraz poprawne kategorie „zwrot”, „dostawa” i „płatność”. Trening może dostosować istniejący model do tej klasyfikacji. Wklejenie kilku takich przykładów do zwykłego promptu zmienia jego wejście, lecz samo nie aktualizuje parametrów. Rozróżnienie adaptacji w kontekście i fine-tuningu opisują Brown et al., Language Models are Few-Shot Learners, §2.
Supervised fine-tuning używa przykładów pożądanych odpowiedzi lub etykiet. Nazwa „fine-tuning” bez doprecyzowania nie wskazuje jednej funkcji celu ani liczby uczonych parametrów. Istniejące Order-consistency SFT jest szczególnym sposobem uczenia scorera, a nie ogólną definicją tego etapu.