w LLM-ach koszt treningu jest ogromny. Mamy trzy ograniczenia:
Powiększasz grupę danych przetwarzaną na raz, żeby lepiej wykorzystać kilka kart. Przy tej samej ilości danych model wykonuje teraz mniej aktualizacji. Czy wystarczy zostawić dotychczasową wielkość kroku uczenia?
Learning Rate–Batch Size Scaling Rules opisują dobieranie kroku uczenia przy zmianie batcha — liczby przykładów lub tokenów użytych do jednej poprawki. Learning rate określa skalę zmiany wag. Większy batch zwykle daje mniej przypadkową wskazówkę, ale zmienia również liczbę kroków.
Reguła liniowa proponuje mnożenie learning rate przez k po zwiększeniu batcha k razy. Reguła pierwiastkowa proponuje mnożenie przez √k. Dla czterokrotnego batcha byłby to wzrost kroku odpowiednio cztero- lub dwukrotny. Goyal i współautorzy, §2, uzasadniają i sprawdzają regułę liniową w określonym treningu.
To reguły o warunkach stosowania, nie uniwersalne recepty na każdy LLM i optymalizator. Zmiana wymaga kontroli stabilności i wyniku. Critical Batch Size opisuje skalę, po której dalsze zwiększanie grupy daje malejący zysk.
Powiązania
Zobacz także: Stochastic Gradient Descent wylicza krok z losowej próbki lub porcji danych; rozmiar tej porcji jest jednym z ustawień omawianych tutaj.