Back to archive

Scaling Laws

Masz budżet na uczenie modelu. Możesz zbudować większy model albo pokazać mniejszemu więcej tekstu. Pełne sprawdzenie każdej kombinacji byłoby kosztowne. Potrzebujesz sposobu oszacowania, co da dodatkowa skala, zanim wydasz cały budżet.

Scaling Laws to empiryczne zależności między rozmiarem modelu, ilością danych, obliczeniami i wynikiem uczenia. „Empiryczne” oznacza, że odkryto je przez pomiary. Często opisują spadek błędu przewidywania tekstu wraz ze zwiększaniem zasobów.

Badacze uczą kilka mniejszych modeli i dopasowują krzywą. Na jej podstawie próbują przewidzieć wynik większego treningu. Podwojenie liczby parametrów, czyli wyuczonych liczb w modelu, nie musi oznaczać podwojenia jakości: korzyść zależy również od ilości danych. Kaplan i współautorzy, §3–6, opisują takie zależności; praca Chinchilla bada podział budżetu między model a dane.

To narzędzie planowania, nie prawo gwarantujące, że większy model lepiej wykona każde zadanie. Niższa strata przewidywania tekstu nie jest automatycznie większą prawdziwością odpowiedzi. Zmiana danych, architektury albo celu uczenia może wymagać nowych pomiarów.

Powiązania

42ah⁝ Czy możemy zbudować teorię fizyki procesu uczenia, która przewiduje makroskopowe zachowania sieci?