Post-training quantization
Masz już wyuczony model, ale zajmuje za dużo pamięci, żeby uruchomić go na wybranym komputerze. Duża część miejsca to zapis liczb sterujących obliczeniami. Czy można zapisać je mniej dokładnie i dzięki temu zmniejszyć model?
Post-training quantization (PTQ) ogranicza precyzję liczb po zakończeniu zasadniczego treningu. W wariancie dotyczących wag zastępuje wyuczone wartości liczbami z mniejszego zestawu, które można przechowywać przy użyciu mniejszej liczby bitów.
W uproszczonym formacie z krokiem 0,1 waga 0,73 staje się 0,7. Oszczędzamy miejsce, ale dodajemy błąd −0,03. Bardziej rozbudowane metody używają próbek danych do doboru zaokrągleń lub skal tak, żeby mniej pogorszyć wynik. GPTQ, §3, opisuje jedną z takich metod.
Mniej bitów nie oznacza automatycznie proporcjonalnie mniejszego zużycia całej pamięci ani szybszego działania. Potrzebny jest silnik obsługujący format; istnieje też koszt skal i innych elementów. PTQ nie jest dowolnym ponownym treningiem modelu. Wpływ błędów na odpowiedź omawia artykuł o przenoszeniu różnic między warstwami.