Back to archive
#ai#papers#aigen#llm#inference

Post-training quantization

Post-training quantization (PTQ) polega na ograniczeniu precyzji zapisu liczb w już wytrenowanym modelu. W kwantyzacji samych wag wybrane macierze zastępuje się wartościami z mniejszego zestawu. Pozwala to przechowywać je z użyciem mniejszej liczby bitów, ale zmienia wynik obliczeń.

W uproszczonym formacie z krokiem 0,1 waga 0,73 zostałaby zaokrąglona do 0,7, z różnicą −0,03. W rzeczywistych formatach skale często są wspólne dla grup wag, a dopuszczalne wartości nie muszą być rozmieszczone równomiernie. Liczba bitów na wartość nie obejmuje automatycznie całego narzutu zapisu skal i pozostałych części modelu.

Najprostsze RTN, czyli round-to-nearest, wybiera najbliższą dopuszczalną wartość. Bardziej rozbudowane metody korzystają z danych kalibracyjnych, żeby ograniczyć skutki zaokrągleń. PTQ nie wymaga ponownego pełnego treningu modelu. Oszczędność pamięci i szybkość zależą również od tego, czy silnik potrafi wykorzystać dany format.

W 42da⁝ Błędy kwantyzacji częściowo znoszą się między warstwami modelu opisano, dlaczego mała różnica wag nie wystarcza do przewidzenia różnicy odpowiedzi: kolejne bloki reagują także na zmienione wejście.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.