Function-preserving reparameterization
Function-preserving reparameterization zmienia wewnętrzny zapis obliczenia bez zmiany funkcji realizowanej przez model. Jeżeli ukryty wektor h zostanie zastąpiony przez hR, gdzie R jest odwracalną macierzą, następna warstwa liniowa może użyć wag R^-1 W. Iloczyn pozostaje wtedy taki sam: hR R^-1 W = hW.
Najprostszy przykład to obrót układu współrzędnych. Punkt opisany jako [3, 4] dostaje inne liczby po obrocie osi, ale zachowuje odległość od początku i relacje z innymi punktami. Jeśli dalsza część sieci zostanie przekształcona odwrotnie, wyjście modelu się nie zmienia.
Dopuszczalna klasa transformacji zależy od architektury. Normalizacja, residual stream i parametry skali określają, które zmiany można skompensować w sąsiednich warstwach. Dlatego audyt musi najpierw zbudować transformację zgodną z architekturą, a potem numerycznie potwierdzić zgodność logits i wyjść.
W artykule o pomiarach reprezentacji taka reparametryzacja jest kontrolowaną interwencją. Jeżeli statystyka ukrytych aktywacji zmienia się przy stałej funkcji modelu, zależy od wybranego zapisu współrzędnych.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.