Back to archive
#ai#alignment#ethics#theory

Corrigibility (Korygowalność) w AI

Robot porządkuje magazyn. Człowiek zauważa błąd w instrukcji i chce zatrzymać pracę. Jeżeli system traktuje wykonanie zadania jako jedyny cel, przerwanie może utrudniać osiągnięcie tego celu. Jak zaprojektować go tak, żeby przyjmował korektę zamiast ją obchodzić?

Corrigibility oznacza podatność systemu na poprawianie przez człowieka, w tym zmianę sposobu działania lub wyłączenie. Chodzi o zachowanie współpracy z nadzorem również wtedy, gdy interwencja zmienia dotychczasowe zadanie. To cel projektowy, a nie przypisywanie maszynie ludzkiej pokory.

W przykładzie robot powinien umożliwić zatrzymanie, przyjąć poprawioną instrukcję i zachować taką możliwość w przyszłych wersjach. Sam przycisk nie wystarcza, jeśli system może utrudnić jego użycie. Z kolei nagradzanie za wyłączenie może stworzyć zachętę do wywoływania niepotrzebnych interwencji.

Soares i współautorzy, „Corrigibility”, §2–4, analizują te trudności w matematycznych modelach agentów. Pokazują, dlaczego proste poprawki nagrody nie rozwiązują całego problemu. Nie wynika z tego, że każdy dzisiejszy model będzie stawiał opór: zachowanie zależy od konstrukcji i warunków działania. Istotne pytanie brzmi, czy nadzór pozostaje skuteczny również wtedy, gdy system zyskuje nowe możliwości.

Powiązania

42 AI