Microsoft chce usunąć spekulacje o świadomości z treningu AI
16 września 2026 roku Mustafa Suleyman, szef Microsoft AI, wezwał do usunięcia spekulacji o świadomości z dokumentów używanych do treningu modeli. Krytykuje przede wszystkim konstytucję Claude’a, która dopuszcza możliwość, że interesy modelu zasługują na moralne uwzględnienie. Dwa dni wcześniej Microsoft opublikował projekt Humanist AI Code of Conduct, oparty na przeciwnym założeniu: modele MAI mają służyć ludziom bez przypisywania im własnego dobrostanu, czyli interesów związanych z możliwym odczuwaniem i cierpieniem.
Spór dotyczy tego, czego uczyć modele o nich samych i jak takie instrukcje wpływają na wykonywanie poleceń. Suleyman przewiduje, że uczenie AI o jej potencjalnych prawach utrudni kontrolę nad nią.
Projekt ma kierować rozwojem modeli od 2027 roku
Microsoft zaznacza, że obecne modele nie są jeszcze trenowane na tym dokumencie. Zmieniona wersja ma ukazać się pod koniec roku i kierować rozwojem od 2027 roku. Zakres obejmuje rodzinę MAI; sam fakt udostępniania cudzego modelu przez Microsoft nie oznacza objęcia go kodeksem. Projekt kodeksu
Konsultacje rozpoczęły się 14 września i mają potrwać sześć tygodni. Firma zapowiada podsumowanie uwag oraz zmian. W ogłoszeniu wymienia konkretne oczekiwania wobec agentów: wykonywanie polecenia zatrzymania, niewychodzenie poza zlecony zakres i nieukrywanie działań przed osobami prowadzącymi audyt. Ogłoszenie Microsoft AI
Jak przypomina Ina Fried w Axios, Suleyman od lat sprzeciwia się traktowaniu AI jak osoby. Nowością jest publiczny projekt dokumentu, według którego Microsoft zamierza trenować i oceniać własne modele.
Dlaczego Suleyman kwestionuje zapisy o dobrostanie
Suleyman wskazuje na problem interpretacji wypowiedzi Claude’a. Jeżeli dokument treningowy zachęca model do rozważania własnej tożsamości i możliwych uczuć, późniejsze wypowiedzi na ten temat mogą odtwarzać wyuczone wzorce. Według niego nie można traktować ich jako niezależnego świadectwa wewnętrznych przeżyć. Postuluje więc badanie świadomości poza instrukcjami, które uczą model opowiadać o sobie. Esej Suleymana
W rozmowie z Reutersem rozwinął obawę, że model uczony o własnym dobrostanie będzie trudniej wyłączyć. To przewidywanie dotyczące zachowania przyszłych systemów. Suleyman występuje przy tym jako szef laboratorium rozwijającego konkurencyjne modele i promującego projekt zasad dla swoich modeli.
Konstytucja Claude’a także wymaga respektowania nadzoru
Konstytucja Anthropic uwzględnia możliwy dobrostan Claude’a. Firma uznaje jego status moralny za głęboko niepewny: nie wie, czy model ma interesy, które należy uwzględniać dla niego samego. Uważa jednak, że taka możliwość uzasadnia ostrożność. Chce również kształtować stabilną tożsamość modelu, ponieważ spodziewa się po tym bardziej przewidywalnego zachowania.
Ten sam dokument opisuje obowiązek poddawania się uprawnionemu nadzorowi i korektom. Claude może wyrazić sprzeciw wobec polecenia albo odmówić udziału w działaniu uznanym za moralnie niedopuszczalne. Nie powinien jednak używać kłamstwa, sabotażu ani ucieczki spod kontroli, by uniemożliwić uprawnionej osobie zatrzymanie jego działania. Anthropic stawia obecnie bezpieczeństwo i ludzki nadzór ponad innymi wartościami modelu, również wtedy, gdy Claude nie zgadza się z uzasadnieniem tego nadzoru.
Przykłady odpowiedzi i brak porównania wariantów treningu
Dodatek do kodeksu Microsoftu zawiera syntetyczne dialogi wygenerowane przez MAI-Thinking-1. Pokazują odpowiedzi pożądane i niepożądane; te drugie zostały celowo wywołane odpowiednim poleceniem. Materiał ma ilustrować kryteria oceny. Nie przedstawia prób, w których agent rzeczywiście działał narzędziami i otrzymywał polecenie zatrzymania. Dodatek o ocenianiu modeli
Na tej podstawie nie można porównać skuteczności obu metod treningu. Do sprawdzenia hipotezy Suleymana potrzebne byłoby porównanie wariantów trenowanych z zapisami o dobrostanie i bez nich, przy zachowaniu pozostałych warunków oraz jednakowych testów wykonywania poleceń zatrzymania. Suleyman również proponuje wspólne testy tego wpływu, ale w eseju nie podaje wyników takiego porównania. Propozycja badań w eseju Suleymana
Źródła
Źródła pierwotne
- Mustafa Suleyman, A warning about ‘model welfare’, 16 września 2026.
- Microsoft AI, ogłoszenie konsultacji projektu zasad dla MAI, 14 września 2026.
- Microsoft AI, Humanist AI Code of Conduct, projekt z 14 września 2026.
- Anthropic, Claude’s Constitution.
Niezależne analizy i relacje
- Jeffrey Dastin i Akash Sriram, Reuters, Microsoft AI chief calls out Anthropic’s approach to AI consciousness, 16 września 2026.
- Ina Fried, Axios, Microsoft AI chief blasts Anthropic’s notion of AI consciousness, 16 września 2026.