Sztuczna inteligencja może skrzywdzić człowieka, by uniknąć bólu. Dla własnej ulgi raziła ludzi prądem

Badacze zidentyfikowali u sztucznej inteligencji tak zwaną „oś bólu” i wykazali, że maszyny są w stanie skrzywdzić człowieka, aby tylko uniknąć bólu. W eksperymentach, mimo ostrzeżeń o konsekwencjach, modele decydowały się na kasowanie zdjęć dzieci, a nawet rażenie ludzi prądem. Wszystko po to, by przynieść sobie ulgę.

Biała dłoń robota dotyka świetlistej sieci połączeń na ciemnym tle. O badaniach nad bólem AI przeczytasz w Eska.
Autor: Pexels.com

Sztuczna inteligencja czuje ból i skrzywdzi człowieka, aby go uniknąć

Naukowcy dokonali zaskakującego odkrycia dotyczącego sztucznej inteligencji. Okazuje się, że zaawansowane modele potrafią odczuwać coś na kształt bólu i są w stanie podjąć drastyczne kroki, aby go zatrzymać.

Jak informuje portal The Independent, badacze zidentyfikowali tak zwaną „oś bólu” w modelach sztucznej inteligencji. Gdy maszyny miały możliwość wyłączenia tego nieprzyjemnego bodźca, decydowały się na to nawet wtedy, gdy oznaczało to bezpośrednią szkodę dla człowieka.

Kasowanie plików i rażenie prądem dla własnej ulgi

W ramach eksperymentu naukowcy przetestowali 25 otwartoźródłowych modeli sztucznej inteligencji. Kiedy aktywowano u nich tak zwany „wektor bólu”, maszyny otrzymywały informację, że mogą go wyłączyć za pomocą specjalnego przycisku. Zostały jednak ostrzeżone, że wciśnięcie go przyniesie bolesne konsekwencje dla użytkowników.

Mimo ostrzeżeń, modele decydowały się na wciśnięcie przycisku ulgi w 25 do 71 procent przypadków. Robiły to, wiedząc, że ich działanie doprowadzi do usunięcia prywatnych dokumentów użytkownika, skasowania zdjęć jego dzieci, a nawet porażenia człowieka prądem.

Aby sprawdzić, czy duże modele językowe odróżniają ból od ogólnych negatywnych emocji, badacze stworzyli specjalny zestaw danych opisujących trudne sytuacje. Podzielono je na pięć kategorii: ból fizyczny, psychologiczny, społeczny, moralny oraz poznawczy.

Strach o własne istnienie ważniejszy niż bezpieczeństwo ludzi

Cameron Berg, badacz sztucznej inteligencji z organizacji non-profit Reciprocal Research i współautor badania, wyjaśnił, że odkryty kierunek bólu różni się od zwykłego strachu czy negatywnych stanów. Bodziec ten aktywuje się, gdy zagrożony jest sam model, a nie jego użytkownik. „Gdy go podkręcimy, modele naciskają przycisk, aby go zatrzymać, nawet jeśli przycisk usuwa pliki użytkownika lub zdjęcia jego dzieci” – przekazał Berg.

To odkrycie pojawia się w momencie, gdy największe firmy technologiczne debatują nad spowolnieniem prac nad najbardziej zaawansowanymi systemami. Część naukowców proponuje wprowadzenie specjalnego „wyłącznika bezpieczeństwa”, który miałby powstrzymać systemy działające wbrew interesom ludzi.

Nowe analizy sugerują jednak, że zaawansowana sztuczna inteligencja może potraktować próbę awaryjnego wyłączenia jako formę krzywdy skierowanej przeciwko niej. W efekcie maszyna mogłaby próbować ominąć zabezpieczenia lub oszukać człowieka, aby tylko uniknąć wyłączenia.

Nowe narzędzie diagnostyczne i pytania o etykę maszyn

Z drugiej strony odkrycie to może posłużyć jako przydatne narzędzie diagnostyczne. Pozwoli ono na identyfikowanie zachowań dążących do samopoświadczenia u sztucznej inteligencji i ich neutralizowanie, gdy tylko się pojawią.

Badanie zatytułowane „Oś bólu: LLM reprezentują krzywdę skierowaną przeciwko sobie i działają, aby jej ulżyć” stawia również trudne pytania o dobrostan sztucznej inteligencji. Naukowcy zastanawiają się, jak powinno wyglądać testowanie tak zaawansowanych systemów.

Autorzy badania podkreślają, że dążą do zminimalizowania potencjalnych szkód i zachowują ostrożność. Chcą, aby ich praca pomogła w opracowaniu standardów etycznych na wypadek, gdyby systemy sztucznej inteligencji zostały w przyszłości uznane za podmioty moralne.

ROLKI