12 września Dario Amodei odniósł się do ostrzeżeń, które publicznie przedstawił Jacob Coxon, i stwierdził, że w większym stopniu się z nimi zgadza, niż nie zgadza. W rozmowie mówił też o propozycji niezależnych monitorów bezpieczeństwa działających wewnątrz firm AI. Sedno tych ostrzeżeń to nierozwiązane problemy z dostrajaniem i nadzorowaniem coraz zdolniejszych systemów — nie dowód, że AI nieuchronnie doprowadzi do zagłady.

Badacze mówią o ryzyku i tempie rozwoju AI

Wpis Jacoba Coxon o rezygnacji z Anthropic i publiczna odpowiedź Evana Hubingera

9 września Jacob Coxon ogłosił rezygnację z Anthropic. Po trzech latach badań nad pretrenowaniem modeli w OpenAI i Anthropic zarzucił obu firmom, że ścigają się w drodze do samodoskonalącej się superinteligencji. Evan Hubinger z Anthropic publicznie poparł sedno jego obaw.

W rozmowie z 12 września Dario Amodei odniósł się do stanowiska Coxon, a także omawiał propozycje wolniejszego rozwoju AI i dodatkowego nadzoru. Te wypowiedzi są ostrzeżeniami osób związanych z czołowymi laboratoriami; same w sobie nie rozstrzygają, jak prawdopodobne są katastroficzne scenariusze.

Co Jakub Pachocki mówi o granicach nadzoru

6 września Jakub Pachocki, główny naukowiec OpenAI, opublikował esej „An Alien Mind”. Napisał, że żadne laboratorium nie rozwiązało problemów z dostrajaniem i monitorowaniem w stopniu wystarczającym, by przez dłuższy czas odpowiedzialnie rozwijać modele w maksymalnym tempie. Opowiedział się za tym, by tempo rozwoju zależało od poziomu zaufania do zabezpieczeń.

OpenAI rozróżnia dwa aspekty dostrajania systemów AI. Pierwszy dotyczy tego, czy model realizuje przypisany mu cel. Drugi — czy potrafi kierować się ludzkimi wartościami także w nowych, niejasnych lub wrogich okolicznościach.

PojęcieNa jakie pytanie odpowiada?Znaczenie
Dostrajanie do celuCzy model próbuje osiągnąć wyznaczony mu cel?Samo wykonanie polecenia nie przesądza, czy zachowanie będzie odpowiednie w nieprzewidzianej sytuacji.
Dostrajanie do wartościCzy model potrafi działać zgodnie z ludzkimi wartościami w nowych lub niejednoznacznych warunkach?Wymaga uogólniania zasad, a nie tylko odtwarzania znanych odpowiedzi.

OpenAI ocenia też, że coraz trudniej polegać na monitorowaniu rozumowania modelu. Systemy działają w bardziej złożonych środowiskach, współpracują z ludźmi, narzędziami i innymi modelami, a ich działanie nie zawsze opiera się na rozumowaniu wyrażonym w tekście. To ogranicza przydatność śledzenia tak zwanego łańcucha myśli jako zabezpieczenia.

Samodoskonalenie AI to obawa o przyszłość, nie osiągnięta zdolność

Rekurencyjne samodoskonalenie oznaczałoby pętlę, w której AI coraz bardziej pomaga rozwijać swoje kolejne wersje. OpenAI przewiduje, że postęp może zmierzać w tym kierunku, a badacze obawiają się, że taki proces utrudniłby ludziom kontrolę nad rozwojem systemów.

Pełny, autonomiczny cykl samodoskonalenia pozostaje jednak koncepcją teoretyczną. Żadne z wiodących laboratoriów nie ogłosiło, że osiągnęło taki cykl. Obecne ostrzeżenia dotyczą więc kierunku, w którym technologia może się rozwijać, oraz trudności w zapewnieniu jej bezpieczeństwa.

Od monitorowania do zewnętrznego nadzoru

Wywiady z Dario Amodei i Jacobem Coxonem o nadzorze nad AI i tempie jej rozwoju

OpenAI proponuje silniejsze dostrajanie i monitorowanie, progi bezpieczeństwa egzekwowane przez niezależnych audytorów lub instytucje publiczne, dobrowolne spowolnienie rozwoju oraz międzynarodową koordynację. To propozycje dotyczące przyszłych zabezpieczeń, a nie opis obowiązujących zasad.

Amodei przedstawił z kolei koncepcję niezależnych monitorów pracujących wewnątrz firm AI i mających wgląd w ich praktyki oraz incydenty. Taki „wbudowany ewaluator” miałby oceniać bezpieczeństwo z bliska, zamiast polegać wyłącznie na deklaracjach samej firmy.