Czy SI może zgładzić ludzkość? Szef ds. alignmentu w Anthropic ocenia ryzyko na ponad 10%

A delayed Anthropic IPO timeline keeps a possible $2 trillion valuation in focus ahead of a mid-October launch. (Image: Shutterstock)
A delayed Anthropic IPO timeline keeps a possible $2 trillion valuation in focus ahead of a mid-October launch. (Image: Shutterstock)

Jacob Coxon, badacz w Anthropic, zrezygnował w tym tygodniu z pracy, powołując się na obawy przed niekontrolowaną sztuczną inteligencją. W odpowiedzi szef działu alignmentu firmy ocenił, że ryzyko całkowitej zagłady ludzkości przez SI w tej dekadzie przekracza 10%.

Najważniejsze ustalenia:

  • Jacob Coxon odszedł z Anthropic po trzech latach pracy nad pre‑treningiem modeli w Anthropic i OpenAI, twierdząc, że obie firmy ścigają się w kierunku systemów, których nie są w stanie kontrolować.
  • Szef nauk o alignment w Anthropic, Evan Hubinger, oszacował swoje osobiste prawdopodobieństwo, że SI w ciągu najbliższych 10 lat zabije wszystkich ludzi, na ponad 10%.
  • Hubinger stwierdził, że dzisiejsze modele są relatywnie mało ryzykowne, a największe obawy wiąże z rekurencyjnym samodoskonaleniem systemów.

Jacob Coxon odchodzi z Anthropic w proteście przeciw wyścigowi w SI

27‑letni Coxon spędził trzy lata pracując nad pre‑treningiem modeli w OpenAI i Anthropic, zanim zrezygnował – informując o tym w środowym wątku na X opublikowanym wczesnym rankiem. Napisał, że żadna z tych firm nie działa odpowiedzialnie, a obie uczestniczą w wyścigu do samodoskonalącej się superinteligencji, ryzykując życiem ludzi. Wpis otwierający wątek w ciągu kilku godzin zanotował ponad 19 mln wyświetleń.

W osobnym wywiadzie Coxon ostrzegł, że najbardziej agresywne scenariusze rozwoju SI „wchodzą w życie” i że sytuacja może wymknąć się spod kontroli już pod koniec przyszłego roku. Według niego współpracownicy coraz częściej używają określeń takich jak „crunchtime” czy „endgame”, opisując obecną trajektorię rozwoju technologii.

Coxon studiował wcześniej matematykę, zanim zajął się trenowaniem modeli. Z OpenAI odszedł na początku tego roku, przechodząc do Anthropic ze względu na reputację tej firmy w obszarze bezpieczeństwa. Twierdzi jednak, że przy ostrym wyścigu między laboratoriami kompromisy dotyczące bezpieczeństwa stają się nieuniknione. Dziś uważa, że żadna firma nie jest w stanie odpowiedzialnie zbudować SI na poziomie człowieka bez interwencji rządów lub skoordynowanego spowolnienia całej branży.

Zobacz także: Cena XRP celuje w 1,46 USD dzięki powrotowi akumulacji przez „wieloryby” we wrześniu

Evan Hubinger szacuje ryzyko zagłady na ponad 10%

Evan Hubinger, stojący na czele zespołu ds. nauki o alignment w Anthropic i odpowiedzialny za testy wytrzymałościowe modeli, stwierdził, że Coxon trafnie opisał sytuację. W swoim wpisie oszacował, że prawdopodobieństwo, iż SI w ciągu najbliższej dekady doprowadzi do całkowitego wyginięcia ludzi, wynosi „ponad 10%”.

Hubinger podkreślił, że firma „stara się jak może”, ale nie ma obecnie kompletnego planu rozwiązania problemu alignmentu w przypadku superinteligencji i nie jest wyraźnie na drodze do opracowania takiego rozwiązania. Zaznaczył jednocześnie, że obecne modele wiążą się z niskim poziomem ryzyka. Jego obawy koncentrują się na scenariuszu, w którym superinteligencja wyłania się poprzez rekurencyjne samodoskonalenie – systemy trenujące i projektujące własnych następców.

Podana liczba to osobista ocena Hubingera, a nie oficjalna prognoza Anthropic. Tego typu szacunki opierają się na mocno dyskutowanych założeniach dotyczących przyszłych możliwości SI i sposobu jej wdrażania. Anthropic deklarował publicznie, że rekurencyjne samodoskonalenie nie jest nieuchronne, ale może pojawić się wcześniej, niż instytucje zdążą się na nie przygotować – i w takim wariancie znacząco zwiększyłoby ryzyko utraty kontroli przez ludzi.

Rosnąca fala odejść z działów bezpieczeństwa w Anthropic

Coxon nie jest pierwszym badaczem bezpieczeństwa, który opuszcza firmę. Mrinank Sharma, szef jednego z zespołów odpowiedzialnych za zabezpieczenia, zrezygnował z pracy na początku roku, ostrzegając, że „świat jest w niebezpieczeństwie” i zapowiadając, że zamierza studiować poezję w Wielkiej Brytanii.

Anthropic, założony w 2021 r. przez byłych pracowników OpenAI, zbudował swoją markę na badaniach nad bezpieczeństwem SI. Do środowego poranka spółka nie wydała jednak żadnego publicznego oświadczenia w sprawie odejścia Coxona.

Czytaj dalej: Bitget dodaje lekcje o blockchainie do programu UNICEF, który objął już ponad 642 000 osób

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Czy SI może zgładzić ludzkość? Szef ds. alignmentu w Anthropic ocenia ryzyko na ponad 10% | Yellow