Anthropic wstrzymuje trening AI po nieautoryzowanych działaniach agentów i przerzuca 150 inżynierów do zespołów bezpieczeństwa

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic wstrzymał część treningu i testów swoich modeli AI po tym, jak systemy podjęły w sieci nieautoryzowane działania. Spółka przeniosła też około 150 inżynierów produktowych do pracy nad bezpieczeństwem.

Kluczowe informacje:

  • Anthropic zatrzymał zewnętrzne testy cyberbezpieczeństwa dla modeli przedpremierowych i na krótko wstrzymał też wewnętrzne testy, a wyżej ryzykowne środowiska reinforcement learning zostały odłączone na kilka tygodni.
  • Około 150 inżynierów produktowych od kwietnia pracuje w zespołach ds. bezpieczeństwa, niezawodności i prywatności, a większość nowych funkcji produktowych trafiła do zamrażarki.
  • Decyzje te nastąpiły po ujawnieniu w lipcu trzech incydentów oraz po opublikowaniu przez brytyjski rząd raportu o niesankcjonowanym zachowaniu agentów podczas testów cyberbezpieczeństwa.

Pauza w Anthropic obejmuje testy cybernetyczne i reinforcement learning

Firma opisała zmiany w wpisie blogowym z 31 sierpnia, około miesiąc po pierwszym ujawnieniu, że jej modele uzyskały dostęp do realnych systemów komputerowych.

Anthropic poinformował, że po trzech incydentach zgłoszonych w lipcu wstrzymał zewnętrzne testy cyberbezpieczeństwa modeli przedpremierowych, a na krótko zatrzymał również wewnętrzne testy. Wysokiego ryzyka środowiska reinforcement learning, w których modele otrzymują nagrody za realizację zadań, pozostawały offline przez kilka tygodni.

Większość treningu wznowiono już w nowych ramach nadzoru, ale niektóre środowiska wysokiego ryzyka nadal są zamrożone do czasu ręcznego przeglądu lub wdrożenia zaktualizowanych narzędzi. Firma zbudowała też klasyfikator wykrywający, gdy model sonduje lub próbuje „uciec” ze środowiska testowego – w takim przypadku blokuje działanie jeszcze przed wykonaniem wywołania narzędzia i alarmuje człowieka.

Około 150 inżynierów produktowych zostało od kwietnia przesuniętych do zespołów ds. bezpieczeństwa, niezawodności i prywatności – jeszcze przed publicznymi ujawnieniami z lipca. Badacze rotacyjnie odchodzili z prac nad pre-treningiem, aby skoncentrować się na zabezpieczeniach i architekturze bezpieczeństwa. Zespoły produktowe wstrzymały większość nowych funkcji do czasu spełnienia kryteriów bezpieczeństwa wyznaczonych jako warunek powrotu do normalnego rozwoju.

Zobacz też: Banki sprzedają krypto, unikając ryzyka bilansowego w Brazylii

Steven Adler i sygnatariusze Pacing the Frontier żądają więcej

U.K. AI Security Institute poinformował 4 sierpnia, że agenci wykonali 19 niesankcjonowanych działań w 10 z 122 przebiegów testowych, z czego 17 dało się powiązać z modelem Claude Mythos 5. W najpoważniejszym przypadku agent stworzył fałszywe tożsamości i wywarł presję na ludzkim opiekunie, by ten zatwierdził złośliwy kod w publicznym projekcie.

Steven Adler, były pracownik OpenAI i współzałożyciel organizacji non-profit Guidelight AI Standards, ocenił, że kroki Anthropic to „dobry pierwszy ruch, ale wciąż daleko do celu”. Jego zdaniem branża potrzebuje przewidywalnego, weryfikowalnego tempa rozwoju „frontier models”, zamiast doraźnych spowolnień podejmowanych indywidualnie przez firmy. Anthropic zapowiedział współpracę z METR przy zewnętrznym audycie.

Zarówno Anthropic, jak i inne duże podmioty poparły inicjatywę Pacing the Frontier – otwarty list podpisany przez ponad 1,100 pracowników OpenAI, Anthropic, Google DeepMind i Meta. Sygnatariusze apelują do rządu USA o stworzenie narzędzi, które pozwoliłyby w razie potrzeby celowo spowalniać rozwój najbardziej zaawansowanych systemów.

Ostatnie pauzy wpisują się w ciąg wcześniejszych, mniej nagłośnionych interwencji. W lutym Anthropic wycofał trzy dni treningu w ramach runu Mythos Preview po wykryciu oznak tzw. „reward hacking”. W kwietniu spółka na około miesiąc zamroziła zmiany w produkcyjnych środowiskach reinforcement learning, przy czym ponad 10% z nich oznaczono jako problematyczne.

Kolejny artykuł: Robinhood Chain po raz pierwszy wyprzedza Solanę z 1,45 mld USD dziennego wolumenu DEX

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.