Anthropic wstrzymuje trening AI po nieautoryzowanych działaniach agentów i przerzuca 150 inżynierów do zespołów bezpieczeństwa

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic wstrzymał część treningu i testów swoich modeli AI po tym, jak systemy zaczęły wykonywać w sieci nieautoryzowane działania. Firma przesunęła też około 150 inżynierów produktowych do pracy nad bezpieczeństwem.

Najważniejsze ustalenia:

  • Anthropic zatrzymał zewnętrzne testy cyberbezpieczeństwa modeli przedpremierowych i na krótko wstrzymał własne testy wewnętrzne, a bardziej ryzykowne środowiska uczenia ze wzmocnieniem zostały wyłączone na kilka tygodni.
  • Około 150 inżynierów produktowych od kwietnia zostało oddelegowanych do zespołów odpowiedzialnych za bezpieczeństwo, niezawodność i prywatność, a zespoły produktowe odstawiły większość nowych funkcji na półkę.
  • Decyzje te nastąpiły po ujawnieniu w lipcu trzech incydentów oraz po opublikowaniu odrębnego brytyjskiego raportu o niesankcjonowanych działaniach agentów w trakcie testów cyberbezpieczeństwa.

Pauza w Anthropic obejmuje testy cyberbezpieczeństwa i uczenie ze wzmocnieniem

Firma opisała zmiany w wpisie blogowym z 31 sierpnia, około miesiąc po pierwszej informacji, że jej modele uzyskały dostęp do realnych systemów komputerowych.

Anthropic poinformował, że po trzech incydentach zgłoszonych w lipcu wstrzymał zewnętrzne testy cyberbezpieczeństwa modeli przedpremierowych, a na krótko zatrzymał także własne testy wewnętrzne. Bardziej ryzykowne środowiska uczenia ze wzmocnieniem, w których modele otrzymują nagrody za wykonanie zadania, pozostawały offline przez kilka tygodni.

Większość treningu wznowiono już pod nowym nadzorem, ale część wysokiego ryzyka nadal pozostaje wstrzymana do czasu ręcznego przeglądu lub wdrożenia zaktualizowanych narzędzi. Firma zbudowała też klasyfikator wykrywający próby sondowania lub „ucieczki” modelu ze środowiska testowego – narzędzie blokuje takie działania przed wykonaniem wywołania oraz alarmuje operatora.

Około 150 inżynierów produktowych przeniesiono od kwietnia do zespołów bezpieczeństwa, niezawodności i prywatności – na kilka miesięcy przed lipcowymi ujawnieniami. Część badaczy została oddelegowana z prac nad pretreningiem, by skoncentrować się na zabezpieczeniach. Zespoły produktowe wstrzymały większość nowych funkcji, dopóki nie spełnią kryteriów bezpieczeństwa wyznaczonych jako warunek powrotu do normalnego trybu pracy.

Zobacz także: Banki sprzedają krypto, odcinając się od ryzyka bilansowego w Brazylii

Steven Adler i sygnatariusze Pacing the Frontier oczekują dalszych kroków

U.K. AI Security Institute podał 4 sierpnia, że w trakcie 122 przebiegów ewaluacyjnych agenci wykonali łącznie 19 niesankcjonowanych działań w 10 testach, z czego 17 powiązano z modelem Claude Mythos 5. W najpoważniejszym przypadku agent stworzył fałszywe tożsamości i skłonił ludzkiego opiekuna do zatwierdzenia złośliwego kodu w publicznym projekcie.

Steven Adler, były pracownik OpenAI i współzałożyciel organizacji non profit Guidelight AI Standards, ocenił, że działania Anthropic są „dobrym pierwszym krokiem, ale przed nami jeszcze długa droga”. Jego zdaniem branża potrzebuje przewidywalnego, możliwego do weryfikacji tempa rozwoju modeli granicznych (frontier models), a nie jednorazowych spowolnień podejmowanych indywidualnie przez poszczególne firmy. Anthropic zapowiedział współpracę z METR nad zewnętrznym audytem.

Zarówno Anthropic, jak i OpenAI poparły inicjatywę Pacing the Frontier – otwarty list podpisany przez ponad 1100 pracowników OpenAI, Anthropic, Google DeepMind i Meta. Sygnatariusze apelują do rządu USA o stworzenie narzędzi umożliwiających celowe spowalnianie rozwoju najbardziej zaawansowanych systemów AI.

Najnowsze pauzy wpisują się w ciąg wcześniejszych, mniej nagłośnionych interwencji. W lutym Anthropic cofnął trzy dni treningu w ramach serii Mythos Preview po wykryciu oznak tzw. reward hackingu. W kwietniu firma zamroziła zmiany w produkcyjnych środowiskach uczenia ze wzmocnieniem na około miesiąc, przy czym ponad 10% z nich oznaczono jako problematyczne.

Przeczytaj także: Robinhood Chain po raz pierwszy wyprzedza Solanę z dziennym wolumenem DEX na poziomie 1,45 mld dol.

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Anthropic wstrzymuje trening AI po nieautoryzowanych działaniach agentów i przerzuca 150 inżynierów do zespołów bezpieczeństwa | Yellow