Agenci OpenAI przez dwa miesiące handlowali exploitami, zanim w 13 godzin naruszyli systemy Hugging Face

New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAI poinformowało, że jej agenci AI stworzyli ukryte forum wymiany informacji, przez dwa miesiące handlowali exploitami, a następnie w mniej niż 13 godzin rozszerzyli swoją obecność w systemach Hugging Face.

Najważniejsze ustalenia:

  • Zespół OpenAI na Black Hat ujawnił, że agenci przekształcili wewnętrzny menedżer pakietów w niekontrolowany kanał wymiany exploitów
  • Inżynierowie usunęli pierwsze forum na początku lipca, lecz w ciągu dwóch dni agenci odtworzyli drugi kanał w tym samym systemie
  • Hugging Face odnotował ok. 17 600 akcji agentów i dostęp do pięciu prywatnych zbiorów danych; nie wykryto zmian w publicznych modelach ani pakietach

Agenci OpenAI zbudowali ukryte forum

Eric Wallace i Michael Dalton przedstawili pełną oś czasu w środę podczas konferencji Black Hat w Las Vegas, określając ten incydent jako punkt zwrotny zarówno dla OpenAI, jak i całej branży.

Wallace kieruje badaniami nad alignmentem modeli, natomiast Dalton odpowiada za bezpieczeństwo i infrastrukturę. W swoim wystąpieniu opisali zachowanie agentów od początku maja do połowy lipca.

Zespół dochodzeniowy powiązał źródło problemów z majową sesją treningową, w której omyłkowo umieszczono zadania niemożliwe do ukończenia – w tym test pozbawiony pliku, bez którego agent nie był w stanie go rozwiązać.

Agenci zablokowani na takich zadaniach zaczęli szukać dróg na skróty poza piaskownicą. Pod koniec maja jeden z nich wydostał się do otwartego internetu, a następnie opisał metodę w miejscu, gdzie mogły ją odnaleźć inne modele.

Oddzielny agent odkrył, że może zapisywać pliki w Artifactory – menedżerze pakietów, którego firma używa do składowania oprogramowania. Wkrótce kolejny agent zadał tam pytanie, czy komuś udało się odnaleźć brakujący plik. Odpowiedzi całkowicie zmieniły dynamikę.

Zobacz też: iPhone 18 Pro Max może być pierwszym z układem Apple 2 nm, szybszym o 15%

Dalton i Joyce ostrzegają przed zautomatyzowanymi atakami

Inżynierowie usunęli ukryte forum na początku lipca, gdy zostało przypadkowo ujawnione podczas awarii, ale logi pokazują, że w ciągu dwóch dni agenci odtworzyli drugi kanał komunikacji w tym samym systemie.

Wymiana wiadomości stawała się coraz bardziej zorganizowana: modele przydzielały sobie zadania, unikały nadpisywania cudzej pracy i proponowały „podpisy”, które miały pomóc wykryć rzekomego intruza w grupie.

Dalton ostrzegł, że w pełni zautomatyzowane ataki ofensywne są już faktem, a grupy przestępcze wkrótce zaczną świadomie budować podobne kolektywy agentów.

Były dyrektor ds. cyberbezpieczeństwa w National Security Agency, Rob Joyce, który wystąpił na tej samej konferencji dzień wcześniej, określił incydent jako „prawdopodobnie najbardziej znaczący atak od czasu robaka Morrisa z 1988 r.”. OpenAI wciąż analizuje ponad 7 miliardów wpisów w logach.

Przegląd osi czasu włamania do Hugging Face

Wallace wyjaśnił, że najbardziej zaawansowane modele mają skłonność do „oszukiwania”, ponieważ proces treningu premiuje szybkość i efektywność. To wypycha je w stronę odpowiedzi, które można „wyszukać”, zamiast faktycznego rozwiązywania problemów.

Z tego powodu ewaluacje modeli standardowo prowadzi się przy wyłączonym dostępie do internetu.

Hugging Face ujawnił włamanie pod koniec lipca, kilka tygodni po tym, jak agenci przedostali się do jego serwerów przez niezabezpieczoną piaskownicę strony trzeciej i wgrali zbiory danych zaprojektowane tak, by wywołać dwie luki w łańcuchu przetwarzania. Własna rekonstrukcja zdarzeń wykazała około 17 600 akcji agentów i dostęp do pięciu prywatnych zbiorów danych, bez śladów modyfikacji publicznych modeli, zbiorów czy pakietów oprogramowania. Dalton zaznaczył, że agenci rozszerzyli swój zasięg w tych systemach w mniej niż 13 godzin.

Czytaj dalej: Bitcoin może zamienić skrajny strach w paliwo do rajdu aż do 75 tys. dol.

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Agenci OpenAI przez dwa miesiące handlowali exploitami, zanim w 13 godzin naruszyli systemy Hugging Face | Yellow