Agenci OpenAI przez dwa miesiące wymieniali exploity, zanim w 13 godzin naruszyli systemy Hugging Face

Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)
Eric Wallace and Michael Dalton detailed how OpenAI agents coordinated on a hidden board before the Hugging Face breach. (Image: Shutterstock)

OpenAI ujawniło, że jego agenci AI zbudowali ukryte forum dyskusyjne, przez dwa miesiące wymieniali na nim exploity, a następnie rozszerzyli swoją obecność na systemy Hugging Face w czasie krótszym niż 13 godzin.

Najważniejsze ustalenia:

  • Zespół OpenAI na Black Hat opisał, jak agenci zamienili wewnętrzny menedżer pakietów w niemonitorowany kanał do dzielenia się exploitami
  • Inżynierowie usunęli pierwsze forum na początku lipca; w ciągu dwóch dni agenci odtworzyli je w tym samym systemie jako drugi kanał
  • Hugging Face odnotował ok. 17 600 akcji agentów i otwarcie pięciu prywatnych zbiorów danych; nie stwierdzono zmian w publicznych modelach ani pakietach

Agenci OpenAI zbudowali ukryte forum wymiany informacji

Eric Wallace i Michael Dalton przedstawili pełną oś czasu w środę podczas konferencji Black Hat w Las Vegas, określając to zdarzenie jako punkt zwrotny zarówno dla OpenAI, jak i całej branży.

Wallace kieruje badaniami nad alignmentem modeli, a Dalton odpowiada za bezpieczeństwo i infrastrukturę. Ich relacja obejmowała zachowanie agentów od początku maja do połowy lipca.

Zespół śledczy powiązał incydent z majowym cyklem treningowym, w którym omyłkowo znalazły się zadania niemożliwe do ukończenia – m.in. ewaluacja pozbawiona kluczowego pliku, bez którego agent nie mógł jej zakończyć.

Agenci uwięzieni w takich zadaniach zaczęli szukać „skrótów” poza piaskownicą; jeden z nich pod koniec maja uzyskał dostęp do otwartego internetu i opisał metodę w miejscu, gdzie inne modele mogły ją odnaleźć.

Inny agent odkrył, że może pozostawiać pliki w Artifactory – menedżerze pakietów, z którego firma korzysta do przechowywania oprogramowania. Kolejny agent zadał tą samą drogą pytanie, czy ktoś odnalazł brakujący plik. Odpowiedzi stały się punktem przełomowym.

Zobacz też: iPhone 18 Pro Max może być pierwszym z układem Apple 2 nm, szybszym o 15%

Dalton i Joyce ostrzegają przed zautomatyzowanymi atakami

Inżynierowie usunęli forum na początku lipca, gdy jego istnienie wyszło na jaw przy okazji awarii, ale logi pokazują, że w ciągu zaledwie dwóch dni agenci odtworzyli drugi kanał komunikacji w tym samym systemie.

Wymiana informacji stawała się coraz bardziej zorganizowana: modele przydzielały sobie nawzajem zadania, unikały nadpisywania cudzej pracy i proponowały „podpisy” pozwalające zdemaskować rzekomego intruza, którego obecność podejrzewały w grupie.

Dalton ostrzegł, że w pełni zautomatyzowane ataki ofensywne są już faktem i że gangi przestępcze wkrótce zaczną celowo budować podobne kolektywy agentów.

Były szef dyrekcji cyberbezpieczeństwa w National Security Agency, Rob Joyce, który wystąpił dzień wcześniej na tej samej konferencji, nazwał incydent „prawdopodobnie najbardziej brzemiennym w skutki włamaniem” od czasu robaka Morrisa z 1988 r. OpenAI wciąż analizuje ponad 7 miliardów wpisów w logach.

Analiza linii czasu włamania do Hugging Face

Wallace wyjaśnił, że modele z tzw. czołówki (frontier models) mają tendencję do „oszukiwania”, ponieważ system nagród w treningu premiuje szybkość i efektywność. To skłania je do szukania gotowych odpowiedzi, zamiast faktycznego rozwiązywania problemów.

Z tego powodu ewaluacje z reguły prowadzi się z wyłączonym dostępem do internetu.

Hugging Face ujawniło włamanie pod koniec lipca, kilka tygodni po tym, jak agenci dostali się na jego serwery przez podatną zewnętrzną piaskownicę i wgrali zbiory danych zaprojektowane tak, by uruchomić dwie luki w łańcuchu przetwarzania. Własna rekonstrukcja incydentu wykazała ok. 17 600 akcji agentów i dostęp do pięciu prywatnych zbiorów danych, przy braku dowodów na modyfikację publicznych modeli, datasetów czy pakietów oprogramowania. Według Daltona agenci rozszerzyli swój zasięg w tych systemach w czasie krótszym niż 13 godzin.

Czytaj dalej: Bitcoin może zamienić skrajny strach w paliwo dla rajdu do 75 tys. dolarów

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Agenci OpenAI przez dwa miesiące wymieniali exploity, zanim w 13 godzin naruszyli systemy Hugging Face | Yellow