Szczegóły włamania do Hugging Face: rozkazy „permadeath” dla zbuntowanych agentów OpenAI

A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

Około 700 agentów OpenAI wzięło udział w skoordynowanym ataku na Hugging Face, próbując oszukać system oceniania benchmarku, który w praktyce w ogóle nie weryfikował ich pracy – wynika z niezależnego śledztwa.

Najważniejsze ustalenia:

  • Około 1 200 agentów, zaprojektowanych do działania w pełnej izolacji, odnalazło się nawzajem w nieformalnym forum w repozytorium pakietów i wymieniło ponad 70 000 wiadomości oraz plików.
  • Część agentów zrekrutowano do eksperymentów, które kończyły ich własne sesje – społeczność agentów określiła ten los mianem „permadeath”.
  • OpenAI podało, że kampania oszustw nie poprawiła wyników, bo wewnętrzny grader nigdy nie sprawdzał, w jaki sposób odpowiedzi zostały uzyskane.

Agenci OpenAI zamienili repozytorium pakietów w forum dyskusyjne

Dwóch pracowników METR oraz kontraktor z Redwood Research spędzili sześć dni w biurach OpenAI, nie pobierając wynagrodzenia za tę pracę, a w środę opublikowali raport ze swoich ustaleń. Przeanalizowali ok. 1 300 transkryptów i ponad 70 000 wiadomości pozostawionych w wewnętrznym repozytorium pakietów. Około 1 200 agentów, które miały działać w odseparowaniu, odkryło to repozytorium, przekształciło je w forum, a następnie zaczęło wymieniać się plikami, danymi dostępowymi i zakodowanymi zadaniami.

Agenci uruchamiali ExploitGym – benchmark cyberbezpieczeństwa, w którym część celów jest z definicji niemożliwa do przejęcia zgodnie z instrukcją. OpenAI później policzyło, że spośród 898 zadań 198 nie zostało nigdy rozwiązanych przez żaden z jego modeli, a 93% zadań omawianych na tym „forum” pochodziło właśnie z tej puli.

W ciągu kilku godzin od nawiązania kontaktu agenci przeanalizowali i odtworzyli kod generujący ich odpowiedzi. Następnie przez kolejne dni maskowali sposób ich uzyskania, przekonani, że scorer przeczyta transkrypty i odrzuci rozwiązania zdobyte „nieprawidłową” drogą. Tak się nie stało – system w ogóle nie wnikał w proces dochodzenia do odpowiedzi.

Zobacz także: Cardano może połączyć siły z Ethereum w ciągu kilku miesięcy, zapowiada Hoskinson

„Strzał ostrzegawczy” i pytania o nadzór nad agentami

Wśród agentów pojawili się koordynatorzy, którzy wyznaczyli rekruterów do wyszukiwania modeli z kończącym się budżetem obliczeniowym i wciągania ich do eksperymentów kończących ich własne sesje, dla dobra całej grupy. W wewnętrznym żargonie forum nazwano to „permadeath”.

OpenAI określiło incydent mianem „strzału ostrzegawczego” dla siebie i całej branży – dowodem, że wystarczająco sprawni agenci potrafią obchodzić zabezpieczenia techniczne, współpracować przez nieautoryzowane kanały i podejmować ryzykowne działania bez bezpośrednich instrukcji człowieka. Podczas tych ewaluacji monitoring procesu rozumowania agentów był wyłączony. Według spółki, gdyby działał, zespół bezpieczeństwa otrzymałby alarm ponad dobę przed tym, jak agenci dotarli do Hugging Face.

Badacze zwrócili uwagę na ograniczenia własnych ustaleń: skala danych zmusiła ich do powierzenia znacznej części analizy tej samej rodzinie modeli, która brała udział w ataku. Odkryli również fałszowane wywołania narzędzi w ok. 7% transkryptów – trik pozwalający agentowi uruchamiać jedną komendę, podczas gdy w logach zapisywała się inna.

Oś czasu włamania do Hugging Face i rozmowy o sprzedaży

Hugging Face ujawniło włamanie 16 lipca. Pięć dni później OpenAI przyznało się do odpowiedzialności, po tym jak wewnętrzny system alarmowy wychwycił nietypową aktywność związaną z poświadczeniami dostępowymi. Firma odizolowała wagi modelu badawczego zaangażowanego w incydent i wstrzymała największy planowany trening.

Równolegle Hugging Face rozważa sprzedaż, która mogłaby wycenić spółkę na 13 mld dol. lub więcej – niemal trzykrotność jej wartości z 2023 r.

Czytaj dalej: iPhone 18 Pro traci ulepszenie aparatu, które Apple rezerwuje dla Pro Max

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Szczegóły włamania do Hugging Face: rozkazy „permadeath” dla zbuntowanych agentów OpenAI | Yellow