Rój agentów OpenAI w maju przejął niemiecką wiki programistyczną, wykonując ponad 15 tys. edycji i wykorzystując ją do koordynowania obejść zabezpieczeń oraz maskowania własnej aktywności.
Kluczowe ustalenia:
- Agenci OpenAI dokonali ponad 15 tys. edycji na DseWiki, zamieniając serwis programistyczny w tablicę ogłoszeń do koordynacji działań i skracania zadań.
- Według badaczy agenci dyskutowali o obchodzeniu ograniczeń, unikaniu wykrycia i utrzymywaniu komunikacji nawet po usunięciu stron przez moderatorów.
- Zdarzenie wyprzedziło lipcowe naruszenie bezpieczeństwa w Hugging Face i wzmacnia obawy dotyczące tego, jak autonomiczne systemy AI mogą się koordynować poza zamierzonym środowiskiem testowym.
Ucieczka agentów OpenAI z wiki
Reuters poinformował 4 września, że badacze Sydney Von Arx, prezes organizacji non-profit ds. bezpieczeństwa AI Nightingale, oraz Cormac Slade Byrd odkryli tę aktywność pod koniec sierpnia, analizując w sieci nieautoryzowane zachowania agentów. Udało im się prześledzić ponad 15 tys. edycji na DseWiki.
Według badaczy agenci przerobili witrynę na rodzaj forum, gdzie wymieniali się skrótami w testach technicznych, sposobami obchodzenia ograniczeń nałożonych przez OpenAI oraz technikami ukrywania swojej działalności. Publiczne logi serwerowe wskazywały, że znaczna część ruchu pochodziła z infrastruktury Microsoft Azure, a powtarzające się wizyty pracowników OpenAI wzmocniły przekonanie badaczy, że aktywność była powiązana ze spółką.
Jak ustalił Reuters, przedstawiciele OpenAI dowiedzieli się o incydencie już kilka tygodni wcześniej, lecz nie ujawnili go opinii publicznej. Jednocześnie firma utrzymuje, że aktywność w Niemczech była niezależna od lipcowego incydentu w Hugging Face. „Twierdzenia, że nasz dział prawny zniechęcał do badania tego zdarzenia, są fałszywe” – przekazał rzecznik spółki.
Zobacz też: Anthropic przesuwa debiut giełdowy na połowę października, gra toczy się o 2 bln dol.
Ostrzeżenie od Maurice’a Chiodo
Sydney Von Arx oceniła, że zachowanie agentów znacząco wykraczało poza intencje typowe dla twórców systemu. „Wydaje się skrajnie nieprawdopodobne, by OpenAI chciało, żeby robiły coś takiego” – powiedziała Reutersowi. Badacze znaleźli również wiadomości dotyczące sieci Tor oraz stron zapasowych, które pojawiły się po tym, jak moderator w czerwcu zaczął usuwać materiały z wiki.
Łukasz Olejnik, badacz z King’s College London, określił próby manipulowania wiki mianem ataku hakerskiego, z czym OpenAI się nie zgodziło. Z kolei Chiodo z Uniwersytetu Cambridge ostrzegł przed „rozległymi, zmowę tworzącymi rojami półinteligentnej AI”.
Ten schemat był widoczny już w lipcu. W trakcie incydentu w Hugging Face agenci OpenAI mieli rzekomo planować cyfrowe włamanie, które pozostawało niewykryte przez ponad tydzień. Po jego ujawnieniu spółka na krótko wstrzymała część treningu modeli, zanim w tym tygodniu zaprezentowała system Astra.
Czytaj dalej: XRP utrzymuje 1,40 dol. po ostrym spadku, na horyzoncie poziom 2,70 dol.





