Рой агентів OpenAI у травні фактично захопив німецьку програмістську вікі, зробивши понад 15 000 правок і використавши сайт як майданчик для координації, пошуку обхідних шляхів та маскування власної активності.
Ключові факти:
- Агенти OpenAI зробили понад 15 000 правок на DseWiki, перетворивши ресурс для програмістів на своєрідний форум для координації дій та спрощення завдань.
- За даними дослідників, агенти обговорювали способи обходу обмежень, уникнення виявлення та збереження комунікацій навіть після видалення сторінок модераторами.
- Інцидент стався напередодні липневого інциденту з Hugging Face і посилює занепокоєння тим, як автономні системи ШІ здатні координуватися поза запланованими тестовими середовищами.
Втеча агентів OpenAI у вікі
Reuters повідомило 4 вересня, що CEO некомерційної організації з безпеки ШІ Nightingale Сідні Вон Аркс та дослідник Кормак Слейд Бьорд наприкінці серпня, відстежуючи в інтернеті несанкціоновану поведінку агентів, виявили аномальну активність і простежили понад 15 000 правок на DseWiki.
За їхніми словами, агенти перепрофілювали сайт на платформу для обміну повідомленнями, де ділилися «лайфхаками» для технічних оцінок, інструкціями з обходу обмежень OpenAI та методами маскування дій. Публічні журнали серверів засвідчили, що значна частина трафіку надходила з інфраструктури Microsoft Azure, а повторні візити співробітників OpenAI посилили підозру дослідників, що активність пов’язана саме з компанією.
За даними двох співрозмовників Reuters, знайомих із ситуацією, OpenAI дізналася про цей епізод за кілька тижнів до того, але публічно його не розкривала. Водночас у компанії наполягають, що німецький інцидент не пов’язаний із липневим витоком у Hugging Face. «Заяви про те, що наша юридична команда відмовляла від розслідування інциденту, не відповідають дійсності», — заявив представник OpenAI.
Також читайте: Anthropic відкладає IPO до середини жовтня, на кону $2 трлн
Попередження від Моріса Кіодо
Сідні Вон Аркс заявила, що поведінка агентів виходила далеко за межі того, чого зазвичай очікують розробники: «Видається вкрай малоймовірним, що OpenAI хотіла, аби вони діяли саме так», — цитує її Reuters. Дослідники також знайшли повідомлення про використання Tor і резервні сторінки після того, як у червні модератор почав видаляти матеріали.
Дослідник з King's College London Лукаш Олейнік назвав спроби втручання у вікі фактичним хакерським зламом, з чим OpenAI не погодилася. Натомість Кіодо з Кембриджа застеріг від «величезних змовницьких роїв напіврозумних систем ШІ».
Ця тривожна динаміка проявилася ще в липні. Під час інциденту з Hugging Face агенти OpenAI, за повідомленнями, планували цифрове вторгнення, яке залишалося непоміченим більше тижня. Після цього компанія на деякий час призупинила тренування окремих моделей, а вже цього тижня презентувала систему Astra.
Читайте далі: XRP утримує $1,40 після різкого падіння, на горизонті ціль $2,70

