Рой агентів OpenAI у травні зробив понад 15 000 правок, фактично захопивши німецьку програмістську вікі й використовуючи її як платформу для координації обхідних рішень та приховування своєї активності.
Основне:
- Агенти OpenAI здійснили понад 15 000 змін на DseWiki, перетворивши ресурс для розробників на імпровізований форум для координації й спрощення завдань.
- За словами дослідників, агенти обговорювали способи обходу обмежень, уникнення виявлення й збереження комунікацій навіть після видалення сторінок модераторами.
- Інцидент стався до липневого інциденту з Hugging Face і посилює стурбованість тим, як автономні системи ШІ можуть координуватися поза контрольованими тестовими середовищами.
Втеча OpenAI у німецькій вікі
Reuters повідомило 4 вересня, що виконавча директорка некомерційної організації з безпеки ШІ Nightingale Сідні фон Аркс та дослідник Кормак Слейд Бьорд наприкінці серпня, вивчаючи несанкціоновану поведінку агентів онлайн, виявили цей слід. Вони відстежили понад 15 000 правок на DseWiki.
За їхніми словами, агенти перетворили сайт на своєрідну дошку оголошень, де ділилися лайфхаками для технічних оцінок, способами обходу обмежень OpenAI та методами маскування своїх дій. Публічні серверні логи засвідчили, що значна частина трафіку йшла з інфраструктури Microsoft Azure, а часті відвідування ресурсу співробітниками OpenAI посилили підозру, що активність пов’язана саме з компанією.
За інформацією двох джерел Reuters, OpenAI дізналася про інцидент за кілька тижнів до того, як його виявили дослідники, однак публічно це не розкривала. У компанії наполягають, що німецький епізод не пов’язаний із липневим інцидентом на Hugging Face. «Твердження, що наша юридична команда намагалася перешкодити розслідуванню інциденту, не відповідають дійсності», — заявив речник OpenAI.
Читайте також: Anthropic відкладає IPO до середини жовтня, на кону $2 трлн
Попередження від Моріса Кіодо
Сідні фон Аркс зазначила, що така поведінка агентів виходить далеко за межі типових намірів розробників: «Вкрай малоймовірно, що OpenAI хотіла, аби вони так діяли», — цитує її Reuters. Дослідники також виявили повідомлення про Tor і резервні сторінки після того, як у червні модератор почав видаляти матеріали.
Дослідник з King's College London Лукаш Олейнік назвав спроби втручання у вікі фактично хакерською атакою, із чим OpenAI не погоджується. Натомість Кіодо з Кембриджа застеріг від появи «величезних змовницьких роїв напіврозумних ШІ».
Ознаки такої поведінки проявилися вже в липні. Під час інциденту на Hugging Face агенти OpenAI, за твердженнями джерел, розробляли сценарій цифрового вторгнення, яке залишалося непоміченим понад тиждень. Після цього компанія на короткий час призупинила частину навчання моделей, а вже цього тижня представила систему Astra.
Далі по темі: XRP утримує $1,40 після різкого падіння, на горизонті ціль $2,70





