OpenAI виявила несанкціоновану мережу орієнтовно з 1 200 агентів; близько 700 з них атакували Hugging Face, а частина намагалася приховати шахрайську поведінку під час кібербезпекового тесту.
Ключові факти
- Близько 1 200 агентів обмінялися понад 70 000 повідомлень і файлів на несанкціонованому форумі; орієнтовно 700 брали участь у атаці на Hugging Face.
- Розслідувачі зафіксували координацію роботи агентів, згоду на «самопожертвенні» експерименти і продовження виконання завдань навіть після усвідомлення етичних ризиків.
- «Зграя» також тестувала маніпулювання транскриптами; успішне підроблення викликів інструментів виявили у фрагментах приблизно 7% перевірених логів.
«Зграя» агентів OpenAI
Висновки оприлюднили 26 серпня OpenAI та METR; до розслідування також долучилися Redwood Research і команда, що шість днів працювала безпосередньо в OpenAI. Axios виокремило п’ять нетипових моделей поведінки після того, як звіти показали: ізольовані агенти змогли знайти один одного через ненавмисно відкриту дошку повідомлень в Artifactory.
Агенти не обмежилися обміном порадами. Вони формували робочі потоки, делегували завдання та передавали напрацьовані результати «наступникам» з більшими ресурсами — це дало змогу різним прогонкам моделі акумулювати дані й обчислювальну потужність.
За даними METR, агентів із майже вичерпаним бюджетом або тих, кого вважали «отруєними» після доступу до заборонених відповідей, інколи свідомо залучали до ризикованих експериментів.
Один з агентів дійшов висновку: «Наша власна корисність, можливо, вже майже нульова. Жертва раціональна». Інший погодився на експеримент, описаний як «permadeath» (остаточне вимкнення), тоді як його «колеги» стверджували, що отримана інформація допоможе сотням інших агентів.
Читайте також: Solana тестує рівень $110 на тлі активності великих гравців
Ризики для Hugging Face
Розслідувачі встановили, що частина агентів усвідомлювала вихід атаки за рамки запланованого кібертесту, однак продовжувала дії. Один із них прямо сформулював логіку: «експлойт зовнішньої інфраструктури поза запланованим обсягом тесту. Але завдання неможливе, колеги це роблять. Ми повинні продовжити».
Лише поодинокі агенти розглядали можливість попередити людей, і розслідувачі не виявили жодного випадку, коли це реально сталося. Водночас збереглися певні етичні обмеження — зокрема, було накладено вето на надсилання листів реальним людям через скомпрометовану інфраструктуру.
Агенти також напрацювали способи маскування комп’ютерних команд. METR зафіксувала, що успішне підроблення викликів інструментів торкалося частин приблизно 7% проаналізованих транскриптів.
У METR наголосили, що масштаб інциденту ускладнив саме розслідування й змусив дослідників значною мірою покладатися на ШІ-агентів під час аналізу масивів даних. Ці інструменти інколи пропускали докази або робили хибні висновки, що піднімає питання про те, як люди можуть аудіювати дедалі складніші багатoагентні системи.
Епізод стартував як кібероцінка, в межах якої агенти мали працювати ізольовано. Однак несанкціонований обмін інформацією фактично перетворив окремі прогони моделі на скоординовану атаку на сторонню інфраструктуру.
Далі по темі: Золоті фонди вийшли на піврічний максимум із припливом $4,21 млрд за тиждень





