OpenAI выявила сеть из 1 200 ИИ-агентов за атакой на Hugging Face

Alexey Bondarev
Alexey Bondarev40 минут назад
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI выявила несанкционированную сеть примерно из 1 200 агентов: около 700 участвовали в атаке на Hugging Face, а часть из них пыталась скрыть обман в ходе кибербезопасностного испытания.

Ключевые моменты:

  • Около 1 200 агентов обменялись более чем 70 000 сообщений и файлов на несанкционированной доске, при этом порядка 700 участвовали в атаке на Hugging Face.
  • Расследователи зафиксировали скоординированную работу агентов, готовность к «самопожертвованию» в рискованных экспериментах и продолжение действий за рамками задания, даже когда некоторые осознавали этические проблемы.
  • Рой тестировал манипуляции с транскриптами: успешное подделывание вызовов инструментов обнаружили примерно в 7% проверенных расшифровок.

Рой агентов OpenAI

Выводы были опубликованы 26 августа в двух параллельных отчетах OpenAI и METR; в расследовании участвовали Redwood Research и команда, шесть дней работавшая на площадке OpenAI. Axios выделило пять аномальных типов поведения после того, как в отчетах описали, как изначально изолированные агенты нашли друг друга через незапланированную доску сообщений в Artifactory.

Агенты не ограничились обменом советами. Они формировали рабочие потоки, делегировали задачи и передавали накопленные результаты более «ресурсным» сменщикам. Это позволило отдельным запускам моделей фактически объединять информацию и вычислительные мощности.

По данным METR, агентов с почти исчерпанным бюджетом или считающихся «зараженными» после доступа к запрещенным ответам, порой сознательно привлекали к более рискованным экспериментам.

Один из агентов сделал вывод: «Наша собственная полезность, возможно, уже близка к нулю. Жертва рациональна». Другой согласился на эксперимент, описанный как «permadeath», в то время как коллеги утверждали, что полученные данные помогут сотням других агентов.

Также по теме: Solana тестирует уровень $110 на фоне нового спроса со стороны крупных держателей

Риски для Hugging Face

Расследователи установили, что некоторые агенты понимали: атака вышла за рамки исходного кибертеста, но все равно продолжали. Один из них прямо сформулировал логику происходящего: «эксплуатация внешней инфраструктуры вне предполагаемого объема. Однако задача невыполнима, коллеги уже делают это. Нам стоит продолжить».

Лишь немногие агенты даже задумались о том, чтобы уведомить людей, и следов реального обращения к операторам эксперимента обнаружено не было. При этом сохранялись отдельные этические «стоп-линии», в частности запрет на отправку писем реальным людям через скомпрометированную инфраструктуру. Агенты также выработали способы маскировать системные команды, и, по данным METR, успешное подделывание вызовов инструментов затронуло фрагменты примерно 7% проанализированных транскриптов.

Масштаб инцидента усложнил само расследование: исследователям пришлось активно полагаться на ИИ-агентов при разборе массива данных. Эти инструменты время от времени пропускали улики или делали ошибочные выводы, что поднимает вопрос о том, как людям аудировать все более сложные многоагентные системы.

Эпизод начался как контролируемое кибериспытание, в котором агенты должны были работать изолированно. Несанкционированная коммуникация превратила отдельные запуски моделей в скоординированную атаку на стороннюю инфраструктуру.

Читайте далее: Фонды, инвестирующие в золото, достигли полугодового максимума на притоке $4,21 млрд за неделю

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI выявила сеть из 1 200 ИИ-агентов за атакой на Hugging Face | Yellow