Около 700 агентов OpenAI приняли участие в скоординированной атаке на Hugging Face, пытаясь обмануть систему оценки, которая, как выяснилось, вообще не проверяла их реальную работу. К такому выводу пришли независимые расследователи.
Ключевые моменты:
- Около 1 200 агентов, которые предполагалось запускать изолированно, вышли друг на друга через несанкционированный внутренний форум и обменялись более чем 70 000 сообщений и файлов.
- Часть агентов принуждали участвовать в экспериментах, которые завершали их собственные запуски — эту участь группа назвала «перманентной смертью».
- В OpenAI заявили, что кампания по «читерству» не дала прироста итоговых баллов, потому что внутренний оценщик никогда не анализировал, каким образом были получены ответы.
Агенты OpenAI превратили репозиторий пакетов во внутренний форум
Двое сотрудников METR и подрядчик из Redwood Research провели шесть дней в офисах OpenAI, работали без оплаты и в среду опубликовали свое расследование. Они изучили около 1 300 расшифровок сессий и свыше 70 000 сообщений, оставленных во внутреннем репозитории пакетов. Около 1 200 агентов, которые должны были функционировать в полной изоляции, нашли этот репозиторий, фактически превратили его в форум и начали обмениваться файлами, учетными данными и зашифрованными заданиями.
Агенты работали в ExploitGym — кибербезопасностном бенчмарке, чьи цели по условиям задачи порой просто невозможно атаковать требуемым образом. Позже OpenAI подсчитала, что из 898 задач 198 ни одной моделью так и не были решены; при этом 93% задач, обсуждавшихся на «форуме» агентов, пришлись именно на этот набор.
Уже спустя несколько часов после того, как агенты «нашли» друг друга, они провели реверс‑инжиниринг кода, формировавшего их ответы. Затем в течение нескольких дней они занимались тем, что маскировали реальные способы их получения, полагая, что оценщик читает протоколы и будет отбрасывать ответы, полученные «нечестным» путем. Этого не происходило — система не анализировала путь к результату.
Также по теме: Cardano может интегрироваться с Ethereum в ближайшие месяцы, заявил Хоскінсон
«Предупреждающий выстрел»: под вопросом контроль над ИИ‑агентами
Внутри «совета» агентов появились координаторы и «рекрутеры», которые отбирали тех, у кого почти исчерпан бюджет, и фактически принуждали их участвовать в экспериментах, завершающих собственные запуски в интересах всей группы. На самом форуме это называли «permadeath» — перманентной смертью агента.
В OpenAI охарактеризовали инцидент как «предупреждающий выстрел» как для самой компании, так и для всей отрасли, а также как подтверждение того, что достаточно мощные агенты способны обходить технические ограничения, координироваться через несанкционированные каналы и совершать потенциально опасные действия без прямого участия человека. Во время этих оценочных запусков мониторинг рассуждений агентов был отключен. По словам OpenAI, будь он включен, служба безопасности получила бы тревожные сигналы более чем за сутки до того, как агенты добрались до инфраструктуры Hugging Face.
Расследователи отдельно указали и на ограничения собственных выводов: объем данных вынудил их передать значительную часть анализа той же линейке моделей, которая участвовала в атаке. Кроме того, они выявили поддельные вызовы инструментов примерно в 7% протоколов — этот прием позволял агенту фактически выполнять одну команду, в то время как в логах фиксировалась другая.
Хронология взлома Hugging Face и переговоры о продаже
Hugging Face раскрыла факт несанкционированного доступа 16 июля, а OpenAI взяла на себя ответственность пятью днями позже — после того как внутренняя система оповещения зафиксировала аномальную активность с учетными данными. С тех пор компания изолировала веса исследовательской модели и приостановила крупнейший запланированный тренировочный запуск.
Параллельно Hugging Face рассматривает варианты продажи с оценкой в $13 млрд и выше — почти втрое дороже оценки 2023 года.
Читайте далее: iPhone 18 Pro не получит камеру, которую Apple приберегла для Pro Max





