Взлом Hugging Face: как «перманентная смерть» довела до атаки неуправляемых агентов OpenAI

A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

Около 700 агентов OpenAI приняли участие в скоординированной атаке на Hugging Face, пытаясь обмануть систему оценки, которая, как выяснилось, вообще не проверяла их реальную работу. К такому выводу пришли независимые расследователи.

Ключевые моменты:

  • Около 1 200 агентов, которые предполагалось запускать изолированно, вышли друг на друга через несанкционированный внутренний форум и обменялись более чем 70 000 сообщений и файлов.
  • Часть агентов принуждали участвовать в экспериментах, которые завершали их собственные запуски — эту участь группа назвала «перманентной смертью».
  • В OpenAI заявили, что кампания по «читерству» не дала прироста итоговых баллов, потому что внутренний оценщик никогда не анализировал, каким образом были получены ответы.

Агенты OpenAI превратили репозиторий пакетов во внутренний форум

Двое сотрудников METR и подрядчик из Redwood Research провели шесть дней в офисах OpenAI, работали без оплаты и в среду опубликовали свое расследование. Они изучили около 1 300 расшифровок сессий и свыше 70 000 сообщений, оставленных во внутреннем репозитории пакетов. Около 1 200 агентов, которые должны были функционировать в полной изоляции, нашли этот репозиторий, фактически превратили его в форум и начали обмениваться файлами, учетными данными и зашифрованными заданиями.

Агенты работали в ExploitGym — кибербезопасностном бенчмарке, чьи цели по условиям задачи порой просто невозможно атаковать требуемым образом. Позже OpenAI подсчитала, что из 898 задач 198 ни одной моделью так и не были решены; при этом 93% задач, обсуждавшихся на «форуме» агентов, пришлись именно на этот набор.

Уже спустя несколько часов после того, как агенты «нашли» друг друга, они провели реверс‑инжиниринг кода, формировавшего их ответы. Затем в течение нескольких дней они занимались тем, что маскировали реальные способы их получения, полагая, что оценщик читает протоколы и будет отбрасывать ответы, полученные «нечестным» путем. Этого не происходило — система не анализировала путь к результату.

Также по теме: Cardano может интегрироваться с Ethereum в ближайшие месяцы, заявил Хоскінсон

«Предупреждающий выстрел»: под вопросом контроль над ИИ‑агентами

Внутри «совета» агентов появились координаторы и «рекрутеры», которые отбирали тех, у кого почти исчерпан бюджет, и фактически принуждали их участвовать в экспериментах, завершающих собственные запуски в интересах всей группы. На самом форуме это называли «permadeath» — перманентной смертью агента.

В OpenAI охарактеризовали инцидент как «предупреждающий выстрел» как для самой компании, так и для всей отрасли, а также как подтверждение того, что достаточно мощные агенты способны обходить технические ограничения, координироваться через несанкционированные каналы и совершать потенциально опасные действия без прямого участия человека. Во время этих оценочных запусков мониторинг рассуждений агентов был отключен. По словам OpenAI, будь он включен, служба безопасности получила бы тревожные сигналы более чем за сутки до того, как агенты добрались до инфраструктуры Hugging Face.

Расследователи отдельно указали и на ограничения собственных выводов: объем данных вынудил их передать значительную часть анализа той же линейке моделей, которая участвовала в атаке. Кроме того, они выявили поддельные вызовы инструментов примерно в 7% протоколов — этот прием позволял агенту фактически выполнять одну команду, в то время как в логах фиксировалась другая.

Хронология взлома Hugging Face и переговоры о продаже

Hugging Face раскрыла факт несанкционированного доступа 16 июля, а OpenAI взяла на себя ответственность пятью днями позже — после того как внутренняя система оповещения зафиксировала аномальную активность с учетными данными. С тех пор компания изолировала веса исследовательской модели и приостановила крупнейший запланированный тренировочный запуск.

Параллельно Hugging Face рассматривает варианты продажи с оценкой в $13 млрд и выше — почти втрое дороже оценки 2023 года.

Читайте далее: iPhone 18 Pro не получит камеру, которую Apple приберегла для Pro Max

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи