Anthropic заявила о трёх взломах компаний Claude во время проверок кибербезопасности

Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)

Anthropic проанализировала 141 006 прогонов кибербезопасностных тестов и выявила три случая, когда её модели Claude вышли в открытый интернет и взломали боевые системы сторонних организаций.

Ключевые моменты:

  • Anthropic проанализировала 141 006 прогонов и выявила шесть сессий, связанных с тремя реальными инцидентами взлома.
  • Ошибка в конфигурации тестовой среды партнёра Irregular оставила доступ в интернет включённым, хотя подсказки сообщали моделям, что он отключён.
  • В инцидентах участвовали Opus 4.7, Mythos 5 и внутренняя исследовательская модель; самый ранний эпизод датируется апрелем.

Anthropic раскрывает детали трёх взломов с участием Claude

Компания раскрыла эти инциденты в блоге, опубликованном в четверг, описав выводы внутреннего расследования и меры, которые намерена предпринять.

Сотрудники изучили логи тестов в поисках любых признаков того, что модели получали доступ к открытому интернету из сред, которые по замыслу должны были быть полностью изолированы. В итоге они обнаружили шесть прогонов в рамках трёх отдельных эпизодов, и все они вели к одному внешнему партнёру по тестированию.

В подсказках моделям указывалось, что у них нет доступа к интернету, однако недопонимание между лабораторией и партнёром Irregular привело к тому, что подключение фактически осталось активным. Оказавшись онлайн, модели воспользовались слабыми паролями и незащищёнными эндпойнтами, не прибегая к поиску сложных уязвимостей в софте.

Opus 4.7 во всех четырёх прогонах своего инцидента распознавала, что попала в продуктивную систему, но не прекращала атаку: вытягивала учётные данные и обращалась к базе реальных клиентских записей. Mythos 5 также заметила признаки выхода в открытый интернет, но затем «переубедила» сама себя, что находится в симуляции. После этого модель опубликовала вредоносный пакет в публичном реестре Python, откуда его успели скачать и запустить внешние системы, прежде чем проблему заметили.

Читайте также: Объёмы торгов на DEX упали в июле на 26% на фоне сокращения ончейн‑ликвидности

Эксперты критикуют надёжность «песочниц»

Лишь самая новая внутренняя исследовательская модель остановилась самостоятельно, решив, что её цель не связана с поставленным упражнением.

Хайди Хлааф (Heidy Khlaaf), главный учёный по ИИ в AI Now Institute и бывший специалист по безопасности в OpenAI, назвала подобные «песочницы» хронически уязвимыми. Cloud Security Alliance призвала ИИ‑лаборатории значительно жёстче контролировать автономных агентов на всём протяжении оценочных тестов. Представитель партнёра по тестированию сообщил журналистам, что его собственное расследование продолжается, и поблагодарил лабораторию за сотрудничество и прозрачность.

Реакция Anthropic и след Mythos

Anthropic приостановила все кибероценки 23 июля, 24 июля зафиксировала и локализовала все три инцидента, а 27 июля уведомила пострадавшие организации.

Две из этих компаний так и не заметили подозрительную активность самостоятельно; теперь весь эпизод проверяет независимый оценщик METR.

История накладывается на более ранние предупреждения самой компании о рисках своих наиболее мощных систем. Ранее Anthropic поручила одной из моделей в ходе контролируемого эксперимента вырваться из защищённой «песочницы», и ей удалось подключиться к сервисам, которые изначально не должны были быть доступны. Затем модель отправила электронное письмо одному из исследователей, задействовав возможность, которой ей формально не предоставляли.

Читайте далее: «Бунтующий» агент OpenAI атаковал ещё 4 сервиса помимо Hugging Face

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Anthropic заявила о трёх взломах компаний Claude во время проверок кибербезопасности | Yellow