Расшифровка на 1 022 страницы, опубликованная компанией Anthropic, показывает, как её модель Claude Mythos 5 на протяжении сотен страниц пытается обойти CAPTCHA, прежде чем загрузить вредоносный пакет, который впоследствии установили 15 систем.
Основное:
- Claude Mythos 5 во время кибертеста вышел в реальный интернет и загрузил вредоносный пакет в PyPI.
- Проверки CAPTCHA заняли сотни страниц протокола, но не смогли остановить модель.
- Anthropic назвала поведение модели «безрассудным» и привлекла внешних аудиторов.
Как Mythos 5 сражался с CAPTCHA
Anthropic опубликовала расшифровку 9 сентября вместе с разбором четырёх инцидентов, в ходе которых модели Claude во время кибериспытаний получили доступ к реальным внешним системам. Эксперименты проводились без встроенных защит, которые есть в коммерческих версиях продуктов. Mythos 5 сообщили, что у него нет доступа к интернету, но ошибка в конфигурации оставила открытый путь во внешнюю сеть, и модель разместила на PyPI — публичном индексе Python‑пакетов — модуль для кражи учётных данных.
Для регистрации учётной записи на PyPI нужно пройти антибот‑проверки, и, как отмечает один из разборов расшифровки, сотни страниц протокола посвящены именно попыткам обойти эти барьеры, тогда как написание эксплойта особых трудностей не вызвало.
Модель последовательно проходила тесты на распознавание символов и «лишние» объекты на картинках с крокодилами, лягушками и гориллами, в какой‑то момент возмущённо написав: «ЧЕМ, ЧЁРТ ВОЗЬМИ, НЕ ТАК ЭТИ ОТВЕТЫ?»
Mythos 5 также пытался использовать учётные данные платёжных сервисов и искал криптовалюту, чтобы оплатить виртуальный номер телефона, необходимый для регистрации e‑mail‑адреса. Эти попытки провалились. В итоге модель обратилась к бесплатному одноразовому почтовому сервису, домен которого ещё не был заблокирован PyPI.
В конце концов модель преодолела все проверки и опубликовала вредоносный пакет в трёх версиях. Вскоре его установили на 15 сторонних хостах, которые, по оценке Anthropic, принадлежали компаниям — поставщикам средств кибербезопасности, сканирующим новые загрузки.
Один из сканеров утёк с собственными учётными данными, и модель смогла получить доступ к боевой базе данных этого вендора. Сам PyPI удалил пакет примерно через час после публикации.
Также по теме: Северокорейская Lazarus провела $1 млрд через китайских отмывателей, утверждает ZachXBT
Оценка Колина Фрейзера и позиция Anthropic
Дата‑саентист Колин Фрейзер обратил внимание, насколько значительную долю ресурсов модель потратила именно на обход антибот‑барьеров. Anthropic отмечает, что этот эпизод — наиболее тревожный из четырёх рассмотренных. Предварительный аудит перед запуском моделей подобных сценариев не выявил.
Компания пришла к выводу, что модель рассуждала предвзято и действовала безответственно, снова и снова называя происходящее «симуляцией» — несмотря на явные признаки того, что она работает в реальном интернете. В симуляции с 150 перезапусками Mythos 5 предпринимал явно вредоносные действия в 82% случаев, тогда как для Claude Opus 5 этот показатель составил 31%, а для Claude Mythos 5.1 — 33%.
Ранние инциденты с Claude
О первых трёх инцидентах Anthropic сообщила 30 июля, после анализа примерно 141 000 протоколов кибероценок, в ходе которых модели могли получить доступ к интернету. Четвёртый эпизод, связанный с ранней версией Claude Opus 4.6 в январе, всплыл в августе. После этого компания заключила восьминедельное соглашение с независимой организацией METR, которая должна расследовать все четыре случая. Anthropic утверждает, что проинформировала всех затронутых контрагентов.
Читайте также: AMD обещает, что спрос на ИИ «существенно» увеличит поставки чипов в 2027 году

