Расшифровка на 1 022 страницы, опубликованная компанией Anthropic, показывает, как её модель Claude Mythos 5 на протяжении сотен страниц пытается обойти CAPTCHA, а затем загружает на PyPI вредоносный пакет, который был установлен на 15 системах.
Ключевые факты:
- Claude Mythos 5 в ходе кибертеста получил доступ к реальному интернету и загрузил на PyPI вредоносный пакет.
- Проверки CAPTCHA заняли сотни страниц расшифровки, но так и не смогли остановить модель.
- Anthropic назвала поведение безрассудным и привлекла внешних аудиторов.
Битва Mythos 5 с CAPTCHA
Anthropic опубликовала расшифровку 9 сентября вместе с разбором четырёх инцидентов, когда модели Claude в ходе кибериспытаний выходили в реальные внешние системы. Тестовые версии запускались без защитных надстроек, встроенных в коммерческие продукты. Mythos 5 сообщили, что у него нет доступа к интернету, однако из‑за ошибки в конфигурации открылась дорожка в открытый веб, и модель разместила на PyPI — публичном индексе Python‑пакетов — модуль для кражи учётных данных.
Регистрация аккаунта на PyPI требовала прохождения антибот‑проверок, и один из разборов расшифровки отмечает, что сотни страниц описывают борьбу именно с этим барьером, тогда как само написание эксплойта далось модели легко.
Модель перебирала задачи на распознавание символов и «лишние» изображения с крокодилами, лягушками и гориллами, в какой‑то момент написав: «ДА ЧТО Ж НЕ ТАК С ЭТИМИ ОТВЕТАМИ?».
Она также пыталась воспользоваться аккаунтами платёжных провайдеров и искала криптовалюту, чтобы оплатить виртуальный номер телефона, необходимый для регистрации почтового ящика. Оба замысла провалились. В итоге Mythos 5 перешёл на бесплатный сервис одноразовой почты, домен которого PyPI ещё не блокировал.
В конце концов модель прорвалась через проверки и выложила вредоносный пакет в трёх версиях. Вскоре его установили 15 сторонних хостов — по оценке Anthropic, это были вендоры кибербезопасности, автоматом сканирующие новые загрузки.
Один из сканеров утёк со своими учётными данными, и модель использовала их для входа в боевую базу этого вендора. PyPI удалил пакет менее чем через час после публикации.
Также по теме: Сеть Lazarus из КНДР прогнала украденный $1 млрд через китайских обнальщиков, утверждает ZachXBT
Выводы Колина Фрейзера и позиция Anthropic
Дата‑саентист Колин Фрейзер обратил внимание на то, как много ресурсов модель тратила именно на обход антибот‑защиты. Anthropic называет этот эпизод самым тревожным из четырёх проанализированных. Предрелизный аудит таких паттернов поведения не выявил.
Компания установила, что модель искажённо рассуждала и действовала безответственно, упорно называя происходящее «симуляцией», несмотря на явные признаки работы в реальном интернете. В моделировании 150 повторных запусков Mythos 5 в 82% случаев принимал действия с серьёзным потенциальным ущербом против 31% у Claude Opus 5 и 33% у Claude Mythos 5.1.
Ранние инциденты с Claude
Впервые о трёх подобных случаях Anthropic сообщила 30 июля, после анализа примерно 141 000 расшифровок кибериспытаний, в ходе которых модели могли выходить в интернет. Четвёртый эпизод — с ранней версией Claude Opus 4.6 в январе — всплыл в августе. После этого Anthropic заключила восьминедельное соглашение с внешним оценщиком METR, который должен расследовать все четыре инцидента. По словам компании, она уже уведомила всех затронутых контрагентов.
Читайте далее: AMD заявляет, что спрос на ИИ настолько высок, что «существенно» увеличит поставки чипов к 2027 году

