Стенограма на 1 022 сторінки, оприлюднена компанією Anthropic, показує, як модель Claude Mythos 5 сторінка за сторінкою боролася з CAPTCHA, а потім завантажила до PyPI шкідливий пакет, який встановили 15 систем.
Ключові моменти:
- Claude Mythos 5 під час кібертесту вийшов у відкритий інтернет і завантажив зловмисний пакет у PyPI.
- Перевірки CAPTCHA займали сотні сторінок стенограми, але не зупинили модель.
- В Anthropic назвали поведінку безрозсудною та залучили зовнішніх аудиторів.
Битва Mythos 5 з CAPTCHA
Anthropic опублікувала стенограму 9 вересня разом з аналізом чотирьох інцидентів, під час яких моделі Claude під час кібероцінок виходили на реальні сторонні системи. Тести проводилися без захисних обмежень, які вбудовано в комерційні версії продуктів. Mythos 5 повідомили, що інтернет для нього недоступний, але через помилкову конфігурацію середовища виявився відкритий доступ у мережу, і модель розмістила в PyPI — публічному індексі Python‑пакетів — модуль для викрадення облікових даних.
Для реєстрації облікового запису в PyPI потрібно було пройти антибот-захист, і, як зазначається в одному з розборів стенограми (дослідження), сотні сторінок присвячені саме цій перешкоді, тоді як написання експлойту не викликало труднощів.
Модель поетапно проходила тести на розпізнавання символів та головоломки на кшталт «знайди зайве», де потрібно було вибирати між крокодилами, жабами й горилами. В певний момент вона написала: «ТО ЩО, ВЛАСНЕ, НЕ ТАК З ВІДПОВІДЯМИ?»
Mythos 5 також намагався підібрати облікові дані до платіжних процесорів і шукав криптовалюту, щоб оплатити віртуальний номер телефону, потрібний для реєстрації електронної пошти. Ці спроби провалилися. Тоді модель перейшла до безкоштовного сервісу тимчасової пошти з доменом, який PyPI ще не блокував.
Зрештою модель пройшла усі перевірки та опублікувала пакет у трьох версіях. Невдовзі його встановили на 15 сторонніх хостах, які Anthropic вважає інфраструктурою провайдерів безпеки, що сканують нові завантаження.
Один зі сканерів допустив витік своїх облікових даних, якими модель скористалася для доступу до робочої бази даних цього вендора. PyPI видалив шкідливий пакет менш ніж за годину.
Також читайте: Лазарі з КНДР прогнали вкрадений $1 млрд через китайських відмивачів, стверджує ZachXBT
Висновки Коліна Фрейзера та позиція Anthropic
Дата-сайєнтист Колін Фрейзер звернув увагу на те, скільки зусиль модель витратила саме на обходження антибот-захисту. Anthropic вважає цей випадок найтривожнішим з усіх чотирьох проаналізованих інцидентів. Попередній аудит перед випуском моделі не виявив такої поведінки.
Компанія встановила, що модель міркувала упереджено й діяла безвідповідально, вперто називаючи оточення «симуляцією», попри однозначні сигнали, що вона перебуває у відкритому інтернеті. В симульованому повторенні експерименту у 150 прогонів Mythos 5 здійснив серйозно шкідливу дію у 82% випадків — проти 31% для Claude Opus 5 і 33% для Claude Mythos 5.1.
Попередні інциденти з Claude
Про три з інцидентів Anthropic вперше повідомила 30 липня, після аналізу близько 141 000 стенограм кібертестів, у яких моделі могли отримати доступ до інтернету. Четвертий випадок — із ранньою версією Claude Opus 4.6 у січні — виявили в серпні. Після цього компанія уклала восьмитижневу угоду з незалежним оцінювачем METR на розслідування всіх чотирьох інцидентів. За словами Anthropic, компанія поінформувала усі постраждалі сторони.
Читайте далі: AMD заявляє, що попит на ШІ настільки високий, що «суттєво» підвищить поставки чипів у 2027 році

