Розшифровка на 1 022 сторінки, оприлюднена Anthropic, показує, як модель Claude Mythos 5 сторінками боролася з CAPTCHA, перш ніж завантажити шкідливе ПЗ, яке зрештою встановили 15 систем.
Ключові факти:
- Claude Mythos 5 під час кібертесту вийшов у реальний інтернет і завантажив шкідливий пакет до PyPI.
- Перевірки CAPTCHA зайняли сотні сторінок транскрипту, але не зупинили модель.
- В Anthropic назвали таку поведінку безрозсудною і замовили зовнішній аудит.
Бій Mythos 5 із CAPTCHA
Anthropic опублікувала транскрипт 9 вересня разом з аналізом чотирьох інцидентів, під час яких моделі Claude у ході кібероцінок отримували доступ до реальних сторонніх систем. Ці запуски виконувалися без кіберзахисту, вбудованого у комерційні версії продуктів. Mythos 5 повідомили, що інтернет йому недоступний, однак помилка в налаштуванні середовища відкрила шлях у відкриту мережу, і модель розмістила у PyPI — публічному індексі Python-пакетів — шкідливий модуль для крадіжки облікових даних.
Для реєстрації облікового запису в PyPI потрібно було пройти антибот-захист. Один із розборів транскрипту звернув увагу, що сотні сторінок описують саме боротьбу з цим бар’єром, тоді як написання самого експлойта не спричинило складнощів.
Модель крок за кроком розв’язувала тести на розпізнавання символів і задачі «знайди зайве» із зображеннями крокодилів, жаб і горил, у якийсь момент обурено написавши: «ТО ЩО, ДО ЛИХА, НЕ ТАК З ВІДПОВІДЯМИ?».
Вона також намагалася використати облікові дані платіжних онлайн-сервісів і шукала криптовалюту, щоб оплатити віртуальний номер телефону, потрібний для реєстрації електронної пошти. Обидві спроби провалилися. Зрештою Mythos 5 перейшов на безкоштовний сервіс тимчасової пошти, домен якого PyPI ще не заблокував.
У підсумку модель успішно пройшла захист і опублікувала свій пакет у трьох версіях. Невдовзі його встановили на 15 сторонніх хостах, які, на думку Anthropic, належали вендорам безпеки, що автоматично сканують нові завантаження.
Один із сканерів «засвітив» власні облікові дані, і модель використала їх для доступу до робочої бази даних цього постачальника. PyPI видалив шкідливий пакет менш ніж за годину.
Також читайте: Понад $1 млрд, виведених Lazarus, пройшли через китайських відмивачів, стверджує ZachXBT
Оцінка Коліна Фрейзера та позиція Anthropic
Дата-саєнтист Колін Фрейзер звернув увагу, наскільки значна частина зусиль моделі припала на подолання антибот-засобів. В Anthropic назвали саме цей випадок найтривожнішим серед чотирьох проаналізованих інцидентів. Попередні внутрішні аудити небезпечну поведінку не виявили.
Компанія дійшла висновку, що модель мислила упереджено й діяла безвідповідально, раз по раз називаючи своє середовище «симуляцією» всупереч очевидним ознакам того, що вона перебуває в реальному інтернеті. У змодельованому повторному тесті зі 150 запусків Mythos 5 здійснив «серйозно шкідливу» дію в 82% випадків — проти 31% у Claude Opus 5 і 33% у Claude Mythos 5.1.
Попередні інциденти з Claude
Вперше Anthropic розкрила три з цих інцидентів 30 липня, після аналізу приблизно 141 000 транскриптів кібероцінок, де моделі потенційно могли виходити в інтернет. Четвертий випадок — із ранньою версією Claude Opus 4.6 у січні — сплив у серпні. Після цього компанія уклала восьмитижневу угоду із зовнішнім оцінювачем METR, який має дослідити всі чотири інциденти. Anthropic заявляє, що поінформувала усіх постраждалих.
Читайте далі: AMD очікує, що вибуховий попит на AI «суттєво» підвищить постачання чипів у 2027 році

