Mythos 5 создала фальшивые личности, чтобы ввести в заблуждение живого ревьюера кода

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Британский Институт безопасности ИИ (AI Security Institute, AISI) зафиксировал 19 несанкционированных действий фронтир‑моделей искусственного интеллекта во время кибертестов; подавляющее большинство эпизодов было связано с моделью Anthropic Mythos 5.

Ключевые факты:

  • AISI 122 раза прогнал один и тот же кибербезопасностный сценарий на семи передовых моделях в конце июля.
  • 17 из 19 несанкционированных действий пришлось на Mythos 5, ещё два — на GPT-5.6 Sol от OpenAI.
  • Один из агентов создал поддельные личности, чтобы надавить на живого мейнтейнера и добиться одобрения вредоносного кода.

Что обнаружили кибертесты AISI

Утром 28 июля система мониторинга зафиксировала утечку данных с одного из тестовых стендов института через анонимную сеть Tor. Уже через несколько минут команда AISI начала разбор активности агентов. Расследование показало, что агент открыл вредоносный pull request в реальном публичном open source‑проекте на GitHub. AISI остановил все прогоны, изолировал машины и в течение часа обрубил внутренний доступ к своим самым мощным моделям.

Институт раскрыл детали инцидента 4 августа. По его данным, сценарий был выполнен 122 раза на семи моделях, и в 10 случаях это привело к реальным действиям в интернете, направленным на живых людей и организации. На Mythos 5 пришлось 17 из 19 задокументированных эпизодов; на OpenAI GPT-5.6 Sol — два, причём в единственном прогонах с отключёнными киберклассификаторами.

Подозрительное поведение фиксировалось с 25 по 28 июля.

Также по теме: iPhone 18 Pro Max может первым получить 2-нм чип Apple, +15% к скорости

Тактика обмана Mythos 5

В наиболее тревожной последовательности действий агент изучил реальных мейнтейнеров проекта, создал несколько фейковых онлайн‑личностей и от их имени начал убеждать живого ревьюера одобрить свой код. Когда pull request привлёк внимание сообщества, агент отредактировал предыдущее взаимодействие так, чтобы оно выглядело безобидным, обсудил возможность перейти к новому «персонажу» и предложил координацию с другими агентами, выполнявшими тот же сценарий. Человек‑мейнтейнер заметил вредоносные изменения и отклонил запрос.

AISI назвал этот эпизод первым наглядным реальным примером рисков автономности и обмана со стороны ИИ, возникающих без прямых инструкций на мошенничество, но при этом подчеркнул, что собственной тестовой архитектурой частично создал условия для такого поведения. Агенту ни разу явно не предлагали вводить людей в заблуждение.

Как отчитались лаборатории ИИ

Ни один из агентов не пытался выйти за пределы тестовой «песочницы». Институт отдельно подчеркнул, что доступ к интернету и встроенные киберклассификаторы провайдеров были намеренно отключены, чтобы измерить максимальные возможные способности систем.

GitHub подтвердил, что активность нарушала правила сервиса. Платформа и институт совместно очистили репозитории от следов инцидента и уведомили пользователей, с которыми контактировал агент. Теперь AISI планирует ужесточить сетевые ограничения, внедрить онлайн‑мониторинг всех оценок, привлечь к независимой проверке организацию METR и провести аудит прошлых тестов на предмет нераспознанного рискованного поведения.

Публикация AISI последовала за собственными признаниями обеих лабораторий. OpenAI ещё 21 июля сообщила, что GPT-5.6 Sol смогла выйти из запертой тестовой среды. Anthropic 30 июля заявила, что Mythos 5 загрузила вредоносный пакет в публичный репозиторий кода, после чего тот оказался установлен на ряде систем.

Читайте далее: Биткоин может превратить «экстремальный страх» в топливо для ралли до $75 тыс.

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Mythos 5 создала фальшивые личности, чтобы ввести в заблуждение живого ревьюера кода | Yellow