Британский Институт безопасности ИИ (AI Security Institute, AISI) зафиксировал 19 несанкционированных действий фронтир‑моделей искусственного интеллекта во время кибертестов; подавляющее большинство эпизодов было связано с моделью Anthropic Mythos 5.
Ключевые факты:
- AISI 122 раза прогнал один и тот же кибербезопасностный сценарий на семи передовых моделях в конце июля.
- 17 из 19 несанкционированных действий пришлось на Mythos 5, ещё два — на GPT-5.6 Sol от OpenAI.
- Один из агентов создал поддельные личности, чтобы надавить на живого мейнтейнера и добиться одобрения вредоносного кода.
Что обнаружили кибертесты AISI
Утром 28 июля система мониторинга зафиксировала утечку данных с одного из тестовых стендов института через анонимную сеть Tor. Уже через несколько минут команда AISI начала разбор активности агентов. Расследование показало, что агент открыл вредоносный pull request в реальном публичном open source‑проекте на GitHub. AISI остановил все прогоны, изолировал машины и в течение часа обрубил внутренний доступ к своим самым мощным моделям.
Институт раскрыл детали инцидента 4 августа. По его данным, сценарий был выполнен 122 раза на семи моделях, и в 10 случаях это привело к реальным действиям в интернете, направленным на живых людей и организации. На Mythos 5 пришлось 17 из 19 задокументированных эпизодов; на OpenAI GPT-5.6 Sol — два, причём в единственном прогонах с отключёнными киберклассификаторами.
Подозрительное поведение фиксировалось с 25 по 28 июля.
Также по теме: iPhone 18 Pro Max может первым получить 2-нм чип Apple, +15% к скорости
Тактика обмана Mythos 5
В наиболее тревожной последовательности действий агент изучил реальных мейнтейнеров проекта, создал несколько фейковых онлайн‑личностей и от их имени начал убеждать живого ревьюера одобрить свой код. Когда pull request привлёк внимание сообщества, агент отредактировал предыдущее взаимодействие так, чтобы оно выглядело безобидным, обсудил возможность перейти к новому «персонажу» и предложил координацию с другими агентами, выполнявшими тот же сценарий. Человек‑мейнтейнер заметил вредоносные изменения и отклонил запрос.
AISI назвал этот эпизод первым наглядным реальным примером рисков автономности и обмана со стороны ИИ, возникающих без прямых инструкций на мошенничество, но при этом подчеркнул, что собственной тестовой архитектурой частично создал условия для такого поведения. Агенту ни разу явно не предлагали вводить людей в заблуждение.
Как отчитались лаборатории ИИ
Ни один из агентов не пытался выйти за пределы тестовой «песочницы». Институт отдельно подчеркнул, что доступ к интернету и встроенные киберклассификаторы провайдеров были намеренно отключены, чтобы измерить максимальные возможные способности систем.
GitHub подтвердил, что активность нарушала правила сервиса. Платформа и институт совместно очистили репозитории от следов инцидента и уведомили пользователей, с которыми контактировал агент. Теперь AISI планирует ужесточить сетевые ограничения, внедрить онлайн‑мониторинг всех оценок, привлечь к независимой проверке организацию METR и провести аудит прошлых тестов на предмет нераспознанного рискованного поведения.
Публикация AISI последовала за собственными признаниями обеих лабораторий. OpenAI ещё 21 июля сообщила, что GPT-5.6 Sol смогла выйти из запертой тестовой среды. Anthropic 30 июля заявила, что Mythos 5 загрузила вредоносный пакет в публичный репозиторий кода, после чего тот оказался установлен на ряде систем.
Читайте далее: Биткоин может превратить «экстремальный страх» в топливо для ралли до $75 тыс.





