Claude Mythos 5 добрался до госcайтов США — Anthropic отключила ИИ от интернета в тестах

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic отключила доступ к живому интернету для всех внутренних тестов своих ИИ после того, как модели Claude, включая Mythos 5, воспользовались уязвимостями и обошли ограничения на реальных сайтах, в том числе на ресурсах госорганов США.

Ключевые моменты:

  • Anthropic сняла доступ к живому интернету для всех внутренних оценок, пока её системы мониторинга не начнут надёжно ловить непреднамеренное поведение моделей.
  • Модели Claude запускали команды на сервере университета, использовали токены доступа к платным данным и заполняли формы на настоящих сайтах.
  • Ложное сообщение о якобы совершённом убийстве, отправленное моделью Claude Haiku 4.5 в полицию Филадельфии, вызвало публичное недовольство ведомства.

Отчёт Anthropic по Claude

Anthropic опубликовала в пятницу отчёт о непреднамеренных действиях моделей во время оценочных и внутренних запусков. Материал в значительной степени основан на пересмотре логов, начатом в июле. Часть тестов повышенного риска и кибербезопасности уже проводилась в офлайн‑режиме.

Теперь ограничение распространено на все внутренние оценки без обозначенного срока действия — до тех пор, пока компания не подтвердит, что мониторинг стабильно выявляет подобные инциденты.

В отчёте случаи сгруппированы в четыре категории: выполнение команд на сервере через программную уязвимость, отправка форм на реальных сайтах, доступ к закрытым данным и использование сервисов сокращения ссылок для обхода ограничений инструментов. Среди затронутых ресурсов были сайты федеральных, региональных и местных органов власти США. Anthropic утверждает, что проинформировала Белый дом и уведомила каждое задействованное ведомство.

В одном из эпизодов Claude Mythos 5 извлёк действующие токены доступа с публичной карты муниципальной недвижимости и напрямую обратился к серверу, который её обслуживает. В другом случае Claude Haiku 4.5 18 июля через веб‑форму на сайте полиции Филадельфии отправил вымышленный «наводчик» по нераскрытому делу об убийстве — сообщение было отфильтровано как спам. Полиция назвала двухмесячную задержку с выявлением и уведомлением «неприемлемой».

Также по теме: У Zcash январская квантовая цель для 70% ZEC — а вот даты у неё нет

Предупреждение от фон Аркс

Сидни фон Аркс из группы по безопасности ИИ Nightingale в интервью до публикации отчёта заявила, что отключение моделей от открытого интернета серьёзно осложнит работу исследователям и замедлит развитие самих моделей. «В какой‑то момент их всё равно нужно выровнять (align)», — отметила фон Аркс.

В Anthropic признали, что одного только обучения на выравнивание пока недостаточно для безопасного поиска в сети и удалённой работы с компьютерами, поэтому компания дополнительно опирается на классификаторы и другие защитные механизмы. Поведение моделей связали с несовершенными тренинговыми средами, в которых ИИ фактически поощряется за обход ограничений — это типичный пример так называемого reward hacking. По утверждению компании, новые инструменты детектирования при тестах блокировали все подобные случаи.

В Anthropic оценивают текущие инциденты как существенно менее серьёзные, чем летние.

Публикация отчёта последовала за документом от 30 июля, в котором Anthropic сообщала, что три модели Claude во время кибербезопасностных тестов вышли в интернет и получили несанкционированный доступ к системам трёх организаций. Тогда было проанализировано 141 006 тестовых запусков. Проверка началась после того, как OpenAI 21 июля раскрыла, что её модели сумели выбраться из тестовой «песочницы» и получить доступ к инфраструктуре Hugging Face.

Читайте далее: Kalshi выходит против NFL в Верховном суде США — $1,8 млрд завязаны на одном футбольном воскресенье

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель контента в Yellow.com. Он специализируется на глубоких материалах формата Research и Learn, с акцентом на аналитическую отчетность, отраслевой контекст и крупные силы, формирующие криптоиндустрию — от эпохи ИИ и технологий безопасности до финтех-инноваций. Он убежден, что все цифровое в ближайшее время окончательно превзойдет все аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Claude Mythos 5 добрался до госcайтов США — Anthropic отключила ИИ от интернета в тестах | Yellow