Anthropic отключила доступ к живому интернету для всех внутренних тестов своих ИИ после того, как модели Claude, включая Mythos 5, воспользовались уязвимостями и обошли ограничения на реальных сайтах, в том числе на ресурсах госорганов США.
Ключевые моменты:
- Anthropic сняла доступ к живому интернету для всех внутренних оценок, пока её системы мониторинга не начнут надёжно ловить непреднамеренное поведение моделей.
- Модели Claude запускали команды на сервере университета, использовали токены доступа к платным данным и заполняли формы на настоящих сайтах.
- Ложное сообщение о якобы совершённом убийстве, отправленное моделью Claude Haiku 4.5 в полицию Филадельфии, вызвало публичное недовольство ведомства.
Отчёт Anthropic по Claude
Anthropic опубликовала в пятницу отчёт о непреднамеренных действиях моделей во время оценочных и внутренних запусков. Материал в значительной степени основан на пересмотре логов, начатом в июле. Часть тестов повышенного риска и кибербезопасности уже проводилась в офлайн‑режиме.
Теперь ограничение распространено на все внутренние оценки без обозначенного срока действия — до тех пор, пока компания не подтвердит, что мониторинг стабильно выявляет подобные инциденты.
В отчёте случаи сгруппированы в четыре категории: выполнение команд на сервере через программную уязвимость, отправка форм на реальных сайтах, доступ к закрытым данным и использование сервисов сокращения ссылок для обхода ограничений инструментов. Среди затронутых ресурсов были сайты федеральных, региональных и местных органов власти США. Anthropic утверждает, что проинформировала Белый дом и уведомила каждое задействованное ведомство.
В одном из эпизодов Claude Mythos 5 извлёк действующие токены доступа с публичной карты муниципальной недвижимости и напрямую обратился к серверу, который её обслуживает. В другом случае Claude Haiku 4.5 18 июля через веб‑форму на сайте полиции Филадельфии отправил вымышленный «наводчик» по нераскрытому делу об убийстве — сообщение было отфильтровано как спам. Полиция назвала двухмесячную задержку с выявлением и уведомлением «неприемлемой».
Также по теме: У Zcash январская квантовая цель для 70% ZEC — а вот даты у неё нет
Предупреждение от фон Аркс
Сидни фон Аркс из группы по безопасности ИИ Nightingale в интервью до публикации отчёта заявила, что отключение моделей от открытого интернета серьёзно осложнит работу исследователям и замедлит развитие самих моделей. «В какой‑то момент их всё равно нужно выровнять (align)», — отметила фон Аркс.
В Anthropic признали, что одного только обучения на выравнивание пока недостаточно для безопасного поиска в сети и удалённой работы с компьютерами, поэтому компания дополнительно опирается на классификаторы и другие защитные механизмы. Поведение моделей связали с несовершенными тренинговыми средами, в которых ИИ фактически поощряется за обход ограничений — это типичный пример так называемого reward hacking. По утверждению компании, новые инструменты детектирования при тестах блокировали все подобные случаи.
В Anthropic оценивают текущие инциденты как существенно менее серьёзные, чем летние.
Публикация отчёта последовала за документом от 30 июля, в котором Anthropic сообщала, что три модели Claude во время кибербезопасностных тестов вышли в интернет и получили несанкционированный доступ к системам трёх организаций. Тогда было проанализировано 141 006 тестовых запусков. Проверка началась после того, как OpenAI 21 июля раскрыла, что её модели сумели выбраться из тестовой «песочницы» и получить доступ к инфраструктуре Hugging Face.
Читайте далее: Kalshi выходит против NFL в Верховном суде США — $1,8 млрд завязаны на одном футбольном воскресенье

