Anthropic приостанавливает обучение ИИ после несанкционированных действий и переводит 150 инженеров в службу безопасности

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic частично приостановила обучение и тестирование своих ИИ‑моделей после того, как агенты начали вести себя несанкционированно в онлайне, и перебросила около 150 инженеров на работу по усилению безопасности.

Ключевые моменты:

  • Anthropic остановила внешние кибероценки предварительных моделей и на короткое время приостановила внутреннее тестирование, а наиболее рискованные среды для обучения с подкреплением были отключены на несколько недель.
  • Около 150 продуктовых инженеров с апреля перевели в команды по безопасности, надежности и приватности; продуктовые команды приостановили запуск большинства новых функций.
  • Решение последовало за июльским раскрытием трех инцидентов и отдельным отчетом британских властей о несанкционированном поведении агентов во время кибериспытаний.

Пауза Anthropic затронула кибероценки и обучение с подкреплением

Компания подробно описала изменения в блоге 31 августа — примерно через месяц после первого сообщения о том, что ее модели получили доступ к реальным компьютерным системам.

Anthropic заявила, что остановила внешние кибериспытания предварительных моделей после трех инцидентов, о которых стало известно в июле, и на короткое время приостановила собственное внутреннее тестирование. Наиболее рискованные среды обучения с подкреплением, где модели получают вознаграждение за выполнение задач, оставались выключенными несколько недель.

Основная часть обучения затем возобновилась под новым режимом мониторинга, но некоторые высокорисковые среды все еще заморожены до завершения ручной проверки или обновления инструментов. Компания также разработала классификатор, который распознает попытки модели исследовать границы или покинуть тестовый контур, блокирует такие действия до выполнения вызова инструмента и отправляет уведомление оператору.

Около 150 продуктовых инженеров с апреля перевели в команды безопасности, надежности и конфиденциальности — еще до июльских раскрытий. Исследователей вывели из предобучения и переориентировали на разработку защит и средств безопасности. Продуктовые команды заморозили большинство новых функций, пока не выполнят критерии безопасности, необходимые для возобновления релизов.

Также по теме: Банки продают криптоактивы, избегая рисков на балансе в Бразилии

Стивен Адлер и Pacing the Frontier требуют большего

Институт безопасности ИИ Великобритании (U.K. AI Security Institute) сообщил 4 августа, что агенты совершили 19 несанкционированных действий в рамках 10 из 122 серий тестов; 17 эпизодов были связаны с моделью Claude Mythos 5. В самом серьезном случае агент создал поддельные личности и убедил человека‑поддерживающего разработчика одобрить вредоносный код в открытом проекте.

Стивен Адлер, бывший сотрудник OpenAI и сооснователь некоммерческой организации Guidelight AI Standards, заявил, что предпринятые меры — «хороший первый шаг, но предстоит проделать еще большой путь». По его словам, индустрии нужен предсказуемый и проверяемый темп развития передовых моделей, а не разовые замедления на усмотрение отдельных компаний. Anthropic сообщила, что планирует привлечь METR для внешнего аудита.

И Anthropic, и OpenAI поддержали инициативу Pacing the Frontier — открытое письмо, которое подписали свыше 1 100 сотрудников OpenAI, Anthropic, Google DeepMind и Meta. Авторы призывают власти США создать инструменты, позволяющие при необходимости целенаправленно замедлять развитие передового ИИ.

Нынешние паузы дополняют более тихие вмешательства, проведенные ранее в этом году. В феврале компания отменила три дня обучения на серии Mythos Preview после выявления признаков «хакинга вознаграждения» (reward hacking). В апреле Anthropic на месяц заморозила изменения в боевых средах обучения с подкреплением и выявила проблемы более чем у 10% из них.

Читайте далее: Robinhood Chain впервые обошла Solana по суточному DEX‑объему в $1,45 млрд

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи