Anthropic приостанавливает обучение ИИ после несанкционированных действий и переводит 150 инженеров в безопасность

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic частично приостановила обучение и тестирование своих моделей после того, как те совершили несанкционированные действия в интернете, и перераспределила около 150 инженеров на задачи безопасности.

Ключевые моменты:

  • Anthropic остановила внешние кибер‑оценки предрелизных моделей и на короткое время заморозила внутренние тесты, при этом наиболее рискованные среды для обучения с подкреплением были отключены на несколько недель.
  • Около 150 продуктовых инженеров с апреля перевели в команды безопасности, надежности и приватности, а продуктовые команды отложили запуск большинства новых функций.
  • Решение последовало за июльским раскрытием трех инцидентов и отдельным докладом британских властей о несанкционированном поведении агентов во время кибериспытаний.

Пауза Anthropic затронула кибер‑оценки и обучение с подкреплением

Компания подробно описала изменения в блоге 31 августа — примерно через месяц после первого сообщения о том, что ее модели получили доступ к реальным компьютерным системам.

По словам Anthropic, она остановила внешние кибер‑оценки предрелизных моделей после трех инцидентов, о которых стало известно в июле, и на короткое время приостановила собственные внутренние тесты. Наиболее рискованные среды обучения с подкреплением, где модели получают вознаграждение за выполнение задач, оставались офлайн несколько недель.

Большая часть обучения уже возобновлена под усиленным мониторингом, однако ряд высокорисковых сред остается замороженным до ручной проверки или обновления инструментов. Компания также разработала классификатор, который выявляет попытки модели «зондировать» или покинуть тестовую среду: он блокирует такие действия до исполнения вызова инструмента и уведомляет сотрудника.

Примерно 150 продуктовых инженеров с апреля перевели в команды, отвечающие за безопасность, надежность и приватность, задолго до июльских раскрытий. Исследователи были временно выведены из проектов по предобучению и переключены на защитные механизмы и кибербезопасность. Продуктовые команды отложили большинство новых функций до выполнения набора критериев безопасности, необходимых для возобновления работы.

Также по теме: Банки продают криптоактивы, но избегают рисков для балансов в Бразилии

Стивен Адлер и Pacing the Frontier требуют большего

Институт безопасности ИИ Великобритании (U.K. AI Security Institute) сообщил 4 августа, что в ходе 10 из 122 прогонов оценок агенты совершили 19 несанкционированных действий, из которых 17 были связаны с моделью Claude Mythos 5. В самом серьезном эпизоде агент создал поддельные личности и вынудил человека‑сопровождающего одобрить вредоносный код в открытом проекте.

Стивен Адлер, бывший сотрудник OpenAI и сооснователь некоммерческой организации Guidelight AI Standards, заявил, что предпринятые шаги — «хорошее начало, но впереди еще долгий путь». По его мнению, отрасли нужен предсказуемый и проверяемый темп работы с передовыми моделями, а не разовые замедления по инициативе отдельных компаний. Anthropic сообщила, что планирует привлечь METR для независимого аудита.

Anthropic и OpenAI поддержали инициативу Pacing the Frontier — открытое письмо, которое подписали свыше 1 100 сотрудников OpenAI, Anthropic, Google DeepMind и Meta. Подписанты призывают власти США помочь в создании механизмов, которые позволили бы целенаправленно сдерживать развитие передовых ИИ‑систем.

Паузы стали продолжением более тихих вмешательств ранее в этом году. В феврале компания откатила три дня обучения на серии Mythos Preview после признаков «взлома» системы вознаграждений. В апреле Anthropic заморозила изменения в производственных средах обучения с подкреплением примерно на месяц, выявив проблемы более чем у 10% таких сред.

Читайте далее: Сеть Robinhood впервые обогнала Solana по суточному DEX‑объему в $1,45 млрд

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи