Anthropic заявила, что Claude сократил число сбоев по безопасности в автоматизированных тестах по выравниванию

Anthropic заявила, что Claude сократил число сбоев по безопасности в автоматизированных тестах по выравниванию
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

Ключевые моменты

Anthropic представила исследование о том, как Claude проводит автоматизированную работу по выравниванию ИИ. Claude улучшил показатели безопасности по 10 протестированным типам сбоев выравнивания. По данным Anthropic, общие способности модели в ходе тестов сохранились. Компания открыла свой стенд для автоматизированных исследований по выравниванию для внешних команд.

Anthropic заявила, что Claude смог повысить показатели безопасности по 10 видам сбоев выравнивания в рамках автоматизированного исследовательского процесса. По словам компании, в ходе тестов общие способности модели сохранялись, пока исследователи проверяли различные меры по повышению безопасности.

В публикации Anthropic сообщила, что открыла свой набор инструментов для автоматизированных исследований по выравниванию для внешних исследовательских групп. Компания описывает работу как попытку более точно измерить и сократить расхождение между поведением модели и целями разработчиков.

Claude тестировал меры по выравниванию

По данным Anthropic, Claude анализировал типичные формы «развыравнивания» — включая склонность к обману и угодничество. Модель предлагала подходы, обучала уменьшенные версии моделей и сама же оценивала результаты, без прямого вмешательства человека на каждом шаге.

В одном из ранних экспериментов Claude предоставили 48 часов вычислительного времени и один графический процессор. За это время модель исследовала возможные методики, сформулировала стратегии обучения и протестировала получившиеся модели.

Anthropic утверждает, что Claude сумел улучшить показатели безопасности без ухудшения общих возможностей модели в проверенных сценариях. Часть подходов, по словам компании, переносилась и на бенчмарки, которые не использовались при оптимизации.

Компания также сообщила, что предложенные методы обобщились на поведенческий аудит Petri. В тестах участвовали и модели, которые были до 4,7 раза больше тех, что использовались на стадии исследовательского процесса.

Речь идёт об управляемых тестовых средах. Anthropic подчёркивает, что малозаметные или крайне редкие сбои могут просто не проявиться в доступных наборах бенчмарков.

Также читайте: Обновление TRON добавляет проверку P-256 и увеличивает историю блоков

Автоматизация выравнивания ИИ

До этого релиза работа по выравниванию в основном опиралась на ручную деятельность исследователей: они проектировали интервенции и сами же оценивали поведение моделей. Автоматизированные системы потенциально могут ускорить этот цикл — при условии, что их результаты подтвердятся независимыми проверками.

За последние 30 дней в дискуссиях об ИИ-безопасности всё больше внимания уделяется идее: использовать более мощные модели для оценки и улучшения слабых систем.

Такой подход критически зависит от надёжных метрик и защиты от «косметического» улучшения результатов только на тестах.

Anthropic отмечает, что в эксперименте использовались отложенные тесты, чтобы проверить, насколько методы действительно обобщаются за пределы бенчмарков, по которым Claude проводил оптимизацию. При этом компания не утверждает, что хорошие результаты на бенчмарках устраняют все риски, связанные с моделью.

Отдельно подчёркивается: выбор корректных метрик и тестов остаётся ключевым для всей работы.

Доступ для внешних исследователей

Anthropic открыла исследовательский стенд, чтобы другие команды могли воспроизвести или расширить эксперименты. Внешние проверки покажут, работают ли предложенные методы для других моделей и в альтернативных рамках оценки безопасности.

Компания не позиционирует текущие результаты как замену более широких аудитов моделей. Выводы ограничены протестированными типами сбоев выравнивания и рамками конкретных экспериментов.

Вероятно, внешние исследователи сосредоточатся на воспроизводимости, дизайне бенчмарков и анализе возможных режимов отказа. Публикация Anthropic даёт отправную точку и инфраструктуру для таких последующих исследований.

Читайте далее: Fomo-копитрейдинг оставил почти 94% кошельков в убытке: исследование

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — опытный финансовый журналист с обширным опытом освещения криптовалют и технологий блокчейн. Он публиковался в Benzinga и Cointelegraph, а также в других изданиях, рассказывая о новых трендах, регуляторной среде и многом другом. Найти его можно в Twitter по нику @murtuza_merc и в Telegram под именем mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Anthropic заявила, что Claude сократил число сбоев по безопасности в автоматизированных тестах по выравниванию | Yellow