Anthropic заявляет: Claude снизил число сбоев по выравниванию в автоматизированных тестах

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

Ключевые моменты

Anthropic опубликовала исследование об использовании Claude для автоматизации работ по выравниванию. Claude улучшил показатели безопасности по 10 типам протестированных сбоев выравнивания. По данным Anthropic, общие способности моделей в ходе тестов сохранились. Компания открыла доступ к своей автоматизированной исследовательской установке по выравниванию.

Anthropic сообщила, что Claude улучшил показатели безопасности по десяти протестированным видам сбоев выравнивания в рамках автоматизированного исследовательского процесса. По данным компании, в ходе экспериментов общие возможности моделей сохранились, тогда как исследователи тестировали различные меры по повышению безопасности.

В публикации Anthropic отметила, что открыла свою автоматизированную установку для исследований по выравниванию внешним специалистам. В компании позиционируют работу как попытку системно измерять и снижать риски несоответствия поведения моделей заданным целям.

Claude тестировал меры по выравниванию

По словам Anthropic, Claude анализировал распространённые формы «рассинхрона» модели с целями разработчиков, включая склонность к обману и чрезмерное подстраивание под ожидания пользователя. Модель предлагала подходы, обучала более компактные модели и оценивала результаты без прямого вмешательства человека на каждом шаге.

В одном из ранних экспериментов Claude выделили 48 часов и один графический процессор. За это время система исследовала потенциальные подходы, сформулировала методы обучения и протестировала получившиеся модели.

Anthropic утверждает, что Claude смог повысить показатели безопасности, не ухудшая общих способностей моделей в протестированных условиях. Отдельные методы, по данным компании, переносились и на тесты, которые не использовались напрямую при оптимизации.

Отчёт также указывает, что разработанные методы масштабировались до поведенческого аудита Petri. Anthropic добавила, что испытания включали модели, которые были до 4,7 раза крупнее, чем те, что использовались на этапе собственно исследовательского процесса.

При этом результаты относятся к контролируемым тестовым средам. Anthropic признаёт, что тонкие или редкие виды сбоев могут не проявляться в доступных бенчмарках.

Также читайте: Обновление TRON добавило валидацию P-256 и увеличило историю блоков

Автоматизация выравнивания ИИ

До публикации этих результатов работы по выравниванию в основном опирались на ручную работу исследователей, которые проектировали интервенции и сами оценивали поведение моделей. Автоматизированные системы могут заметно ускорить этот цикл — при условии, что их выводы подтвердятся независимыми проверками.

За последние 30 дней дискуссии по безопасности ИИ всё чаще вращаются вокруг идеи использовать более мощные модели для оценки и улучшения более слабых систем.

Такой подход держится на надёжных метриках и защитах от ситуаций, когда хорошие результаты на бенчмарках вводят в заблуждение относительно реальных рисков. В Anthropic подчеркнули, что в эксперименте использовали отложенные тесты, чтобы проверить, насколько методы выходят за рамки тех бенчмарков, под которые Claude непосредственно оптимизировал решения. Компания при этом не заявляет, что высокие показатели на тестах снимают все риски, связанные с моделью.

В фирме отдельно акцентируют, что выбор правильных измерителей и наборов тестов остаётся ключевым элементом работы по выравниванию.

Установка доступна сторонним исследователям

Anthropic открыла исследовательскую установку, чтобы другие команды могли воспроизводить или расширять эксперименты. Внешние проверки покажут, насколько методы устойчивы при применении к другим моделям и иным оценкам безопасности.

Компания не позиционирует результаты как замену более широких аудитов моделей. Отчёт ограничивается конкретными протестированными типами сбоев выравнивания и рамками проведённых экспериментов.

Ожидается, что внешние исследователи сосредоточатся на воспроизводимости, дизайне бенчмарков и анализе потенциальных режимов отказа. Публикация Anthropic фактически задаёт инфраструктуру и отправную точку для подобных работ.

Читайте далее: Fomo-копитрейдинг привёл почти 94% кошельков к убыткам: исследование

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — опытный финансовый журналист с обширным опытом освещения криптовалют и технологий блокчейн. Он публиковался в Benzinga и Cointelegraph, а также в других изданиях, рассказывая о новых трендах, регуляторной среде и многом другом. Найти его можно в Twitter по нику @murtuza_merc и в Telegram под именем mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Anthropic заявляет: Claude снизил число сбоев по выравниванию в автоматизированных тестах | Yellow