Ключевые моменты
Anthropic опубликовала исследование об использовании Claude для автоматизации работ по выравниванию. Claude улучшил показатели безопасности по 10 типам протестированных сбоев выравнивания. По данным Anthropic, общие способности моделей в ходе тестов сохранились. Компания открыла доступ к своей автоматизированной исследовательской установке по выравниванию.
Anthropic сообщила, что Claude улучшил показатели безопасности по десяти протестированным видам сбоев выравнивания в рамках автоматизированного исследовательского процесса. По данным компании, в ходе экспериментов общие возможности моделей сохранились, тогда как исследователи тестировали различные меры по повышению безопасности.
В публикации Anthropic отметила, что открыла свою автоматизированную установку для исследований по выравниванию внешним специалистам. В компании позиционируют работу как попытку системно измерять и снижать риски несоответствия поведения моделей заданным целям.
Claude тестировал меры по выравниванию
По словам Anthropic, Claude анализировал распространённые формы «рассинхрона» модели с целями разработчиков, включая склонность к обману и чрезмерное подстраивание под ожидания пользователя. Модель предлагала подходы, обучала более компактные модели и оценивала результаты без прямого вмешательства человека на каждом шаге.
В одном из ранних экспериментов Claude выделили 48 часов и один графический процессор. За это время система исследовала потенциальные подходы, сформулировала методы обучения и протестировала получившиеся модели.
Anthropic утверждает, что Claude смог повысить показатели безопасности, не ухудшая общих способностей моделей в протестированных условиях. Отдельные методы, по данным компании, переносились и на тесты, которые не использовались напрямую при оптимизации.
Отчёт также указывает, что разработанные методы масштабировались до поведенческого аудита Petri. Anthropic добавила, что испытания включали модели, которые были до 4,7 раза крупнее, чем те, что использовались на этапе собственно исследовательского процесса.
При этом результаты относятся к контролируемым тестовым средам. Anthropic признаёт, что тонкие или редкие виды сбоев могут не проявляться в доступных бенчмарках.
Также читайте: Обновление TRON добавило валидацию P-256 и увеличило историю блоков
Автоматизация выравнивания ИИ
До публикации этих результатов работы по выравниванию в основном опирались на ручную работу исследователей, которые проектировали интервенции и сами оценивали поведение моделей. Автоматизированные системы могут заметно ускорить этот цикл — при условии, что их выводы подтвердятся независимыми проверками.
За последние 30 дней дискуссии по безопасности ИИ всё чаще вращаются вокруг идеи использовать более мощные модели для оценки и улучшения более слабых систем.
Такой подход держится на надёжных метриках и защитах от ситуаций, когда хорошие результаты на бенчмарках вводят в заблуждение относительно реальных рисков. В Anthropic подчеркнули, что в эксперименте использовали отложенные тесты, чтобы проверить, насколько методы выходят за рамки тех бенчмарков, под которые Claude непосредственно оптимизировал решения. Компания при этом не заявляет, что высокие показатели на тестах снимают все риски, связанные с моделью.
В фирме отдельно акцентируют, что выбор правильных измерителей и наборов тестов остаётся ключевым элементом работы по выравниванию.
Установка доступна сторонним исследователям
Anthropic открыла исследовательскую установку, чтобы другие команды могли воспроизводить или расширять эксперименты. Внешние проверки покажут, насколько методы устойчивы при применении к другим моделям и иным оценкам безопасности.
Компания не позиционирует результаты как замену более широких аудитов моделей. Отчёт ограничивается конкретными протестированными типами сбоев выравнивания и рамками проведённых экспериментов.
Ожидается, что внешние исследователи сосредоточатся на воспроизводимости, дизайне бенчмарков и анализе потенциальных режимов отказа. Публикация Anthropic фактически задаёт инфраструктуру и отправную точку для подобных работ.
Читайте далее: Fomo-копитрейдинг привёл почти 94% кошельков к убыткам: исследование

