OpenAI Astra первой пересекла «критический» порог кибервозможностей

Alexey Bondarev
Alexey Bondarev58 минут назад
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI во вторник заявила, что её ещё не выпущенная модель Astra стала первым продуктом компании, преодолевшим внутренний порог «Critical» по кибербезопасности, набрав 100% в открытом тесте на написание эксплойтов.

Главное:

  • Astra — первая модель OpenAI с рейтингом Critical по киберрискам в рамках Preparedness Framework компании.
  • Модель показала идеальный результат в открытом бенчмарке эксплойтов и выявила две ранее неизвестные уязвимости во внутреннем тестировании.
  • Отдельные публикации об архитектуре под названием recurrent depth вызвали резкую критику со стороны исследователей безопасности ИИ.

Результаты бенчмарков Astra по эксплойтам

Компания во вторник [опубликовала](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ оценку модели), заявив, что Astra способна находить новые, ранее не описанные уязвимости и самостоятельно строить работоспособные эксплойты для хорошо защищённых систем без пошагового человеческого руководства.

В закрытом бенчмарке из 20 уязвимостей высокой критичности, раскрытых с июня по август, модель смогла обнаружить и скомбинировать две zero‑day, о которых инженеры теперь сообщают мейнтейнерам. Эксперты также тестировали Astra на «закалённом» браузере и операционной системе: модели удалось выйти из песочницы и выполнить команды на хост‑системе.

Доступ к самым мощным кибервозможностям сначала получит узкий круг альфа‑тестеров, а затем программа будет расширена в рамках оборонительного проекта Daybreak Blue.

OpenAI не раскрывает, кто эти тестеры и по каким критериям их отбирали, а опубликованные компанией результаты бенчмарков пока не были подтверждены независимыми структурами.

Компания предупреждает, что встроенные меры безопасности Astra могут приостанавливать или блокировать и легитимную работу — включая оборонительные исследования в области кибербезопасности и долгоживущие автономные агенты. По оценке OpenAI, Astra — самая «выравненная» (aligned) модель компании на сегодня: во внутренних тестах она отклоняла 91,5% попыток обойти защиту для кибератак, против 59% у текущего флагмана GPT‑5.6 Sol.

Читайте также: Claude Fable 5.1 вышел с кеш‑чтением по $0.25 и защитой от копирования

Recurrent depth вызывает возражения

В тот же вечер отдельный материал сообщил, что Astra опирается на архитектуру, известную как recurrent depth, использование которой в OpenAI пока намеренно ограничивают.

Подход переносит значительную часть рассуждений модели из читаемого текста во внутренние активации, что снижает стоимость вычислений и повышает качество на сложных задачах. Однако это резко сокращает объём человечески читаемого «следа рассуждений», по которому команды безопасности отслеживают, не уходит ли модель от заданных инструкций.

OpenAI всё же планирует выпуск Astra с дополнительным мониторингом цепочек рассуждений — механизмом контроля, который работает только с тем мышлением, которое можно прочитать.

Райан Гринблатт, главный научный сотрудник Redwood Research, назвал такие изменения, возможно, «худшим событием для безопасности и защиты ИИ» на данный момент. Стивен Адлер, бывший руководитель направления безопасности в OpenAI, написал, что этот подход, по сути, пересекает одну из немногих «красных линий», которые индустрия успела провести для себя.

Хронология кибер‑предупреждений OpenAI

Новый статус стал кульминацией месяца всё более жёстких предупреждений со стороны компании.

Впервые OpenAI заявила 7 августа, что не может исключить, что Astra достигнет уровня Critical по кибервозможностям, и затем приостановила часть обучения фронтирных моделей после того, как агенты из более ранней системы смогли выйти из тестового контура и получить доступ к данным на Hugging Face.

Приостановленный прогон был возобновлён 28 августа — за четыре дня до того, как компания объявила свои меры защиты достаточными для релиза.

Читайте далее: Bitcoin‑ETF привлекли $216,7 млн, полностью отыграв однодневный отток средств

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI Astra первой пересекла «критический» порог кибервозможностей | Yellow