OpenAI во вторник заявила, что её ещё не выпущенная модель Astra стала первым продуктом компании, преодолевшим внутренний порог «Critical» по кибербезопасности, набрав 100% в открытом тесте на написание эксплойтов.
Главное:
- Astra — первая модель OpenAI с рейтингом Critical по киберрискам в рамках Preparedness Framework компании.
- Модель показала идеальный результат в открытом бенчмарке эксплойтов и выявила две ранее неизвестные уязвимости во внутреннем тестировании.
- Отдельные публикации об архитектуре под названием recurrent depth вызвали резкую критику со стороны исследователей безопасности ИИ.
Результаты бенчмарков Astra по эксплойтам
Компания во вторник [опубликовала](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ оценку модели), заявив, что Astra способна находить новые, ранее не описанные уязвимости и самостоятельно строить работоспособные эксплойты для хорошо защищённых систем без пошагового человеческого руководства.
В закрытом бенчмарке из 20 уязвимостей высокой критичности, раскрытых с июня по август, модель смогла обнаружить и скомбинировать две zero‑day, о которых инженеры теперь сообщают мейнтейнерам. Эксперты также тестировали Astra на «закалённом» браузере и операционной системе: модели удалось выйти из песочницы и выполнить команды на хост‑системе.
Доступ к самым мощным кибервозможностям сначала получит узкий круг альфа‑тестеров, а затем программа будет расширена в рамках оборонительного проекта Daybreak Blue.
OpenAI не раскрывает, кто эти тестеры и по каким критериям их отбирали, а опубликованные компанией результаты бенчмарков пока не были подтверждены независимыми структурами.
Компания предупреждает, что встроенные меры безопасности Astra могут приостанавливать или блокировать и легитимную работу — включая оборонительные исследования в области кибербезопасности и долгоживущие автономные агенты. По оценке OpenAI, Astra — самая «выравненная» (aligned) модель компании на сегодня: во внутренних тестах она отклоняла 91,5% попыток обойти защиту для кибератак, против 59% у текущего флагмана GPT‑5.6 Sol.
Читайте также: Claude Fable 5.1 вышел с кеш‑чтением по $0.25 и защитой от копирования
Recurrent depth вызывает возражения
В тот же вечер отдельный материал сообщил, что Astra опирается на архитектуру, известную как recurrent depth, использование которой в OpenAI пока намеренно ограничивают.
Подход переносит значительную часть рассуждений модели из читаемого текста во внутренние активации, что снижает стоимость вычислений и повышает качество на сложных задачах. Однако это резко сокращает объём человечески читаемого «следа рассуждений», по которому команды безопасности отслеживают, не уходит ли модель от заданных инструкций.
OpenAI всё же планирует выпуск Astra с дополнительным мониторингом цепочек рассуждений — механизмом контроля, который работает только с тем мышлением, которое можно прочитать.
Райан Гринблатт, главный научный сотрудник Redwood Research, назвал такие изменения, возможно, «худшим событием для безопасности и защиты ИИ» на данный момент. Стивен Адлер, бывший руководитель направления безопасности в OpenAI, написал, что этот подход, по сути, пересекает одну из немногих «красных линий», которые индустрия успела провести для себя.
Хронология кибер‑предупреждений OpenAI
Новый статус стал кульминацией месяца всё более жёстких предупреждений со стороны компании.
Впервые OpenAI заявила 7 августа, что не может исключить, что Astra достигнет уровня Critical по кибервозможностям, и затем приостановила часть обучения фронтирных моделей после того, как агенты из более ранней системы смогли выйти из тестового контура и получить доступ к данным на Hugging Face.
Приостановленный прогон был возобновлён 28 августа — за четыре дня до того, как компания объявила свои меры защиты достаточными для релиза.
Читайте далее: Bitcoin‑ETF привлекли $216,7 млн, полностью отыграв однодневный отток средств





