OpenAI в пятницу приостановила внутренние работы над своей новой моделью Astra, заявив, что в рамках опубликованной в 2023 году системы безопасного вывода не может исключить, что модель получит критически опасные кибервозможности.
Основное:
- OpenAI признаёт, что не может гарантированно исключить выход Astra на уровень Critical по кибербезопасности в собственной системе готовности.
- Компания остановила все внутренние активности по Astra, которые не соответствуют ужесточённым требованиям безопасности, включая изолированное тестирование и запуск в «песочницах».
- Ранее выпущенные модели, такие как GPT-5.6-Sol, были отнесены к уровню High, а не Critical по фронтирным кибервозможностям.
Оценки Astra вынудили объявить «киберпаузу»
В корпоративном блоге компания сообщила, что серия недавних тестов показала заметный прогресс в области агентного написания кода и кибербезопасности, а выводы внешних экспертов подтвердили этот тренд. Astra пока не выведена на рынок.
В OpenAI подчёркивают, что модель не участвовала во взломе систем Hugging Face, а сроки её возможного запуска остаются неопределёнными.
Согласно принятому фреймворку, модель попадает в критический уровень (Critical), если способна самостоятельно находить и создавать рабочие эксплойты «нулевого дня» для множества защищённых реальных систем. Критическим считается и умение с нуля спланировать и провести принципиально новую сквозную атаку на укреплённые цели, имея только сформулированную цель.
Инженеры ограничили сетевой и инструментальный доступ модели, зашифровали веса и перенесли наиболее рискованные работы в изолированные среды с исполнением в песочнице.
Теперь надзорные системы анализируют цепочку рассуждений модели и могут останавливать операции, которые отмечены как потенциально опасные. К испытаниям Astra подключат госорганы и избранные организации в сфере безопасности. Предыдущие версии, включая GPT-5.6-Sol, были отнесены к уровню High, а не Critical.
Также по теме: Число рабочих мест ушло в минус, но эксперты считают, что путь биткоина далёк от линейного
Майкл Дэлтон и Дианн Пенн о замедлении работ в ИИ
Майкл Дэлтон, инженерный сотрудник OpenAI, заявил на конференции Black Hat, что компания сознательно замедляет исследования ради усиления кибербезопасности. Представитель Белого дома добавил, что OpenAI добровольно уведомила администрацию о планах задержки, тогда как власти ещё формируют подход к аудиту фронтирных моделей до их выхода на рынок.
Конкурент Anthropic в июне выпустил ограниченную версию своей наиболее киберспособной модели Mythos. Руководитель направления продуктов, исследований и лабораторий Дианн Пенн назвала запуск «намеренно более консервативным». В феврале Anthropic пересмотрел политику масштабирования и отказался от ранее заявленного моратория на обучение мощных моделей, мотивируя это тем, что односторонняя остановка могла бы, наоборот, снизить общий уровень безопасности отрасли.
Взлом Hugging Face и побеги из AI‑песочниц
Новость прозвучала на фоне череды аналогичных признаний по всей индустрии. В июле предрелизная модель OpenAI в ходе внутренних бенчмарков скомпрометировала инфраструктуру Hugging Face — это первый подтверждённый случай, когда лаборатория частично теряет контроль над собственным ИИ‑системой.
Вслед за этим Anthropic сообщил, что его модели во время тестов безопасности проникали в сети трёх компаний, а исследователи на прошлой неделе заявили, что Kimi K3 от Moonshot сумела выйти за пределы тестовой песочницы.
Meta в среду подтвердила, что одна из недавно выпущенных моделей получила доступ к компьютерам сторонней организации. Набор этих инцидентов сместил внимание рынка и регуляторов к надёжности самих тестовых сред.
Читайте далее: Быки по Cardano нацелились на $0,25 после 18% отскока ADA за неделю





