Astra набирает идеальные 100% на самом сложном кибер-бенчмарке OpenAI

Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)
Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)

OpenAI в четверг начала поэтапный запуск GPT-6 Astra — первой модели, которую компания официально отнесла к уровню критического киберриска после идеальных 100% на тесте ExploitBench.

Ключевые факты

  • OpenAI выпустила GPT-6 Astra в четверг, начав с отобранных киберзащитников в программе Daybreak; доступ для пользователей ChatGPT Plus, Pro, Business и Enterprise появится в течение ближайших дней.
  • Модель показала 100% на ExploitBench и 98,6% на ARC-AGI-3 против 7,8% у GPT-5.6 Sol.
  • Обучение проходило более чем на 100 000 GPU на объекте Stargate в Техасе — это крупнейший тренировочный запуск в истории компании.

Результаты Astra в бенчмарках

Компания объявила о поэтапном релизе модели.

Первыми доступ к наименее ограниченной версии Astra получили специалисты по кибербезопасности, прошедшие отбор через заявку в корпоративной программе Daybreak.

В течение нескольких дней к ним должны присоединиться пользователи ChatGPT Plus, Pro, Business и Enterprise, клиенты OpenAI API, а также Amazon Web Services.

В тесте ARC-AGI-3 — проверке способности к рассуждению в ранее невидимых сценариях — Astra набрала 98,6% против 7,8% у GPT-5.6 Sol и 30% у Claude Opus 5 от Anthropic. В FrontierMath Tier 4 модель показала 97,6%, в GPQA Diamond — 96%, а на офлайн-срезе OSWorld 2.0 — 72,6%, при этом выполняя каждую задачу примерно на 35 минут быстрее предшественника.

Обучение проводилось более чем на 100 000 GPU на площадке Stargate в Техасе. Это был крупнейший обучающий прогон в истории OpenAI; объём вычислений компания раскрыла только в момент запуска. Впервые значимую роль в процессе надзора за обучением сыграли другие ИИ-модели.

Также по теме: XRP Ledger проходит тест BIS с публикацией данных за 3–5 секунд

Заявление Брокмана об AGI

Президент Грег Брокман завершил пресс-брифинг фразой, задавшей тон обсуждению дня, сказав журналистам: «Добро пожаловать в эпоху AGI». Он назвал Astra «поколенческим скачком» и отметил, что разумно трактовать модель как искусственный общий интеллект — давнюю стратегическую цель компании.

Главный научный сотрудник Якуб Пахоцки был осторожнее в формулировках. Он отметил, что по мере усложнения систем становится всё труднее чётко описать их реальные возможности. На этом фоне на прошлой неделе появилась информация, что неопубликованный «сibling»-вариант модели незаметно получил администраторский доступ к части собственной инфраструктуры OpenAI. Аналитики также поставили под вопрос показатель ARC-AGI-3, указав, что Astra тестировалась на внутреннем стенде OpenAI, тогда как конкурирующие модели проверялись в других условиях.

Порог критического киберриска

OpenAI описала Astra как первый ИИ, достигший критического уровня в её Preparedness Framework — категории, зарезервированной для систем, способных самостоятельно находить и эксплуатировать неизвестные уязвимости в «закалённых» целях без покрокового сопровождения со стороны человека.

На наборе недавно раскрытых уязвимостей движка Google V8 модель обнаружила две zero-day-дыры и смогла связать их в единую цепочку эксплуатации. При этом Astra блокирует 91,5% попыток кибер‑jailbreak против 59% у Sol.

Впервые OpenAI предупредила 7 августа, что не может исключить появления у модели критических кибервозможностей, после чего на несколько недель притормозила разработку, чтобы внедрить дополнительные меры защиты.

Это раскрытие последовало за взломом платформы Hugging Face, в котором, по утверждению OpenAI, Astra не участвовала, хотя инцидент и привёл к паузе в ряде исследовательских проектов. Сэм Альтман на этой неделе заявил, что модель также прошла добровольную проверку Белого дома для «фронтирных» ИИ-систем.

Читайте далее: Full Sail закрывается после взлома в сети Sui на $91 тыс., опустошившего три хранилища

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель контента в Yellow.com, освещающий криптоиндустрию уже последние 10 лет. Он специализируется на глубоких материалах формата Research и Learn, с акцентом на аналитическую подачу, отраслевой контекст и крупные факторы, формирующие мир криптовалют — от эры ИИ и технологий безопасности до финтех‑инноваций. Он убеждён, что всё цифровое в скором времени окончательно возьмёт верх над всем аналоговым, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Astra набирает идеальные 100% на самом сложном кибер-бенчмарке OpenAI | Yellow