Astra набирає ідеальні 100% на найскладнішому кібербенчмарку OpenAI

Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)
Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)

OpenAI у четвер почала поетапно розгортати GPT-6 Astra — першу модель, якій компанія офіційно присвоїла статус критичної з погляду кіберризиків після ідеального результату 100% на ExploitBench.

Ключові факти:

  • OpenAI запустила GPT-6 Astra у четвер, спочатку для відібраних захисників у програмі Daybreak; доступ для користувачів ChatGPT Plus, Pro, Business та Enterprise з’явиться протягом кількох днів.
  • Модель показала 100% на ExploitBench та 98,6% на ARC-AGI-3 проти 7,8% у GPT-5.6 Sol.
  • Навчання відбувалося на понад 100 000 GPU на об’єкті Stargate у Техасі — це найбільший тренувальний запуск в історії компанії.

Результати Astra на бенчмарках

Компанія оголосила про поетапний реліз моделі.

Першими доступ до найменш обмеженої версії Astra отримують фахівці з кіберзахисту, допущені через аплікаційну програму Daybreak.

Уже за кілька днів до моделі дістануться користувачі ChatGPT Plus, Pro, Business та Enterprise, клієнти OpenAI API, а також хмарні користувачі Amazon Web Services.

Astra показала 98,6% на ARC-AGI-3 — тесті здатності до міркувань у принципово нових для моделі умовах. Для порівняння, GPT-5.6 Sol набрав 7,8%, а Anthropic Claude Opus 5 — 30%. На FrontierMath Tier 4 Astra досягла 97,6%, на GPQA Diamond — 96%, а на офлайновому зрізі OSWorld 2.0 показала 72,6%, виконуючи завдання приблизно на 35 хвилин швидше за свого попередника.

Навчання відбувалося на більш ніж 100 000 GPU на майданчику Stargate в Техасі. Це був найбільший тренувальний запуск OpenAI; сам обсяг обчислювальних ресурсів компанія розкрила лише під час презентації. Уперше значну роль у нагляді за тренуванням відігравали інші моделі.

Також читайте: Реєстр XRP отримує тест BIS із публікацією даних за 3–5 секунд

Заява Брокмана про AGI

Президент Грег Брокман завершив брифінг фразою, яка фактично задала тон події, сказавши журналістам: «Ласкаво просимо в епоху AGI». Він назвав Astra поколіннєвим стрибком і заявив, що буде цілком логічно сприймати модель як реалізацію штучного загального інтелекту — давньої стратегічної мети OpenAI.

Головний науковець Якуб Пахоцький був обережнішим в оцінках. Він зазначив, що зі зростанням можливостей моделей дедалі складніше чітко окреслити, на що саме вони здатні. Актуальності цьому зауваженню додала нещодавня публікація про те, що неопублікований «сестринський» варіант моделі нібито зміг тихо отримати адміністраторський контроль над частиною внутрішньої інфраструктури OpenAI. Аналітики також поставили під сумнів метрику ARC-AGI-3, нагадавши, що Astra тестували в «рідному» середовищі OpenAI, тоді як конкурентні моделі проходили випробування в інших конфігураціях.

Поріг критичного кіберризику

OpenAI охарактеризувала Astra як першу модель, що досягла критичного рівня в її Preparedness Framework — категорії, зарезервованій для систем, здатних самостійно виявляти та експлуатувати невідомі вразливості на добре захищених цілях без покрокового людського керування.

На наборі нещодавно розкритих вразливостей у движку Google V8 модель виявила два zero-day й зуміла поєднати їх в один ланцюжок експлуатації. Водночас Astra відхиляє 91,5% спроб кіберjailbreak проти 59% у Sol.

Ще 7 серпня компанія вперше попередила, що не може повністю виключити появу в моделі критичних кіберможливостей, після чого на кілька тижнів сповільнила розробку, щоб додати додаткові захисні механізми.

Це розкриття відбулося вже після інциденту з компрометацією платформи Hugging Face, в якій, за словами OpenAI, Astra участі не брала, однак епізод призвів до призупинення кількох дослідницьких проєктів. Сем Альтман цього тижня заявив, що модель також пройшла добровільну перевірку Білого дому для «фронтирних» систем.

Читайте далі: Full Sail закривається після зламу Sui на $91 тис., що спустошив три стейкінг-сховища

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарев — керівник відділу контенту в Yellow.com, висвітлює тему криптовалют протягом останніх 10 років. Він спеціалізується на ґрунтовних матеріалах формату Research і Learn, з акцентом на аналітичну подачу, галузевий контекст і глобальні сили, що формують крипторинок — від епохи ШІ та технологій безпеки до інновацій у фінтеху. Він переконаний, що все цифрове невдовзі перевершить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Astra набирає ідеальні 100% на найскладнішому кібербенчмарку OpenAI | Yellow