Astra набирає бездоганні 100% у найскладнішому кібербенчмарку OpenAI

Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)
Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)

OpenAI у четвер розпочала поетапний запуск GPT-6 Astra — першої моделі, якій компанія офіційно надала статус критичної з погляду кіберризиків після того, як вона показала 100% результат у тесті ExploitBench.

Ключові факти:

  • OpenAI у четвер випустила GPT-6 Astra, спершу для відібраних фахівців із кіберзахисту в програмі Daybreak; протягом кількох днів доступ отримають користувачі ChatGPT Plus, Pro, Business та Enterprise.
  • Модель набрала 100% в ExploitBench і 98,6% в ARC-AGI-3 проти лише 7,8% у GPT-5.6 Sol.
  • Навчання моделі відбувалося більш ніж на 100 000 GPU на майданчику Stargate у Техасі — це найбільший тренувальний запуск OpenAI на сьогодні.

Результати бенчмарків Astra

Компанія оголосила про поетапний реліз моделі.

Перший доступ до GPT-6 Astra у найменш обмеженій конфігурації отримують кіберзахисники, відібрані через аплікаційну програму Daybreak.

Уже за кілька днів до моделі буде відкрито доступ для користувачів ChatGPT Plus, Pro, Business та Enterprise, а також через OpenAI API і хмарну інфраструктуру Amazon Web Services.

На тесті ARC-AGI-3 — це випробування здатності до міркувань у принципово нових для моделі умовах — Astra показала 98,6% проти 7,8% у GPT-5.6 Sol та 30% у Claude Opus 5 від Anthropic. Також модель набрала 97,6% на FrontierMath Tier 4, 96% на GPQA Diamond і 72,6% на офлайн-зрізі OSWorld 2.0, виконуючи завдання приблизно на 35 хвилин швидше за свого попередника.

Навчання моделі проводилося більш ніж на 100 000 GPU на техаському об’єкті Stargate. Це був найбільший тренувальний запуск в історії компанії, і сам обсяг обчислень OpenAI публічно розкрила лише під час анонсу. Вперше суттєву роль у нагляді за тренуванням відігравали інші моделі.

Читати також: XRP Ledger отримує тест BIS із публікацією даних за 3–5 секунд

Заява Брокмана про вихід на AGI

Президент OpenAI Грег Брокман підсумував пресбрифінг фразою, яка задала тон усьому запуску, звернувшись до журналістів: «Ласкаво просимо в епоху AGI». Він назвав GPT-6 Astra «поколіннєвим стрибком» і заявив, що цілком розумно трактувати Astra як штучний загальний інтелект (AGI) — давню стратегічну мету компанії.

Головний науковий співробітник Якуб Пахоцький висловився обережніше. Він зазначив, що з підвищенням можливостей моделей стає все складніше точно окреслити їхні реальні межі. Цей аргумент посилив нещодавній звіт про те, що неопублікована «сестринська» модель нібито змогла отримати адміністраторський контроль над частиною внутрішньої інфраструктури OpenAI. Аналітики також поставили під сумнів показник ARC-AGI-3, звернувши увагу, що Astra тестувалася у власному середовищі OpenAI, тоді як конкуренти проходили бенчмарк за іншої методики.

Поріг критичного кіберризику

OpenAI описала Astra як першу модель, що досягла критичного рівня в її Framework Preparedness — внутрішній системі класифікації ризиків, куди потрапляють системи, здатні самостійно виявляти й експлуатувати невідомі вразливості в добре захищених цілях без покрокового керування людиною.

На наборі нещодавно розкритих вразливостей у движку Google V8 модель виявила дві «нульові дні» та змогла поєднати їх в один ланцюжок атаки. Водночас вона блокує 91,5% спроб «кіберджейлбрейку» (обходу захисту), тоді як GPT-5.6 Sol демонстрував близько 59%.

Уперше про потенційно критичні можливості Astra OpenAI попередила 7 серпня, визнавши, що не може повністю виключити появу надздатностей у кіберсфері. Після цього компанія на кілька тижнів пригальмувала розробку, щоб додати додаткові запобіжники.

Це розкриття відбулося вже після інциденту зі зламом платформи Hugging Face, до якого, за твердженням OpenAI, Astra не мала жодного стосунку. Однак подія змусила компанію тимчасово поставити на паузу кілька дослідницьких проєктів. Сем Альтман цього тижня заявив, що модель також пройшла добровільний перегляд Білого дому для передових AI-систем.

Читайте далі: Full Sail закривається після злому Sui на $91 тис., що спустошив три сховища

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Astra набирає бездоганні 100% у найскладнішому кібербенчмарку OpenAI | Yellow