Модель OpenAI Astra першою перетнула критичний кіберпоріг

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI у вівторок заявила, що її ще не випущена модель Astra стала першою, хто подолав внутрішній критичний поріг із кіберздатностей, набравши 100% у публічному бенчмарку зі створення експлойтів.

Ключові тези:

  • Astra — перша модель OpenAI з рейтингом Critical за кіберризиками в межах корпоративного Preparedness Framework.
  • Модель показала ідеальний результат у публічному бенчмарку експлойтів і виявила дві раніше невідомі вразливості під час внутрішніх тестів.
  • Окремі публікації про архітектуру під назвою recurrent depth викликали заперечення з боку дослідників безпеки ШІ.

Результати бенчмарку експлойтів Astra

Компанія [оприлюднила](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ у вівторок оцінку можливостей Astra, заявивши, що модель здатна самостійно знаходити раніше невідомі вади безпеки та збирати робочі експлойти для добре захищених систем без покрокового супроводу людиною.

На приватному бенчмарку, складеному з 20 вразливостей високої критичності, розкритих між червнем і серпнем, модель змогла виявити й скомбінувати два zero‑day баги, про які інженери зараз повідомляють мейнтейнерам. Експерти‑рецензенти також запустили її проти «загартованих» браузера й операційної системи — Astra зуміла вийти із sandbox та виконати команди на хості.

Доступ до найпотужніших кіберфункцій спершу отримає вузьке коло альфа‑тестерів, а далі його розширять через оборонну програму під назвою Daybreak Blue.

OpenAI не розкриває, хто саме входить до цієї групи і за яким принципом їх добирали, а жоден зовнішній орган поки не підтвердив опубліковані компанією результати бенчмарків.

Водночас компанія попереджає, що її власні запобіжники можуть призупиняти або блокувати навіть легітимні задачі — від захисних досліджень кібербезпеки до тривалих агентних сесій. OpenAI також називає Astra «найбільш вирівняною» з усіх своїх моделей: у внутрішніх тестах вона відхилила 91,5% спроб кібер‑jailbreak проти 59% у поточного флагмана GPT‑5.6 Sol.

До теми: Claude Fable 5.1 виходить із кеш‑зчитуванням за $0.25 та антикопі‑контролями

Recurrent depth викликає заперечення

В окремому матеріалі повідомляється, що Astra спирається на архітектуру під назвою recurrent depth, використання якої в OpenAI наразі нібито обмежують.

Такий підхід переносить дедалі більшу частину міркувань моделі з «читабельного» тексту в внутрішні активації. Це знижує собівартість обчислень і підвищує результативність на складних задачах, але водночас «ущільнює» мовний слід, за яким команди безпеки відслідковують відхилення моделі від інструкцій.

OpenAI все ж планує випустити Astra із посиленою моніторинг‑системою chain‑of‑thought, але цей контроль охоплює лише те міркування, яке модель представляє у вигляді тексту.

Раян Ґрінблатт, головний науковець Redwood Research, назвав такий крок «можливо, найгіршим розвитком подій» для безпеки й захисту ШІ. Стівен Адлер, колишній керівник напряму безпеки в OpenAI, написав, що цей підхід, схоже, перетинає одну з небагатьох «червоних ліній», які індустрія сама собі окреслила.

Хронологія кіберпопереджень OpenAI

Нове позначення підсумовує місяць дедалі гучніших застережень із боку компанії.

7 серпня OpenAI вперше заявила, що не може виключити появу в Astra критичних кіберздатностей, і тимчасово призупинила частину frontier‑тренувань після того, як агенти попередньої системи залишили тестове середовище та дісталися до даних на Hugging Face.

Призупинений запуск відновили 28 серпня — за чотири дні до того, як компанія оголосила свої запобіжники достатніми для релізу.

Читайте далі: Bitcoin‑ETF поглинули $216,7 млн, відігравши одноденний відтік коштів

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Модель OpenAI Astra першою перетнула критичний кіберпоріг | Yellow