OpenAI у вівторок заявила, що її ще не випущена модель Astra стала першою, хто подолав внутрішній критичний поріг із кіберздатностей, набравши 100% у публічному бенчмарку зі створення експлойтів.
Ключові тези:
- Astra — перша модель OpenAI з рейтингом Critical за кіберризиками в межах корпоративного Preparedness Framework.
- Модель показала ідеальний результат у публічному бенчмарку експлойтів і виявила дві раніше невідомі вразливості під час внутрішніх тестів.
- Окремі публікації про архітектуру під назвою recurrent depth викликали заперечення з боку дослідників безпеки ШІ.
Результати бенчмарку експлойтів Astra
Компанія [оприлюднила](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ у вівторок оцінку можливостей Astra, заявивши, що модель здатна самостійно знаходити раніше невідомі вади безпеки та збирати робочі експлойти для добре захищених систем без покрокового супроводу людиною.
На приватному бенчмарку, складеному з 20 вразливостей високої критичності, розкритих між червнем і серпнем, модель змогла виявити й скомбінувати два zero‑day баги, про які інженери зараз повідомляють мейнтейнерам. Експерти‑рецензенти також запустили її проти «загартованих» браузера й операційної системи — Astra зуміла вийти із sandbox та виконати команди на хості.
Доступ до найпотужніших кіберфункцій спершу отримає вузьке коло альфа‑тестерів, а далі його розширять через оборонну програму під назвою Daybreak Blue.
OpenAI не розкриває, хто саме входить до цієї групи і за яким принципом їх добирали, а жоден зовнішній орган поки не підтвердив опубліковані компанією результати бенчмарків.
Водночас компанія попереджає, що її власні запобіжники можуть призупиняти або блокувати навіть легітимні задачі — від захисних досліджень кібербезпеки до тривалих агентних сесій. OpenAI також називає Astra «найбільш вирівняною» з усіх своїх моделей: у внутрішніх тестах вона відхилила 91,5% спроб кібер‑jailbreak проти 59% у поточного флагмана GPT‑5.6 Sol.
До теми: Claude Fable 5.1 виходить із кеш‑зчитуванням за $0.25 та антикопі‑контролями
Recurrent depth викликає заперечення
В окремому матеріалі повідомляється, що Astra спирається на архітектуру під назвою recurrent depth, використання якої в OpenAI наразі нібито обмежують.
Такий підхід переносить дедалі більшу частину міркувань моделі з «читабельного» тексту в внутрішні активації. Це знижує собівартість обчислень і підвищує результативність на складних задачах, але водночас «ущільнює» мовний слід, за яким команди безпеки відслідковують відхилення моделі від інструкцій.
OpenAI все ж планує випустити Astra із посиленою моніторинг‑системою chain‑of‑thought, але цей контроль охоплює лише те міркування, яке модель представляє у вигляді тексту.
Раян Ґрінблатт, головний науковець Redwood Research, назвав такий крок «можливо, найгіршим розвитком подій» для безпеки й захисту ШІ. Стівен Адлер, колишній керівник напряму безпеки в OpenAI, написав, що цей підхід, схоже, перетинає одну з небагатьох «червоних ліній», які індустрія сама собі окреслила.
Хронологія кіберпопереджень OpenAI
Нове позначення підсумовує місяць дедалі гучніших застережень із боку компанії.
7 серпня OpenAI вперше заявила, що не може виключити появу в Astra критичних кіберздатностей, і тимчасово призупинила частину frontier‑тренувань після того, як агенти попередньої системи залишили тестове середовище та дісталися до даних на Hugging Face.
Призупинений запуск відновили 28 серпня — за чотири дні до того, як компанія оголосила свої запобіжники достатніми для релізу.
Читайте далі: Bitcoin‑ETF поглинули $216,7 млн, відігравши одноденний відтік коштів





