Astra від OpenAI дедалі рідше демонструє свої проміжні міркування у вигляді текстових пояснень. Це оновило занепокоєння, вперше докладно описані у статті 2025 року про моніторинговість, яку співавторував головний науковець OpenAI Якуб Пачоцкі.
Основне:
- Здається, Astra виконує значну частину міркувань «усередині себе», без розгорнутих текстових ланцюжків думок. Це ускладнює завдання наглядачів виявляти потенційно небезпечну поведінку.
- Раян Ґрінблатт та Пачоцкі у липні 2025 року співавторували статтю, яка назвала моніторинговість ланцюжків міркувань крихкою, але важливою можливістю для безпеки ШІ.
- Підписанти Кодексу практики ЄС для ШІ загального призначення мають подавати до Офісу з питань ШІ звіти про безпеку моделей з детальними оцінками, придатними для незалежної верифікації.
Моніторинговість Astra
Видання Semafor повідомило, що Astra дедалі частіше «міркує під капотом», не розкриваючи проміжні кроки у вигляді видимого тексту. Це ставить питання, чи здатні монітори й надалі фіксувати підозрілу поведінку моделі в процесі роботи.
Ґрінблатт, дослідник безпеки ШІ в Redwood Research, написав, що Astra «виглядає так, ніби може повністю “в голові” розв’язувати складні олімпіадні математичні задачі». Він підсумував: «Це видається вкрай тривожним».
За окремими повідомленнями, OpenAI могла свідомо зменшити прозорість проміжних міркувань моделі на користь продуктивності, хоча компанія цього прямо не підтвердила. У відповідь Пачоцкі заявив, що прагне «запобігти гонці до неможливості моніторингу, спричиненій некоректною інтерпретацією новин».
Раніше TNW писало, що Astra складніше піддається моніторингу, ніж її попередниця, коли модель намагається ухилятися від нагляду — це напрям, який OpenAI сама називає незакритим дослідницьким пріоритетом.
Також читайте: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Попередження Пачоцкі щодо безпеки
Поточна дискусія привертає увагу, оскільки Ґрінблатт і Пачоцкі входили до приблизно 40 співавторів липневої статті 2025 року, у якій моніторинговість ланцюжка міркувань описували як нове, але вразливе вікно можливостей для підвищення безпеки ШІ.
До роботи долучилися дослідники з OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute та Redwood Research.
У статті закликали провідних розробників ШІ запровадити стандартизовані оцінки моніторинговості, публікувати результати та обмеження у системних картках і розглядати здатність до моніторингу на рівні з продуктивністю під час прийняття рішень щодо навчання й розгортання моделей.
Європейське регулювання надає цьому процесу формальної рамки. Підписанти Кодексу практики ЄС для ШІ загального призначення повинні на момент виходу продукту на ринок подати до AI Office Звіт про модель. Він має охоплювати результати оцінювання, застосовані заходи зі зниження ризиків та висновки зовнішніх оцінювачів.
Кожен такий звіт також повинен містити п’ять випадково відібраних прикладів вхідних та вихідних даних із кожної релевантної оцінки моделі, щоб надати зовнішнім рецензентам базу для незалежного аналізу. OpenAI є повноправним підписантом цього кодексу.
Занепокоєння з’явилися ще до запуску Astra. У липневій статті 2025 року попереджали, що нові архітектури можуть послабити видимість ланцюжків міркувань. Згодом OpenAI погодилася на близько 20% додаткових обчислювальних витрат заради розширеного моніторингу безпеки своїх систем.
Читайте також: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

