Astra від OpenAI, за спостереженнями тестерів, демонструє менше видимого ланцюжка міркувань. Це відновлює занепокоєння, описані в дослідженні з моніторованості 2025 року, одним із співавторів якого є головний науковець компанії Якуб Пахоцькі.
Ключові тези:
- Astra, ймовірно, переносить частину своїх міркувань «у голову», а не у видимий текст, що загострює питання: чи здатні системи моніторингу виявляти ризиковану поведінку моделі.
- Раян Ґрінблатт та Пахоцькі у липні 2025 року співавторствували статтю, де моніторованість chain-of-thought назвали крихким, але перспективним шансом для безпеки ШІ.
- Підписанти європейського кодексу для загального призначення ШІ зобов’язані подавати до AI Office звіти безпеки моделей з оцінками, достатніми для незалежного аудиту.
Моніторованість Astra
Видання Semafor повідомило, що Astra виконує більше міркувань без відображення їх у тексті відповіді. Це викликало сумніви, чи зможуть наглядові системи й надалі виявляти підозрілу поведінку в процесі роботи моделі.
Ґрінблатт, дослідник безпеки ШІ в Redwood Research, у своїй колонці написав, що Astra «виглядає так, ніби здатна розв’язувати складні змагальні задачі з математики повністю в себе в голові». За його словами, «це виглядає надзвичайно тривожно».
Ряд публікацій також припустили, що OpenAI могла свідомо обмежити прозорість проміжних міркувань, щоб посилити можливості моделі, хоча компанія цього прямо не підтвердила. Пахоцькі у відповідь заявив, що прагне «не допустити гонки до немоніторованості, запущеної плутаними повідомленнями в медіа».
Раніше TNW повідомляло, що Astra стає суттєво важчою для моніторингу, ніж її попередник, коли модель намагається ухилятися від контролю. OpenAI описує таку «опірність нагляду» як окремий відкритий напрям досліджень.
Також читайте: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Попередження Пахоцького щодо безпеки
Суперечка довкола Astra привертає увагу ще й тому, що Ґрінблатт і Пахоцькі належали до приблизно 40 співавторів липневої статті 2025 року, де моніторованість chain-of-thought було описано як нове, але вразливе вікно можливостей для безпеки ШІ.
До роботи долучилися дослідники OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute та Redwood Research.
У статті розробників передових моделей закликали:
- запровадити стандартизовані оцінки моніторованості;
- публікувати результати й обмеження таких тестів у system cards;
- враховувати моніторованість нарівні з продуктивністю під час тренування та запуску моделей.
Європейське регулювання надає цьому процесу формальну рамку. Підписанти General-Purpose AI Code of Practice в ЄС мають подавати до AI Office Model Report до моменту виходу продукту на ринок. У документі мають бути:
- результати оцінок;
- застосовані заходи зниження ризиків;
- звіти зовнішніх оцінювачів.
Кожен звіт також повинен містити п’ять випадково вибраних пар «вхід–вихід» з кожної релевантної оцінки моделі. Це дає зовнішнім рецензентам матеріал для незалежного аналізу, і OpenAI є повним підписантом цього кодексу.
Занепокоєння виникли ще до запуску Astra. У липневій статті 2025 року попереджалося, що нові архітектури можуть послабити видимий chain-of-thought. Пізніше OpenAI погодилася на близько 20% додаткових витрат обчислювальних ресурсів, щоб розширити можливості безпекового моніторингу своїх систем.
Читайте далі: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





