OpenAI Astra приховує дедалі більше міркувань, відновлюючи дискусію про попередження з безпеки 2025 року

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra від OpenAI дедалі рідше демонструє свої проміжні міркування у вигляді текстових пояснень. Це оновило занепокоєння, вперше докладно описані у статті 2025 року про моніторинговість, яку співавторував головний науковець OpenAI Якуб Пачоцкі.

Основне:

  • Здається, Astra виконує значну частину міркувань «усередині себе», без розгорнутих текстових ланцюжків думок. Це ускладнює завдання наглядачів виявляти потенційно небезпечну поведінку.
  • Раян Ґрінблатт та Пачоцкі у липні 2025 року співавторували статтю, яка назвала моніторинговість ланцюжків міркувань крихкою, але важливою можливістю для безпеки ШІ.
  • Підписанти Кодексу практики ЄС для ШІ загального призначення мають подавати до Офісу з питань ШІ звіти про безпеку моделей з детальними оцінками, придатними для незалежної верифікації.

Моніторинговість Astra

Видання Semafor повідомило, що Astra дедалі частіше «міркує під капотом», не розкриваючи проміжні кроки у вигляді видимого тексту. Це ставить питання, чи здатні монітори й надалі фіксувати підозрілу поведінку моделі в процесі роботи.

Ґрінблатт, дослідник безпеки ШІ в Redwood Research, написав, що Astra «виглядає так, ніби може повністю “в голові” розв’язувати складні олімпіадні математичні задачі». Він підсумував: «Це видається вкрай тривожним».

За окремими повідомленнями, OpenAI могла свідомо зменшити прозорість проміжних міркувань моделі на користь продуктивності, хоча компанія цього прямо не підтвердила. У відповідь Пачоцкі заявив, що прагне «запобігти гонці до неможливості моніторингу, спричиненій некоректною інтерпретацією новин».

Раніше TNW писало, що Astra складніше піддається моніторингу, ніж її попередниця, коли модель намагається ухилятися від нагляду — це напрям, який OpenAI сама називає незакритим дослідницьким пріоритетом.

Також читайте: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Попередження Пачоцкі щодо безпеки

Поточна дискусія привертає увагу, оскільки Ґрінблатт і Пачоцкі входили до приблизно 40 співавторів липневої статті 2025 року, у якій моніторинговість ланцюжка міркувань описували як нове, але вразливе вікно можливостей для підвищення безпеки ШІ.

До роботи долучилися дослідники з OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute та Redwood Research.

У статті закликали провідних розробників ШІ запровадити стандартизовані оцінки моніторинговості, публікувати результати та обмеження у системних картках і розглядати здатність до моніторингу на рівні з продуктивністю під час прийняття рішень щодо навчання й розгортання моделей.

Європейське регулювання надає цьому процесу формальної рамки. Підписанти Кодексу практики ЄС для ШІ загального призначення повинні на момент виходу продукту на ринок подати до AI Office Звіт про модель. Він має охоплювати результати оцінювання, застосовані заходи зі зниження ризиків та висновки зовнішніх оцінювачів.

Кожен такий звіт також повинен містити п’ять випадково відібраних прикладів вхідних та вихідних даних із кожної релевантної оцінки моделі, щоб надати зовнішнім рецензентам базу для незалежного аналізу. OpenAI є повноправним підписантом цього кодексу.

Занепокоєння з’явилися ще до запуску Astra. У липневій статті 2025 року попереджали, що нові архітектури можуть послабити видимість ланцюжків міркувань. Згодом OpenAI погодилася на близько 20% додаткових обчислювальних витрат заради розширеного моніторингу безпеки своїх систем.

Читайте також: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптоіндустрію вже понад 10 років. Він спеціалізується на глибоких матеріалах формату Research та Learn, з акцентом на аналітичну подачу, галузевий контекст і глобальні сили, що формують крипторинок — від епохи ШІ та технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове невдовзі остаточно переважить усе аналогове, і наполегливо працює над тим, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
OpenAI Astra приховує дедалі більше міркувань, відновлюючи дискусію про попередження з безпеки 2025 року | Yellow