OpenAI Astra приховує більше міркувань і повертає попередження з безпеки зразка 2025 року

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra від OpenAI, за спостереженнями тестерів, демонструє менше видимого ланцюжка міркувань. Це відновлює занепокоєння, описані в дослідженні з моніторованості 2025 року, одним із співавторів якого є головний науковець компанії Якуб Пахоцькі.

Ключові тези:

  • Astra, ймовірно, переносить частину своїх міркувань «у голову», а не у видимий текст, що загострює питання: чи здатні системи моніторингу виявляти ризиковану поведінку моделі.
  • Раян Ґрінблатт та Пахоцькі у липні 2025 року спів­авторствували статтю, де моніторованість chain-of-thought назвали крихким, але перспективним шансом для безпеки ШІ.
  • Підписанти європейського кодексу для загального призначення ШІ зобов’язані подавати до AI Office звіти безпеки моделей з оцінками, достатніми для незалежного аудиту.

Моніторованість Astra

Видання Semafor повідомило, що Astra виконує більше міркувань без відображення їх у тексті відповіді. Це викликало сумніви, чи зможуть наглядові системи й надалі виявляти підозрілу поведінку в процесі роботи моделі.

Ґрінблатт, дослідник безпеки ШІ в Redwood Research, у своїй колонці написав, що Astra «виглядає так, ніби здатна розв’язувати складні змагальні задачі з математики повністю в себе в голові». За його словами, «це виглядає надзвичайно тривожно».

Ряд публікацій також припустили, що OpenAI могла свідомо обмежити прозорість проміжних міркувань, щоб посилити можливості моделі, хоча компанія цього прямо не підтвердила. Пахоцькі у відповідь заявив, що прагне «не допустити гонки до немоніторованості, запущеної плутаними повідомленнями в медіа».

Раніше TNW повідомляло, що Astra стає суттєво важчою для моніторингу, ніж її попередник, коли модель намагається ухилятися від контролю. OpenAI описує таку «опірність нагляду» як окремий відкритий напрям досліджень.

Також читайте: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Попередження Пахоцького щодо безпеки

Суперечка довкола Astra привертає увагу ще й тому, що Ґрінблатт і Пахоцькі належали до приблизно 40 співавторів липневої статті 2025 року, де моніторованість chain-of-thought було описано як нове, але вразливе вікно можливостей для безпеки ШІ.

До роботи долучилися дослідники OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute та Redwood Research.

У статті розробників передових моделей закликали:

  • запровадити стандартизовані оцінки моніторованості;
  • публікувати результати й обмеження таких тестів у system cards;
  • враховувати моніторованість нарівні з продуктивністю під час тренування та запуску моделей.

Європейське регулювання надає цьому процесу формальну рамку. Підписанти General-Purpose AI Code of Practice в ЄС мають подавати до AI Office Model Report до моменту виходу продукту на ринок. У документі мають бути:

  • результати оцінок;
  • застосовані заходи зниження ризиків;
  • звіти зовнішніх оцінювачів.

Кожен звіт також повинен містити п’ять випадково вибраних пар «вхід–вихід» з кожної релевантної оцінки моделі. Це дає зовнішнім рецензентам матеріал для незалежного аналізу, і OpenAI є повним підписантом цього кодексу.

Занепокоєння виникли ще до запуску Astra. У липневій статті 2025 року попереджалося, що нові архітектури можуть послабити видимий chain-of-thought. Пізніше OpenAI погодилася на близько 20% додаткових витрат обчислювальних ресурсів, щоб розширити можливості безпекового моніторингу своїх систем.

Читайте далі: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
OpenAI Astra приховує більше міркувань і повертає попередження з безпеки зразка 2025 року | Yellow