OpenAI Astra скрывает цепочки рассуждений, возвращая повестку предупреждений по безопасности 2025 года

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra от OpenAI, по всей видимости, стала заметно реже показывать свои промежуточные рассуждения, что возобновило дискуссию вокруг рисков, описанных в статье 2025 года по мониторингу цепочек рассуждений, среди соавторов которой — главный ученый компании Якуб Пахоцки.

Ключевые моменты:

  • Astra, судя по тестам, реже «думает вслух» в открытом тексте, что усиливает опасения, смогут ли системы мониторинга вовремя заметить опасное поведение модели.
  • Райан Гринблатт и Пахоцки в июле 2025 года опубликовали совместную работу, где назвали наблюдаемость цепочек рассуждений хрупким, но важным окном возможностей для безопасности ИИ.
  • Подписанты европейского Кодекса практики для ИИ общего назначения обязаны предоставлять в Офис ИИ отчеты о безопасности моделей, включая результаты оценок, которые позволяют проводить независимую экспертизу.

Мониторируемость Astra

Издание Semafor сообщило, что Astra выполняет больше вычислительной «работы» без явного отображения рассуждений в тексте. Это вызвало вопросы, смогут ли наблюдатели по-прежнему выявлять подозрительное поведение в процессе работы модели. Гринблатт, исследователь безопасности ИИ в Redwood Research, написал, что Astra «выглядит так, словно способна решать сложные соревновательные задачи по математике полностью у себя в голове». По его словам, «это выглядит крайне тревожно».

В ряде публикаций также высказывалось предположение, что OpenAI могла сознательно сократить прозрачность выводов модели ради усиления ее возможностей, хотя компания этого не подтверждала. В ответ Пахоцки заявил, что хочет «не допустить гонки к полной ненаблюдаемости, спровоцированной неточными интерпретациями».

TNW ранее сообщало, что Astra стало сложнее мониторить по сравнению с предыдущей моделью, когда та предпринимала попытки обойти надзор — направление, которое в OpenAI называют приоритетной, но еще далекой от решения исследовательской задачей.

Также по теме: OpenAI утверждает, что ИИ теперь справляется с исследовательскими задачами, длящимися несколько дней

Предупреждение Пахоцки о безопасности

Спор вокруг Astra особенно примечателен, поскольку Гринблатт и Пахоцки числятся среди примерно 40 авторов июльской статьи 2025 года, где наблюдаемость цепочек рассуждений описывалась как новая, но легко утрачиваемая возможность для повышения безопасности ИИ. В работе участвовали исследователи из OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Института безопасности ИИ Великобритании и Redwood Research.

Авторы рекомендовали разработчикам передовых моделей создать стандартизированные процедуры оценки мониторируемости, публиковать как результаты, так и ограничения в системных карточках, а также учитывать мониторируемость наряду с уровнем возможностей при принятии решений о тренировке и развертывании систем.

В Европе этому процессу придан формальный статус. Подписанты Общего кодекса практики ЕС по ИИ общего назначения обязаны к моменту вывода продукта на рынок направить в Офис ИИ отчет о модели (Model Report), включающий результаты оценок, принятые меры по снижению рисков и отчеты внешних аудиторов.

В каждом отчете также должны содержаться по пять случайно выбранных примеров входных и выходных данных для каждой значимой оценки модели — это дает внешним экспертам базу для самостоятельного анализа. OpenAI входит в число полноправных подписантов кодекса.

Опасения появились задолго до запуска Astra. В июльской статье 2025 года предупреждалось, что новые архитектуры могут ослабить видимую цепочку рассуждений, усложняя мониторинг. Позже OpenAI согласилась принять порядка 20% дополнительной вычислительной нагрузки ради расширенных механизмов контроля и безопасности своих систем.

Читайте далее: Bitcoin‑ETF привлекли $987 млн, продлив трехнедельную серию притоков капитала

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий криптоиндустрию последние 10 лет. Он специализируется на глубоких материалах формата Research и Learn, уделяя особое внимание аналитическим репортажам, отраслевому контексту и крупным факторам, формирующим крипторынок — от эры ИИ и технологий безопасности до финтех‑инноваций. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и активно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи