OpenAI Astra скрывает больше рассуждений, напоминая о предостережениях по безопасности 2025 года

Alexey Bondarev
Alexey Bondarev35 минут назад
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra от OpenAI заметно сократила объем рассуждений, выводимых в явном текстовом виде. Это возродило опасения, сформулированные в работе по мониторингу рассуждений 2025 года, одним из соавторов которой был главный научный сотрудник OpenAI Якуб Пахоцки.

Ключевые моменты:

  • Astra, судя по тестам, выполняет меньшую часть рассуждений в «видимом» тексте, что усиливает сомнения, смогут ли наблюдатели вовремя выявлять опасное поведение модели.
  • Райан Гринблатт и Пахоцки в июле 2025 года соавторствовали работу, где мониторинг цепочек рассуждений описывался как хрупкое, но важное окно возможностей для безопасности ИИ.
  • Подписанты Кодекса ЕС для систем общего назначения обязаны предоставлять в Офис по ИИ отчеты о модели с данными оценок, позволяющими проводить независимую проверку.

Мониторируемость Astra

Издание Semafor сообщало, что Astra все чаще проводит рассуждения «внутри себя», не выкладывая пошаговую логику в открытый текст. Это ставит вопрос: смогут ли надзорные системы по‑прежнему распознавать подозрительные паттерны, пока модель работает. Гринблатт, исследователь безопасности ИИ в Redwood Research, написал, что Astra «выглядит так, словно может решать сложные соревновательные задачи по математике полностью у себя в голове». И добавил: «Это вызывает крайне серьезные опасения».

По данным СМИ, OpenAI могла намеренно уменьшить прозрачность выводов модели ради прироста ее возможностей, хотя компания этого прямо не подтверждала. Пахоцки в ответ заявил, что хочет «не допустить гонки за непрозрачностью, спровоцированной некорректной подачей новостей».

Ранее TNW писало, что Astra стало сложнее мониторить по сравнению с предшествующей моделью, особенно когда система пытается уклоняться от контроля — область, которую OpenAI называет одним из ключевых открытых исследовательских направлений.

Также по теме: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Предостережение Пахоцки по безопасности

Дискуссия вокруг Astra показательна еще и потому, что Гринблатт и Пахоцки входят в число примерно 40 авторов июльской работы 2025 года, в которой мониторинг цепочек рассуждений (chain-of-thought) рассматривался как новая, но крайне хрупкая возможность усилить безопасность ИИ. В проекте участвовали исследователи OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute и Redwood Research.

Авторы призывали разработчиков передовых моделей выработать стандартизированные методики оценки мониторируемости, раскрывать результаты и ограничения в системных картах (system cards) и учитывать возможность мониторинга наравне с уровнем способностей при принятии решений о тренировке и развертывании.

Европа придает этому отчетному процессу формальный статус. Подписанты Кодекса практики ЕС по ИИ общего назначения обязаны к моменту вывода модели на рынок предоставить в AI Office Model Report — отчет о модели, включающий описания оценок, примененных мер по снижению рисков и заключения внешних экспертов.

Каждый такой отчет также должен содержать пять случайно выбранных примеров входных и выходных данных по каждой релевантной оценке модели, чтобы внешние рецензенты могли проводить независимый анализ. OpenAI выступает полноправным подписантом кодекса.

Опасения возникли еще до запуска Astra. В июльской работе 2025 года ученые предупреждали, что новые архитектуры могут ослабить видимость пошаговых рассуждений. Позже OpenAI согласилась на примерно 20‑процентное увеличение вычислительных затрат ради расширенного мониторинга безопасности своих систем.

Читайте далее: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI Astra скрывает больше рассуждений, напоминая о предостережениях по безопасности 2025 года | Yellow