Astra от OpenAI заметно сократила объем рассуждений, выводимых в явном текстовом виде. Это возродило опасения, сформулированные в работе по мониторингу рассуждений 2025 года, одним из соавторов которой был главный научный сотрудник OpenAI Якуб Пахоцки.
Ключевые моменты:
- Astra, судя по тестам, выполняет меньшую часть рассуждений в «видимом» тексте, что усиливает сомнения, смогут ли наблюдатели вовремя выявлять опасное поведение модели.
- Райан Гринблатт и Пахоцки в июле 2025 года соавторствовали работу, где мониторинг цепочек рассуждений описывался как хрупкое, но важное окно возможностей для безопасности ИИ.
- Подписанты Кодекса ЕС для систем общего назначения обязаны предоставлять в Офис по ИИ отчеты о модели с данными оценок, позволяющими проводить независимую проверку.
Мониторируемость Astra
Издание Semafor сообщало, что Astra все чаще проводит рассуждения «внутри себя», не выкладывая пошаговую логику в открытый текст. Это ставит вопрос: смогут ли надзорные системы по‑прежнему распознавать подозрительные паттерны, пока модель работает. Гринблатт, исследователь безопасности ИИ в Redwood Research, написал, что Astra «выглядит так, словно может решать сложные соревновательные задачи по математике полностью у себя в голове». И добавил: «Это вызывает крайне серьезные опасения».
По данным СМИ, OpenAI могла намеренно уменьшить прозрачность выводов модели ради прироста ее возможностей, хотя компания этого прямо не подтверждала. Пахоцки в ответ заявил, что хочет «не допустить гонки за непрозрачностью, спровоцированной некорректной подачей новостей».
Ранее TNW писало, что Astra стало сложнее мониторить по сравнению с предшествующей моделью, особенно когда система пытается уклоняться от контроля — область, которую OpenAI называет одним из ключевых открытых исследовательских направлений.
Также по теме: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Предостережение Пахоцки по безопасности
Дискуссия вокруг Astra показательна еще и потому, что Гринблатт и Пахоцки входят в число примерно 40 авторов июльской работы 2025 года, в которой мониторинг цепочек рассуждений (chain-of-thought) рассматривался как новая, но крайне хрупкая возможность усилить безопасность ИИ. В проекте участвовали исследователи OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute и Redwood Research.
Авторы призывали разработчиков передовых моделей выработать стандартизированные методики оценки мониторируемости, раскрывать результаты и ограничения в системных картах (system cards) и учитывать возможность мониторинга наравне с уровнем способностей при принятии решений о тренировке и развертывании.
Европа придает этому отчетному процессу формальный статус. Подписанты Кодекса практики ЕС по ИИ общего назначения обязаны к моменту вывода модели на рынок предоставить в AI Office Model Report — отчет о модели, включающий описания оценок, примененных мер по снижению рисков и заключения внешних экспертов.
Каждый такой отчет также должен содержать пять случайно выбранных примеров входных и выходных данных по каждой релевантной оценке модели, чтобы внешние рецензенты могли проводить независимый анализ. OpenAI выступает полноправным подписантом кодекса.
Опасения возникли еще до запуска Astra. В июльской работе 2025 года ученые предупреждали, что новые архитектуры могут ослабить видимость пошаговых рассуждений. Позже OpenAI согласилась на примерно 20‑процентное увеличение вычислительных затрат ради расширенного мониторинга безопасности своих систем.
Читайте далее: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





