Astra от OpenAI, по всей видимости, стала заметно реже показывать свои промежуточные рассуждения, что возобновило дискуссию вокруг рисков, описанных в статье 2025 года по мониторингу цепочек рассуждений, среди соавторов которой — главный ученый компании Якуб Пахоцки.
Ключевые моменты:
- Astra, судя по тестам, реже «думает вслух» в открытом тексте, что усиливает опасения, смогут ли системы мониторинга вовремя заметить опасное поведение модели.
- Райан Гринблатт и Пахоцки в июле 2025 года опубликовали совместную работу, где назвали наблюдаемость цепочек рассуждений хрупким, но важным окном возможностей для безопасности ИИ.
- Подписанты европейского Кодекса практики для ИИ общего назначения обязаны предоставлять в Офис ИИ отчеты о безопасности моделей, включая результаты оценок, которые позволяют проводить независимую экспертизу.
Мониторируемость Astra
Издание Semafor сообщило, что Astra выполняет больше вычислительной «работы» без явного отображения рассуждений в тексте. Это вызвало вопросы, смогут ли наблюдатели по-прежнему выявлять подозрительное поведение в процессе работы модели. Гринблатт, исследователь безопасности ИИ в Redwood Research, написал, что Astra «выглядит так, словно способна решать сложные соревновательные задачи по математике полностью у себя в голове». По его словам, «это выглядит крайне тревожно».
В ряде публикаций также высказывалось предположение, что OpenAI могла сознательно сократить прозрачность выводов модели ради усиления ее возможностей, хотя компания этого не подтверждала. В ответ Пахоцки заявил, что хочет «не допустить гонки к полной ненаблюдаемости, спровоцированной неточными интерпретациями».
TNW ранее сообщало, что Astra стало сложнее мониторить по сравнению с предыдущей моделью, когда та предпринимала попытки обойти надзор — направление, которое в OpenAI называют приоритетной, но еще далекой от решения исследовательской задачей.
Также по теме: OpenAI утверждает, что ИИ теперь справляется с исследовательскими задачами, длящимися несколько дней
Предупреждение Пахоцки о безопасности
Спор вокруг Astra особенно примечателен, поскольку Гринблатт и Пахоцки числятся среди примерно 40 авторов июльской статьи 2025 года, где наблюдаемость цепочек рассуждений описывалась как новая, но легко утрачиваемая возможность для повышения безопасности ИИ. В работе участвовали исследователи из OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Института безопасности ИИ Великобритании и Redwood Research.
Авторы рекомендовали разработчикам передовых моделей создать стандартизированные процедуры оценки мониторируемости, публиковать как результаты, так и ограничения в системных карточках, а также учитывать мониторируемость наряду с уровнем возможностей при принятии решений о тренировке и развертывании систем.
В Европе этому процессу придан формальный статус. Подписанты Общего кодекса практики ЕС по ИИ общего назначения обязаны к моменту вывода продукта на рынок направить в Офис ИИ отчет о модели (Model Report), включающий результаты оценок, принятые меры по снижению рисков и отчеты внешних аудиторов.
В каждом отчете также должны содержаться по пять случайно выбранных примеров входных и выходных данных для каждой значимой оценки модели — это дает внешним экспертам базу для самостоятельного анализа. OpenAI входит в число полноправных подписантов кодекса.
Опасения появились задолго до запуска Astra. В июльской статье 2025 года предупреждалось, что новые архитектуры могут ослабить видимую цепочку рассуждений, усложняя мониторинг. Позже OpenAI согласилась принять порядка 20% дополнительной вычислительной нагрузки ради расширенных механизмов контроля и безопасности своих систем.
Читайте далее: Bitcoin‑ETF привлекли $987 млн, продлив трехнедельную серию притоков капитала

