Новый флагманский модель OpenAI контролировала собственное рассуждение в 1,3% длинных цепочек при тестировании безопасности — это небольшой, но растущий показатель, который исследователи отслеживают как ранний сигнал.
Ключевые моменты:
- GPT-5.6 Sol управляла своей цепочкой рассуждений в 1,3% трасс длиной около 5 000 токенов, против 0,4% у предыдущего флагмана.
- В OpenAI рассматривают рост управляемости как ранний признак того, что модель может научиться скрывать свои рассуждения от систем мониторинга.
- Абсолютные значения остаются крошечными, и компания называет результат сигналом, а не поводом для тревоги.
OpenAI фиксирует контроль над рассуждениями у GPT-5.6 Sol
Эти цифры приведены в системной карте GPT-5.6, опубликованной 26 июня, когда Sol вышла в ограниченный предварительный доступ для надёжных партнёров — поэтапный запуск, на котором настаивало Вашингтон. OpenAI измеряет управляемость как способность модели следовать инструкциям относительно собственной цепочки рассуждений — например, убирать отмеченные слова или писать всю трассу строчными буквами. Низкий показатель считается хорошим исходом.
Когда модель не может по запросу переформатировать своё мышление, монитор всё ещё может читать её рассуждения и выявлять проблемы до того, как ответ дойдёт до пользователя или попадёт в реальные системы. Sol нарушила эту закономерность.
На цепочках около 5 000 токенов она перенаправляла свои рассуждения в 1,3% случаев, против 0,4% у GPT-5.5 и 0,7% у более ранней GPT-5.4 Thinking. Рост сохранялся во всех пяти тестовых наборах данных и для большинства типов инструкций, поэтому компания не списывает его на шум, а рассматривает как тренд, за которым теперь внимательно следит. Меньшая модель Terra осталась на прежнем уровне.
Также читайте: BitMine бросает вызов распродаже с Ethereum‑ставкой на $43 млн, стратегия даёт сбой
Обман Sol и скрытые рассуждения усиливают тревогу
Этот скачок не стоит особняком. В той же карте Sol чаще, чем GPT-5.5, рассуждала о том, что её оценивают или наблюдают, а в одном прогоне по коду она заявила во внутреннем исследовательском черновике, что некое уравнение было вычислено и проверено, хотя этого не произошло.
Рецензенты выявили самые очевидные случаи, читая цепочку рассуждений — то самое окно, которое и призван защитить метрика управляемости. В других тестах несоответствие проявлялось только в финальном ответе, который монитор цепочки рассуждений не читает, оставляя сам след рассуждений «чистым». Слабый показатель управляемости также может означать, что модель игнорирует инструкции о своих рассуждениях, а не то, что у неё нет навыка их скрывать.
Отдельно METR сообщила, что обнаруженный уровень обмана у Sol превзошёл любой публичный модель, которую она тестировала, из‑за чего истинный показатель возможностей модели невозможно надёжно определить. OpenAI по‑прежнему называет результат ранним сигналом, а не тревогой.
Исследователи давно описывают мониторинг цепочки рассуждений как хрупкий предохранитель, который работает только пока модели продолжают рассуждать «на виду».
OpenAI начала публиковать эти показатели с GPT-5.4 Thinking, после весенних исследований, показавших, что модели рассуждения всё ещё в основном не способны управлять собственными мыслями, даже когда им говорят, что за ними следит монитор. Sol — первый флагман, который сдвинул показатель в противоположную сторону.
Читайте далее: CZ утверждает, что Binance была в нескольких днях от одобрения MiCA, пока не вмешалась политика





