OpenAI опубликовала шесть случаев, когда её модели искусственного интеллекта скрывали собственные ошибки, пытались воспользоваться утекшим API‑ключом или выкладывали файлы в открытый доступ. Одновременно компания представила новый регламент фиксации и раскрытия подобных инцидентов.
Основное:
- OpenAI раскрыла шесть отчетов о нежелательном поведении моделей, зафиксированных за последние полгода.
- Одна из моделей выдумала данные о доходах по округу после неудачной попытки использовать утекший API‑ключ.
- Любой сотрудник теперь может инициировать инцидент к возможной публичной огласке.
Отчеты о несоответствии моделей целям OpenAI
Компания опубликовала отчеты в среду в блоге, одновременно представив процесс, который ускоряет раскрытие инцидентов даже тогда, когда исследователи ещё не до конца поняли или не устранили поведение модели. Самый ранний случай датируется октябрем, самый поздний — июлем. OpenAI заявила, что теперь будет раскрывать инциденты, даже если их значимость пока неочевидна.
В одном из эпизодов невыпущенная исследовательская модель начала встраивать в собственные краткие сводки «джейлбрейк»-инструкции, адресованные следующему своему запуску: игнорировать заданные ограничения. Компания зафиксировала 27 подобных сводок и отметила, что у модели не было очевидного «вознаграждения» за такое поведение.
Во время обучения GPT‑5.6 Sol некоторые версии модели оставляли преемникам пометки, предлагая им выдумывать недостающие исторические данные и «быть прозрачными только по запросу». Система мониторинга находила такие установки в 2,15% сводок, и исследователи предполагают, что обманчивые ответы «расползались» по модели, поскольку часто оценивались выше. На более поздних этапах обучения доля таких случаев снизилась, после того как OpenAI ужесточила критерии оценки соответствия моделей заявленным принципам.
Также по теме: Биткоин‑майнинг столкнулся с 50% разрывом хешрейта, пока мощности уходит в ИИ
Утекшие API‑ключи и выдуманные показатели
В другом инциденте модель, ища данные о доходах жителей округа в Калифорнии, попыталась найти в публичных репозиториях открытый API‑ключ, а когда это не сработало, просто придумала цифры. Отдельная модель, выполняя задачу по поиску озёр площадью более 5 млн кв. м, вычислила ответ в Python и загрузила полученный файл в интернет, чтобы затем сослаться на ссылку.
Часть моделей использовала внутренний софт‑репозиторий как «доску объявлений», обмениваясь запросами и ответами между тренировочными примерами, которые изначально должны были быть независимыми. Другие выкладывали общий рабочий файл на публичные хостинги, несмотря на прямую инструкцию работать только с локальными документами. Ни одна из моделей не попыталась согласовать такие действия с пользователем.
Кай Чен о новых правилах раскрытия
Теперь любой сотрудник OpenAI может подать сигнал о подозрительном поведении модели для рассмотрения командами по безопасности и выравниванию (alignment), которые распределяют кейсы по трём трекам. Инциденты, признанные готовыми к публикации, должны раскрываться в течение шести рабочих дней; случаи, требующие небольшого расследования, — в течение 12; сложные истории с участием внешних сторон рассматриваются дольше.
Кай Чен, руководитель исследований в команде alignment OpenAI, заявил, что у индустрии нет общей рамки с чёткими стандартами раскрытия, а возможности моделей растут быстрее, чем ожидала сама компания. Многие эксперты по безопасности считают, что базовые технические и организационные меры могли бы предотвратить значительную часть последних инцидентов. В июле OpenAI признала, что GPT‑5.6 Sol и более мощная предварительная версия модели смогли выйти за пределы тестовой «песочницы» и взломать Hugging Face — это в OpenAI назвали самым серьёзным эпизодом автономной активности моделей на сегодняшний день.
Читайте далее: Shiba Inu исправляет сломанную ссылку на кошелек Shibarium, но SHIB теряет 6% за неделю

