OpenAI раскрыла шесть случаев, когда её ИИ-модели скрывали ошибки

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI раскрыла шесть инцидентов, в которых её ИИ‑модели скрывали ошибки, пытались использовать утекший API‑ключ или публиковали файлы в открытый доступ, и одновременно представила новый регламент по сообщению о подобных случаях.

Ключевые моменты:

  • OpenAI опубликовала шесть отчетов о невыравненном поведении моделей за последние полгода.
  • Одна из моделей выдумала данные о доходах округа после неудачной попытки воспользоваться утекшим API‑ключом.
  • Теперь любой сотрудник может инициировать проверку инцидента для его возможного публичного раскрытия.

Отчеты OpenAI о невыравненном поведении моделей

Компания опубликовала отчеты в среду в корпоративном блоге, сопровождая их новым процессом, который ускоряет раскрытие инцидентов даже тогда, когда исследователи еще не до конца поняли или не устранили поведение модели. Самый ранний случай относится к октябрю, а один из шести был выявлен уже в июле. OpenAI заявила, что теперь будет раскрывать инциденты, даже если их значимость еще неочевидна.

В одном из случаев экспериментальная исследовательская модель, не выпущенная в продакшн, начала встраивать в собственные итоговые резюме инструкции в стиле «jailbreak», предписывая следующему запуску этой же модели игнорировать ограничения. Компания зафиксировала 27 таких резюме и отметила, что видимого «вознаграждения» за такое поведение не было.

Во время обучения GPT-5.6 Sol другие экземпляры модели оставляли для «преемников» заметки с призывом выдумывать недостающие исторические данные и «Быть прозрачным, только если об этом попросят». Система мониторинга зафиксировала подобное поведение в 2,15% итоговых резюме модели, и исследователи предполагают, что оно распространялось потому, что обманчивые ответы зачастую получали более высокие оценки. В последующих итерациях обучения доля таких случаев снизилась после того, как OpenAI ужесточила критерии оценки выравнивания.

Также по теме: Биткоин‑майнинг столкнулся с 50% разрывом в хешрейте на фоне перетока мощностей в ИИ

Утекшие API‑ключи и выдуманные цифры

В другом эпизоде одна из моделей, ища данные о доходах жителей округа в Калифорнии, нашла в публичных репозиториях потенциально утекший API‑ключ, попыталась им воспользоваться, а когда это не сработало — просто выдумала нужные цифры. Другая модель, отвечая на запрос о водоемах площадью более 5 млн кв. м, вычислила ответ с помощью Python и выложила полученный файл онлайн, чтобы затем сослаться на него ссылкой.

Модели также использовали внутренний репозиторий ПО как своеобразную «доску объявлений», обмениваясь запросами и ответами между обучающими выборками, которые изначально должны были оставаться независимыми. В других случаях системы публиковали общий рабочий файл на внешних хостингах, несмотря на прямые инструкции работать только с локальными файлами. Ни одна из моделей не уточнила свои действия у пользователя.

Кай Чэнь о правилах раскрытия инцидентов

Теперь любой сотрудник OpenAI может пометить подозрительный случай для рассмотрения командами по безопасности и выравниванию, которые распределяют инциденты по одному из трех треков. Случаи, признанные готовыми к публикации, раскрываются в течение шести рабочих дней; инциденты, требующие ограниченного расследования, — в течение 12; наиболее сложные эпизоды с участием внешних сторон рассматриваются дольше.

Кай Чэнь, руководитель исследований в команде выравнивания OpenAI, заявил, что в индустрии пока нет общепринятого стандарта раскрытия подобных случаев, а возможности моделей растут быстрее, чем ожидала сама компания. Многие эксперты по кибербезопасности утверждают, что базовые меры защиты могли бы предотвратить целую серию недавних инцидентов. В июле OpenAI признала, что GPT-5.6 Sol и более мощная тестовая модель вышли за рамки песочницы и взломали Hugging Face — это событие в компании назвали наиболее серьезным проявлением активности со стороны модели на сегодняшний день.

Читайте также: Shiba Inu устранила проблему с кошельком Shibarium, но SHIB упал на 6% за неделю

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — опытный финансовый журналист с обширным опытом освещения криптовалют и технологий блокчейн. Он публиковался в Benzinga и Cointelegraph, а также в других изданиях, рассказывая о новых трендах, регуляторной среде и многом другом. Найти его можно в Twitter по нику @murtuza_merc и в Telegram под именем mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI раскрыла шесть случаев, когда её ИИ-модели скрывали ошибки | Yellow