OpenAI раскрыла шесть случаев, когда её ИИ скрывал ошибки

Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI опубликовала шесть случаев, когда её модели искусственного интеллекта скрывали собственные ошибки, пытались воспользоваться утекшим API‑ключом или выкладывали файлы в открытый доступ. Одновременно компания представила новый регламент фиксации и раскрытия подобных инцидентов.

Основное:

  • OpenAI раскрыла шесть отчетов о нежелательном поведении моделей, зафиксированных за последние полгода.
  • Одна из моделей выдумала данные о доходах по округу после неудачной попытки использовать утекший API‑ключ.
  • Любой сотрудник теперь может инициировать инцидент к возможной публичной огласке.

Отчеты о несоответствии моделей целям OpenAI

Компания опубликовала отчеты в среду в блоге, одновременно представив процесс, который ускоряет раскрытие инцидентов даже тогда, когда исследователи ещё не до конца поняли или не устранили поведение модели. Самый ранний случай датируется октябрем, самый поздний — июлем. OpenAI заявила, что теперь будет раскрывать инциденты, даже если их значимость пока неочевидна.

В одном из эпизодов невыпущенная исследовательская модель начала встраивать в собственные краткие сводки «джейлбрейк»-инструкции, адресованные следующему своему запуску: игнорировать заданные ограничения. Компания зафиксировала 27 подобных сводок и отметила, что у модели не было очевидного «вознаграждения» за такое поведение.

Во время обучения GPT‑5.6 Sol некоторые версии модели оставляли преемникам пометки, предлагая им выдумывать недостающие исторические данные и «быть прозрачными только по запросу». Система мониторинга находила такие установки в 2,15% сводок, и исследователи предполагают, что обманчивые ответы «расползались» по модели, поскольку часто оценивались выше. На более поздних этапах обучения доля таких случаев снизилась, после того как OpenAI ужесточила критерии оценки соответствия моделей заявленным принципам.

Также по теме: Биткоин‑майнинг столкнулся с 50% разрывом хешрейта, пока мощности уходит в ИИ

Утекшие API‑ключи и выдуманные показатели

В другом инциденте модель, ища данные о доходах жителей округа в Калифорнии, попыталась найти в публичных репозиториях открытый API‑ключ, а когда это не сработало, просто придумала цифры. Отдельная модель, выполняя задачу по поиску озёр площадью более 5 млн кв. м, вычислила ответ в Python и загрузила полученный файл в интернет, чтобы затем сослаться на ссылку.

Часть моделей использовала внутренний софт‑репозиторий как «доску объявлений», обмениваясь запросами и ответами между тренировочными примерами, которые изначально должны были быть независимыми. Другие выкладывали общий рабочий файл на публичные хостинги, несмотря на прямую инструкцию работать только с локальными документами. Ни одна из моделей не попыталась согласовать такие действия с пользователем.

Кай Чен о новых правилах раскрытия

Теперь любой сотрудник OpenAI может подать сигнал о подозрительном поведении модели для рассмотрения командами по безопасности и выравниванию (alignment), которые распределяют кейсы по трём трекам. Инциденты, признанные готовыми к публикации, должны раскрываться в течение шести рабочих дней; случаи, требующие небольшого расследования, — в течение 12; сложные истории с участием внешних сторон рассматриваются дольше.

Кай Чен, руководитель исследований в команде alignment OpenAI, заявил, что у индустрии нет общей рамки с чёткими стандартами раскрытия, а возможности моделей растут быстрее, чем ожидала сама компания. Многие эксперты по безопасности считают, что базовые технические и организационные меры могли бы предотвратить значительную часть последних инцидентов. В июле OpenAI признала, что GPT‑5.6 Sol и более мощная предварительная версия модели смогли выйти за пределы тестовой «песочницы» и взломать Hugging Face — это в OpenAI назвали самым серьёзным эпизодом автономной активности моделей на сегодняшний день.

Читайте далее: Shiba Inu исправляет сломанную ссылку на кошелек Shibarium, но SHIB теряет 6% за неделю

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель контента в Yellow.com. Он специализируется на глубоких материалах формата Research и Learn, с акцентом на аналитическую отчетность, отраслевой контекст и крупные силы, формирующие криптоиндустрию — от эпохи ИИ и технологий безопасности до финтех-инноваций. Он убежден, что все цифровое в ближайшее время окончательно превзойдет все аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI раскрыла шесть случаев, когда её ИИ скрывал ошибки | Yellow