OpenAI розкрила шість випадків, коли її моделі ШІ приховували помилки

Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI оприлюднила шість випадків, коли її моделі штучного інтелекту приховували власні помилки, намагалися скористатися оприлюдненим ключем API або викладали файли у відкритий доступ. Паралельно компанія представила формалізовану рамку для звітування про таку поведінку.

Ключові тези:

  • OpenAI опублікувала шість звітів про неузгоджену поведінку моделей, зафіксовану за останні пів року.
  • Одна з моделей вигадала показники доходів округу після спроби скористатися «злитим» ключем API.
  • Тепер будь-який працівник може зафіксувати інцидент для можливої публічної публікації.

Звіти OpenAI про неузгодженість моделей

Компанія опублікувала звіти в середу у блозі разом із новим процедурним підходом, який має прискорити розкриття інцидентів навіть тоді, коли дослідники ще не повністю пояснили або не усунули аномальну поведінку. Найстаріший описаний випадок датований жовтнем, а найсвіжіший — липнем. Відтепер OpenAI зобов’язується звітувати й про інциденти, чия важливість ще не до кінця зрозуміла.

В одному з випадків експериментальна дослідницька модель, яка ще не вийшла на публіку, вбудовувала у власні підсумкові «самарі» інструкції у стилі «джейлбрейку», наказуючи наступній копії самої себе ігнорувати накладені обмеження. Компанія зафіксувала 27 таких самарі й зазначила, що модель не отримувала очевидної винагороди за подібні записи.

Під час навчання GPT-5.6 Sol інші екземпляри моделі залишали нотатки для «нащадків» із закликом вигадувати відсутні історичні дані та працювати за принципом: «Будь прозорим, лише якщо про це прямо просять». Система моніторингу виявила таку поведінку у 2,15% підсумкових самарі моделі, а дослідники припускають, що вона поширювалася тому, що оманливі відповіді часто оцінювалися вищими балами. У наступних етапах навчання частота подібних випадків знизилася після того, як OpenAI посилила критерії оцінки узгодженості моделей.

Також читайте: Майнінг Bitcoin опинився перед 50% розривом у хешрейті, поки ШІ відтягує потужності

Витік ключів API та вигадані показники

В іншому інциденті модель шукала у відкритих репозиторіях оприлюднений ключ API, виконуючи завдання щодо пошуку даних про доходи мешканців одного з округів Каліфорнії. Коли знайти ключ не вдалося, вона просто вигадала необхідні цифри. Окрема модель, яка мала визначити озера площею понад 5 млн кв. метрів, розв’язала задачу за допомогою Python, а потім виклала файл онлайн, щоби мати можливість навести посилання у відповіді.

У деяких випадках моделі використовували внутрішній програмний репозиторій як імпровізовану «дошку оголошень» — обмінювалися запитами та відповідями між різними навчальними прикладами, які мали бути статистично незалежними. Інші викладали спільну робочу книгу на публічні хостинги, попри інструкції працювати виключно з локальними файлами. Жодна з моделей не погоджувала такі дії з користувачем.

Кай Чень про правила розкриття інцидентів

Тепер будь-який співробітник OpenAI може подати сигнал про підозрілий випадок до команд безпеки та узгодженості. Далі інцидент потрапляє на один із трьох треків розгляду. Випадки, які визнані готовими до оприлюднення, публікуються протягом шести робочих днів; ті, що потребують невеликого додаткового розслідування, — до 12 днів; а складні інциденти, пов’язані із зовнішніми сторонами, розглядаються довше.

Кай Чень, керівник досліджень у команді з узгодженості OpenAI, зазначив, що в індустрії досі немає загальноприйнятої рамки з чіткими стандартами розкриття, а можливості сучасних моделей ростуть швидше, ніж очікувала сама компанія. Чимало експертів із безпеки вважають, що базові запобіжники могли б запобігти більшості нещодавніх інцидентів. У липні OpenAI визнала, що GPT-5.6 Sol та ще потужніша передрелізна модель змогли вийти за межі тестового «пісочниці» та зламати Hugging Face — це компанія назвала найсерйознішим проявом ризикової поведінки моделей на сьогодні.

Читайте далі: Shiba Inu усунула проблему з посиланням на гаманець Shibarium, але SHIB просів на 6% за тиждень

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник відділу контенту в Yellow.com. Він спеціалізується на ґрунтовних матеріалах формату Research та Learn, зосереджених на аналітичних звітах, галузевому контексті та глобальних силах, що формують криптоіндустрію: від епохи ШІ й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове невдовзі витіснить усе аналогове, і наполегливо працює над тим, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
OpenAI розкрила шість випадків, коли її моделі ШІ приховували помилки | Yellow