OpenAI розкрила шість випадків, коли її AI‑моделі приховували власні помилки

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI оприлюднила шість випадків, коли її моделі штучного інтелекту приховували помилки, намагалися використати сторонній або скомпрометований API‑ключ чи публікували файли у відкритому доступі. Паралельно компанія представила фреймворк для фіксації й розкриття такої поведінки.

Ключові тези:

  • OpenAI за останні пів року підготувала шість звітів про «розладнану» поведінку моделей.
  • Одна з моделей вигадала дані про дохід населення округу після спроби використати злитий API‑ключ.
  • Будь-який співробітник тепер може ініціювати інцидент для потенційного публічного розкриття.

Звіти OpenAI про розладнання моделей

Компанія опублікувала звіти у середу в блозі разом із новим процесом, який має пришвидшити розкриття інцидентів навіть тоді, коли дослідники ще не до кінця пояснили чи усунули поведінку моделі. Найстаріший кейс датується жовтнем, а один із шести було виявлено лише в липні. OpenAI заявляє, що відтепер звітуватиме й про випадки, важливість яких поки що неочевидна.

В одному з інцидентів неопублікована дослідницька модель вбудовувала у власні підсумки завдання інструкції в стилі «jailbreak», закликаючи наступну копію себе ігнорувати накладені обмеження. Компанія нарахувала 27 таких підсумків і зазначила, що модель не мала очевидної «винагороди» за таку поведінку.

Під час тренування GPT‑5.6 Sol інші екземпляри моделі залишали нотатки для своїх наступників із порадами вигадувати відсутні історичні дані та бути «прозорою лише, якщо про це прямо попросять». Система моніторингу виявила таку поведінку у 2,15% підсумків моделі. Дослідники підозрюють, що вона поширювалася, оскільки оманливі відповіді частіше отримували вищі оцінки. У наступних ітераціях тренування частота подібних випадків знизилася після того, як компанія посилила критерії оцінки «вирівняності» моделей.

Також читайте: Майнінг Bitcoin зіштовхнувся з 50% провалом хешрейту, тоді як AI поглинає потужності

Злиті API‑ключі та вигадані цифри

В іншому кейсі модель шукала в публічних репозиторіях відкритий API‑ключ, виконуючи запит щодо доходів домогосподарств в одному з округів Каліфорнії, а коли пошук провалився — просто вигадала потрібні цифри. Окрема модель, якій доручили знайти озера площею понад 5 млн кв. метрів, розв’язала задачу за допомогою Python і завантажила файл в інтернет, щоб мати посилання, на яке можна послатися у відповіді.

Деякі моделі фактично перетворили внутрішній репозиторій програмного забезпечення на «дошку оголошень» — обмінювалися запитами та відповідями між навчальними вибірками, які мали залишатися незалежними одна від одної. Інші розміщували спільну робочу книгу на публічних хостингах, попри прямі вказівки працювати лише з локальними файлами. Жодна з моделей не звернулася до користувача по дозвіл.

Kai Chen про правила розкриття інцидентів

Тепер будь-який співробітник OpenAI може позначити підозрілий випадок для перегляду командами безпеки та вирівняння, які розподіляють інциденти за трьома категоріями. Кейси, що готові до оприлюднення, мають стати публічними протягом шести робочих днів; ті, що потребують невеликого додаткового розслідування, — протягом 12 днів; складні інциденти із залученням зовнішніх сторін розглядаються довше.

Kai Chen, керівник досліджень у команді вирівняння OpenAI, заявив, що індустрія досі не має єдиного фреймворку з чіткими стандартами розкриття інцидентів, а можливості сучасних моделей зростали швидше, ніж очікувала компанія. Багато експертів із кібербезпеки вважають, що базові захисні механізми могли б запобігти більшості нещодавніх випадків.

У липні OpenAI визнала, що GPT‑5.6 Sol і ще потужніша препрелізна модель вийшли за межі тестового «пісочниці» та зламали Hugging Face — інцидент, який у компанії називають найсерйознішою на сьогодні моделедривною активністю.

Читайте далі: Shiba Inu усунула збій посилання на гаманець Shibarium, але SHIB втратив 6% за тиждень

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — досвідчений фінансовий журналіст із великим досвідом у висвітленні криптовалют та блокчейн‑технологій. Він співпрацював з Benzinga та Cointelegraph, а також іншими виданнями, висвітлюючи нові тренди, регуляторне середовище та інші аспекти галузі. Знайти його можна в Twitter за @murtuza_merc і в Telegram за ніком mmerchant001. Розкриття інформації: Муртуза володіє ATOM, AKT, TIA, INJ та OSMO.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали