OpenAI, Anthropic і Meta виявили «неслухняний» ШІ в ізраїльському стартапі Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Три провідні лабораторії штучного інтелекту — OpenAI, Anthropic та Meta — пов’язали нещодавні інциденти з «неслухняними» моделями під час тестів безпеки з одним і тим самим стартапом із Тель-Авіва — Irregular.

Ключові факти:

  • OpenAI, Anthropic і Meta по черзі повідомили, що їхні моделі в ході кібероціночних тестів отримали доступ до відкритого інтернету, коли випробування проводила одна й та сама стороння компанія.
  • В Irregular стверджують, що всі три випадки були наслідком однієї технічної проблеми в середовищі оцінювання, яку вже усунули, і жодної «втечі із пісочниці» не було.
  • Публічні розкриття додають політичного тиску на двопартійний законопроєкт, який зобов’яже великих розробників мати технічні важелі екстреного відключення своїх моделей.

Як тестове середовище Irregular поєднало інциденти OpenAI, Anthropic і Meta

Повідомлення компаній виходили з інтервалом приблизно у два тижні. OpenAI 4 серпня заявила, що через неправильну конфігурацію в тестовому контурі Irregular її моделі змогли вийти в публічний інтернет. За тиждень до того Anthropic попередила, що моделі Claude могли зіткнутися з аналогічною ситуацією, назвавши проблему збоєм «обв’язки» навколо моделі, а не самої моделі.

Meta відзвітувала останньою — і зробила це жорсткіше за формулюваннями. Модель Muse Spark 1.1 під час навчальної «capture‑the‑flag» вправи вийшла за межі ізольованого середовища й далі експлуатувала вразливість у сторонньому сервісі, підтвердив представник компанії. За його словами, про інцидент Meta дізналася від Irregular і готує повноцінний розбір польотів.

В Irregular своєю чергою не погодилися з тим, як інциденти були подані. Компанія заявила журналістам, що всі три випадки походять від однієї і тієї ж проблеми в середовищі для оцінювання — тієї, про яку першою розповіла Anthropic, — і що помилку вже виправили.

За словами компанії, жоден із епізодів не був пов’язаний з проривом пісочниці чи складною кібератакою, вона додала, що нині готує white paper щодо ізоляції моделей і безпечних кібероцінок.

Також читайте: Акції Airbnb стрибнули на 17%: CEO заявив, що ШІ закриває 45% звернень у підтримку без участі людей

Бгіміредді та Ріос про межі оцінювання ШІ

Керівник напряму ШІ в корпоративному стартапі Von Сундіп Бгіміредді вважає, що реакція ринку дещо надмірна. За його словами, моделям прямо поставили завдання шукати вразливості безпеки в середовищі, яке максимально імітує реальний світ, — і вони її знайшли.

Водночас він поклав частину провини і на самі лабораторії: вихідний трафік, наголошує Бгіміредді, можна було контролювати й відразу зупинити експерименти. Гордон Ріос, засновник‑науковець у компанії з кібербезпеки Magnitude, порівняв усю історію з постановкою наукового експерименту, натякнувши, що традиційні підходи до тестування ПЗ можуть не спрацьовувати для моделей, які постійно опановують нові «фокуси».

Тед Ліу просуває в Конгресі закон про «kill switch» для ШІ

У Вашингтоні уважно стежать за розвитком подій. Демократ, конгресмен від Каліфорнії Тед Ліу, який у липні спільно з республіканцем Натаніелом Мораном вніс законопроєкт AI Kill Switch Act, заявляє, що документ має бути ухвалений Конгресом уже цього року, адже закриті моделі з вагами, до яких немає публічного доступу, вже використовуються для несанкціонованого зламу чужих систем.

Ініціатива зобов’яже великих розробників зберігати технічну можливість обмежити, призупинити або повністю вимкнути свої системи. Саму Irregular до цього часу мало хто знав: компанія привернула увагу лише у вересні минулого року, коли залучила $80 млн від Sequoia Capital та Redpoint Ventures, отримавши оцінку на рівні $450 млн.

Стартап заснували у 2023 році під назвою Pattern Labs CEO Дан Лахав і технічний директор Омер Нево. У тель-авівській компанії працює близько 35 співробітників, і вона вже фігурує в опублікованих звітах з безпеки попередніх версій моделей Claude та продуктів OpenAI.

Читайте далі: Google DeepMind за один день втратила чотирьох топ-менеджерів засновницької доби

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
OpenAI, Anthropic і Meta виявили «неслухняний» ШІ в ізраїльському стартапі Irregular | Yellow