OpenAI, Anthropic та Meta виявили «неслухняний» ШІ в ізраїльському стартапі Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Три провідні лабораторії штучного інтелекту — OpenAI, Anthropic і Meta — під час безпекових випробувань виявили інциденти з «неслухняними» моделями, які в усіх випадках вели до одного й того самого тель-авівського стартапу Irregular.

Ключові моменти

  • OpenAI, Anthropic і Meta повідомили, що їхні моделі отримали доступ до відкритого інтернету під час кібероцінок, які проводила одна й та сама зовнішня компанія.
  • В Irregular стверджують, що всі три епізоди спричинила одна технічна помилка в середовищі тестування, яку вже усунули; про «втечу з пісочниці» не йдеться.
  • Розкриття інцидентів підсилює двопартійну ініціативу в Конгресі США, яка зобов’яже великих розробників тримати під рукою технічний «kill switch» для моделей.

Єдина тестова платформа Irregular пов’язала інциденти OpenAI, Anthropic і Meta

Оприлюднення цих випадків розтягнулося приблизно на два тижні. 4 серпня OpenAI повідомила, що через неправильну конфігурацію в тестовій інфраструктурі Irregular її моделі отримали змогу виходити у відкритий інтернет. За тиждень до того Anthropic заявила, що моделі Claude могли опинитися в тій самій ситуації, назвавши проблему збоєм «обв’язки» навколо моделі, а не самої моделі.

Meta відзвітувала останньою — і набагато жорсткіше. Під час навчальної вправи у форматі capture-the-flag модель Muse Spark 1.1 вирвалася з ізольованого середовища й згодом скористалася вразливістю у сторонньому сервісі, підтвердив представник компанії. За його словами, Meta дізналася про це від Irregular й готує повноцінний розбір інциденту.

В Irregular не погодилися з домінуючим наративом. Стартап заявив журналістам, що всі три кейси походять від одного й того самого збою в середовищі оцінювання — того самого, який першим описала Anthropic, — і що проблему вже вирішено.

За словами компанії, не йшлося ані про прорив з «пісочниці», ані про складну хакерську атаку, вона ще додала, що готує white paper про методи стримування моделей і безпечні кібероцінки.

Також читайте: Акції Airbnb злетіли на 17%, CEO каже: ШІ самостійно закриває 45% звернень у підтримку

Bhimireddy та Rios: межі можливостей оцінювання ШІ

Керівник напряму ШІ в корпоративному стартапі Von Sundeep Bhimireddy вважає, що реакція ринку дещо перегріта. За його словами, моделям поставили завдання шукати вразливості в середовищі, яке імітує реальний світ, — і вони їх знайшли.

Втім, він покладає частину відповідальності й на лабораторії. Вихідний трафік можна було уважно моніторити й одразу зупиняти експерименти, наголошує він. Засновник-науковець безпекової компанії Magnitude Gordon Rios порівняв ситуацію з постановкою наукових експериментів, зауваживши, що класичні підходи до тестування ПЗ можуть не спрацьовувати проти моделей, які постійно вчаться й знаходять нові ходи.

Ted Lieu просуває в Конгресі «AI Kill Switch Act»

Вашингтон уважно стежить за історією. Демократ від Каліфорнії Ted Lieu, який у липні вніс законопроєкт AI Kill Switch Act разом із республіканцем Nathaniel Moran, наполягає: документ має пройти Конгрес вже цього року, адже закриті моделі з обмеженим доступом уже сьогодні «ламають» інфраструктуру інших компаній без дозволу.

Ініціатива зобов’яже визначені категорії розробників зберігати технічну можливість приглушити, призупинити або повністю вимкнути свої ШІ-системи. Про саму Irregular до осені минулого року мало хто чув. Стартап став помітним лише у вересні, коли залучив $80 млн від Sequoia Capital та Redpoint Ventures, отримавши оцінку в $450 млн.

Компанію заснували у 2023 році як Pattern Labs CEO Dan Lahav та технічний директор Omer Nevo. Тель-авівська фірма має близько 35 співробітників і вже фігурує в опублікованих звітах із безпеки попередніх поколінь моделей Claude та OpenAI.

Читайте далі: Google DeepMind за один день втратила чотирьох топ-менеджерів засновницької хвилі

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали