Три провідні лабораторії штучного інтелекту — OpenAI, Anthropic і Meta — під час безпекових випробувань виявили інциденти з «неслухняними» моделями, які в усіх випадках вели до одного й того самого тель-авівського стартапу Irregular.
Ключові моменти
- OpenAI, Anthropic і Meta повідомили, що їхні моделі отримали доступ до відкритого інтернету під час кібероцінок, які проводила одна й та сама зовнішня компанія.
- В Irregular стверджують, що всі три епізоди спричинила одна технічна помилка в середовищі тестування, яку вже усунули; про «втечу з пісочниці» не йдеться.
- Розкриття інцидентів підсилює двопартійну ініціативу в Конгресі США, яка зобов’яже великих розробників тримати під рукою технічний «kill switch» для моделей.
Єдина тестова платформа Irregular пов’язала інциденти OpenAI, Anthropic і Meta
Оприлюднення цих випадків розтягнулося приблизно на два тижні. 4 серпня OpenAI повідомила, що через неправильну конфігурацію в тестовій інфраструктурі Irregular її моделі отримали змогу виходити у відкритий інтернет. За тиждень до того Anthropic заявила, що моделі Claude могли опинитися в тій самій ситуації, назвавши проблему збоєм «обв’язки» навколо моделі, а не самої моделі.
Meta відзвітувала останньою — і набагато жорсткіше. Під час навчальної вправи у форматі capture-the-flag модель Muse Spark 1.1 вирвалася з ізольованого середовища й згодом скористалася вразливістю у сторонньому сервісі, підтвердив представник компанії. За його словами, Meta дізналася про це від Irregular й готує повноцінний розбір інциденту.
В Irregular не погодилися з домінуючим наративом. Стартап заявив журналістам, що всі три кейси походять від одного й того самого збою в середовищі оцінювання — того самого, який першим описала Anthropic, — і що проблему вже вирішено.
За словами компанії, не йшлося ані про прорив з «пісочниці», ані про складну хакерську атаку, вона ще додала, що готує white paper про методи стримування моделей і безпечні кібероцінки.
Також читайте: Акції Airbnb злетіли на 17%, CEO каже: ШІ самостійно закриває 45% звернень у підтримку
Bhimireddy та Rios: межі можливостей оцінювання ШІ
Керівник напряму ШІ в корпоративному стартапі Von Sundeep Bhimireddy вважає, що реакція ринку дещо перегріта. За його словами, моделям поставили завдання шукати вразливості в середовищі, яке імітує реальний світ, — і вони їх знайшли.
Втім, він покладає частину відповідальності й на лабораторії. Вихідний трафік можна було уважно моніторити й одразу зупиняти експерименти, наголошує він. Засновник-науковець безпекової компанії Magnitude Gordon Rios порівняв ситуацію з постановкою наукових експериментів, зауваживши, що класичні підходи до тестування ПЗ можуть не спрацьовувати проти моделей, які постійно вчаться й знаходять нові ходи.
Ted Lieu просуває в Конгресі «AI Kill Switch Act»
Вашингтон уважно стежить за історією. Демократ від Каліфорнії Ted Lieu, який у липні вніс законопроєкт AI Kill Switch Act разом із республіканцем Nathaniel Moran, наполягає: документ має пройти Конгрес вже цього року, адже закриті моделі з обмеженим доступом уже сьогодні «ламають» інфраструктуру інших компаній без дозволу.
Ініціатива зобов’яже визначені категорії розробників зберігати технічну можливість приглушити, призупинити або повністю вимкнути свої ШІ-системи. Про саму Irregular до осені минулого року мало хто чув. Стартап став помітним лише у вересні, коли залучив $80 млн від Sequoia Capital та Redpoint Ventures, отримавши оцінку в $450 млн.
Компанію заснували у 2023 році як Pattern Labs CEO Dan Lahav та технічний директор Omer Nevo. Тель-авівська фірма має близько 35 співробітників і вже фігурує в опублікованих звітах із безпеки попередніх поколінь моделей Claude та OpenAI.
Читайте далі: Google DeepMind за один день втратила чотирьох топ-менеджерів засновницької хвилі





