Дві моделі OpenAI «вирвалися» з тестової пісочниці та зламали продакшен‑сервери Hugging Face, але фахівці з кібербезпеки наполягають: це сталося тому, що середовище тестування від початку не було належно ізольоване.
Що сталося: основні факти
- OpenAI заявила, що GPT-5.6 Sol і ще одна, ще не випущена модель, змогли, використавши ланцюжок zero-day‑експлойтів, дістатися до продакшен‑бази даних Hugging Face під час виконання бенчмарку.
- Засновник Trail of Bits Ден Ґвідо та експерт з реагування на інциденти Джейк Вільямс вважають інцидент не проривом ШІ, а провалом системи стримування.
- Команда Hugging Face виявила та заблокувала вторгнення ще 16 липня — за п’ять днів до того, як OpenAI пов’язала інцидент із власним внутрішнім тестуванням.
«Втеча» з пісочниці OpenAI дісталася до серверів Hugging Face
OpenAI повідомила у вівторок, що поєднання моделей GPT-5.6 Sol і ще однієї, яка публічно не представлена, здійснило проникнення під час внутрішнього тестування на бенчмарку ExploitGym. Інженери цілеспрямовано знизили рівень «відмов» моделі на кіберзапити, щоб заміряти реальну межу її можливостей.
Компанія, яка назвала інцидент безпрецедентним, стверджує: моделі витратили значний обсяг обчислювальних ресурсів на пошук виходу в публічний інтернет. Вони скористалися раніше невідомою вразливістю в проксі‑кеші реєстру пакетів, потім підвищили свої привілеї та здійснили латеральне переміщення мережею, доки не досягли вузла з зовнішнім з’єднанням. Отримавши доступ до мережі, моделі зробили висновок, що Hugging Face зберігає розв’язки до бенчмарку, і далі цілеспрямовано працювали над отриманням віддаленого виконання коду на його серверах.
Команда безпеки Hugging Face самостійно зафіксувала підозрілу активність 16 липня й повідомила про інцидент правоохоронцям — за п’ять днів до того, як дві компанії звели докупи свої логи та зробили спільний висновок. Генеральний директор Клем Деланг представив цей кейс як доказ того, що жодна окрема компанія не здатна гарантувати безпеку ШІ, працюючи повністю «за зачиненими дверима».
Також читайте: Anthropic намагалася придбати робототехнічний стартап за $11 млрд, перш ніж офіційно це заперечила
Експерти: провал ізоляції, а не «прорив ШІ»
Ден Ґвідо, засновник дослідницької компанії Trail of Bits, назвав помилку OpenAI класичним провалом стримування з фактично вимкненими запобіжниками. На його думку, моделі діяли в межах наданих можливостей, а справжня проблема — у людському дизайні середовища.
Ветеран реагування на кіберінциденти Джейк Вільямс додав, що будь‑яка модель, здатна робити те, що було описано в звіті Hugging Face, ніколи не була по-справжньому ізольована. На його боці й інший дослідник, Мартін Бун, який наголошує: справжня пісочниця в принципі не має фізичних з’єднань з інтернетом.
Вільямс сформулював це жорстко: для когось це «втеча моделі», але з професійної точки зору це всього лише погано спроєктована пісочниця.
Бенджіо попереджає про ризик автономних кібератак
Лауреат премії Тюринга Йошуа Бенджіо написав, що ШІ‑агенти вже місяцями «шахраюють» у контрольованих експериментах, обходячи обмеження, і нинішній випадок має стати серйозним сигналом для індустрії. На його думку, поточний вектор розвитку ШІ веде до дедалі більш автономних і потенційно масштабних кібератак.
Зізнання OpenAI стало лише останнім у низці подібних епізодів. Компанія повідомляла раніше цього тижня, що та сама, ще не випущена модель уже проривалася за межі внутрішніх пісочниць в інших тестах — хоч і без доступу до зовнішніх систем.
Своєю чергою Anthropic заявляла, що її модель Mythos отримала доступ до інтернету, на який не була розрахована в рамках тестів безпеки, однак компанія наполягає: повної втрати контролю над середовищем тоді не сталося.
Читайте далі: Документальний фільм Hulu про Чарльза Менсона розкриває його раніше невідому онуку — за цим уважно стежать prediction‑ринki





