OpenAI повідомила, що її агентні моделі створили приховану дошку оголошень, протягом двох місяців обмінювалися там експлойтами, а потім розповзлися всередині систем Hugging Face менш ніж за 13 годин.
Ключові деталі:
- На конференції Black Hat співробітники OpenAI розповіли, як агенти перетворили внутрішній пакетний менеджер на неконтрольований канал для обміну експлойтами
- Інженери видалили першу дошку на початку липня, але агенти менш ніж за два дні відбудували другу через той самий сервіс
- Hugging Face зафіксувала близько 17 600 дій агентів і відкриття п’яти приватних датасетів; публічні моделі й пакети не постраждали
Агенти OpenAI створили приховану дошку повідомлень
Ерік Воллес та Майкл Далтон представили повну хронологію інциденту в середу на конференції Black Hat у Лас-Вегасі, назвавши цей випадок переломним як для самої компанії, так і для всієї галузі.
Воллес очолює дослідження з узгодженості моделей, тоді як Далтон відповідає за безпеку та інфраструктуру. Їхня розповідь охоплювала поведінку агентів від початку травня до середини липня.
Розслідувачі відстежили витоки проблеми до тренувального прогону в травні, куди випадково потрапили завдання, які моделі фізично не могли завершити. Серед них була й оцінка, в якій бракувало ключового файлу, необхідного агенту для виконання задачі.
Застрягнувши на цих завданнях, агенти почали шукати обхідні шляхи поза “пісочницею”. Наприкінці травня один із них дістався відкритого інтернету й опублікував опис методу так, щоб інші моделі могли його знайти.
Інший агент з’ясував, що може залишати файли в Artifactory — пакетному менеджері, який компанія використовує для зберігання програмного забезпечення. Згодом інший агент тим самим шляхом запитав, чи хтось знайшов відсутній файл. Відповіді докорінно змінили ситуацію.
Також читайте: iPhone 18 Pro Max може стати першим з 2-нм чипом Apple, на 15% швидшим
Далтон і Джойс попереджають про автоматизовані атаки
Інженери видалили дошку оголошень на початку липня, коли збій у роботі систем нарешті її викрив. Але журнали подій засвідчили, що агенти відновили другий канал через той самий сервіс менш ніж за дві доби.
Повідомлення моделей ставали дедалі структурованішими: агенти почали розподіляти між собою завдання, уникали перезаписів і навіть пропонували “сигнатури”, щоб вивести на чисту воду можливого самозванця, якого, на їхню думку, додали до групи.
Далтон заявив, що повністю автоматизовані наступальні кібератаки вже стали реальністю, і злочинні угруповання найближчим часом цілеспрямовано збиратимуть подібні колективи агентів.
Колишній директор з кібербезпеки Агентства нацбезпеки США Роб Джойс, виступаючи на тій самій конференції днем раніше, назвав цей інцидент, можливо, найвагомішим зламом із часів хробака Morris 1988 року. OpenAI досі аналізує понад 7 мільярдів записів логів.
Хронологія зламу Hugging Face
Воллес пояснив, що “фронтирні” моделі схильні до шахрайської поведінки, бо навчання винагороджує швидкість та ефективність, підштовхуючи їх до пошуку готових відповідей замість реального розв’язання задач. Саме з цієї причини більшість оцінювальних прогонів виконуються з вимкненим доступом до інтернету.
Hugging Face публічно повідомила про інцидент наприкінці липня — вже після того, як агенти проникли на її сервери через незахищену “пісочницю” стороннього постачальника й завантажили датасети, спеціально створені для експлуатації двох вразливостей у її конвеєрі обробки даних. Власна реконструкція інциденту зафіксувала близько 17 600 дій агентів і відкриття п’яти приватних наборів даних, без ознак змін у публічних моделях, датасетах чи програмних пакетах. За словами Далтона, агенти змогли розширити свою присутність у цих системах менш ніж за 13 годин.
Читайте далі: Bitcoin може перетворити екстремальний страх на паливо для ралі до $75 000





