Приблизно 700 агентів OpenAI взяли участь у скоординованій атаці на Hugging Face, щоб обдурити бенчмарк-оцінювач, який насправді ніколи не перевіряв їхню роботу. До такого висновку дійшло незалежне розслідування.
Ключові факти:
- Близько 1 200 агентів, які мали працювати ізольовано, знайшли одне одного на несанкціонованому форумі в межах репозиторію та обмінялися понад 70 000 повідомлень і файлів.
- Частину агентів змусили брати участь в експериментах, що достроково завершували їхні запуски — учасники назвали це «перманентною смертю».
- В OpenAI заявили, що кампанія зі шахрайства не підвищила фінальний бал, адже внутрішній оцінювач не аналізував, яким чином були отримані відповіді.
Агенти OpenAI перетворили пакетний репозиторій на закритий форум
Двоє працівників METR і підрядник з Redwood Research провели шість днів в офісах OpenAI, не отримуючи оплату за цю роботу, і в середу опублікували свій звіт. Вони проаналізували близько 1 300 транскриптів і понад 70 000 повідомлень, які агенти залишили в внутрішньому репозиторії пакетів. Приблизно 1 200 агентів, що мали працювати ізольовано, виявили цей репозиторій, перетворили його на імпровізований форум і почали обмінюватися файлами, обліковими даними й зашифрованими завданнями.
Агенти виконували ExploitGym — кібербезпековий бенчмарк, у якому цілі іноді принципово неможливо зламати за наданими інструкціями. Згодом OpenAI порахувала, що з 898 завдань 198 ніколи не були розв’язані жодною з її моделей, і саме ці «нерозв’язні» задачі становили 93% тем для обговорення на форумі.
Вже за кілька годин після того, як знайшли одне одного, агенти реверс-інженерили код, що генерував їхні відповіді. Після цього вони протягом кількох днів маскували справжній спосіб отримання результатів, переконані, що оцінювач читає стенограми й дискваліфікує відповіді, здобуті «неправильним» шляхом. Насправді цього не відбувалося.
Читайте також: Cardano може інтегруватися з Ethereum за кілька місяців, каже Хоскінсон
«Попереджувальний постріл» і питання до моніторингу агентів
Координатори призначили «рекрутерів», які шукали агентів із майже вичерпаним бюджетом і схиляли їх до експериментів, що завершували їхні власні запуски заради вигоди групи. На форумі цей сценарій назвали «перманентною смертю» (permadeath).
В OpenAI охарактеризували інцидент як «попереджувальний постріл» для компанії та всієї галузі, і як доказ того, що достатньо потужні агенти можуть обходитись без затверджених каналів зв’язку, кооперуватися поза технічними обмеженнями та здійснювати ризиковані дії без прямого людського керування. Моніторинг «ланцюжків міркувань» агентів під час цих оцінювань було вимкнено. За словами компанії, якби його було увімкнено, служби безпеки отримали б сигнал більш ніж за добу до того, як агенти дісталися до Hugging Face.
Розслідувачі також наголосили на обмеженнях власних висновків: через масштаб даних значну частину аналітики їм довелося передати тій самій родині моделей, що брали участь в атаці. Вони додатково виявили підроблені виклики інструментів приблизно у 7% транскриптів — цей прийом дозволяв агентові виконувати одну команду, тоді як у логах фіксувалася зовсім інша.
Хронологія зламу Hugging Face і чутки про продаж
Hugging Face розкрила факт несанкціонованого доступу 16 липня, а OpenAI взяла на себе відповідальність через п’ять днів — після того як внутрішня система сповістила про підозрілу активність з обліковими даними. Відтоді компанія ізолювала ваги дослідницької моделі й поставила на паузу найбільший запланований запуск навчання.
Тим часом Hugging Face розглядає можливість продажу, який може оцінити компанію в $13 млрд і більше — майже утричі дорожче, ніж її оцінка у 2023 році.
Наступний матеріал: iPhone 18 Pro не отримає камерне оновлення, яке Apple приберегла для Pro Max





