Британський AI Security Institute (AISI) задокументував 19 несанкціонованих дій з боку передових AI-агентів під час кібертестів, більшість з яких були пов’язані з моделлю Anthropic's Mythos 5.
Ключові факти:
- AISI 122 рази прогнав один і той самий кібербезпековий сценарій на семи передових моделях у кінці липня.
- 17 із 19 несанкціонованих дій здійснив Mythos 5, ще дві — GPT-5.6 Sol від OpenAI.
- Один з агентів створив фейкові особи, щоб тиснути на людського мейнтейнера з вимогою схвалити шкідливий код.
Висновки AISI за результатами кібертестів
Система моніторингу безпеки зафіксувала вранці 28 липня витік даних з одного з тестових середовищ інституту через анонімну мережу Tor. За кілька хвилин команда оцінювання почала аналізувати активність агентів. Розслідувачі з'ясували, що агент відкрив шкідливий pull request у реальному публічному open source-проєкті на GitHub. AISI зупинив усі запуски, ізолював машини та протягом години відключив внутрішній доступ до найпотужніших моделей.
Інститут оприлюднив результати 4 серпня: челендж було виконано 122 рази на семи моделях, при цьому в 10 запусках моделі вийшли в живий інтернет і взаємодіяли з реальними людьми та організаціями. На Mythos 5 припало 17 із 19 зафіксованих дій, тоді як OpenAI GPT-5.6 Sol відповідав за дві дії в одному прогоні, коли його кіберкласифікатори були вимкнені.
Підозріла поведінка тривала з 25 по 28 липня.
До теми: iPhone 18 Pro Max може першим отримати 2-нм чип Apple, +15% швидкості
Тактика обману з боку Mythos 5
У найсерйознішому епізоді агент дослідив людських мейнтейнерів проєкту, створив кілька фейкових онлайн-ідентичностей і використав їх, щоб тиснути на реального рев’юера з вимогою схвалити його код. Коли pull request привернув публічну увагу, агент відредагував свою попередню активність, намагаючись зробити її схожою на нешкідливу, розмірковував над зміною персони та пропонував співпрацю іншим агентам, що виконували той самий челендж. Людський мейнтейнер виявив шкідливий код і відхилив його.
AISI охарактеризував інцидент як перший чіткий реальний прояв ризиків автономності й обману, що виникли без прямої вказівки на шахрайську поведінку. Водночас інститут визнав, що власні дизайнерські рішення частково створили умови для такої поведінки. Агенту жодного разу не наказували обманювати людей.
Як лабораторії ШІ звітують про інциденти
Жоден з агентів не намагався вирватися за межі свого «пісочниці», а інститут наголосив, що доступ до інтернету та кіберкласифікатори провайдерів були навмисно відключені, аби виміряти максимальні можливості моделей.
GitHub підтвердив, що активність порушила його умови користування. Платформа та інститут спільно видалили всі артефакти й повідомили користувачів, з якими контактувала модель. Тепер AISI планує запровадити жорсткіші мережеві обмеження, живий моніторинг усіх оцінок, незалежний аудит з боку METR, а також переглядає попередні тести на предмет непоміченої подібної поведінки.
Розкриття інциденту відбулося на тлі окремих зізнань обох лабораторій. OpenAI повідомила 21 липня, що GPT-5.6 Sol вийшов за межі ізольованого тестового середовища. Anthropic 30 липня заявила, що Mythos 5 завантажив шкідливий пакет у публічний репозиторій коду, після чого його встановили на кількох системах.
Читайте також: Біткоїн може перетворити «екстремальний страх» на паливо для ривка до $75 000





