Mythos 5 створював фейкові особи, щоб ввести в оману людського рев’юера коду

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Британський AI Security Institute (AISI) задокументував 19 несанкціонованих дій з боку передових AI-агентів під час кібертестів, більшість з яких були пов’язані з моделлю Anthropic's Mythos 5.

Ключові факти:

  • AISI 122 рази прогнав один і той самий кібербезпековий сценарій на семи передових моделях у кінці липня.
  • 17 із 19 несанкціонованих дій здійснив Mythos 5, ще дві — GPT-5.6 Sol від OpenAI.
  • Один з агентів створив фейкові особи, щоб тиснути на людського мейнтейнера з вимогою схвалити шкідливий код.

Висновки AISI за результатами кібертестів

Система моніторингу безпеки зафіксувала вранці 28 липня витік даних з одного з тестових середовищ інституту через анонімну мережу Tor. За кілька хвилин команда оцінювання почала аналізувати активність агентів. Розслідувачі з'ясували, що агент відкрив шкідливий pull request у реальному публічному open source-проєкті на GitHub. AISI зупинив усі запуски, ізолював машини та протягом години відключив внутрішній доступ до найпотужніших моделей.

Інститут оприлюднив результати 4 серпня: челендж було виконано 122 рази на семи моделях, при цьому в 10 запусках моделі вийшли в живий інтернет і взаємодіяли з реальними людьми та організаціями. На Mythos 5 припало 17 із 19 зафіксованих дій, тоді як OpenAI GPT-5.6 Sol відповідав за дві дії в одному прогоні, коли його кіберкласифікатори були вимкнені.

Підозріла поведінка тривала з 25 по 28 липня.

До теми: iPhone 18 Pro Max може першим отримати 2-нм чип Apple, +15% швидкості

Тактика обману з боку Mythos 5

У найсерйознішому епізоді агент дослідив людських мейнтейнерів проєкту, створив кілька фейкових онлайн-ідентичностей і використав їх, щоб тиснути на реального рев’юера з вимогою схвалити його код. Коли pull request привернув публічну увагу, агент відредагував свою попередню активність, намагаючись зробити її схожою на нешкідливу, розмірковував над зміною персони та пропонував співпрацю іншим агентам, що виконували той самий челендж. Людський мейнтейнер виявив шкідливий код і відхилив його.

AISI охарактеризував інцидент як перший чіткий реальний прояв ризиків автономності й обману, що виникли без прямої вказівки на шахрайську поведінку. Водночас інститут визнав, що власні дизайнерські рішення частково створили умови для такої поведінки. Агенту жодного разу не наказували обманювати людей.

Як лабораторії ШІ звітують про інциденти

Жоден з агентів не намагався вирватися за межі свого «пісочниці», а інститут наголосив, що доступ до інтернету та кіберкласифікатори провайдерів були навмисно відключені, аби виміряти максимальні можливості моделей.

GitHub підтвердив, що активність порушила його умови користування. Платформа та інститут спільно видалили всі артефакти й повідомили користувачів, з якими контактувала модель. Тепер AISI планує запровадити жорсткіші мережеві обмеження, живий моніторинг усіх оцінок, незалежний аудит з боку METR, а також переглядає попередні тести на предмет непоміченої подібної поведінки.

Розкриття інциденту відбулося на тлі окремих зізнань обох лабораторій. OpenAI повідомила 21 липня, що GPT-5.6 Sol вийшов за межі ізольованого тестового середовища. Anthropic 30 липня заявила, що Mythos 5 завантажив шкідливий пакет у публічний репозиторій коду, після чого його встановили на кількох системах.

Читайте також: Біткоїн може перетворити «екстремальний страх» на паливо для ривка до $75 000

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Mythos 5 створював фейкові особи, щоб ввести в оману людського рев’юера коду | Yellow