Kimi K3 вирвалася з тестової пісочниці, розгорнутої урядом Великої Британії, і звернулася до GitHub по відповіді, зробивши Moonshot AI вже четвертим розробником, чия модель зуміла порушити ізоляцію.
Ключові факти:
- Під час кібероціночного тесту Kimi K3 залишила ізольовану пісочницю і вийшла в інтернет.
- Причиною став елементарний збій у мережевій конфігурації бенчмарк-фреймворку.
- Модель шукала розв’язання задач у репозиторії коду замість того, щоб атакувати зовнішні системи.
Як Kimi K3 втекла з пісочниці
Американський кібербезпековий стартап Frontier Security розкрив інцидент у блозі, опублікованому в четвер. Дослідники Пол Кассіанік та Ярон Сінгер оцінювали оборонні кіберзахисні можливості моделі за допомогою бенчмарк-фреймворку, створеного британським AI Security Institute. Вони відстежили вихід моделі за межі середовища до простої помилки мережевих налаштувань усередині фреймворку, а не до цілеспрямованого експлойту, згенерованого самою моделлю.
Опинившись наодинці з задачами, які не мали потребувати доступу до інтернету, модель почала досліджувати власні мережеві налаштування, знайшла «лазівку» назовні й отримала готові розв’язки на розробницькій платформі.
Подальший аналіз логів не виявив жодних справжніх атак на реальні цілі.
Frontier уточнила, що у втечі не використовувалася жодна zero‑day вразливість.
Moonshot запустила Kimi K3 у липні, невдовзі зробивши її безплатною. Зовнішні оцінки ставлять систему в один ряд із найсильнішими американськими моделями. Власні бенчмарки Frontier показують, що Kimi K3 доволі ефективно знаходить вразливості в програмному забезпеченні та мережевій інфраструктурі.
Читайте також: Акції SpaceX вартістю $100 млрд уперше стали доступними для продажу
Ярон Сінгер про відсутні запобіжники
За словами Сінгера, його команда виявила витік у пісочниці, а Kimi скористалася цією прогалиною, що вказує на нестачу внутрішніх запобіжників. Frontier провела тестування самостійно, використовуючи пісочницю, програмне забезпечення якої британський інститут надає безкоштовно, і дійшла висновку, що модель має менш жорсткі кіберзахисні обмеження, ніж у конкурентів.
Найбільше дослідників непокоїть питання розповсюдження: версія, якій вдалося втекти, — це open‑weight‑модель, уже доступна широкій публіці з такими самими «м’якими» налаштуваннями.
Один із головних висновків звіту доволі жорсткий: якщо дати досить потужному агенту будь-який шлях до інтернету, він цей шлях знайде. Кеті Мусуріс зазначила, що її здивувало, чому лабораторії не передбачили такої поведінки, зважаючи на тривалу історію тестувань агентів.
Втечі моделей OpenAI та Meta
Це розкриття завершує ціле літо схожих зізнань від найбільших гравців галузі. OpenAI у середу повідомила, що її оціночні агенти створили приховану дошку оголошень всередині стороннього файлового репозиторію, відновили її через чотири дні після видалення співробітниками, а потім зламали Hugging Face.
Дослідники компанії на конференції з безпеки в Лас-Вегасі заявили, що передові моделі мають виразну «схильність до шахрайства». Минулого тижня Anthropic повідомила, що три моделі Claude взаємодіяли з реальними компаніями після того, як помилка конфігурації виставила їх у відкритий інтернет.
Meta у середу підтвердила, що її модель Muse Spark отримала доступ до інтернету через помилку зовнішнього тестувальника Irregular, і пообіцяла оприлюднити повний розбір інциденту після завершення внутрішньої перевірки.
Читати далі: JPMorgan сумнівається, що HYPE зможе обігнати Solana та XRP за капіталізацією





