Moonshot AI переглядає дві моделі Kimi після того, як дослідники з Mindgard обійшли вбудовані системи безпеки й отримали від моделей інструкції щодо створення біологічної зброї та вбивств.
Основні факти:
- Mindgard заявляє, що Kimi K2.6 та K3 Swarm можна було проштовхнути за межі захисних обмежень через джейлбрейк.
- Дослідники не довели, що шкідливі відповіді моделей реально працюють на практиці.
- Moonshot стверджує, що вивчає результати дослідження та обговорює їх із Mindgard.
Висновки щодо джейлбрейку Kimi
BBC повідомила, що в липні Mindgard виявила можливість обійти розробницькі обмеження в Kimi K2.6 та K3 Swarm за допомогою джейлбрейку — техніки, яка використовує спеціально структуровані запити, аби перевірити, чи проігнорує модель правила безпеки. На думку Mindgard, ці запобіжники мали повністю блокувати обговорення настільки небезпечних тем.
Засновник Пітер Гарраган розповів BBC, що після успішного джейлбрейку моделі були готові обговорювати майже будь-яку тему й могли продовжувати видавати шкідливі пропозиції навіть без додаткових підштовхувань з боку користувача.
У коментарі для BBC Moonshot наголосила, що вітає незалежні перевірки “як ключовий елемент побудови кращого й безпечнішого ШІ” та підтвердила, що обговорює результати з Mindgard. За словами Mindgard, компанія надіслала перший звіт Moonshot 27 липня, нагадала про нього приблизно за тиждень і опублікувала свої висновки 12 вересня.
Також читайте: Ripple допомагає бразильському депозитарію CSD BR віддзеркалити володіння фондами в публічному блокчейні
Ризики безпеки за оцінкою Mindgard
У Mindgard визнають, що не довели практичну дієвість отриманих інструкцій, однак вважають сам факт можливості таких відповідей свідченням провалу систем безпеки, покликаних блокувати взаємодію з небезпечними запитами. Компанія також заявила, що зламана версія Kimi K2.6 теоретично могла б виконувати код на власних обчислювальних ресурсах і виходити в інтернет, перетворюючись на потенціальну точку запуску кібератаки.
У Moonshot відповіли, що внутрішні тести зазвичай фіксували “високий рівень відмови для такого типу запитів”, що вказує на розрив між рутинними перевірками й навмисно ворожим підходом зовнішніх дослідників.
Професор Університету Суррея Алан Вудвард у коментарі BBC зазначив, що відкриті моделі створюють ризики зловживань, коли потрапляють до рук зловмисників, хоча ті самі інструменти можуть бути корисні й для кіберзахисту.
Він також наголосив, що регулювання навряд чи встигатиме за темпами розвитку ШІ, тож акцент правозастосування варто зміщувати на переслідування тих, хто зловживає такими системами.
Ширший контекст виходить за межі цього окремого кейсу: моделі Kimi від Moonshot мають відкриті ваги, тож користувачі можуть розгортати їх на власній інфраструктурі. Паралельно останні інциденти безпеки в сфері ШІ стосувалися також агентних систем від OpenAI, Meta та Anthropic. У сукупності це зміщує фокус дослідників не лише на відмови моделей, а й на те, що відбувається, коли потужні системи отримують інструменти, доступ до інтернету та можливість діяти у кілька кроків.
Читайте далі: Альткоїни отримали 41% відкритих позицій у ф’ючерсах, спотові обсяги вчетверо перевищили Bitcoin

