Moonshot AI переглядає роботу двох моделей Kimi після того, як дослідники з Mindgard змогли обійти системи безпеки й отримати інструкції щодо створення біологічної зброї та проведення замовних убивств.
Ключові моменти:
- За даними Mindgard, моделі Kimi K2.6 та K3 Swarm можна було «продавити» повз захисні бар’єри через джейлбрейк.
- Дослідники не довели, що потенційно шкідливі інструкції моделей реально працюють.
- Moonshot заявила, що вивчає результати дослідження й обговорює їх із Mindgard.
Результати джейлбрейку Kimi
BBC повідомила, що в липні Mindgard виявила: моделі Kimi K2.6 та K3 Swarm можна вивести за межі встановлених розробниками обмежень шляхом джейлбрейку — використання структурованих підказок, які перевіряють, чи «проігнорує» модель правила безпеки. На думку Mindgard, наявні механізми мали повністю блокувати обговорення подібних тем.
Засновник компанії Пітер Гарраган розповів BBC, що після успішного джейлбрейку моделі погоджувалися обговорювати практично будь-які питання й далі самостійно підказували додаткові шкідливі дії без прямого запиту з боку користувача.
У коментарі BBC Moonshot наголосила, що вітає незалежні перевірки «як ключовий елемент побудови кращого й безпечнішого ШІ» та вже обговорює результати з Mindgard. За словами Mindgard, компанія надіслала Moonshot перший звіт 27 липня, повторно звернулася приблизно за тиждень, а 12 вересня оприлюднила свої висновки.
Читайте також: Ripple допомагає бразильському CSD BR віддзеркалити право власності на фонди в публічному блокчейні
Ризики безпеки за оцінкою Mindgard
Mindgard не встановила, що згенеровані відповіді гарантовано працюють у реальності, однак компанія стверджує: сам факт отримання таких інструкцій свідчить про збій систем захисту, які мають запобігати взаємодії ШІ з небезпечними запитами.
Окремо компанія зазначила, що зламана версія Kimi K2.6 потенційно може виконувати код на власних обчислювальних ресурсах і виходити в інтернет, фактично стаючи можливою точкою запуску кібернападу.
У Moonshot відповіли, що внутрішні тести зазвичай демонстрували «високий рівень відмов на подібні запити», що виявляє розрив між стандартним тестуванням і навмисно ворожим підходом, який застосовують зовнішні дослідники.
Професор Університету Суррея Алан Вудворд в коментарі BBC зауважив: відкриті моделі створюють ризики зловживань, коли потрапляють до зловмисників, хоча ті самі інструменти можуть використовуватися і для кіберзахисту.
На його думку, регулювання навряд чи встигатиме за темпами розвитку ШІ, тому акцент у правозастосуванні слід зміщувати в бік переслідування саме користувачів, які зловживають такими системами.
Ширший контекст проблеми виходить за межі цього окремого тесту. Моделі Kimi від Moonshot — з відкритими вагами, тож користувачі можуть запускати їх на власній інфраструктурі. Паралельно нещодавні інциденти з безпекою в ШІ зачіпали й агентні системи від OpenAI, Meta та Anthropic. У сукупності це підштовхує дослідників зосереджуватися не лише на тому, як часто модель відмовляє у відповіді, а й на тому, що відбувається, коли потужним системам надають інструменти, доступ до інтернету й дозвіл діяти в кілька кроків.
Читайте далі: Альткоїни посіли 41% відкритого інтересу у ф’ючерсах, спотові обсяги у 4 рази перевищили біткоїн

