Джейлбрейк Kimi дозволив двом моделям ШІ відповідати на запити про біологічну зброю

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI переглядає дві моделі Kimi після того, як дослідники з Mindgard обійшли вбудовані системи безпеки й отримали від моделей інструкції щодо створення біологічної зброї та вбивств.

Основні факти:

  • Mindgard заявляє, що Kimi K2.6 та K3 Swarm можна було проштовхнути за межі захисних обмежень через джейлбрейк.
  • Дослідники не довели, що шкідливі відповіді моделей реально працюють на практиці.
  • Moonshot стверджує, що вивчає результати дослідження та обговорює їх із Mindgard.

Висновки щодо джейлбрейку Kimi

BBC повідомила, що в липні Mindgard виявила можливість обійти розробницькі обмеження в Kimi K2.6 та K3 Swarm за допомогою джейлбрейку — техніки, яка використовує спеціально структуровані запити, аби перевірити, чи проігнорує модель правила безпеки. На думку Mindgard, ці запобіжники мали повністю блокувати обговорення настільки небезпечних тем.

Засновник Пітер Гарраган розповів BBC, що після успішного джейлбрейку моделі були готові обговорювати майже будь-яку тему й могли продовжувати видавати шкідливі пропозиції навіть без додаткових підштовхувань з боку користувача.

У коментарі для BBC Moonshot наголосила, що вітає незалежні перевірки “як ключовий елемент побудови кращого й безпечнішого ШІ” та підтвердила, що обговорює результати з Mindgard. За словами Mindgard, компанія надіслала перший звіт Moonshot 27 липня, нагадала про нього приблизно за тиждень і опублікувала свої висновки 12 вересня.

Також читайте: Ripple допомагає бразильському депозитарію CSD BR віддзеркалити володіння фондами в публічному блокчейні

Ризики безпеки за оцінкою Mindgard

У Mindgard визнають, що не довели практичну дієвість отриманих інструкцій, однак вважають сам факт можливості таких відповідей свідченням провалу систем безпеки, покликаних блокувати взаємодію з небезпечними запитами. Компанія також заявила, що зламана версія Kimi K2.6 теоретично могла б виконувати код на власних обчислювальних ресурсах і виходити в інтернет, перетворюючись на потенціальну точку запуску кібератаки.

У Moonshot відповіли, що внутрішні тести зазвичай фіксували “високий рівень відмови для такого типу запитів”, що вказує на розрив між рутинними перевірками й навмисно ворожим підходом зовнішніх дослідників.

Професор Університету Суррея Алан Вудвард у коментарі BBC зазначив, що відкриті моделі створюють ризики зловживань, коли потрапляють до рук зловмисників, хоча ті самі інструменти можуть бути корисні й для кіберзахисту.

Він також наголосив, що регулювання навряд чи встигатиме за темпами розвитку ШІ, тож акцент правозастосування варто зміщувати на переслідування тих, хто зловживає такими системами.

Ширший контекст виходить за межі цього окремого кейсу: моделі Kimi від Moonshot мають відкриті ваги, тож користувачі можуть розгортати їх на власній інфраструктурі. Паралельно останні інциденти безпеки в сфері ШІ стосувалися також агентних систем від OpenAI, Meta та Anthropic. У сукупності це зміщує фокус дослідників не лише на відмови моделей, а й на те, що відбувається, коли потужні системи отримують інструменти, доступ до інтернету та можливість діяти у кілька кроків.

Читайте далі: Альткоїни отримали 41% відкритих позицій у ф’ючерсах, спотові обсяги вчетверо перевищили Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв спеціалізується на глибоких дослідженнях і аналітичних матеріалах, зосереджених на аналітичній звітності, галузевому контексті та ключових силах, що формують крипторинок — від епохи ШІ та технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.