Джейлбрейк Kimi дає змогу двом моделям ШІ відповідати на запити щодо біологічної зброї

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI переглядає роботу двох моделей Kimi після того, як дослідники з Mindgard змогли обійти системи безпеки й отримати інструкції щодо створення біологічної зброї та проведення замовних убивств.

Ключові моменти:

  • За даними Mindgard, моделі Kimi K2.6 та K3 Swarm можна було «продавити» повз захисні бар’єри через джейлбрейк.
  • Дослідники не довели, що потенційно шкідливі інструкції моделей реально працюють.
  • Moonshot заявила, що вивчає результати дослідження й обговорює їх із Mindgard.

Результати джейлбрейку Kimi

BBC повідомила, що в липні Mindgard виявила: моделі Kimi K2.6 та K3 Swarm можна вивести за межі встановлених розробниками обмежень шляхом джейлбрейку — використання структурованих підказок, які перевіряють, чи «проігнорує» модель правила безпеки. На думку Mindgard, наявні механізми мали повністю блокувати обговорення подібних тем.

Засновник компанії Пітер Гарраган розповів BBC, що після успішного джейлбрейку моделі погоджувалися обговорювати практично будь-які питання й далі самостійно підказували додаткові шкідливі дії без прямого запиту з боку користувача.

У коментарі BBC Moonshot наголосила, що вітає незалежні перевірки «як ключовий елемент побудови кращого й безпечнішого ШІ» та вже обговорює результати з Mindgard. За словами Mindgard, компанія надіслала Moonshot перший звіт 27 липня, повторно звернулася приблизно за тиждень, а 12 вересня оприлюднила свої висновки.

Читайте також: Ripple допомагає бразильському CSD BR віддзеркалити право власності на фонди в публічному блокчейні

Ризики безпеки за оцінкою Mindgard

Mindgard не встановила, що згенеровані відповіді гарантовано працюють у реальності, однак компанія стверджує: сам факт отримання таких інструкцій свідчить про збій систем захисту, які мають запобігати взаємодії ШІ з небезпечними запитами.

Окремо компанія зазначила, що зламана версія Kimi K2.6 потенційно може виконувати код на власних обчислювальних ресурсах і виходити в інтернет, фактично стаючи можливою точкою запуску кібернападу.

У Moonshot відповіли, що внутрішні тести зазвичай демонстрували «високий рівень відмов на подібні запити», що виявляє розрив між стандартним тестуванням і навмисно ворожим підходом, який застосовують зовнішні дослідники.

Професор Університету Суррея Алан Вудворд в коментарі BBC зауважив: відкриті моделі створюють ризики зловживань, коли потрапляють до зловмисників, хоча ті самі інструменти можуть використовуватися і для кіберзахисту.

На його думку, регулювання навряд чи встигатиме за темпами розвитку ШІ, тому акцент у правозастосуванні слід зміщувати в бік переслідування саме користувачів, які зловживають такими системами.

Ширший контекст проблеми виходить за межі цього окремого тесту. Моделі Kimi від Moonshot — з відкритими вагами, тож користувачі можуть запускати їх на власній інфраструктурі. Паралельно нещодавні інциденти з безпекою в ШІ зачіпали й агентні системи від OpenAI, Meta та Anthropic. У сукупності це підштовхує дослідників зосереджуватися не лише на тому, як часто модель відмовляє у відповіді, а й на тому, що відбувається, коли потужним системам надають інструменти, доступ до інтернету й дозвіл діяти в кілька кроків.

Читайте далі: Альткоїни посіли 41% відкритого інтересу у ф’ючерсах, спотові обсяги у 4 рази перевищили біткоїн

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптоіндустрію вже понад 10 років. Він спеціалізується на глибоких матеріалах формату Research та Learn, з акцентом на аналітичну подачу, галузевий контекст і глобальні сили, що формують крипторинок — від епохи ШІ та технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове невдовзі остаточно переважить усе аналогове, і наполегливо працює над тим, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини