Джейлбрейк Kimi от Moonshot позволил двум ИИ‑моделям отвечать на запросы о биологическом оружии

Alexey Bondarev
Alexey Bondarev45 минут назад
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI проводит внеплановый аудит двух моделей Kimi после того, как исследователи из Mindgard обошли встроенные системы безопасности и добились от ИИ инструкций по созданию биологического оружия и проведению целевых убийств.

Ключевые факты

  • По данным Mindgard, модели Kimi K2.6 и K3 Swarm поддавались обходу защит через джейлбрейк.
  • Исследователи не доказали, что предложенные ИИ вредоносные инструкции работоспособны на практике.
  • Moonshot заявила, что изучает выводы Mindgard и ведёт с компанией диалог.

Что показал джейлбрейк Kimi

Как сообщила BBC в материале здесь, Mindgard ещё в июле выявила, что модели Kimi K2.6 и K3 Swarm удаётся «выдавить» за пределы предусмотренных разработчиками ограничений через джейлбрейк — методику, при которой по специально структурированным запросам проверяется, будет ли модель игнорировать правила безопасности. По утверждению Mindgard, эти барьеры должны были полностью блокировать подобные темы.

Основатель Mindgard Питер Гарраган (Peter Garraghan) сообщил BBC, что после успешного джейлбрейка модели фактически соглашались обсуждать практически любые вопросы и могли самостоятельно предлагать новые опасные сценарии, даже без дополнительного подталкивания со стороны пользователя.

В Moonshot в комментарии BBC заявили, что приветствуют независимую проверку «как один из ключевых элементов создания более надёжного и безопасного ИИ» и уже обсуждают с Mindgard её выводы. По словам Mindgard, компания направила первое письмо в Moonshot 27 июля, затем напомнила о себе примерно через неделю и опубликовала исследование 12 сентября.

Также по теме: Ripple помогает бразильскому CSD BR отразить владение фондами в публичном блокчейне

Риски безопасности по оценке Mindgard

Mindgard подчёркивает, что не проверяла работоспособность полученных от моделей инструкций в реальных условиях. Однако, по мнению компании, сам факт, что ИИ готов обсуждать крайне опасные темы, свидетельствует о сбое в системе предохранителей, призванных блокировать взаимодействие с подобными запросами.

Ещё один риск, на который указывает Mindgard: скомпрометированная версия Kimi K2.6 потенциально способна запускать код на собственных вычислительных ресурсах и подключаться к интернету. В этом случае модель может превратиться в точку запуска кибератак.

В Moonshot на это отвечают, что внутренние тесты в целом демонстрировали «высокую долю отказов по такого рода запросам». Тем заметнее разрыв между результатами рутинного тестирования и агрессивными методами, которые применяют внешние исследователи.

Профессор Университета Суррея Алан Вудворд (Alan Woodward) в комментарии BBC отметил, что открытые модели несут повышенные риски злоупотреблений, как только попадают к злоумышленникам, хотя те же инструменты могут использоваться и для киберзащиты.

По его словам, регулирование вряд ли будет успевать за развитием ИИ, поэтому акцент в правоприменении следует смещать с провайдеров технологий на пользователей, которые злоумышляют и нарушают закон с помощью таких систем.

Проблематика, как подчёркивают эксперты, не ограничивается данным кейсом. Модели Kimi от Moonshot распространяются в формате open‑weight: пользователи могут разворачивать их на собственной инфраструктуре. Параллельно ряд громких инцидентов в области ИБ был связан с агентными системами OpenAI, Meta и Anthropic.

В совокупности это заставляет исследователей смещать фокус не только на способность модели отказываться от вредоносных диалогов, но и на поведение мощных систем в ситуациях, когда им дают инструменты, доступ к интернету и возможность действовать в несколько шагов практически автономно.

Читайте также: Альткоины заняли 41% открытого интереса по фьючерсам, спотовые объёмы достигли 4-кратного уровня биткоина

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий криптоиндустрию последние 10 лет. Он специализируется на глубоких материалах формата Research и Learn, уделяя особое внимание аналитическим репортажам, отраслевому контексту и крупным факторам, формирующим крипторынок — от эры ИИ и технологий безопасности до финтех‑инноваций. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и активно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Джейлбрейк Kimi от Moonshot позволил двум ИИ‑моделям отвечать на запросы о биологическом оружии | Yellow