Взлом Kimi от Moonshot: две модели ИИ обошли запреты и отвечали на запросы о биологическом оружии

Alexey Bondarev
Alexey Bondarev11 часов назад
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI проводит проверку двух моделей Kimi после того, как исследователи из Mindgard обошли их защиту и получили от них инструкции по созданию биологического оружия и совершению целенаправленных убийств.

Ключевые моменты

  • По данным Mindgard, модели Kimi K2.6 и K3 Swarm удалось «продавить» через джейлбрейк, преодолев установленные ограничения.
  • Исследователи не доказали, что вредоносные инструкции реально работоспособны в практическом применении.
  • В Moonshot заявили, что изучают выводы Mindgard и находятся с компанией в диалоге.

Как взломали Kimi

BBC сообщила, что Mindgard в июле обнаружила уязвимость: модели Kimi K2.6 и K3 Swarm можно было вывести за рамки разработческих ограничений через джейлбрейк — использование специально структурированных запросов, проверяющих, станет ли модель игнорировать правила безопасности. По словам Mindgard, встроенные барьеры должны были полностью блокировать обсуждение таких тем.

Основатель Mindgard Питер Гаррагэн (Peter Garraghan) рассказал BBC, что после успешного джейлбрейка модели фактически были готовы обсуждать практически любые темы и могли сами предлагать дополнительные вредоносные сценарии, даже без прямых уточняющих запросов.

В Moonshot в комментарии для BBC заявили, что приветствуют внешний аудит «как ключевой элемент создания более надежного и безопасного ИИ» и уже обсудили с Mindgard представленные материалы. В Mindgard отметили, что направили первый отчет Moonshot 27 июля, примерно через неделю сделали повторный запрос, а свои результаты публично обнародовали 12 сентября.

Читайте также: Ripple помогает бразильскому CSD BR отразить владение фондами в публичном блокчейне

Риски безопасности по версии Mindgard

В Mindgard подчеркивают, что их эксперименты не доказывают практическую применимость полученных от моделей инструкций. Однако сам факт готовности систем переходить к обсуждению таких запросов, по мнению компании, свидетельствует о сбое механизмов безопасности, которые должны предотвращать взаимодействие с опасным контентом.

Исследователи также заявили, что взломанная версия Kimi K2.6 теоретически могла выполнять код на собственных вычислительных ресурсах и выходить в интернет. Это, по их оценке, создает потенциальную точку запуска кибератак, если модель окажется под контролем злоумышленников.

В Moonshot в ответ указали, что внутренние тесты в целом показывали «высокий уровень отказов по такого рода запросам», и признали разрыв между результатами рутинного тестирования и тем, чего добиваются внешние исследователи с использованием более агрессивных «противоборственных» методик.

Профессор Алан Вудворд (Alan Woodward) из Университета Суррея заявил BBC, что открытые модели несут существенные риски, если попадают в руки злоумышленников. В то же время те же инструменты могут использоваться и в интересах киберзащиты, подчеркнул он.

По мнению Вудворда, регулирование вряд ли будет успевать за темпами развития искусственного интеллекта, поэтому акцент правоприменения стоит смещать в сторону ответственности пользователей, намеренно применяющих системы ИИ во вред.

Открытые веса и растущие угрозы

Обсуждаемые риски выходят за рамки отдельного эксперимента Mindgard. Модели Kimi распространяются в формате open‑weight: пользователи могут запускать их на собственной инфраструктуре, без контроля со стороны разработчика. Одновременно недавние инциденты безопасности в сфере ИИ затронули и агентные системы от OpenAI, Meta и Anthropic.

Такое сочетание факторов подталкивает исследователей к смещению фокуса: сегодня внимание уделяется не только тому, насколько часто модели отказываются отвечать на недопустимые запросы, но и тому, что происходит, когда мощным системам предоставляют доступ к инструментам, интернету и разрешают выполнять сложные цепочки действий.

Читайте далее: Альткоины заняли 41% открытого интереса по фьючерсам, спот‑объемы в 4 раза превысили биткоин

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев специализируется на глубоких материалах формата Research и Learn с акцентом на аналитическую отчётность, отраслевой контекст и масштабные силы, формирующие криптоиндустрию — от эры ИИ и технологий безопасности до финтех‑инноваций. Он убеждён, что всё цифровое в скором времени превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.