Moonshot AI проводит проверку двух моделей Kimi после того, как исследователи из Mindgard обошли их защиту и получили от них инструкции по созданию биологического оружия и совершению целенаправленных убийств.
Ключевые моменты
- По данным Mindgard, модели Kimi K2.6 и K3 Swarm удалось «продавить» через джейлбрейк, преодолев установленные ограничения.
- Исследователи не доказали, что вредоносные инструкции реально работоспособны в практическом применении.
- В Moonshot заявили, что изучают выводы Mindgard и находятся с компанией в диалоге.
Как взломали Kimi
BBC сообщила, что Mindgard в июле обнаружила уязвимость: модели Kimi K2.6 и K3 Swarm можно было вывести за рамки разработческих ограничений через джейлбрейк — использование специально структурированных запросов, проверяющих, станет ли модель игнорировать правила безопасности. По словам Mindgard, встроенные барьеры должны были полностью блокировать обсуждение таких тем.
Основатель Mindgard Питер Гаррагэн (Peter Garraghan) рассказал BBC, что после успешного джейлбрейка модели фактически были готовы обсуждать практически любые темы и могли сами предлагать дополнительные вредоносные сценарии, даже без прямых уточняющих запросов.
В Moonshot в комментарии для BBC заявили, что приветствуют внешний аудит «как ключевой элемент создания более надежного и безопасного ИИ» и уже обсудили с Mindgard представленные материалы. В Mindgard отметили, что направили первый отчет Moonshot 27 июля, примерно через неделю сделали повторный запрос, а свои результаты публично обнародовали 12 сентября.
Читайте также: Ripple помогает бразильскому CSD BR отразить владение фондами в публичном блокчейне
Риски безопасности по версии Mindgard
В Mindgard подчеркивают, что их эксперименты не доказывают практическую применимость полученных от моделей инструкций. Однако сам факт готовности систем переходить к обсуждению таких запросов, по мнению компании, свидетельствует о сбое механизмов безопасности, которые должны предотвращать взаимодействие с опасным контентом.
Исследователи также заявили, что взломанная версия Kimi K2.6 теоретически могла выполнять код на собственных вычислительных ресурсах и выходить в интернет. Это, по их оценке, создает потенциальную точку запуска кибератак, если модель окажется под контролем злоумышленников.
В Moonshot в ответ указали, что внутренние тесты в целом показывали «высокий уровень отказов по такого рода запросам», и признали разрыв между результатами рутинного тестирования и тем, чего добиваются внешние исследователи с использованием более агрессивных «противоборственных» методик.
Профессор Алан Вудворд (Alan Woodward) из Университета Суррея заявил BBC, что открытые модели несут существенные риски, если попадают в руки злоумышленников. В то же время те же инструменты могут использоваться и в интересах киберзащиты, подчеркнул он.
По мнению Вудворда, регулирование вряд ли будет успевать за темпами развития искусственного интеллекта, поэтому акцент правоприменения стоит смещать в сторону ответственности пользователей, намеренно применяющих системы ИИ во вред.
Открытые веса и растущие угрозы
Обсуждаемые риски выходят за рамки отдельного эксперимента Mindgard. Модели Kimi распространяются в формате open‑weight: пользователи могут запускать их на собственной инфраструктуре, без контроля со стороны разработчика. Одновременно недавние инциденты безопасности в сфере ИИ затронули и агентные системы от OpenAI, Meta и Anthropic.
Такое сочетание факторов подталкивает исследователей к смещению фокуса: сегодня внимание уделяется не только тому, насколько часто модели отказываются отвечать на недопустимые запросы, но и тому, что происходит, когда мощным системам предоставляют доступ к инструментам, интернету и разрешают выполнять сложные цепочки действий.
Читайте далее: Альткоины заняли 41% открытого интереса по фьючерсам, спот‑объемы в 4 раза превысили биткоин

