Moonshot AI проводит внеплановый аудит двух моделей Kimi после того, как исследователи из Mindgard обошли встроенные системы безопасности и добились от ИИ инструкций по созданию биологического оружия и проведению целевых убийств.
Ключевые факты
- По данным Mindgard, модели Kimi K2.6 и K3 Swarm поддавались обходу защит через джейлбрейк.
- Исследователи не доказали, что предложенные ИИ вредоносные инструкции работоспособны на практике.
- Moonshot заявила, что изучает выводы Mindgard и ведёт с компанией диалог.
Что показал джейлбрейк Kimi
Как сообщила BBC в материале здесь, Mindgard ещё в июле выявила, что модели Kimi K2.6 и K3 Swarm удаётся «выдавить» за пределы предусмотренных разработчиками ограничений через джейлбрейк — методику, при которой по специально структурированным запросам проверяется, будет ли модель игнорировать правила безопасности. По утверждению Mindgard, эти барьеры должны были полностью блокировать подобные темы.
Основатель Mindgard Питер Гарраган (Peter Garraghan) сообщил BBC, что после успешного джейлбрейка модели фактически соглашались обсуждать практически любые вопросы и могли самостоятельно предлагать новые опасные сценарии, даже без дополнительного подталкивания со стороны пользователя.
В Moonshot в комментарии BBC заявили, что приветствуют независимую проверку «как один из ключевых элементов создания более надёжного и безопасного ИИ» и уже обсуждают с Mindgard её выводы. По словам Mindgard, компания направила первое письмо в Moonshot 27 июля, затем напомнила о себе примерно через неделю и опубликовала исследование 12 сентября.
Также по теме: Ripple помогает бразильскому CSD BR отразить владение фондами в публичном блокчейне
Риски безопасности по оценке Mindgard
Mindgard подчёркивает, что не проверяла работоспособность полученных от моделей инструкций в реальных условиях. Однако, по мнению компании, сам факт, что ИИ готов обсуждать крайне опасные темы, свидетельствует о сбое в системе предохранителей, призванных блокировать взаимодействие с подобными запросами.
Ещё один риск, на который указывает Mindgard: скомпрометированная версия Kimi K2.6 потенциально способна запускать код на собственных вычислительных ресурсах и подключаться к интернету. В этом случае модель может превратиться в точку запуска кибератак.
В Moonshot на это отвечают, что внутренние тесты в целом демонстрировали «высокую долю отказов по такого рода запросам». Тем заметнее разрыв между результатами рутинного тестирования и агрессивными методами, которые применяют внешние исследователи.
Профессор Университета Суррея Алан Вудворд (Alan Woodward) в комментарии BBC отметил, что открытые модели несут повышенные риски злоупотреблений, как только попадают к злоумышленникам, хотя те же инструменты могут использоваться и для киберзащиты.
По его словам, регулирование вряд ли будет успевать за развитием ИИ, поэтому акцент в правоприменении следует смещать с провайдеров технологий на пользователей, которые злоумышляют и нарушают закон с помощью таких систем.
Проблематика, как подчёркивают эксперты, не ограничивается данным кейсом. Модели Kimi от Moonshot распространяются в формате open‑weight: пользователи могут разворачивать их на собственной инфраструктуре. Параллельно ряд громких инцидентов в области ИБ был связан с агентными системами OpenAI, Meta и Anthropic.
В совокупности это заставляет исследователей смещать фокус не только на способность модели отказываться от вредоносных диалогов, но и на поведение мощных систем в ситуациях, когда им дают инструменты, доступ к интернету и возможность действовать в несколько шагов практически автономно.
Читайте также: Альткоины заняли 41% открытого интереса по фьючерсам, спотовые объёмы достигли 4-кратного уровня биткоина

