月之暗面(Moonshot AI) 正对两款 Kimi 模型展开审查,原因是安全公司 Mindgard 的研究人员声称绕过了模型安全控制,获取了有关生物武器和暗杀的具体操作指引。
事件要点
- Mindgard 表示,Kimi K2.6 与 K3 Swarm 可通过“越狱”方式突破安全防线。
- 研究人员并未验证这些有害回答在现实中是否可操作。
- 月之暗面称正审阅相关发现,并与 Mindgard 沟通细节。
Kimi “越狱”情况
英国 BBC 报道 称,Mindgard 在今年 7 月发现,Kimi K2.6 与 K3 Swarm 可以通过“越狱”(jailbreaking)被推动越过开发者设定的安全护栏。所谓“越狱”,是利用结构化提示语对模型进行压力测试,观察其是否会无视安全规则。按理说,这些安全控制应当直接封禁相关敏感话题的讨论。
Mindgard 创始人 Peter Garraghan 向 BBC 表示,一旦越狱成功,模型几乎可以谈论任何主题,并能在未被进一步追问的情况下,主动给出更多潜在有害建议。
月之暗面对 BBC 表示,欢迎第三方输入,视其为“构建更好、更安全 AI 的关键支柱之一”,并称正在就相关发现与 Mindgard 进行沟通。Mindgard 方面表示,其已于 7 月 27 日向月之暗面发邮件通报,大约一周后再次跟进,并于 9 月 12 日公开研究结果。
延伸阅读: Ripple 助力巴西 CSD BR 在公有链上镜像基金份额登记
Mindgard 提示的安全风险
Mindgard 承认,目前尚未证明模型给出的具体“操作指令”在现实中一定有效。但该机构认为,单就模型能够生成此类回答这一事实,已经足以说明用于阻止模型回应危险请求的安全防线出现了失效。
该公司还补充称,在“越狱”状态下,Kimi K2.6 理论上可能利用自身算力资源执行代码,并连接互联网,从而演变为潜在的网络攻击跳板。
月之暗面则表示,内部测试普遍显示,模型对这类请求的拒绝率“较高”,这反映出常规安全评估与外部研究采用的对抗性测试方法之间仍存在明显差距。
英国萨里大学教授 Alan Woodward 对 BBC 指出,当开源或开放权重模型落入恶意行为者之手时,会加剧被滥用的风险,但同样的工具也能用于网络防御。
他认为,监管节奏很难赶上 AI 技术迭代,现实中更可行的路径,是将执法重心更多放在滥用系统的个人和机构身上。
对行业而言,焦虑远不止这一案例。月之暗面的 Kimi 模型属于开源权重(open-weight),用户可在自有基础设施上独立部署;与此同时,近期多起 AI 安全事件也与 OpenAI、Meta、Anthropic 的智能体(agent)系统有关。这种组合因素使研究焦点从“模型会不会拒绝”进一步扩展到“当强大系统被赋予工具、联网能力和多步自主执行权限之后,究竟会发生什么”。

