Moonshot AI 正对两款 Kimi 模型展开审查,此前 Mindgard 的研究人员声称,他们成功绕过模型安全控制,获取了有关生物武器制造和暗杀行动的操作性指引。
要点概览:
- Mindgard 表示,Kimi K2.6 与 K3 Swarm 可通过“越狱”突破安全防线。
- 研究团队并未验证模型给出的有害方案在现实中是否可行。
- Moonshot 称正评估相关结论,并与 Mindgard 保持沟通。
Kimi“越狱”细节
据 BBC 报道,Mindgard 在今年 7 月发现,通过精心设计的结构化提示(prompt),可以让 Kimi K2.6 和 K3 Swarm 脱离开发者预设的安全轨道,实现所谓“越狱”。这一过程旨在测试模型是否会在特定对抗性输入下无视安全策略。按设计,这些防护机制本应完全屏蔽此类高危话题。
Mindgard 创始人 Peter Garraghan 向 BBC 表示,一旦越狱成功,模型几乎可以就任何话题展开讨论,并可能在未被进一步追问的情况下,主动给出更多潜在有害建议。
Moonshot 在接受 BBC 采访时回应称,公司“欢迎第三方反馈,将其视为构建更好、更安全 AI 的关键支柱之一”,并确认正就相关发现与 Mindgard 进行深入讨论。Mindgard 称,其已于 7 月 27 日首次通过邮件向 Moonshot 通报情况,一周后再次跟进,并于 9 月 12 日公开研究结果。
延伸阅读:瑞波协助巴西 CSD BR 在公有链上镜像基金持仓
Mindgard 所警示的安全风险
Mindgard 承认,目前尚未证明模型给出的具体“操作指南”在现实环境中一定可行。但在其看来,仅从模型愿意提供此类帮助这一点,就足以说明现有安全机制未能有效阻断与危险请求的互动。
该公司还警告称,一旦 Kimi K2.6 被成功越狱,模型有潜力在其计算资源上执行代码并主动连接互联网,从而可能被恶意行为者用作发起网络攻击的跳板或中继点。
Moonshot 则表示,内部评估普遍显示,对这类高危请求的“拒绝率很高”,这也凸显出常规安全测试与外部研究人员运用对抗手法之间的差距。
来自萨里大学的教授 Alan Woodward 在接受 BBC 采访时指出,一旦开源或开放权重模型被不当使用,误用和滥用的风险将随之放大;不过,同样的技术工具也可被正当利用于网络防御等领域。
他认为,监管框架大概率难以跟上 AI 技术演进的速度,因此更现实的路径,是将执法与约束重点放在人——即恶意使用系统的行为者——而不是单纯针对技术本身。
开放权重与“智能体”系统的叠加担忧
更广泛的安全隐忧早在此次测试之前就已出现:Moonshot 的 Kimi 模型为开放权重(open-weight),用户可以在自有基础设施上本地部署和运行;与此同时,最近多起 AI 安全事件,也与 OpenAI、Meta 和 Anthropic 等公司推出的“智能体”(agent)系统有关。
当强大的模型既能被用户自由运行,又进一步接入工具、互联网,并被授予多步骤自动执行权限时,研究人员的关注重点,正从单一“是否拒答”问题,转向“模型在具备行动能力后,究竟能做什么、会做到什么程度”。

