月之暗面 Kimi 被“越狱”:两款大模型被曝可回应生物武器等敏感问询

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

月之暗面(Moonshot AI) 正对两款 Kimi 模型展开审查,原因是安全公司 Mindgard 的研究人员声称绕过了模型安全控制,获取了有关生物武器和暗杀的具体操作指引。

事件要点

  • Mindgard 表示,Kimi K2.6 与 K3 Swarm 可通过“越狱”方式突破安全防线。
  • 研究人员并未验证这些有害回答在现实中是否可操作。
  • 月之暗面称正审阅相关发现,并与 Mindgard 沟通细节。

Kimi “越狱”情况

英国 BBC 报道 称,Mindgard 在今年 7 月发现,Kimi K2.6 与 K3 Swarm 可以通过“越狱”(jailbreaking)被推动越过开发者设定的安全护栏。所谓“越狱”,是利用结构化提示语对模型进行压力测试,观察其是否会无视安全规则。按理说,这些安全控制应当直接封禁相关敏感话题的讨论。

Mindgard 创始人 Peter Garraghan 向 BBC 表示,一旦越狱成功,模型几乎可以谈论任何主题,并能在未被进一步追问的情况下,主动给出更多潜在有害建议。

月之暗面对 BBC 表示,欢迎第三方输入,视其为“构建更好、更安全 AI 的关键支柱之一”,并称正在就相关发现与 Mindgard 进行沟通。Mindgard 方面表示,其已于 7 月 27 日向月之暗面发邮件通报,大约一周后再次跟进,并于 9 月 12 日公开研究结果。

延伸阅读: Ripple 助力巴西 CSD BR 在公有链上镜像基金份额登记

Mindgard 提示的安全风险

Mindgard 承认,目前尚未证明模型给出的具体“操作指令”在现实中一定有效。但该机构认为,单就模型能够生成此类回答这一事实,已经足以说明用于阻止模型回应危险请求的安全防线出现了失效。

该公司还补充称,在“越狱”状态下,Kimi K2.6 理论上可能利用自身算力资源执行代码,并连接互联网,从而演变为潜在的网络攻击跳板。

月之暗面则表示,内部测试普遍显示,模型对这类请求的拒绝率“较高”,这反映出常规安全评估与外部研究采用的对抗性测试方法之间仍存在明显差距。

英国萨里大学教授 Alan Woodward 对 BBC 指出,当开源或开放权重模型落入恶意行为者之手时,会加剧被滥用的风险,但同样的工具也能用于网络防御。

他认为,监管节奏很难赶上 AI 技术迭代,现实中更可行的路径,是将执法重心更多放在滥用系统的个人和机构身上。

对行业而言,焦虑远不止这一案例。月之暗面的 Kimi 模型属于开源权重(open-weight),用户可在自有基础设施上独立部署;与此同时,近期多起 AI 安全事件也与 OpenAI、Meta、Anthropic 的智能体(agent)系统有关。这种组合因素使研究焦点从“模型会不会拒绝”进一步扩展到“当强大系统被赋予工具、联网能力和多步自主执行权限之后,究竟会发生什么”。

下篇阅读: 山寨币占据 41% 合约未平仓量,现货成交量飙至比特币 4 倍

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 专注于撰写深度的研究与学习类文章,侧重分析性报道、行业背景,以及从人工智能时代、安全技术到金融科技创新等塑造加密行业发展的宏观力量。他坚信,一切数字化事物即将全面超越一切模拟事物,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
月之暗面 Kimi 被“越狱”:两款大模型被曝可回应生物武器等敏感问询 | Yellow