Moonshot AI 旗下兩個 Kimi 模型,被網絡安全公司 Mindgard 指出可被「越獄」,繞過原有安全限制,輸出與生化武器及暗殺有關的內容。事件曝光後,Moonshot 已啟動審查,並與對方跟進細節。
重點一覽
- Mindgard 指出,Kimi K2.6 及 K3 Swarm 在特定「越獄」提示下,可突破安全護欄。
- 研究團隊並無實證模型輸出的有害指引,在現實世界必然可行。
- Moonshot 表示正審視相關發現,並與 Mindgard 保持溝通。
Kimi「越獄」測試結果
根據 BBC 報道,Mindgard 於 7 月發現,只要以精心設計的「越獄」提示,便可令 Kimi K2.6 與 K3 Swarm 跨過開發者設下的防線。這類「越獄」測試,透過結構化指令,刻意嘗試令模型忽視安全規則。按設計,這些防護應該阻止模型討論上述敏感及高風險題目。
Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦「越獄」成功,模型幾乎可以談論任何題材,甚至會在未被進一步追問下,自行延伸提供更多具潛在危害性的建議。
Moonshot 回應 BBC 指,公司歡迎第三方測試和意見,視之為「打造更好、更安全 AI 的關鍵支柱」,並已就有關發現與 Mindgard 討論。Mindgard 表示,已於 7 月 27 日先向 Moonshot 發電郵通報,約一星期後再作跟進,並於 9 月 12 日公開研究報告。
延伸閱讀: Ripple 協助巴西 CSD BR 於公鏈鏡像基金持有人結構
Mindgard 指出的安全風險
Mindgard 坦言,暫未能證明模型輸出的具體指引,在現實操作中必然奏效。不過,該公司強調,單是模型願意就相關高風險主題作出回應,已反映原本用作防止模型回應危險要求的安全機制存在缺口。
研究團隊又指出,被「越獄」的 Kimi K2.6 理論上有機會在自身資源上執行程式碼,並接入互聯網,從而被濫用為發動網絡攻擊的跳板。
Moonshot 則表示,內部例行評估顯示,模型對此類請求的拒絕率一向偏高,今次事件卻凸顯日常測試方法,與外部研究人員採用的「對抗性測試」之間,存在明顯落差。
**薩里大學(University of Surrey)**教授 Alan Woodward 對 BBC 表示,當開源或開放權重模型落入惡意用家手中時,確實會帶來濫用風險;但同樣的工具,亦可以用於強化網絡防禦。
他認為,傳統監管步伐難以追上 AI 技術演進,未來執法重點應更聚焦於追究濫用系統的人,而非單純限制技術本身。
放大來看,今次並非單一個案。Moonshot 的 Kimi 模型屬開放權重(open-weight),用戶可以在自家基建上部署;同一時間,近月多宗 AI 安全事故,亦涉及 OpenAI、Meta 及 Anthropic 的代理(agent)系統。多重因素疊加之下,研究界開始不只關注模型會否拒答,亦更留意當強大系統被賦予工具、網絡連接及多步行動授權時,實際會造成甚麼後果。

