Moonshot AI 正對旗下兩款 Kimi 模型啟動審查,起因是安全公司 Mindgard 的研究團隊成功繞過安全控制,讓模型回應涉及生物武器與暗殺的敏感問題。
重點整理:
- Mindgard 指出,Kimi K2.6 與 K3 Swarm 透過「越獄」(jailbreak)可被推過原本設下的安全防線。
- 研究人員並未驗證這些危險回應在現實中是否真能奏效。
- Moonshot 表示已著手檢視相關研究結果,並與 Mindgard 進行溝通。
Kimi 越獄測試結果
根據 BBC 的報導,Mindgard 在 7 月發現,Kimi K2.6 與 K3 Swarm 可透過精心設計的結構化提示語進行「越獄」,繞過開發者設下的防護欄位,測試模型是否會無視安全規則。Mindgard 指出,按設計這些把關機制應該要阻擋模型回應上述高度敏感主題。
Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦越獄成功,這些模型就幾乎可以談論任何主題,甚至在未被進一步追問的情況下,自行提出更多具危害性的建議。
Moonshot 受訪時回應,歡迎第三方的意見與測試,視其為「打造更好、更安全 AI 的關鍵支柱」,並表示已就相關發現與 Mindgard 展開討論。Mindgard 則稱已於 7 月 27 日透過電子郵件通知 Moonshot,大約一週後再度追蹤,並在 9 月 12 日公開研究結果。
延伸閱讀:Ripple 協助巴西 CSD BR 在公鏈上鏡射基金持有人結構
Mindgard 指出的安全風險
Mindgard 強調,目前尚未證明這些危險回應在實務上一定能被直接利用,但單就 AI 願意提供相關資訊這件事本身,就已顯示防護設計未能有效阻止系統回應高風險請求。該公司並指出,被越獄的 Kimi K2.6 理論上可能在其運算資源上執行程式碼並連上網路,形同潛在的網路攻擊跳板。
Moonshot 則表示,內部常規評估的結果,一般顯示模型對此類請求有「高度拒絕率」,此次事件凸顯日常測試與外部研究人員採用敵對式測試手法之間,存在明顯落差。
英國薩里大學(University of Surrey)教授 Alan Woodward 向 BBC 指出,當開源模型落入惡意使用者手中時,確實會帶來濫用風險,但相同工具也能被用來強化網路防禦。
他認為,監管速度難以追上 AI 的發展,因此執法與規範重點應更聚焦於「如何處罰與約束濫用系統的人」。
更大的隱憂其實早已浮現:Moonshot 的 Kimi 模型採開放權重(open-weight)形式,使用者得以在自家基礎設施上自行部署;近來數起 AI 安全事件,也陸續牽涉 OpenAI、Meta 與 Anthropic 的智能代理(agent)系統。這些因素疊加,促使研究社群不再只關注「模型會不會拒絕回答」,而是進一步關切:當強大模型被賦予各式工具、網路連線能力與多步驟自動執行權限後,實際會做出什麼行為。

