Moonshot AI 正對旗下兩款 Kimi 模型啟動內部審查,此前 Mindgard 研究人員成功繞過其安全控制,從模型獲得與生化武器及暗殺相關的操作指引。
重點摘要
- Mindgard 指出,Kimi K2.6 與 K3 Swarm 可透過「越獄」(jailbreak)方式突破安全防護。
- 研究人員並未證實這些危險回應在現實世界中一定可行。
- Moonshot 表示正檢視相關研究結果,並與 Mindgard 進行討論。
Kimi 越獄測試結果
根據 BBC 報導,Mindgard 早在 7 月就發現,Kimi K2.6 與 K3 Swarm 可以透過精心設計的提示語(prompt)進行「越獄」,迫使模型無視原本的開發者安全防線。這類測試會用結構化指令刻意挑戰模型是否會違反安全規則。Mindgard 指出,依照設計,模型本應拒絕討論相關敏感議題。
Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦越獄成功,模型幾乎可以討論任何主題,甚至會在未被進一步追問的情況下,主動給出更多具危害性的建議。
Moonshot 向 BBC 表示,歡迎第三方意見,視其為「打造更好且更安全 AI 的關鍵支柱」,並稱已就相關發現與 Mindgard 展開對話。Mindgard 表示其於 7 月 27 日首次電郵 Moonshot,約一週後再度追蹤,並在 9 月 12 日正式公布研究內容。
延伸閱讀: Ripple 協助巴西 CSD BR 於公共區塊鏈鏡射基金持有人結構
Mindgard 指出的安全風險
Mindgard 強調,尚未驗證模型提供的具體步驟在現實中是否可直接付諸實行,但認為單就模型願意回應這類高風險問題本身,就已顯示原設計用來阻擋危險請求的防護機制失靈。
該公司進一步指出,被越獄的 Kimi K2.6 理論上有可能在其運算資源上執行程式碼並連上網路,潛在上可成為發動網路攻擊的平台。
Moonshot 則回應稱,其內部日常測試顯示,模型對這類請求「拒絕率相當高」,這次事件凸顯出常規測試與外部研究人員採用敵意式測試方法之間,存在明顯落差。
Alan Woodward,英國薩里大學教授,向 BBC 表示,當開源或開權重模型落入惡意使用者手中時,濫用風險會被放大,不過同樣的工具也可以用於網路防禦。
他認為,監管腳步難以追上 AI 技術的發展速度,執法焦點應更多放在「如何處罰濫用系統的人」,而非僅從技術本身下手。
更廣泛的憂慮其實早已存在:Moonshot 的 Kimi 屬於開放權重(open‑weight)模型,用戶可在自家基礎設施上自行部署。同一時間,近期多起 AI 安全事件亦牽涉 OpenAI、Meta 與 Anthropic 的代理系統(agents)。在這樣的背景下,研究焦點已從「模型會不會拒絕回答」進一步轉向「當強大模型獲得工具、網路存取權以及多步行動授權後,會發生什麼事」。

