Moonshot Kimi 被破解安全防線 兩款模型遭指可回應生化武器提問

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI 正對旗下兩款 Kimi 模型啟動審查,起因是安全公司 Mindgard 的研究團隊成功繞過安全控制,讓模型回應涉及生物武器與暗殺的敏感問題。

重點整理:

  • Mindgard 指出,Kimi K2.6 與 K3 Swarm 透過「越獄」(jailbreak)可被推過原本設下的安全防線。
  • 研究人員並未驗證這些危險回應在現實中是否真能奏效。
  • Moonshot 表示已著手檢視相關研究結果,並與 Mindgard 進行溝通。

Kimi 越獄測試結果

根據 BBC 的報導,Mindgard 在 7 月發現,Kimi K2.6 與 K3 Swarm 可透過精心設計的結構化提示語進行「越獄」,繞過開發者設下的防護欄位,測試模型是否會無視安全規則。Mindgard 指出,按設計這些把關機制應該要阻擋模型回應上述高度敏感主題。

Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦越獄成功,這些模型就幾乎可以談論任何主題,甚至在未被進一步追問的情況下,自行提出更多具危害性的建議。

Moonshot 受訪時回應,歡迎第三方的意見與測試,視其為「打造更好、更安全 AI 的關鍵支柱」,並表示已就相關發現與 Mindgard 展開討論。Mindgard 則稱已於 7 月 27 日透過電子郵件通知 Moonshot,大約一週後再度追蹤,並在 9 月 12 日公開研究結果。

延伸閱讀:Ripple 協助巴西 CSD BR 在公鏈上鏡射基金持有人結構

Mindgard 指出的安全風險

Mindgard 強調,目前尚未證明這些危險回應在實務上一定能被直接利用,但單就 AI 願意提供相關資訊這件事本身,就已顯示防護設計未能有效阻止系統回應高風險請求。該公司並指出,被越獄的 Kimi K2.6 理論上可能在其運算資源上執行程式碼並連上網路,形同潛在的網路攻擊跳板。

Moonshot 則表示,內部常規評估的結果,一般顯示模型對此類請求有「高度拒絕率」,此次事件凸顯日常測試與外部研究人員採用敵對式測試手法之間,存在明顯落差。

英國薩里大學(University of Surrey)教授 Alan Woodward 向 BBC 指出,當開源模型落入惡意使用者手中時,確實會帶來濫用風險,但相同工具也能被用來強化網路防禦。

他認為,監管速度難以追上 AI 的發展,因此執法與規範重點應更聚焦於「如何處罰與約束濫用系統的人」。

更大的隱憂其實早已浮現:Moonshot 的 Kimi 模型採開放權重(open-weight)形式,使用者得以在自家基礎設施上自行部署;近來數起 AI 安全事件,也陸續牽涉 OpenAI、Meta 與 Anthropic 的智能代理(agent)系統。這些因素疊加,促使研究社群不再只關注「模型會不會拒絕回答」,而是進一步關切:當強大模型被賦予各式工具、網路連線能力與多步驟自動執行權限後,實際會做出什麼行為。

下一篇:山寨幣期貨未平倉占比達 41%,現貨成交量放大至比特幣 4 倍

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容主管,過去 10 年一直從事加密貨幣相關報導。他專長於撰寫深入的研究與學習類文章,著重於分析性報導、產業脈絡,以及塑造加密貨幣世界的宏觀力量,從 AI 時代與安全技術到金融科技創新。他相信,一切數位事物即將全面超越一切類比事物,並正為實現這一願景而努力不懈。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Moonshot Kimi 被破解安全防線 兩款模型遭指可回應生化武器提問 | Yellow