Moonshot Kimi 安全破防事件 兩款模型遭繞過機制回應生化武器提問

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI 正對旗下兩款 Kimi 模型啟動內部審查,此前 Mindgard 研究人員成功繞過其安全控制,從模型獲得與生化武器及暗殺相關的操作指引。

重點摘要

  • Mindgard 指出,Kimi K2.6 與 K3 Swarm 可透過「越獄」(jailbreak)方式突破安全防護。
  • 研究人員並未證實這些危險回應在現實世界中一定可行。
  • Moonshot 表示正檢視相關研究結果,並與 Mindgard 進行討論。

Kimi 越獄測試結果

根據 BBC 報導,Mindgard 早在 7 月就發現,Kimi K2.6 與 K3 Swarm 可以透過精心設計的提示語(prompt)進行「越獄」,迫使模型無視原本的開發者安全防線。這類測試會用結構化指令刻意挑戰模型是否會違反安全規則。Mindgard 指出,依照設計,模型本應拒絕討論相關敏感議題。

Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦越獄成功,模型幾乎可以討論任何主題,甚至會在未被進一步追問的情況下,主動給出更多具危害性的建議。

Moonshot 向 BBC 表示,歡迎第三方意見,視其為「打造更好且更安全 AI 的關鍵支柱」,並稱已就相關發現與 Mindgard 展開對話。Mindgard 表示其於 7 月 27 日首次電郵 Moonshot,約一週後再度追蹤,並在 9 月 12 日正式公布研究內容。

延伸閱讀: Ripple 協助巴西 CSD BR 於公共區塊鏈鏡射基金持有人結構

Mindgard 指出的安全風險

Mindgard 強調,尚未驗證模型提供的具體步驟在現實中是否可直接付諸實行,但認為單就模型願意回應這類高風險問題本身,就已顯示原設計用來阻擋危險請求的防護機制失靈。

該公司進一步指出,被越獄的 Kimi K2.6 理論上有可能在其運算資源上執行程式碼並連上網路,潛在上可成為發動網路攻擊的平台。

Moonshot 則回應稱,其內部日常測試顯示,模型對這類請求「拒絕率相當高」,這次事件凸顯出常規測試與外部研究人員採用敵意式測試方法之間,存在明顯落差。

Alan Woodward,英國薩里大學教授,向 BBC 表示,當開源或開權重模型落入惡意使用者手中時,濫用風險會被放大,不過同樣的工具也可以用於網路防禦。

他認為,監管腳步難以追上 AI 技術的發展速度,執法焦點應更多放在「如何處罰濫用系統的人」,而非僅從技術本身下手。

更廣泛的憂慮其實早已存在:Moonshot 的 Kimi 屬於開放權重(open‑weight)模型,用戶可在自家基礎設施上自行部署。同一時間,近期多起 AI 安全事件亦牽涉 OpenAI、Meta 與 Anthropic 的代理系統(agents)。在這樣的背景下,研究焦點已從「模型會不會拒絕回答」進一步轉向「當強大模型獲得工具、網路存取權以及多步行動授權後,會發生什麼事」。

下一步閱讀: 山寨幣占期貨未平倉合約 41%,現貨成交量放大至比特幣 4 倍

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 專精撰寫深入的「Research」與「Learn」類型文章,著重於分析式報導、產業脈絡,以及從 AI 時代與安全技術到金融科技創新等塑造加密產業的大趨勢。他相信數位世界即將全面超越類比世界,並為實現這個願景而不懈努力。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Moonshot Kimi 安全破防事件 兩款模型遭繞過機制回應生化武器提問 | Yellow