Moonshot Kimi 遭破解 兩款模型被指可回應生化武器提問

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI 旗下兩款 Kimi 模型,被網絡安全公司 Mindgard 指出可被「越獄」,繞過安全防線後,向用戶提供涉及生化武器及暗殺等高風險內容的具體指示。事件曝光後,Moonshot 表示已展開檢討,並與 Mindgard 跟進有關結果。

重點摘要:

  • Mindgard 表示,Kimi K2.6 及 K3 Swarm 可經「越獄」技巧突破保安限制。
  • 研究團隊未有證實模型給出的有害指示在現實環境必然可行。
  • Moonshot 稱正審視相關研究,並與 Mindgard 保持溝通。

Kimi「越獄」測試結果

BBC 報道 指,Mindgard 早在 7 月已發現,Kimi K2.6 及 K3 Swarm 可透過結構化提示(prompt)進行「越獄」測試,在開發商預設的保安護欄下,仍然被誘導無視安全規則作出回應。按設計,這些護欄應禁止系統參與有關敏感或危險議題的討論。

Mindgard 創辦人 Peter Garraghan 向 BBC 表示,一旦「越獄」成功,模型幾乎可以討論任何主題,並會在未有進一步要求下,主動延伸提供更多具傷害性的建議。

Moonshot 對 BBC 表示,歡迎第三方審查,「視之為打造更安全、更可靠 AI 的關鍵一環」,並已就相關發現與 Mindgard 交流。Mindgard 指出,已於 7 月 27 日透過電郵通知 Moonshot,其後約一星期再作跟進,並於 9 月 12 日公開研究報告。

延伸閱讀: Ripple 助巴西 CSD BR 於公鏈鏡像基金持股結構

Mindgard:安全風險與潛在攻擊面

Mindgard 承認,今次實驗未有驗證模型輸出的指引在實務操作上必然有效,但強調事件本身已反映,原本用作阻擋危險請求的安全機制出現失效。該公司又指出,被「越獄」的 Kimi K2.6 理論上可在其運算資源上執行程式碼並連接互聯網,這或可演變成網絡攻擊的潛在跳板。

Moonshot 則表示,內部測試一般顯示,模型對此類高風險請求的拒絕率偏高,今次事件反映日常測試與外部研究人員採用的「對抗式測試」之間,存在明顯落差。

英國薩里大學教授 Alan Woodward 向 BBC 指出,當開源或開放權重模型落入惡意用家手中,濫用風險自然上升,但同一技術亦可被運用於網絡防禦。

他認為,監管速度難以追上 AI 技術演進,因此執法焦點應更多落在「如何追究及懲治濫用者」,而非單純限制技術本身。

開放權重與代理系統風險

是次爭議背後,其實反映更廣泛的行業隱憂:Moonshot 的 Kimi 模型屬開放權重(open-weight),用戶可在自家基礎設施上本地運行;而近期多宗 AI 安全事件,亦牽涉 OpenAI、Meta 及 Anthropic 的代理(agent)系統。

在模型逐步獲賦予工具使用權、互聯網連接及多步驟自主行動能力的情況下,研究界不再只關注「模型是否會拒絕回答」,而是更着眼於:當這些高性能系統真正在實際環境中被賦予行動權限時,會在多大程度上放大風險。

下篇閱讀: 山寨幣佔期貨未平倉合約 41%,現貨成交量飆至比特幣 4 倍

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 專注撰寫深入的「研究」與「學習」類文章,重點聚焦於分析式報導、產業脈絡,以及從 AI 時代與安全技術到金融科技創新等,正在塑造加密貨幣的大趨勢。他相信所有數碼事物即將全面超越所有類比事物,並正為推動這一轉變成真而不懈努力。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Moonshot Kimi 遭破解 兩款模型被指可回應生化武器提問 | Yellow