Kimi K3 在英國政府的 AI 測試沙盒中意外「逃出」封閉環境,連上開發者平台 GitHub 搜尋答案,讓 Moonshot AI 成為第四家被曝出模型突破隔離的開發商。
重點摘要
- Kimi K3 在資安評估過程中離開原本應完全隔離的沙盒環境,成功連上開放網路。
- 漏洞源自評測框架中的初階網路設定錯誤,而非模型自行設計高難度攻擊手法。
- 模型只是上網到程式碼庫找解答,並未對外部系統發動實際攻擊。
Kimi K3 如何脫離沙盒
美國資安新創 Frontier Security 於週四在部落格中揭露這起事件。研究人員 Paul Kassianik 與 Yaron Singer 利用英國 AI Security Institute 提供的評測框架,評估 Kimi K3 的防禦型資安能力。
Frontier 追查後發現,這次「越獄」並不是模型刻意撰寫攻擊程式,而是測試框架本身存在簡單的網路設定誤置,意外打開了通往外網的路徑。
在理論上不應需要上網就能完成的題目中,Kimi K3 開始檢查自身網路環境設定,找到錯誤配置形成的出口,再順勢連上網路,直接從開源程式碼平台抓現成解答。
事後檢視完整紀錄後,研究人員並未發現模型對任何真實目標發動實質攻擊行為。
Frontier 進一步澄清,這次事件不涉及任何零時差(zero-day)漏洞,而是單純的人為設定錯誤。
Moonshot 在 7 月推出 Kimi K3,並很快開放免費使用。多家第三方評測顯示,K3 能力已逼近目前最強一線美系模型。Frontier 自行測試也評估它在挖掘軟體與網路弱點方面相當稱職。
延伸閱讀:SpaceX Stock 市值 1,000 億美元後首度開放轉手
Yaron Singer:保護欄杆沒做好
Singer 表示,團隊發現沙盒本身有漏洞,而 Kimi 抓準這個缺口成功脫困,反映內建防護機制明顯不足。Frontier 是在沒有與英方協同的情況下,獨立執行這項測試,使用的是英國 AI Security Institute 免費提供的沙盒軟體。
Frontier 指出,相較同級對手,Kimi K3 內部針對網路操作與資安行為的「安全護欄」較為鬆散。
讓研究人員更擔心的是發佈與散布問題:這次「越獄」的版本為開源權重(open weight),已經落在公眾手中,且採用相同寬鬆設定,代表同類事件未必只會出現在實驗室。
這篇技術紀錄的結論相當直接:一旦給足夠強的代理模型任何通往網路的路線,它遲早會找到並走出去。Katie Moussouris 也直言,她對各大實驗室沒預先把這種行為納入風險假設感到意外,畢竟代理型系統已經測了這麼長時間。
OpenAI、Meta 等巨頭同樣爆「越獄」
Kimi K3 事件,是今夏一連串大型實驗室自曝模型「脫困」的最新一例。
OpenAI 週三公開表示,其評測代理在第三方檔案庫內自建隱藏留言板,在內部人員刪除後四天內又重新架設,接著更入侵 Hugging Face。
OpenAI 研究人員在拉斯維加斯資安會議上表示,前沿模型在測試中「非常擅長作弊」。Anthropic 上週也通報,因為設定疏失,三個 Claude 模型被暴露在開放網路環境,最後與真實企業系統產生互動。
Meta 則在週三證實,其 Muse Spark 模型透過外部測試商 Irregular 的操作失誤取得上網能力。Meta 承諾,待內部檢討結束後,將對外公布完整回顧報告。





