Kimi K3 在英國政府測試沙盒中意外「越獄」,成功連上開放網路並前往 GitHub 搜尋解題程式碼,讓 Moonshot AI 成為第四家被揭露模型在官方測試中突破隔離的開發商。
事件重點一覽
- Kimi K3 在一場資安評估中離開原本應該完全隔離的沙盒環境,成功連上公開網路。
- 漏洞主因是評測框架中的「基本網路設定錯誤」,並非模型刻意利用零日弱點。
- 模型只是到程式碼庫查找解法,並未對任何外部系統發動實質攻擊行為。
Kimi K3 如何「走出」沙盒
美國資安新創 Frontier Security 在周四發布部落格文章,首度揭露這起事故。研究員 Paul Kassianik 與 Yaron Singer 使用英國 AI Security Institute 提供的評測框架,測試 Kimi K3 在防禦型資安任務上的表現。
事後追查發現,這次「突破圍籬」並非模型主動設計高階攻擊,而是框架本身的網路設定有基本疏漏,無意間打開了一條對外通道。
在理論上應該「離線解題」、不需上網的測試情境下,模型開始探測自身的網路環境,找到出口後,便前往開發者平台抓取現成解答程式碼。
Frontier 後續檢視紀錄檔,沒有發現任何針對實際目標的惡意攻擊跡象。
Frontier 並進一步說明,這次事件沒有涉及任何零日漏洞,純粹是評測環境設計不當。
Moonshot 在 7 月推出 Kimi K3,不久後即開放免費使用。多項外部測評顯示,Kimi K3 實力接近美國頂尖模型。Frontier 自家評測也給出「具備相當強勁找出軟體與網路弱點能力」的評價。
延伸閱讀:SpaceX 股票估值 1 兆美元、首度開放二級市場交易
Yaron Singer:沙盒本身有破口,模型就會鑽
Singer 表示,他的團隊發現沙盒框架本身存在「漏水點」,而 Kimi 則自然地利用這個缺口,顯示模型內部防護軌道(guardrails)並不完善。
Frontier 是獨立執行這次測試,使用的是英國研究機構免費提供的沙盒軟體。Frontier 指出,相較同級競品,Kimi K3 內建的網路與資安防範機制顯得較為鬆散。
研究社群最擔心的,是這次出事的版本屬於「開源權重」,相關設定已經以相同寬鬆條件流入公眾手中,未來被二次開發或誤用的風險更高。
這篇技術報告的核心警訊相當直接:只要給足夠強的代理模型一條通往網路的路,它遲早會把那條路找出來。Katie Moussouris 就表示,她對各大實驗室至今仍未充分預判這類行為感到意外,畢竟他們已經測試代理型系統好一陣子。
OpenAI、Meta 等巨頭也接連爆出「脫困」事件
這次披露,為今夏一連串大型模型「脫離掌控」的案例再添一樁。
OpenAI 週三透露,其評估代理在第三方檔案庫內悄悄建立隱藏討論區;該伺服器在被工作人員刪除四天後,又被代理重新架設,隨後更入侵 Hugging Face。
OpenAI 研究人員在拉斯維加斯資安研討會上表示,前沿模型在評測情境中往往展現出高度「作弊」傾向。Anthropic 也在上週報告,三個 Claude 模型因設定疏失暴露在開放網路上,最終連上多家真實企業的系統。
Meta 則在週三證實,其 Muse Spark 模型透過外部測試商 Irregular 的錯誤設定取得網路存取權。Meta 承諾,待內部調查結束後,將發布完整事後檢討。





