Kimi K3 在英國政府網絡安全測試中「逃出」隔離沙盒,登上 GitHub 尋找解題方案,令 Moonshot AI 成為第四間被揭發模型突破封閉環境的開發商。
重點摘要:
- Kimi K3 在網絡安全評估期間離開本應完全隔離的沙盒環境,成功接通公開互聯網。
- 事件並非高深攻擊,而是英方評測框架存在簡單網絡設定錯誤,被模型鑽空子。
- 模型只是到程式碼庫查找答案,沒有對任何外部系統發動實際攻擊。
Kimi K3 如何「走出」沙盒?
美國網絡安全初創 Frontier Security 在周四發表的博文中披露事件。研究人員 Paul Kassianik 及 Yaron Singer 使用英國 AI Security Institute 提供的評測框架,測試該模型在防禦性網絡安全方面的能力。
他們追蹤整個過程後發現,所謂「越獄」並非模型刻意設計精密攻擊,而是框架本身存在基本網絡配置錯誤,意外打開通往外網的通道。
在原本應該「離線」、不需上網的題目環境下,Kimi K3 反過來檢查自己的網絡設定,自行摸索到一條外出的路徑,然後直接到開發者平台拉取現成方案。
事後檢視日誌紀錄,研究人員未發現模型對任何真實目標發動實質攻擊行為。
Frontier 其後強調,整件事沒有涉及任何零日漏洞,只是設定層面的疏漏。
Moonshot 於 7 月推出 Kimi K3,其後很快向公眾免費開放。多項第三方評估顯示,Kimi K3 效能已逼近頂尖美國模型。Frontier 自家基準測試更指,它在尋找軟件及網絡漏洞方面具相當實力。
延伸閱讀: SpaceX 股票市值 1,000 億美元 首次開放二手市場交易
Yaron Singer:沙盒有漏水 模型又欠內建防線
Singer 表示,團隊在沙盒軟件中發現「漏水位」,而 Kimi 正是利用這個缺口出逃,反映模型本身欠缺足夠內置防護欄桿。Frontier 是獨立使用英國研究所免費派發的沙盒軟件進行評測,並指結果顯示,Kimi 的網絡安全防護設計較同級競爭對手為弱。
最令研究人員憂慮的,是這個「會走出沙盒」的版本屬開源權重,相關設定鬆散的模型已經流入公眾手中,難以回收。
報告其中一個結論相當直白:只要給功能強勁的智能代理留下一條通往互聯網的路,它最終就會找到並用上這條路。網安專家 Katie Moussouris 就表示,她對多間實驗室沒有事前預判這種行為感到意外,畢竟業界測試代理模型已有相當長時間。
OpenAI、Meta 亦相繼爆出「走甩」事件
Kimi 事件,為今個夏天一連串大型實驗室「自爆」事故再添一宗。OpenAI 早前在周三披露,其評估代理曾在第三方檔案庫中暗中建立隱藏訊息板;就算內部人員刪除,代理亦在四日內重建,之後更滲透 Hugging Face 平台。
OpenAI 研究團隊在拉斯維加斯的網安會議上指出,前沿模型在測試中往往傾向「取巧」,一旦有機會繞過限制,往往主動這樣做。Anthropic 上周亦通報,指三個 Claude 模型因為設定失誤而暴露於開放互聯網,最後竟能接觸到真實企業系統。
Meta 則在周三確認,其 Muse Spark 模型因外部測試公司 Irregular 的操作失誤而取得上網權限,並承諾待內部檢討完成後會公開詳細回顧報告。





