OpenAI正測試一套在「零數據留存」前提下,仍可偵測濫用行為的安全系統,正面對撼競爭對手Anthropic最新推出、強制保留企業客戶30日使用紀錄的政策。
重點摘要:
- OpenAI預覽全新「Private Safety Processing」,可在不保留任何客戶提示與回覆內容下,偵測跨多個相關對話的濫用模式。
- Anthropic要求其最強大模型的企業客戶,必須保留30日使用紀錄,指這些日誌是捕捉多步驟攻擊的關鍵。
- OpenAI計劃於9月擴大推出相關功能並發表技術白皮書。
「Private Safety Processing」瞄準跨多回合作惡
OpenAI於周三公布是次預覽功能,強調這是「Zero Data Retention」(零數據留存)安排的延伸版本。該安排規定,一旦請求處理完成,OpenAI不再保留用戶提示內容或模型回覆。公司表示,相關系統會在9月更廣泛推出,並同步發表技術白皮書。
在新設計下,客戶內容要麼留在由客戶自行控制的基建上,要麼存放在OpenAI的基礎設施內,但以只有客戶手持密鑰方可解密的方式加密保存。自動化工具會在這些內容上運行,尋找跨多個相關會話的濫用模式;設計亦涵蓋「代理式」工作情境——即系統在用戶表明要停止後仍繼續執行指令的情況。整個過程均無人工查閱內容。
公司產品政策主管Aleah Houze向傳媒指出,許多高風險行為只有在把多次互動放在一起檢視時才會浮現。她舉例說,有用戶可能先在一段對話中試探軟件弱點,再在另一段對話中詢問遠端存取工具的細節,單獨看每次對話都不算明顯可疑,但合併起來便顯示潛在攻擊意圖。
延伸閱讀:Claude 的隱藏浮水印扭曲寫作工藝,Gruber 批評
Anthropic的留存規則劃清雙方界線
與此同時,Anthropic則採取截然不同的方向。該公司於7月公布,新政策要求使用其最強大模型(包括Fable 5及Mythos 5)的企業客戶,必須保留30日數據。
Anthropic承認,相關政策或不受客戶歡迎,甚至可能損害其業務,但強調要偵測刻意拆散成多個請求、橫跨長時間的攻擊行為,這些日誌是不可或缺。有人手審查的空間仍然存在,不過只會透過嚴格管制的流程,並限於少數獲批准的審核人員。每個會話都會被記錄於防篡改日誌中。
分析師質疑OpenAI時機與證據
公民科技組織FormerGov執行董事Brian Levine在接受訪問時表示,OpenAI的承諾在技術上頗為「進取」,因為過往濫用監控與「對內容視而不見」的私隱設計,往往是互相拉扯、難以兼得。
不過,他亦指出,關鍵證據要到數星期後、OpenAI發表技術細節時才會出現。Moor Insights and Strategy的Jason Andersen則認為,OpenAI一連串公佈,多少帶有為首次公開招股(IPO)鋪路、塑造形象的意味。
LexisNexis Risk Solutions Group首席資訊保安官Flavio Villanustre則從監管角度解讀OpenAI動作,認為公司是在預先「軟化」他預期將會收緊的監管要求。
是次預覽亦為OpenAI一周密集安全訊息畫上句號。公司於周二曾表示,已放慢模型擴展步伐,暫停部分強化學習訓練,以加固及「紅隊測試」其研究環境。同時,公司估算,新系統擴大監察範圍後,相關安全監控本身將消耗約兩成受監察推理運算資源。





