OpenAI 正測試一套在不保留客戶資料前提下,偵測濫用行為的安全系統,正面對決競爭對手 Anthropic 新上路的「企業客戶日誌必留存 30 天」政策。
亮點整理
- OpenAI 預覽中的「Private Safety Processing」工具,能跨多個相關對話蒐集濫用線索,卻不保存任何客戶輸入與模型回覆。
- Anthropic 則要求使用其最強大模型的企業客戶,必須保留 30 天操作紀錄,稱這是攔截多階段攻擊的必要條件。
- OpenAI 預告將於 9 月擴大推出此方案,並發表技術白皮書。
Private Safety Processing 鎖定多階段濫用行為
公司於週三 宣布 展開預覽,並將此工具定位為「零資料留存」(Zero Data Retention)機制的延伸——也就是在請求處理完畢後,OpenAI 不再保留用戶輸入與模型輸出。更大規模上線與技術白皮書預計在 9 月登場。
在這套新架構下,客戶內容要嘛全程留在客戶自管的基礎設施上,要嘛存放在 OpenAI 端、但以只有客戶持有金鑰的方式加密。自動化工具會在這些內容上運作,尋找多個關聯對話之間的濫用模式;即便是「代理型」任務(系統在使用者終止後仍持續行動)也涵蓋在內。依設計,人工審閱人員不會看到內容本身。
公司產品政策負責人 Aleah Houze 向記者 表示,許多高風險行為只有在把多次互動放在一起看時,才會浮現脈絡。她舉例,有的使用者先在一段對話中試探軟體弱點,之後又在另一段對話中詢問遠端存取工具。
延伸閱讀:Claude 的隱藏浮水印正在扭曲寫作藝術,Gruber 批評
Anthropic 的 30 天留存紅線,拉開兩家差異
Anthropic 於 7 月揭示截然不同的路線:使用其最先進模型(包括 Fable 5、Mythos 5)的企業客戶,必須接受「資料日誌保留 30 天」的條款。
該實驗室坦言,這項政策勢必不受歡迎,甚至可能拖累業務成長,但堅稱完整的操作軌跡,是揪出刻意分散在多次請求中的攻擊行為所不可或缺的。人工作業仍有可能介入審查,但必須透過受嚴格管控的流程,且僅限少數經核准的審閱人接觸。每一場對話都會被記錄在防竄改的日誌中。
分析師質疑 OpenAI 時點與證據力
公益組織 FormerGov 執行董事 Brian Levine 在接受訪問時 指出,這項承諾在技術上相當「進取」,因為濫用偵測與「內容不可見」兩個目標,長期以來往往是彼此牴觸的。
他同時提醒,真正的技術證據要到數週後才會公開。Moor Insights and Strategy 的 Jason Andersen 則認為,這一連串宣布,某種程度是在為可能的首次公開募股(IPO)暖身鋪路。
LexisNexis Risk Solutions Group 資安長 Flavio Villanustre 則解讀為:OpenAI 企圖在預期中的監管壓力成形前,先用自律方案「軟化」未來規範。
這次預覽為 OpenAI 一整週的「安全訊息攻勢」畫下句點。週二,公司才宣布暫緩擴張規模與強化學習訓練,先專注強化研究環境安全並進行紅隊測試。OpenAI 也估計,這套擴增後的監控機制,將吃掉大約兩成受監控推論運算資源。





