OpenAI 正在测试一套安全系统,在不保留客户数据的前提下识别滥用行为,正面挑战竞争对手 Anthropic 最新推出的“企业数据保留30天”规定。
要点概览:
- OpenAI 预览的“私有安全处理”(Private Safety Processing)工具,可在不保存客户提示词与回复的前提下,跨关联会话识别滥用模式。
- Anthropic 要求使用其最强大模型的企业客户,必须接受30天数据留存,称日志是发现多步攻击的必要条件。
- OpenAI 计划于9月更大范围推开该系统,并发布技术白皮书。
“私有安全处理”锁定多会话滥用场景
公司在周三的公告中表示,此次预览版是其“零数据留存”(Zero Data Retention)安排的延伸——该机制在请求处理完成后,不再保存客户的提示词或模型输出。更大范围的上线与技术白皮书预计将在9月公布。
在新架构下,客户内容要么保存在由客户自主管理的基础设施上,要么存储在 OpenAI 侧,但仅以加密形式存在,加密密钥完全由客户控制。自动化工具会在这些内容中寻找跨关联会话的滥用模式。设计同时覆盖“代理式工作”场景——即系统在用户表面“叫停”后仍可能持续执行任务的情况。其间不会有人工直接查看内容。
公司产品政策负责人 Aleah Houze 向媒体表示,许多高风险行为只有在把多次交互放在一起看时才会显形。她举例称,一名用户可能在一轮对话中探测软件漏洞,在另一轮对话中则询问远程访问工具。
延伸阅读: Claude 的隐藏水印正在“扭曲写作艺术”,Gruber 称
Anthropic 的留存规则划清竞争边界
与之相反,Anthropic 在7月明确,对使用其最强大模型(包括 Fable 5 与 Mythos 5)的企业客户,统一要求数据留存30天。
该实验室承认,这一政策可能不受欢迎、甚至损害商业机会,但坚持认为,为捕捉被刻意拆分到大量独立请求中的攻击行为,这类日志是“必需品”。在其模式下,仍保留人工审查通道,但仅限少数获批的审查员通过受控流程访问。每一次会话都会被记录在防篡改日志中。
分析师质疑OpenAI的时点与技术佐证
前政府机构咨询机构 FormerGov 执行董事 Brian Levine 在接受采访时称,OpenAI 的承诺在技术上“雄心很大”,因为按传统做法,“滥用监控”与“内容不见光”往往是相互牵制的目标。
他同时指出,真正的技术证明要到数周之后才会公布。Moor Insights and Strategy 的 Jason Andersen 则解读称,本周一系列宣布在一定程度上可视作潜在IPO前的“姿态管理”。
LexisNexis Risk Solutions Group 首席信息安全官 Flavio Villanustre 则认为,OpenAI 此举意在为即将到来的监管预期“预先松绑”。
此次预览为 OpenAI 一周密集“安全叙事”画上句号。周二,公司宣布放缓算力扩张,并暂停强化学习训练,以便加强研究环境的加固和红队测试。公司同时预计,扩展后的安全监控将消耗大约20%的被纳入监控范围的推理算力。





