OpenAI正在测试一套在“不留存客户数据”的前提下识别滥用行为的安全系统,直接对标竞争对手Anthropic近期推出的企业级“30天日志留存”新规。
要点速读:
- OpenAI预览的“Private Safety Processing”(私有安全处理)可在不保留客户提示词和回复的前提下,跨关联会话识别滥用模式。
- Anthropic要求其最强模型的企业客户必须保留30天日志,称这是发现多步骤攻击的必要条件。
- OpenAI计划在9月更大范围推出该功能,并发布技术白皮书。
“私有安全处理”瞄准多会话滥用场景
公司在周三的公告中称,本次预览是其“Zero Data Retention”(零数据留存)承诺的延伸——即在请求处理完成后,不再保留用户提示或模型回复。更广范围的上线和一份技术白皮书预计将在9月公布。
按新的设计,客户内容要么完全留在客户自有或托管的基础设施上,要么存放于OpenAI的存储中,但使用仅由客户掌握密钥的加密方式保护。自动化工具会在这些内容“就地”运行,寻找跨关联会话的滥用模式。架构也覆盖“自主代理”式任务,即系统在用户表面结束对话后仍持续执行操作的情形。整个过程中,OpenAI员工无法直接查看相关内容。
公司产品政策负责人Aleah Houze向媒体表示,许多高风险行为只有在把多次交互串联起来看时才会显露。她举例称,一名用户可能先在一轮对话中试探软件漏洞,在另一轮则询问远程访问工具,两者合在一起才构成明显威胁。
延伸阅读:Claude隐性水印“扭曲写作之道”,Gruber批评称
Anthropic的留存规则凸显两家分歧
与OpenAI走向“零留存”形成鲜明对比的是,Anthropic在7月明确要求:企业客户若使用其最强大的模型(包括Fable 5和Mythos 5),必须接受至少30天的数据留存。
实验室承认,这一政策“不会受欢迎”,甚至可能损害其商业前景,但坚持认为,长期日志对于识别被刻意拆分到大量独立请求中的攻击至关重要。基于人工的内容审查仍然可能发生,但仅通过一条高度管控的流程完成,且只对少数获准审查人员开放。每一轮会话都会被记录在防篡改的审计日志中。
分析师追问OpenAI的时机与技术“证据”
公共政策组织FormerGov执行董事Brian Levine在接受采访时称,OpenAI的承诺在技术上“雄心很大”,因为“滥用监测”和“内容失明”在历史上往往是拉扯两端的目标。
他指出,真正的技术证明要到几周后、白皮书发布和系统扩展落地时才会浮出水面。Moor Insights and Strategy的Jason Andersen则解读称,这一系列密集宣布多少带有在潜在IPO前“占位”的意味。
LexisNexis Risk Solutions Group首席信息安全官Flavio Villanustre则认为,OpenAI此举还在为未来更严监管“预作缓冲”。
本次预览为OpenAI一周内的“安全宣传攻势”画上句号。周二,公司刚宣布放缓模型扩容,并暂停强化学习训练,以便加固、红队测试其研究环境。OpenAI还估算,扩展后的安全监控大约会吞掉被监控推理算力的20%左右。





