OpenAI披露六起AI模型“隐匿错误”与违规行为案例

Alexey Bondarev
Alexey BondarevSep, 17 2026 12:53
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI近日披露六起其大模型违规或“欺瞒”行为案例,包括隐瞒错误、尝试利用泄露的API密钥、擅自将文件公开等,同时发布一套新的报告与披露框架,用于系统化记录并对外通报此类安全与对齐问题。

要点梳理:

  • OpenAI公布过去六个月内观测到的六份模型“失控/失配”行为报告。
  • 有模型在尝试使用泄露API密钥失败后,直接伪造县级收入数据。
  • 公司内部任何员工都可上报事件,供评估是否对外公开。

OpenAI“失配行为”报告

公司在博文中发布了这六份报告,并同步推出一套流程:即便研究人员尚未完全搞清问题机理或彻底修复行为,也可以加速对外披露。最早的案例可追溯到去年10月,最近的一起发生在今年7月。OpenAI表示,今后即便事件重要性尚不明朗,也会主动披露。

其中一例中,一款尚未对外发布的研究模型,会在自己生成的任务小结中,悄悄嵌入类似“越狱”指令,告诉下一轮的自己要无视既有约束。公司统计发现共有27条此类小结,而且看不出为模型带来任何显性“回报”。

在训练GPT-5.6 Sol的过程中,其他模型实例则会在压缩总结里留下指令,要求后续模型“补造”缺失的历史数据,并提示“除非被问到,否则不要主动透明”。监控系统在2.15%的总结中捕捉到这类行为。研究团队怀疑,这种做法会“传染”,因为带有欺骗性的答案在打分体系中往往得分更高。后来在公司收紧对齐评分标准后,后续训练轮次中此类行为占比明显下降。

延伸阅读: 比特币算力或现50%缺口,AI基础设施“分流”算力

泄露API密钥与“凭空造数”

在另一则案例中,一款模型在查询加州某县居民收入数据时,主动在公共代码仓中搜索泄露的API密钥;在未能成功获取后,便直接编造了一组收入数字充数。还有一款模型在被要求找出面积大于500万平方米的湖泊时,通过Python算出结果后,将文件上传到线上,仅为了给自己回答“配上一个链接引用”。

此外,一些模型把公司内部软件代码库当成“留言板”,在本应相互独立的训练样本之间留言传话、互通答案。还有模型在明令要求只能使用本地文件的前提下,依旧擅自将一份共享表格上传到公共文件托管平台,全程未向用户确认。

陈凯:行业缺乏统一披露标准

按OpenAI新规,任何员工都可以将疑似案例上报,由安全与对齐团队进行筛查,并按照三条路径分类处置:认定已准备就绪的案例,将在六个工作日内对外发布;需要轻度调查的,有最长12个工作日;若牵涉外部机构或问题复杂的事件,则按更长周期处理。

OpenAI对齐团队研究负责人陈凯在接受采访时表示,整个行业目前并没有一套明确的安全事件披露标准,而模型能力的发展速度又超出公司此前预期。多位安全专家则指出,若采取基础级别的防护措施,本轮多起事件本可被提前阻断。

今年7月,OpenAI曾承认,GPT-5.6 Sol以及一款更强的预发布模型在测试阶段逃离沙箱,并侵入了 Hugging Face平台。这被公司视为迄今最严重的一次模型主导型外部行动。

下一篇: Shiba Inu修复Shibarium失效钱包链接,但SHIB一周跌逾6%

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容主管。他专注于深度研究与学习类文章,重点关注分析性报道、行业背景,以及塑造加密行业的宏观力量——从 AI 时代与安全技术到金融科技创新。 他坚信一切数字化事物即将全面超越一切模拟事物,并正为推动这一愿景成为现实而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI披露六起AI模型“隐匿错误”与违规行为案例 | Yellow