OpenAI已修复导致新模型GPT-6 Astra在上线后一周内饱受“变笨”质疑的三项缺陷,并宣布为Codex订阅用户重置使用额度。
要点概览:
- Astra用户整周在社交平台发布对照测试,称模型上线后“被悄悄削弱”。
- OpenAI Codex负责人点名三大原因,其中一项是影响约4,000至5,000名用户的上下文实验。
- 公司上一代旗舰GPT-5.6 Sol今年7月也曾遭遇类似指控。
OpenAI修复Astra质量问题
Codex产品负责人Tibo Sottiaux在周六的一则更新中表示,团队与用户合作追踪问题根源,并在当地时间午夜前完成修复及配额重置。按照他的说法,为旧版本模型编写的一些“技能”被触发得过于频繁,有时会直接阻断Astra对自身输出进行复核。
此外,一项可选的上下文管理实验也被证实会导致模型提前结束回复,或者回应已经过期的对话信息。OpenAI在发现约4,000至5,000名用户受到该实验影响后,选择彻底关闭这一功能。
部分推理引擎此前存在配置错误,对被路由到这些引擎的“尾部流量”带来了可测量的质量损失。对此,公司已将相关引擎下线,并做出数项“小修小补”。Sottiaux在X上表示,模型目前对用户“最新一条消息”的追踪显著更精准。
延伸阅读:以太坊遭遇2,800美元“筹码墙”,ETF资金净流入已达2.16亿美元
开发者抱怨Astra“写代码退步”
整个一周内,X平台上不断出现开发者的对照测试:他们用完全相同的提示词、相同参数设置,对比“首发日版本Astra”和当前版本,然后将结果晒出。
其中,曾在Astra上线初期公开称赞该模型的开发者Pranjal Paliwal,重新审阅了模型此前为他生成的代码后,反而将近期表现评价为“退步”,而非迭代。
开发工具Opencode创始人Dax Raad更是选择“用脚投票”——在发现团队使用Astra的成本几乎翻倍,却换来他认为“不值这个价”的副作用后,他已将团队主力模型切回旧一代GPT-5.6 Sol。
OpenAI社区论坛上一则帖子则直言,当前版本Astra在同一任务上的表现与Sol“拉平”,甚至需要类似的重试次数。不过,并非所有人认同这一结论。一位化名Antikythera的用户反驳称,Astra从一开始就偏爱“偷懒”和使用项目符号,只是用户最初被“新鲜感”晃了眼,如今不再轻易惊艳。
产能与限额阴影笼罩GPT-6 Astra
自9月初面向更广泛用户开放以来,Astra的算力供给压力始终不容忽视。
多位用户反映,OpenAI已下调重度ChatGPT用户的Astra调用上限,并暂停新增每月200美元的Pro订阅。Sottiaux在9月10日的发文中证实了这一措施。
定价方面,Astra仍维持每百万输入tokens收费10美元、每百万输出tokens收费50美元的标准——是Sol当年上线价的2.5倍。
这已是OpenAI在短短两个月内第二次遭遇“旗舰模型被偷偷削弱”的指控。早在7月,部分付费用户就抱怨称,Sol的顶级推理模式“一夜之间变浅”。当时,Sottiaux予以否认,称公司并未刻意“削弱”模型,但承认团队确实在尝试不同的“推理强度”实验。

