OpenAI 于 8 月 1 日确认,其下一代旗舰模型家族命名为 Astra。这一尚未公开发售的系统曾一次性解出 10 道数学难题,发布时间点正好落在 Anthropic 推出 Claude Opus 5 一周之后。
要点速览:
- 8 月 1 日,OpenAI 在一篇研究文章中首次公开 “Astra” 名称,并宣称其内部版本已攻克 10 道长期悬而未决的数学题。
- Astra 通过协调多个智能体在单一问题上持续工作数小时乃至数日,目前仍未发布,也没有明确上市时间表。
- Claude Opus 5 则已于 7 月 24 日上线,按百万 Token 收费:输入 5 美元、输出 25 美元,并支持 100 万 Token 级上下文窗口。
OpenAI Astra 模型细节
OpenAI 在一篇研究帖中宣布了 Astra 的名称,并将 10 项数学与理论计算机科学成果归功于 Astra 的内部版本——这些问题在公开文献中已悬而未决至少十年。
这些成果横跨高维几何、编码理论与量子复杂性,其中一项证明首次给出了非 sofic 群存在性的严格论证。
与主流大模型强调“算得更快”不同,Astra 的卖点在于“撑得更久”:它通过调度多个智能体围绕同一问题进行长时间协同推理,往往以小时甚至天为单位来计时,而非毫秒级响应。
早前的报道将 Astra 列入 Sol、Terra、Luna 等内部模型家族同一序列之中,目前尚未确定是冠以 GPT-6,还是 GPT-5.7 标签,更谈不上具体发布日期。Sam Altman 已在华盛顿向政策制定者现场演示该系统,业界普遍预期 Astra 将成为美国联邦拟议“事前审批框架”下首批接受安全审查的大模型之一。
延伸阅读: AI 基础设施:高利贷公司豪赌 10 亿美元,押注数据中心翻身
Claude Opus 5:定价与跑分
Anthropic 于 7 月 24 日正式发布 Claude Opus 5,定价与上一代 Opus 4.8 持平:每百万输入 Token 5 美元、每百万输出 Token 25 美元。
在第三方测评中,Claude Opus 5 拿下 Artificial Analysis Intelligence Index 61 分的最高分,而在同等任务成本上大约只有 Fable 5 的一半。
该模型支持 100 万 Token 的上下文窗口,单次输出上限则被限制在 12.8 万 Token。性能方面,Opus 5 在 ARC-AGI-3 基准上取得 30.2% 的成绩,约为此前公开最好成绩的三倍;在 Terminal-Bench 2.1 上,在“最大努力”设置下跑出 89.1% 的得分。
一位 Anthropic 发言人建议,企业客户在正式选型前,至少要让候选模型各自完成一次“边界清晰的短任务”和“一次长周期复杂任务”,再做长期绑定决策。
市场与学界如何看 Astra?
Astra 目前尚无官方定价、无完整评测、也未开放第三方验证。对企业来说,这意味着要在“可直接上手的现货产品”和“来自实验室的前沿研究声明”之间做权衡。
曼彻斯特大学数学家 Thomas Bloom 在 X 上称赞这 10 项成果是“重大新闻”,并认为其分量超过 OpenAI 此前在数学领域公布的相关证明。
不过 Bloom 也提醒,不应简单宣称模型“取代了数学家”:Astra 本身由人类设计与训练,其知识基础源自数学界几代人的文献积累。OpenAI 研究员 Noam Brown 也指出,这批成果并未触及千禧年难题(Millennium Prize Problems),而且团队对单个问题投入的算力和预算并不算高。
认知科学家 Gary Marcus 在其 Substack 上表示,OpenAI 的这些数学结果“确有其事”,但被包装成“领域已被攻克”则是一种严重夸大。
此次 Astra 公告延续了同一“长周期推理”技术路线。今年 5 月,同一技术家族就曾给出一项被普遍认为推翻 Erdős 单位距离猜想的证明——这一离散几何难题已悬而未决近 80 年。菲尔兹奖得主 Tim Gowers 当时公开表示,他会“毫不犹豫地”建议将该成果投稿至《Annals of Mathematics》(《数学年刊》)。





