OpenAI 已在 8 月 1 日确认,其下一代重磅模型族定名为 Astra。这一仍未公开发布的系统据称已解出 10 道长期悬而未决的数学题,亮相时间刚好落在 Anthropic 发布 Claude Opus 5 一周之后。
要点速览:
- 8 月 1 日,OpenAI 在一篇研究博文中首次确认“Astra”命名,并展示其解出的 10 道数学题。
- Astra 采用“多智能体协同”路径,可在同一问题上连续推理数小时甚至数日,目前尚未开放,也未给出时间表。
- Claude Opus 5 已于 7 月 24 日开售,定价为每百万输入 Token 5 美元、百万输出 Token 25 美元,提供 100 万 Token 上下文窗口。
OpenAI Astra:长时协同的“攻坚型”模型
OpenAI 在一篇研究博文中正式公布 Astra 名称,称其内部版本在数学与理论计算机科学领域拿下 10 个悬而未决的结果,这些问题至少已开放十多年。相关工作涉及高维几何、编码理论与量子复杂性,其中一项证明给出了非 sofic 群存在性的结果。
与主流大模型强调“推理速度”不同,Astra 的卖点在于“推理时长”:它通过协调多个智能体在同一问题上长期协作,可持续运算数小时乃至数日,以换取在高难度领域问题上的突破。
早前报道曾将 Astra 归入 Sol、Terra、Luna 等内部家族旁边,目前既无公开发布时间,也尚未决定是否冠以 GPT-6 或 GPT-5.7 之名。Sam Altman 已在华盛顿向政策制定者现场演示该系统,这一系列模型也被视为美国联邦即将实施的 AI 审批框架下首批接受审查的对象。
延伸阅读:AI 基础设施:发薪日贷款商豪赌 10 亿美元转型数据中心
Claude Opus 5:定价、性能与场景定位
Anthropic 于 7 月 24 日发布 Claude Opus 5,收费标准为每百万输入 Token 5 美元、百万输出 Token 25 美元,与 Opus 4.8 保持一致。据报道,该模型在 Artificial Analysis Intelligence Index 上以 61 分登顶,而完成同等任务的平均成本大约仅为 Fable 5 的一半。
Claude Opus 5 支持 100 万 Token 上下文窗口,单次输出上限为 128,000 Token。在 ARC-AGI-3 基准上得分 30.2%,约为此前公开最佳结果的三倍;在 Terminal-Bench 2.1 的“最大努力”设置下,则取得 89.1% 的成绩。Anthropic 发言人建议企业用户在锁定供应商前,至少选取一个边界清晰的小任务与一个长周期复杂任务,分别对多家模型进行对比测试。
Astra:专家与市场的“审慎乐观”
相比已经上架、价格与性能明牌的 Claude Opus 5,Astra 至今仍无定价、无公开基准测试,更无第三方测评。这意味着潜在客户需要在“可用的现货产品”与“尚待兑现的研究承诺”之间权衡。
曼彻斯特大学数学家 Thomas Bloom 在 X 上评价这 10 项成果是“重大新闻”,并认为其分量超过 OpenAI 此前借助 AI 获得的证明。
不过,Bloom 也反驳了“AI 将取代数学家”的夸张说法——在他看来,Astra 本身就是由数学家团队构建,并训练在大量数学文献之上,更像是数学家的“放大器”而非替代品。OpenAI 研究员 Noam Brown 则指出,此次攻克的并非千禧难题级别的超难问题,且团队在每道题上的资源投入并不算高。
认知科学家 Gary Marcus 在个人专栏中强调,Astra 的成果是真实且值得重视的,但当前围绕“AI 已经解决数学”的叙事被严重夸大。
此次官宣,也延续了同一“长时推理”家族在今年 5 月取得的突破:该路线曾给出一项推翻 Erdos 单位距离猜想的证明——这一离散几何中的经典难题已悬而未决 80 余年。菲尔兹奖得主 Tim Gowers 当时表示,他会毫不犹豫地向《Annals of Mathematics》推荐该成果发表。






