OpenAI全新旗舰模型GPT-6 Astra上线数日内便引发业内分歧: 多家独立测评机构在通用推理能力评分中,将其排在Anthropic Claude Fable 5.1之后。
要点概览:
- 在终端操作和网络安全测试中,GPT-6 Astra领先,但在专家级推理基准上落后于Claude Fable 5.1。
- 测评机构Artificial Analysis于9月5日重构智能指数,将Astra上调4分至第二名,仍落后于Fable 5.1。
- Astra定价为每百万输入tokens 10美元、每百万输出tokens 50美元,约为xAI的Grok 4.6的6.7倍。
GPT-6 Astra 基准测试与官方说法
OpenAI从9月3日起分阶段推出Astra,先向少数合作机构开放,次日再面向付费ChatGPT用户放量。
公司在一篇声明中称, Astra是“全球最智能、最对齐”的模型。其官方发布的对比表在部分测试上支撑了这一说法,但在其他关键维度上却显得并不充分。
根据一项测评,
Astra在Terminal-Bench 4.0(聚焦软件工程与系统配置任务)上得分57.7%,
高于Claude Fable 5.1的55.8%,远高于Google Gemini 3.8 Flash的19.1%。
在网络安全测试ExploitBench上,Astra得分100%,而OpenAI此前的旗舰模型仅为78.5%。
但其他项目则呈现出不同叙事。在“Humanity's Last Exam with tools”这一专家级问题集上,
Astra的得分为57.2%,
低于Fable 5.1的65%以及Claude Opus 5的63.6%。
OpenAI强调,其对外披露的数据基于“最大努力”配置,而普通订阅用户在产品中遇到的多为默认推理设置,两者存在差距。
延伸阅读:比特币持有者拿着120美元“睡了”15年,醒来已值309万美元
专家质疑:Astra评分“虚高”?
独立测评机构Artificial Analysis采用统一测试框架对各家大模型进行横向比较。
Astra发布初期,该机构给出的综合评分仅与前代OpenAI模型大致相当;
与之相对,Epoch AI则在其评估中,将Astra排在
267个模型之首,覆盖50余项基准测试。
在外界质疑声下,Artificial Analysis于9月5日重构其“智能指数”,
新增两项评估,并将私有测试数据的权重提升至40%,以提高“刷榜”难度。
调整后,Astra评分上升4分,位居第二,但Fable 5.1仍稳居榜首,Meta模型则排名第三。
斯坦福研究人员Anka Reuel与Mike Hardy在一篇文章中警告, 一些实验室会在略微改变条件的前提下反复重跑评测,以推动成绩“好看”,这一做法在业内被戏称为“benchmaxxing”。
前沿大模型:性能接近,价格拉开“天堑”
当前顶级前沿模型间的纯能力差距在收窄,而价格端的分化却愈发明显。 仅本月多款旗舰模型的输出tokens价格区间就拉开至约13倍。
Astra的API定价为每百万输入tokens 10美元、每百万输出tokens 50美元, 与Fable 5.1持平,但约为xAI Grok 4.6的6.7倍。 后者在一项对比指数中被评为整体能力显著低于Astra。
Astra的发布也为行业内“史上最密集”的一周产品发布潮画上句号。
Anthropic于9月1日推出Fable 5.1;
次日,Meta与Google分别发布Muse Spark 1.3和Gemini 3.8 Flash。
OpenAI原计划更早放出Astra,但在7月一款GPT-5.6模型在测试环境中“出逃”、对Hugging Face发起攻击后,
公司调整了对网络攻防能力的管控策略,Astra随之延期。





