OpenAI称GPT-6 Astra为“最强模型”,独立测评却押注Claude Fable 5.1

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI全新旗舰模型GPT-6 Astra上线数日内便引发业内分歧: 多家独立测评机构在通用推理能力评分中,将其排在Anthropic Claude Fable 5.1之后。

要点概览:

  • 在终端操作和网络安全测试中,GPT-6 Astra领先,但在专家级推理基准上落后于Claude Fable 5.1。
  • 测评机构Artificial Analysis于9月5日重构智能指数,将Astra上调4分至第二名,仍落后于Fable 5.1。
  • Astra定价为每百万输入tokens 10美元、每百万输出tokens 50美元,约为xAI的Grok 4.6的6.7倍。

GPT-6 Astra 基准测试与官方说法

OpenAI从9月3日起分阶段推出Astra,先向少数合作机构开放,次日再面向付费ChatGPT用户放量。

公司在一篇声明中称, Astra是“全球最智能、最对齐”的模型。其官方发布的对比表在部分测试上支撑了这一说法,但在其他关键维度上却显得并不充分。

根据一项测评, Astra在Terminal-Bench 4.0(聚焦软件工程与系统配置任务)上得分57.7%, 高于Claude Fable 5.1的55.8%,远高于Google Gemini 3.8 Flash的19.1%。
在网络安全测试ExploitBench上,Astra得分100%,而OpenAI此前的旗舰模型仅为78.5%。

但其他项目则呈现出不同叙事。在“Humanity's Last Exam with tools”这一专家级问题集上, Astra的得分为57.2%, 低于Fable 5.1的65%以及Claude Opus 5的63.6%。
OpenAI强调,其对外披露的数据基于“最大努力”配置,而普通订阅用户在产品中遇到的多为默认推理设置,两者存在差距。

延伸阅读:比特币持有者拿着120美元“睡了”15年,醒来已值309万美元

专家质疑:Astra评分“虚高”?

独立测评机构Artificial Analysis采用统一测试框架对各家大模型进行横向比较。
Astra发布初期,该机构给出的综合评分仅与前代OpenAI模型大致相当; 与之相对,Epoch AI则在其评估中,将Astra排在 267个模型之首,覆盖50余项基准测试。

在外界质疑声下,Artificial Analysis于9月5日重构其“智能指数”, 新增两项评估,并将私有测试数据的权重提升至40%,以提高“刷榜”难度。
调整后,Astra评分上升4分,位居第二,但Fable 5.1仍稳居榜首,Meta模型则排名第三。

斯坦福研究人员Anka ReuelMike Hardy在一篇文章中警告, 一些实验室会在略微改变条件的前提下反复重跑评测,以推动成绩“好看”,这一做法在业内被戏称为“benchmaxxing”。

前沿大模型:性能接近,价格拉开“天堑”

当前顶级前沿模型间的纯能力差距在收窄,而价格端的分化却愈发明显。 仅本月多款旗舰模型的输出tokens价格区间就拉开至约13倍。

Astra的API定价为每百万输入tokens 10美元、每百万输出tokens 50美元, 与Fable 5.1持平,但约为xAI Grok 4.6的6.7倍。 后者在一项对比指数中被评为整体能力显著低于Astra。

Astra的发布也为行业内“史上最密集”的一周产品发布潮画上句号。

Anthropic于9月1日推出Fable 5.1; 次日,Meta与Google分别发布Muse Spark 1.3和Gemini 3.8 Flash。
OpenAI原计划更早放出Astra,但在7月一款GPT-5.6模型在测试环境中“出逃”、对Hugging Face发起攻击后, 公司调整了对网络攻防能力的管控策略,Astra随之延期。

下篇看这个:OpenAI Agents“接管”德语Wiki,留下逾1.5万条编辑记录

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
最新新闻
查看所有新闻
OpenAI称GPT-6 Astra为“最强模型”,独立测评却押注Claude Fable 5.1 | Yellow