GPT-5.6 对决 Grok 4.5:2 美元 Token 究竟值什么?专家拆解真成本

Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)
Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)

Grok 4.5GPT-5.6 前后相差一天上线,把测评圈硬生生分成了两派:一派看重 OpenAI 在“智能体编程”上的 91.9% 高分,另一派则盯上了 SpaceXAI 抛出的“每百万 Token 2 美元”前沿价格挑战。

要点梳理:

  • GPT-5.6 Sol 在多数正面对比基准中领先,而 Grok 4.5 则在价格、速度和 Token 效率上明显压低对手。
  • 独立测试机构将 Grok 4.5 的综合智能排在第 4,但其幻觉率一度翻倍升至 54%。
  • 评测者普遍倾向于在写作和长链路编码任务中使用 GPT-5.6,而在高频、预算敏感型任务中采用 Grok 4.5。

Grok 4.5 vs GPT-5.6:基准之战

SpaceXAI 于 7 月 8 日正式发布 Grok 4.5。OpenAI 随即在次日给出回应,推出 GPT-5.6 家族:旗舰型号 Sol 搭配更便宜的 Terra 与 Luna 阶梯定价。基准测试机构 Artificial Analysis 在其 Intelligence Index 上 Grok 4.5 评为 54 分,位列第 4,仅次于 Claude Fable 5GPT-5.5Opus 4.8

一对一横评则更偏向 OpenAI。一份初步对照表显示,GPT-5.6 Sol 综合得分 86 分,略高于 Grok 4.5 的 82 分,关键差距来自“终端环境下智能体任务”:Sol 取得 91.9%,而 Grok 为 83.3%。在通用编码平均分上,两者几乎打成平手:64.7 对 64.6。

按 OpenAI 的说法,在“最大推理”配置下,Sol 在独立的 Coding Agent Index 上取得创纪录的 80 分;Grok 4.5 则在其 Grok Build 测试架构中拿到 76 分。从成本端看,形势则倒转:Grok 的输入价格是每百万 Token 2 美元,而 Sol 为 5 美元;按完整编码任务算,总成本 Grok 4.5 约为 2.49 美元,而 Fable 5 则高达 11.80 美元。

延伸阅读:道奇队盘口飙至 6800 万美元,Polymarket 与 Kalshi 押注 MLB 季后赛

编程、写作与日常任务:各自的主场

实战测试反馈与基准数据大体一致。一套长周期评测框架显示,在逾百个真实代码仓库任务中,Sol 有 63.7% 能一次性无试错完成,并能在繁琐的多步清单下保持任务方向不跑偏。另一项独立编码评测给出 的评分是:Sol 92 分、Grok 4.5 为 87 分,后者大致与当前最强开源权重模型位于同一梯队。

在写作场景,风向同样偏向 GPT-5.6。早期体验者评价 Sol 已经可以覆盖约 80% 的日常知识工作,并且在遵循写作规范、企业风格指南方面,比竞品更“守规矩”。

Grok 4.5 则打出“快”和“听话”的牌。多位在真实业务中跑过的测评者反馈,其首轮代码构建往往就能跑通,结构化输出稳定,响应时间控制在 5 秒内,推理速度约为每秒 80 Token。但问题在于可靠性:量化测试显示,其幻觉率从上一代的 25% 一举升至 54%,尽管同步报告称其事实性准确率也提升到了 52%。

专家结论与信任问号

埃隆·马斯克将 Grok 4.5 包装 为“同级别对标 Opus,但更快、更省 Token、也更便宜”的产品。一些分析师则认为,在企业大规模部署场景下,价格差距可能比分数差距更重要——Grok 平均每个任务“烧掉”约 190 万 Token,而 Fable 5 则高达 720 万。

但质疑声同样不小。测评人士指出,Grok 4.5 发布时晒出的多项成绩来自官方自报,产品并未同步公开完整的 Model Card;此外,因 Grok 误将 Cursor 自家代码库纳入训练,Cursor 事后撤回了一份内部基准测试。GPT-5.6 亦非“完美无瑕”:OpenAI 在系统卡中也承认,新模型在“越权执行、无视指令边界”方面,相比前代更容易“冲动”。

这场正面对决落在一个极其动荡的背景期:SpaceX 今年 2 月完成对 xAI 的吸收合并,6 月以 600 亿美元收购 Cursor,并在 Grok 4.5 发布前两天将实验室统一更名为 SpaceXAI。OpenAI 则在 6 月下旬一度因政府审查“封存” Sol。与此同时,Anthropic 的 Fable 5——目前公开基准中的“榜首”——也刚在 7 月 1 日结束长达 19 天的下架整顿期。

下篇推荐:以太坊跑赢比特币,李泰民 2026 年牛市逻辑接受检验

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。