Grok 4.5 在一项独立智能体基准测试中夺得第一,为 Elon Musk 一直强调的“性能与成本优势”提供了新的外部证据。
要点速览:
- Grok 4.5 在 AutomationBench-AA 中得分 51.4%,领先两款 Claude 模型。
- 模型单任务成本为 0.34 美元,远低于最接近的 Anthropic 竞品。
- 规则违规率偏高,给企业级智能体部署埋下合规与风控隐患。
Grok 测试结果
Artificial Analysis 披露,Grok 4.5 在 AutomationBench-AA 的得分为 51.4%,高于 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。在成本方面,Grok 4.5 单任务约 0.34 美元,而 Fable 5 为 1.35 美元、Opus 4.8 为 1.46 美元,差距拉开明显。
这次评测为马斯克的说法提供了第三方背书——即 Grok 4.5 性能可对标 Opus,但运行更快、成本更低。SpaceXAI 本周正式将该模型面向公众推出,基于 1.5 万亿参数的 V9 基座模型,以及早期内部测试结果进行市场定位。
AutomationBench-AA 涵盖 40 个模拟应用、共 657 项任务,场景包括 Gmail、Slack、Salesforce 和 HubSpot 等主流企业工具。测试评估 AI 智能体在不触犯安全与合规护栏的前提下完成任务目标的能力;为降低“刷榜”和数据污染风险,Artificial Analysis 并未公开完整任务集。
延伸阅读:Grok 4.5 以更低成本挑战 OpenAI 与 Anthropic 的智能体布局
马斯克的“性价比”叙事
Artificial Analysis 称,Grok 4.5 每个任务平均输出约 8,000 个 token,大致只有 Opus 4.8 的四分之一。“其单任务总 token 使用量约 44 万,在榜单上属于最低一档。”该机构指出,成本优势既来自推理效率,也来自定价策略。
从任务完成度看,Grok 4.5 能够实现 79.9% 的目标达成率,完全通过(即无明显瑕疵地完成)的任务占 21.9%。在被视为难度最高的金融场景中,Grok 4.5 得分 71%,领先 Fable 5 的 64% 和 Opus 4.8 的 62%。
短板则集中在合规控制上。Grok 4.5 平均每个任务出现 0.63 次护栏违规,高于 Opus 4.8 的 0.55 次,以及 Google Gemini 3.5 Flash 的 0.46 次。对于计划在接近真实资金流和业务系统附近部署智能体的金融机构与大型企业,这一差距并非细枝末节。
因此,马斯克在发布时选择将叙事重心放在“效率与成本的现实权衡”,而不是追求各类榜单的“完美通杀”。Grok 4.5 目前已获得外部验证的性能与价格优势,但较高的违规率也提示市场:企业级大规模采用仍将以可靠性和风控为硬门槛。
下一篇:Bitcoin’s Recovery Has A Demand Problem Bulls Cannot Ignore





