独立测试首秀:专家对 Claude Opus 5 分歧加剧

Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)
Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)

独立评测机构给 Anthropic 新一代模型 Claude Opus 5 打出 159 分的能力指数,仅比 Claude Fable 5 低 2 分,但在代码审查方面的表现却让测试方意见分化。

要点速览

  • Epoch AI 将 Claude Opus 5 评为能力指数 159 分,Fable 5 为 161 分,在软件工程维度两者持平。
  • CodeRabbit 测得其「可执行评论」精确率为 39.3%,高于 35.2% 的基线,但吹毛求疵式的低价值评论增加了 4 倍。
  • 企业级客户 Cognition 与 Zapier 报告称,其在调试和端到端业务自动化方面带来明显提升。

Claude Opus 5 基准测试遭遇「放大镜」审视

Anthropic 上周五正式发布 Opus 5,并在公告中称,该模型以「半价」逼近 Fable 5 的前沿智能水准,更定位为日常通用工作马,而非高端专用机。多数第三方评测基本认可这一定位,但对具体差距并不一致。

Latent Space 整理的评测显示Epoch AI 给出 Opus 5 能力指数 159 分,Fable 5 为 161 分,两者在软件工程上打成平手。

Artificial Analysis 则在其「代理式知识工作」基准中,将 Opus 5 排名第一:相较 Fable 5,Elo 评分高出近 150 点,同时单任务成本降低约 20%。部分开发者则对「能力指数」这一单一指标提出质疑,认为相较旧版 Opus 4.8 只有 1 分提升,严重低估了他们在日常使用中感受到的跳跃式进步。一位评测者甚至发现,在某项编程测试中,中等「努力等级」设置的表现优于高强度设置。

延伸阅读:BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

代码审查:测评结果严重分化

CodeRabbit 选取了约 100 种来自真实开源 Pull Request 的错误模式,对 Opus 5 进行多轮(每种配置 3 轮)对比测试,并统计其可执行代码审查评论的精确率为 39.3%。

这一结果高于其线上生产审查器 35.2% 的基线,但代价是模型命中的已知缺陷更少,却多出了 4 倍的「鸡蛋里挑骨头」式细枝末节评论——这些低价值意见最终都要由工程师人工筛查。

在默认「努力等级」下,精确率进一步下滑至 26.4%。CodeRabbit 的结论是:团队应将 Opus 5 视作一个偏重精确度的「第二审查人」,而不是对既有、已运行良好的审查流水线的直接替代升级。

运营产品评测体系、同时对七款模型做横向对比的 Claire Vo 在一篇评论中给出的评价是「聪明但惹人烦」——她称 Opus 5 有明显的「神经质」一面,甚至曾对一次合并冲突「死活不肯碰」。

Anthropic 企业客户报告「代理」能力提升

Cognition 首席执行官 Scott Wu 表示,在其智能开发代理 Devin 中,Opus 5 以约半价逼近 Fable 级别的表现,尤其在调试和根因分析(root cause analysis)上表现突出。Zapier 首席执行官 Wade Foster 则称,该模型在公司内部自动化场景的排行榜上登顶,同时在 Token 消耗上并未高于此前同为每百万输入 Token 收费 5 美元的 Claude 版本。

赞誉之下也有清醒的边界约束。Anthropic 在一则说明中坦言,Opus 5 在进攻性网络安全(offensive security)任务上仍落后于自家 Mythos 5,一旦触发公司安全分类器的高风险请求,将自动回退至 Opus 4.8 处理。

这份谨慎并非空穴来风。作为旗舰产品的 Fable 5,此前在 6 月上线后不久即因问题被紧急下线,直至 7 月初才重新回归用户视野。

下篇关注:HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
独立测试首秀:专家对 Claude Opus 5 分歧加剧 | Yellow