独立评测者将 Anthropic 推出的新模型 Claude Opus 5 的某项能力指数评为 159 分,仅比 Claude Fable 5 低 2 分,但在代码审查表现上,测试方意见出现明显分化。
要点速览:
- Epoch AI 给出 Claude Opus 5 能力指数 159 分,Claude Fable 5 为 161 分,两者在软件工程维度打成平手。
- CodeRabbit 测得可执行代码审查意见的精准率为 39.3%,高于 35.2% 的基线,但“吹毛求疵”式低价值点评数量增加约 4 倍。
- 企业侧 Cognition 与 Zapier 的测试显示,该模型在调试与端到端业务自动化上有明显提升。
Claude Opus 5 基准测试迎来首轮“放大镜”
Anthropic 于周五正式发布该模型,并在官方声明中称,Opus 5 以约半价接近 Fable 5 的“前沿智能”水平,定位是一款适合日常场景而非纯粹专家用途的通用型工具。外部评测机构大体认可这一定位,但在具体差距上意见不一。
Epoch AI 在其能力指数上给 Opus 5 打出 159 分,Fable 5 为 161 分;在软件工程维度,两者评分持平,这一结果由 Latent Space 的评测综述披露。
Artificial Analysis 则在其“智能代理知识工作”基准上将 Opus 5 排名第一,相比 Fable 5 领先近 150 Elo,同时将单任务成本压低约 20%。一些开发者对通用能力指数提出质疑,认为“比旧版 Opus 4.8 只高 1 分”的结论严重低估了他们在日常使用中感受到的跃升。一位评测者还发现,在编码测试里,中等“努力等级”的整体效果反而优于更高档位。
延伸阅读:BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
代码审查:评测结果明显分道而行
CodeRabbit 用接近 100 种来自真实开源 Pull Request 的错误模式,对 Opus 5 进行多轮对比测试(每种配置跑三遍),并测得其“可执行审查意见”的精准率为 39.3%。
这一数据优于其现网代码审查系统 35.2% 的基线,但 Opus 5 抓到的“已知缺陷”更少,同时给出的“吹毛求疵式”小问题点评增加约 4 倍——这些低价值意见需要工程师人工筛查和处理。
在默认努力等级下,精准率进一步跌至 26.4%。CodeRabbit 因此认为,团队更适合将 Opus 5 作为“第二位偏重精准度的审查员”,而非简单替换已有、运行良好的审查流水线。运营一套覆盖七种模型、面向产品团队的评测体系的 Claire Vo 在个人评测中评价 Opus 5 “聪明但惹人烦”,直指其“神经质”倾向,以及在遇到一次合并冲突时“死活不愿下手”的表现。
Anthropic 客户:智能代理能力显著增强
Cognition 首席执行官 Scott Wu 表示,在其智能开发助手 Devin 内部测试中,Opus 5 以“半价”逼近 Fable 级别表现,尤其在调试与根因分析方面优势突出。Zapier 首席执行官 Wade Foster 则称,该模型在公司内部自动化性能榜单中名列前茅,而其 Token 消耗并未高于此前同样按每百万输入 Token 5 美元计价的 Claude 版本。
不过,赞誉也伴随着边界。Anthropic 在一篇说明中承认,Opus 5 在“进攻性网络安全”场景中仍落后于其 Mythos 5 模型;一旦触发公司安全分类器,相关请求会自动回退至 Opus 4.8 处理。
这番谨慎态度,延续了近期高端模型线的“起伏期”。Claude 家族的旗舰 Fable 5 在 6 月上线,数日后即被紧急下线整改,直到 7 月初才重新向用户开放。
下一篇:HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent





