獨立測試機構近期公布結果,將 Anthropic 最新模型 Claude Opus 5 在一項能力指數上評為 159 分,僅比 Claude Fable 5 少 2 分,但在程式碼審查與實務效益上的解讀卻高度分歧。
重點整理
- Epoch AI 在其能力指數上給出 Claude Opus 5 159 分,Fable 5 則為 161 分,兩者在軟體工程項目並列。
- CodeRabbit 測得 Opus 5 在「具行動意義」的審查註解上精準度為 39.3%,高於 35.2% 的既有基準,但無關痛癢的挑剔註解暴增逾四倍。
- 企業用戶 Cognition 與 Zapier 回報,在除錯與端到端業務流程自動化方面,Opus 5 帶來明顯提升。
Claude Opus 5 基準測試 上線即遭放大檢視
Anthropic 於上週五正式推出 Opus 5,並在官網表示,其整體智能逼近 Fable 5 的前緣水準,價格卻只有一半,定位為日常廣泛適用的「主力工作機」,而非少數場景專用的高階利器。多數外部評測整體上同意這個說法,但在細部差距上看法不一。
Epoch AI 將 Opus 5 的能力指數定在 159 分,相較 Fable 5 的 161 分略遜一籌,且在軟體工程維度上評為實質打成平手;相關彙整由 Latent Space 在報導中揭露。
另一方面,Artificial Analysis 在其「智能代理知識工作」基準測試中,將 Opus 5 排名第一,Elo 評分幾乎領先 Fable 5 近 150 分,同時每項任務成本降低約 20%。部分開發者則質疑這類「單一能力指數」,認為只比舊版 Opus 4.8 高出 1 分,嚴重低估了他們在日常開發中感受到的躍進。有評測者甚至發現,在程式測試場景中,中等「努力等級」的設定表現,反而優於更高強度設定。
延伸閱讀:BitMEX 營運 11 年宣告關門 仍未尋獲買家接手
程式碼審查結果兩極 「精準但囉嗦」成共識
專攻自動程式碼審查的 CodeRabbit,以約 100 種實際開源 Pull Request 中常見錯誤模式為標的,針對不同設定各跑三輪測試,並統計 Opus 5 在「具行動意義」審查註解上的精準度為 39.3%。
這項成績優於其現行正式上線 Reviewer 的 35.2% 基準水準,但同時也抓漏較少已知錯誤,且產生的「雞蛋裡挑骨頭」式低價值註解約為原本四倍,工程師必須花更多時間篩選與忽略。
在預設努力等級下,精準度進一步下滑到 26.4%。CodeRabbit 的結論是:團隊應將 Opus 5 視為「第二位、偏重精準度的輔助 Reviewer」,而不是對既有穩定產線的直接升級替換。負責為產品團隊運行七款模型評測的 Claire Vo 在個人評測文中形容,Opus 5「聰明又惹人厭」,指出它在互動上帶有某種「神經質」傾向,甚至曾遇到一個 Merge Conflict,模型堅持拒絕處理。
Anthropic 企業客戶:代理能力明顯升級
Cognition 執行長 Scott Wu 表示,在該公司 AI 工程師產品 Devin 中,Opus 5 以「半價逼近 Fable 等級表現」,尤其在除錯與根因分析(root-cause analysis)等場景展現出色實力。Zapier 執行長 Wade Foster 則指出,Opus 5 在公司內部的自動化任務排行榜中奪冠,且使用 Token 量並未高於過去同樣以每百萬輸入 Token 5 美元定價的 Claude 系列前代模型。
不過,這些正面評價也伴隨明確但書。Anthropic 在一篇技術說明中強調,Opus 5 在「攻擊性資安」(offensive cybersecurity)任務上仍不及自家 Mythos 5 模型;此外,凡是被公司安全分類器標記為高風險的請求,都會自動回退改由 Opus 4.8 處理。
這種謹慎態度與此前高階產品線的波折有關:Fable 5 於 6 月正式推出,卻在上線數日後緊急下架,直到 7 月初才再度開放使用。






