首波獨立測試出爐 專家對 Claude Opus 5 評價分歧

Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)
Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)

獨立測試機構近期公布結果,將 Anthropic 最新模型 Claude Opus 5 在一項能力指數上評為 159 分,僅比 Claude Fable 5 少 2 分,但在程式碼審查與實務效益上的解讀卻高度分歧。

重點整理

  • Epoch AI 在其能力指數上給出 Claude Opus 5 159 分,Fable 5 則為 161 分,兩者在軟體工程項目並列。
  • CodeRabbit 測得 Opus 5 在「具行動意義」的審查註解上精準度為 39.3%,高於 35.2% 的既有基準,但無關痛癢的挑剔註解暴增逾四倍。
  • 企業用戶 Cognition 與 Zapier 回報,在除錯與端到端業務流程自動化方面,Opus 5 帶來明顯提升。

Claude Opus 5 基準測試 上線即遭放大檢視

Anthropic 於上週五正式推出 Opus 5,並在官網表示,其整體智能逼近 Fable 5 的前緣水準,價格卻只有一半,定位為日常廣泛適用的「主力工作機」,而非少數場景專用的高階利器。多數外部評測整體上同意這個說法,但在細部差距上看法不一。

Epoch AI 將 Opus 5 的能力指數定在 159 分,相較 Fable 5 的 161 分略遜一籌,且在軟體工程維度上評為實質打成平手;相關彙整由 Latent Space 在報導中揭露

另一方面,Artificial Analysis 在其「智能代理知識工作」基準測試中,將 Opus 5 排名第一,Elo 評分幾乎領先 Fable 5 近 150 分,同時每項任務成本降低約 20%。部分開發者則質疑這類「單一能力指數」,認為只比舊版 Opus 4.8 高出 1 分,嚴重低估了他們在日常開發中感受到的躍進。有評測者甚至發現,在程式測試場景中,中等「努力等級」的設定表現,反而優於更高強度設定。

延伸閱讀:BitMEX 營運 11 年宣告關門 仍未尋獲買家接手

程式碼審查結果兩極 「精準但囉嗦」成共識

專攻自動程式碼審查的 CodeRabbit,以約 100 種實際開源 Pull Request 中常見錯誤模式為標的,針對不同設定各跑三輪測試,並統計 Opus 5 在「具行動意義」審查註解上的精準度為 39.3%。

這項成績優於其現行正式上線 Reviewer 的 35.2% 基準水準,但同時也抓漏較少已知錯誤,且產生的「雞蛋裡挑骨頭」式低價值註解約為原本四倍,工程師必須花更多時間篩選與忽略。

在預設努力等級下,精準度進一步下滑到 26.4%。CodeRabbit 的結論是:團隊應將 Opus 5 視為「第二位、偏重精準度的輔助 Reviewer」,而不是對既有穩定產線的直接升級替換。負責為產品團隊運行七款模型評測的 Claire Vo 在個人評測文中形容,Opus 5「聰明又惹人厭」,指出它在互動上帶有某種「神經質」傾向,甚至曾遇到一個 Merge Conflict,模型堅持拒絕處理。

Anthropic 企業客戶:代理能力明顯升級

Cognition 執行長 Scott Wu 表示,在該公司 AI 工程師產品 Devin 中,Opus 5 以「半價逼近 Fable 等級表現」,尤其在除錯與根因分析(root-cause analysis)等場景展現出色實力。Zapier 執行長 Wade Foster 則指出,Opus 5 在公司內部的自動化任務排行榜中奪冠,且使用 Token 量並未高於過去同樣以每百萬輸入 Token 5 美元定價的 Claude 系列前代模型。

不過,這些正面評價也伴隨明確但書。Anthropic 在一篇技術說明中強調,Opus 5 在「攻擊性資安」(offensive cybersecurity)任務上仍不及自家 Mythos 5 模型;此外,凡是被公司安全分類器標記為高風險的請求,都會自動回退改由 Opus 4.8 處理。

這種謹慎態度與此前高階產品線的波折有關:Fable 5 於 6 月正式推出,卻在上線數日後緊急下架,直到 7 月初才再度開放使用。

下一篇看這裡:HubSpot 重挫 12.7% 分析師直指 OpenAI 新代理是元凶

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
首波獨立測試出爐 專家對 Claude Opus 5 評價分歧 | Yellow