Claude Opus 5 首輪獨立測試出爐 專家評價嚴重分歧

Claude Opus 5 首輪獨立測試出爐 專家評價嚴重分歧

獨立測試機構近期對 Anthropic 新款模型 Claude Opus 5 展開首輪評估,在某項能力指數中給出 159 分,比 Claude Fable 5 低兩分,但在程式碼審查上的成績,卻讓測試者意見嚴重分歧。

重點整理:

  • Epoch AI 給予 Claude Opus 5 能力指數 159 分,Fable 5 則為 161 分,兩者在軟體工程能力上幾乎打成平手。
  • CodeRabbit 測得可執行審查意見精準率 39.3%,優於 35.2% 基準值,但同時產生約四倍的「雞蛋裡挑骨頭」式瑣碎意見。
  • 企業測試方 Cognition 與 Zapier 回報,Opus 5 在除錯與端對端業務自動化流程上有明顯提升。

Claude Opus 5 基準測試提早接受市場檢驗

Anthropic 上週五正式推出 Opus 5,並在官網表示,該模型以約半價逼近 Fable 5 的前沿能力,定位是「日常使用主力」,而非高度專業化工具。多數第三方評測機構同意 Opus 5 的整體實力接近 Fable 5,但對差距大小看法不一。

Epoch AI 在自家能力指數中給 Opus 5 打出 159 分,Fable 5 則是 161 分,兩者在軟體工程評分上則被視為同級。這份比較由 Latent Space 匯整發布

另一家機構 Artificial Analysis 則在其「智能代理知識工作」基準測試上,將 Opus 5 排在首位,Elo 分數領先 Fable 5 近 150 分,同時將單次任務成本壓低約 20%。不過,有開發者質疑這些能力指標,認為「比舊版 Opus 4.8 僅多 1 分」嚴重低估了他們在日常使用中感受到的躍進;也有評測者指出,在某些程式測試情境下,中等努力等級的表現,反而優於高強度設定。

延伸閱讀: BitMEX 營運 11 年宣布關門 無人接手收購

代碼審查結果兩極 精準度拉升、瑣碎意見爆量

專攻程式碼審查的 CodeRabbit 將 Opus 5 對照約 100 種真實開源 Pull Request 錯誤樣式進行測試,每種配置跑了三輪,並測得實際可採納審查意見的精準率為 39.3%。

這一成績優於其現行產品級審查員的 35.2% 基準表現,但 Opus 5 抓到的已知錯誤反而較少,卻多產出約四倍的吹毛求疵式註解,也就是工程師最需要花時間人工篩選的低價值意見。

在預設努力等級下,精準率甚至掉到 26.4%。CodeRabbit 的結論是:團隊應將 Opus 5 視為一名偏重精準、作為「第二審查人」的工具,而不是直接替換既有、運作穩定的審查流程。負責為產品團隊評測七款模型的 Claire Vo 則在個人評論中形容這款模型「聰明但惹人厭」,指出其表現帶有某種「神經質」特質,甚至曾堅決拒絕處理一個合併衝突。

Anthropic 企業客戶:代理能力與除錯表現顯著

Cognition 執行長 Scott Wu 表示,在其 AI 工程師產品 Devin 中,Opus 5 以約半成本逼近 Fable 等級的表現,特別是在除錯與根因分析上表現突出。Zapier 執行長 Wade Foster 則指出,Opus 5 在公司內部自動化排行榜中名列前茅,且在 Token 使用量上與過去同樣以每百萬輸入 Token 收費 5 美元的 Claude 型號相當,並未帶來額外支出。

這些正面評價仍有但書。Anthropic 自家也提醒,在進攻性網路安全(offensive cybersecurity)任務上,Opus 5 明顯落後自家 Mythos 5 模型;一旦觸發公司安全分類器標記,請求會自動回退到 Opus 4.8 處理。

這種謹慎態度與其高階產品近期的波折有關:Fable 5 在 6 月正式推出,卻在上線數日後被緊急下架,直到 7 月初才重新開放使用。

接下來看這個: HubSpot 重挫 12.7% 分析師直指 OpenAI 新代理衝擊

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Claude Opus 5 首輪獨立測試出爐 專家評價嚴重分歧 | Yellow