獨立測試機構近日為 Anthropic 最新大模型 Claude Opus 5 打分, 在某項能力指數上評得 159 分,僅落後 Claude Fable 5 兩分,但在程式碼審查表現及整體體感上, 評測者卻出現明顯分歧。
重點摘要:
- Epoch AI 在其能力指數上給予 Claude Opus 5 159 分,Claude Fable 5 為 161 分,兩者在軟件工程項目打成平手。
- CodeRabbit 測得 Opus 5 的「可採納評論」精準度為 39.3%,較 35.2% 基線略有提升,但「雞蛋裡挑骨頭」式評論增加約四倍。
- 企業用戶 Cognition、Zapier 指出,在除錯及端到端業務自動化方面,Opus 5 帶來明顯收益。
Claude Opus 5 基準測試 起步即受放大檢視
Anthropic 上周五推出 Opus 5,並在官方聲明中強調, 新模型在前沿智能上已相當接近 Fable 5,但價格只及一半,定位為日常通用工作馬, 而非高端專用工具。多數外部評測機構大致同意這個定位,但對「差多少」卻各執一詞。
Epoch AI 在其能力指數上,為 Opus 5 打出 159 分,Fable 5 則為 161 分; 兩者於軟件工程相關項目評分相若。據 Latent Space 的綜合報告, 在此維度上兩者實質不分軒輊。
Artificial Analysis 在其「代理式知識工作」基準上,則把 Opus 5 排在首位, 相對 Fable 5 高出近 150 Elo,同時單次任務成本降低約兩成。 不過,部分開發者對能力指數提出質疑,認為 Opus 5 相對舊版 Opus 4.8 只被記錄為「+1 分」, 嚴重低估他們在日常使用中感受到的躍升。一名評測員甚至發現, 模型在中等「努力程度」設定下的編碼表現,勝過高強度設定。
延伸閱讀: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
程式碼審查結果兩極 精準度提升「碎碎念」更多
程式碼審查平台 CodeRabbit 以約 100 個真實開源 Pull Request 中的錯誤模式, 在多種配置下對 Opus 5 進行三輪測試,並統計 其「可採納評論」精準度為 39.3%。
這一數字高於其現役生產審查系統 35.2% 的基線,但 Opus 5 捕捉到的「已知錯誤」反而較少, 同時產生的低價值吹毛求疵式評論約為基線的四倍,工程師需花額外時間逐一過濾。
在預設「努力程度」之下,精準度更跌至 26.4%。CodeRabbit 的結論是, 團隊應把 Opus 5 視為一名「第二審、偏重精準」的輔助審查員, 而非對現有、已運作良好審查流水線的直接升級替代。
進行七款模型評測、專注產品團隊場景的 Claire Vo 則在評論中形容 Opus 5「又聰明又惱人」,指其展現出近乎神經質的性格,甚至曾在遇到合併衝突時, 直接拒絕處理。
Anthropic 企業客戶:智能代理表現明顯拉升
Cognition 行政總裁 Scott Wu 表示,在其開發者代理產品 Devin 內部測試中, Opus 5 以約半價,實際表現已逼近 Fable 等級,尤其在除錯及根因分析方面表現突出。
Zapier 行政總裁 Wade Foster 則指出,Opus 5 在公司內部自動化評分榜上名列前茅, 但整體 Token 使用量並未高於過往同樣定價為每百萬輸入 Token 5 美元的 Claude 型號。
不過,這些讚譽同時伴隨邊界限制。Anthropic 在一篇技術說明中提到, Opus 5 在進攻性網絡安全任務上,仍落後於自家 Mythos 5 模型; 而所有被安全分類器標記為風險較高的請求,系統會自動回退至 Opus 4.8 處理。
此一謹慎取態,可視為對其高階產品近期「顛簸期」的回應:Fable 5 在 6 月推出後不久即被暫停服務, 其後於 7 月初才重新向用戶開放。
下一篇: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent






