獨立評測機構為 Anthropic 全新模型 Claude Opus 5 打出 159 分能力指數,比 Claude Fable 5 低 2 分,而在程式碼審查表現上,更令測試者分成兩派。
重點摘要:
- Epoch AI 在其能力指數上給予 Claude Opus 5 159 分,Fable 5 則為 161 分,兩者在軟件工程能力上則旗鼓相當。
- CodeRabbit 測得 Opus 5 在「可採納評論」精準度為 39.3%,高於原有 35.2% 基線,但同時產生多出四倍的「吹毛求疵」式評論。
- 企業用戶如 Cognition 與 Zapier 指出,Opus 5 在除錯及端到端業務自動化方面有明顯進步。
Claude Opus 5 初期基準測試備受放大檢視
Anthropic 上周五正式推出 Opus 5,並在官方聲明中表示,該模型以約半價的成本逼近 Fable 5 的前沿智能水準,定位為「日用旗艦」而非專用高階工具。多數外部評測機構大致認同這個定位,但對與 Fable 5 的實際差距卻頗有爭論。
Epoch AI 在能力指數中給 Opus 5 評為 159 分,Fable 5 則為 161 分,並指兩者在軟件工程項目上不分高下;相關統整由 Latent Space 在報告中披露。
另一邊廂,Artificial Analysis 在其「代理型知識工作」基準中,把 Opus 5 排在首位,不但在 Elo 評級上大幅領先 Fable 5 近 150 分,亦把單次任務成本壓低約兩成。不過,部分開發者對「能力指數」這指標提出質疑,認為該指數僅反映出對舊版 Opus 4.8「多 1 分」的進步,遠遠低估了他們在日常使用中感受到的躍升。有評測者甚至發現,在某些編碼測試中,中等「努力等級」比高強度設定表現更好。
延伸閱讀:BitMEX 營運 11 年宣告結業 暫未覓得接手買家
程式碼審查測試結果分裂社群
程式碼審查平台 CodeRabbit 以約 100 個來自實際開源 Pull Request 的錯誤模式,對 Opus 5 進行多組配置、每組三輪測試,並統計其可行審查評論的精準度為 39.3%。
該成績高於其現役生產審查系統的 35.2% 基線,顯示 Opus 5 較擅長提出「真正值得修改」的建議。但同一時間,模型抓到的「已知錯誤」總數反而較少,而「吹毛求疵」式低價值評論則暴增四倍,意味工程師要花更多時間篩選雜訊。
在預設「努力等級」下,精準度更跌至 26.4%。CodeRabbit 因而總結:團隊應把 Opus 5 當作「專責精準第二審」的輔助審查者,而不是直接取代現有已穩定運作的程式審查流程。
進行七款模型產品評測的 Claire Vo 則在個人評語中形容 Opus 5「聰明到有點煩人」,指出模型帶有明顯「神經質」特質,甚至曾因操心合併衝突風險而堅拒處理某次 merge conflict。
Anthropic 企業客戶:代理能力顯著升級
Cognition 行政總裁 Scott Wu 表示,在其開發的 AI 工程師 Devin 內部測試中,Opus 5 以約半價的成本,逼近 Fable 級別的整體表現,尤其在程式除錯和根因分析(root-cause analysis)方面表現突出。
Zapier 創辦人兼行政總裁 Wade Foster 亦指出,Opus 5 在公司內部自動化任務排行榜中躍升至首位,而且在使用的 Token 數量上並未多於早前同價(每百萬輸入 Token 收費 5 美元)的 Claude 版本,等於在不加價的情況下,實際運算效益更高。
不過,這些正面評價亦附帶前提。Anthropic 在另一份技術說明中提醒,Opus 5 在進攻性網絡安全場景上仍落後於自家 Mythos 5 模型;而一旦請求被公司安全分類器標記為高風險,系統會自動回退使用較舊的 Opus 4.8。
這種審慎態度與近期高階模型的波折不無關係——Fable 5 在 6 月推出後不久曾一度下架,至 7 月初才重新全面向用戶開放。





