独立系の評価者らは、Anthropicの新モデルClaude Opus 5に対し、ある能力指数で「159」というスコアを付与した。これはClaude Fable 5の161に2ポイント差と肉薄する一方、コードレビュー性能を中心に評価は大きく割れている。
主なポイント
- Epoch AIは能力指数でClaude Opus 5を159、Claude Fable 5を161と評価し、ソフトウェアエンジニアリング領域では両者を同等と判定。
- CodeRabbitは、実務で役立つコードレビューコメントの適合率を39.3%と測定(従来ベースラインは35.2%)する一方、「粗探し」的な指摘は約4倍に増加。
- CognitionやZapierなどエンタープライズ利用企業は、デバッグや業務プロセス全体の自動化での性能向上を報告。
「Claude Opus 5」ベンチマーク、早くも精査の対象に
Anthropicは金曜日に同モデルをリリースし、自社発表で「Fable 5に迫るフロンティア級の知能を、価格は半分で提供する」と説明した。位置づけは、特定用途向けの“尖った”モデルではなく、日常的に使える万能ツールだとしている。外部の評価者も概ねこの見立てに同調したが、その“差の大きさ”については意見が割れている。
Epoch AIはOpus 5に能力指数159、Fable 5に161を付与し、ソフトウェアエンジニアリング分野では両者を「同格」と評価したと、Latent Spaceのまとめ記事が報じている。
一方、Artificial Analysisは、エージェント型のナレッジワーク向けベンチマークでOpus 5を首位に位置づけ、Fable 5をEloレーティングで約150ポイント上回った上、タスク単価も20%削減したとしている。
ただし、開発者コミュニティからはこの能力指数に対する異論も少なくない。旧モデルのOpus 4.8から「1ポイントしか伸びていない」という指標は、日々の実務で感じる性能向上を大きく過小評価しているのではないか、との声が上がる。ある評価者は、コーディングテストにおいて、より高い設定よりも「中程度の努力」設定の方がスコアが良かったと指摘した。
関連記事: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
コードレビュー評価は真っ二つ
コードレビュー用AIツールを提供するCodeRabbitは、実在するオープンソースのプルリクエストから抽出した約100種類のエラーパターンを用い、設定ごとに3回ずつ、Opus 5を検証。自社ブログで「実務で修正アクションにつながるコメント」の適合率を39.3%と報告した。
これは、同社の本番レビュワーモデルが出す35.2%というベースラインを上回る。しかし既知のバグの検出数は減少し、エンジニアが対応の優先順位付けに苦慮するような低付加価値の“重箱の隅”コメント(nitpick)が約4倍に増加したとされる。
デフォルト設定(標準的な努力レベル)では、適合率は26.4%まで低下した。同社は総括として、「既に機能しているレビューパイプラインをOpus 5に全面置き換える“アップグレード”としてではなく、“精度重視の2人目のレビュワー”として位置づけるのが現実的」との見解を示した。
プロダクトチーム向けに7モデルを横断評価しているClaire Vo氏も、ニュースレターで同モデルを「優秀だが扱いづらい」と表現。神経質な応答傾向と、マージコンフリクトの解消を頑なに拒否した事例を挙げ、使い勝手に課題があると指摘した。
Anthropic顧客はエージェント性能向上を評価
開発者向けAIエージェント「Devin」を展開するCognitionのScott Wu最高経営責任者(CEO)は、Opus 5がDevin内部において「Fableクラスの性能にコスト半分で迫っている」とコメント。特にデバッグと根本原因分析(RCA)で強みがあると評価した。
業務自動化プラットフォームを運営するZapierのトップ、Wade Foster氏も、同社の自動化ベンチマークでOpus 5が歴代Claudeモデルを上回りながら、入力100万トークンあたり5ドルという従来Claudeと同水準の料金で、トークン消費量も増えていないと述べた。
もっとも、賛辞には留保も付く。Anthropic自身も、Opus 5は攻撃的サイバーセキュリティ分野ではMythos 5に及ばないと認めており、同社の安全性クラシファイアによりリスクが高いと判定されたリクエストは、自動的にOpus 4.8へフォールバックさせている。
こうした慎重姿勢の背景には、上位モデルを巡る不安定な推移がある。Fable 5は6月にローンチされたものの、数日で一時停止となり、その後7月初旬に再提供されるという経緯をたどった。
次に読む: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent






