AIスタートアップのAnthropicは月曜、「Claude Sonnet 5.5」を発表した。新たな中位グレードの生成AIモデルで、前世代と比べて処理速度は3割超向上し、タスク当たりのコストも最大30%削減できると説明している。
注目ポイント
- コーディング試験「Terminal-Bench 4.0」でSonnet 5.5は70.6%を記録(Sonnet 5は10.3%)。
- Anthropicの最上位モデル向けだったサイバーセキュリティ対策を、Sonnetシリーズとして初めて実装。
- 一部の独立ベンチマークでは、最大負荷時のタスク単価がSonnet 5より高くなったとの指摘もある。
Claude Sonnet 5.5のベンチマーク
Claude Sonnet 5.5は、Claude 5.5シリーズとしては2つ目のモデルで、フラッグシップの「Claude Opus 5.5」公開から6日後に投入されたと、Anthropicはローンチ告知の中で明らかにしている。
同社は、Sonnet 5.5をOpus 5.5の「高速かつ低コストな補完モデル」と位置づける。明確に要件定義された日常業務、バグ修正、仕上げ済みの文書やスライド、スプレッドシート作成などに最適化したとしている。料金は入力トークン100万件あたり2ドル、出力トークン100万件あたり10ドル。
エージェント型のコーディングテスト「Terminal-Bench 4.0」では、Sonnet 5.5は70.6%をマーク。10.3%のSonnet 5や、より高価なOpus 5.5の66.4%を上回った。また、長期的なタスク遂行能力と画像理解力を測る試験として、スクリーンショットのみを入力に「ポケットモンスター 赤」を攻略した初のSonnetモデルにもなった。
Sonnet 5.5は現在、Amazon Web Services、Google Cloud、Microsoft Azureを含むAnthropicの全プラットフォームで提供されている。同社は、より小型で高トラフィック用途やコスト重視のシナリオ向けに設計した「Claude Haiku 5.5」も数週間以内に投入する計画で、これにより3モデル構成が出そろう見通しだ。
関連記事: OpenAI、9月20日の「サンドボックス脱出」後にフロンティアAI開発ペースを減速
Sonnet 5.5の安全策とコスト構造
Anthropicはリリースで、Epic Gamesの最高執行責任者(COO)であるDaniel Vogel氏のコメントを引用している。同氏によると、Sonnet 5.5はテスト段階で数万行規模のゲームプレイ系システムコードを扱うことに成功し、「上位モデルと同等の品質基準を満たした」という。
サイバー領域での能力がOpus 5と同水準に達したことから、Sonnet 5.5は、従来はAnthropicの最上位モデルに限定してきたセキュリティ対策を搭載した初のSonnetとなる。日常的なバグ修正機能には影響しない一方で、リスクの高いサイバー関連リクエストについては、応答先を明示的にSonnet 5へフォールバックさせる仕組みを導入。さらに、新たな分類器により、モデルの推論過程を抽出しようとする試みもブロックする。
ただし、同社のコスト削減主張をすべてのテストが裏付けているわけではない。調査会社Artificial Analysisは、最大努力設定での加重コストを1タスクあたり7.60ドルと算出した。これはSonnet 5の5.09ドルを上回る。一方で、性能を示すインデックススコアは38から56へと大きく伸びている。
今回の投入は、9月22日のOpus 5.5発表に続くものだ。Anthropicはその際、フラッグシップモデルの価格を20%引き下げ、入力トークン100万件あたり4ドル、出力トークン100万件あたり20ドルに改定。典型的なワークロードではOpus 5比で約4割のコスト削減と、3割超の生成速度向上を見込むとしていた。同じ日にOpenAIも「GPT-6 Sol」と「GPT-6 Luna」を投入し、従来モデルの半額水準に価格を設定している。

