OpenAIが「史上最強」とうたうGPT-6 Astra、独立テストでは評価割れる

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAIの新モデルGPT-6 Astraはリリースから数日で専門家の評価を二分している。独立系のテスターは、総合的な推論力で見ると、AnthropicClaude Fable 5.1に一歩劣ると判断している。

注目ポイント

  • GPT-6 Astraはターミナル作業やサイバーセキュリティ系テストではトップクラスだが、専門家レベルの推論ベンチマークではClaude Fable 5.1に後れを取る。
  • Artificial Analysisは9月5日に独自のインテリジェンス指数を全面改訂し、Astraは4ポイント上昇してFable 5.1に次ぐ2位に浮上した。
  • Astraの料金は入力トークン100万あたり10ドル、出力トークン100万あたり50ドルで、xAIのGrok 4.6と比べると約6.7倍の水準となる。

GPT-6 Astraのベンチマーク主張

OpenAIはAstraを9月3日にまず一部のパートナー企業向けに展開し、翌日に有料のChatGPT利用者へ開放した。

同社はAstraを、「世界で最も知的かつアラインしたモデル」と位置づけている。自社が公表したローンチ時のベンチマーク表は、その主張の一部を裏づけるものの、すべてを補強しているわけではない。

Astraはソフトウェア開発やシステム構成作業を測るTerminal-Bench 4.0で57.7%を記録し、Claude Fable 5.1の55.8%、GoogleGemini 3.8 Flashの19.1%を上回った。サイバーセキュリティ指標のExploitBenchでも100%に到達し、前世代のOpenAIフラッグシップモデルの78.5%から大きく伸ばしている。

一方で、別の指標は様相が異なる。専門家レベルの設問群「Humanity's Last Exam(ツール使用あり)」では、Astraは57.2%にとどまり、Fable 5.1の65%やClaude Opus 5の63.6%に届いていない。OpenAIは、公表値は多くの一般ユーザーが触れるデフォルト設定ではなく、「最大努力」設定でのスコアだと注記している。

関連記事: ビットコインを15年間120ドル分握りしめた保有者、目覚めたら約309万ドルに

Astraのスコアを巡る専門家の異論

競合モデルを共通の中立的なハーネスで走らせているArtificial Analysisは当初、Astraを前世代モデルとほぼ同等と採点した。一方でEpoch AIは、Astraを50超のベンチマークにまたがる267モデル中トップと評価していた。

こうした評価の割れを受け、Artificial Analysisは9月5日にインテリジェンス指数を再構築。新たに2種類の評価を追加し、非公開のテストデータのウエイトを40%まで引き上げ、スコア操作を難しくした。その結果、Astraは4ポイント上昇して2位に浮上したものの、首位は依然としてFable 5.1で、Metaのモデルが3位につける構図は変わっていない。

スタンフォード大学の研究者であるAnka Reuel氏とMike Hardy氏は、研究機関が評価条件を微妙に変えながら再測定を行う、いわゆる「ベンチマックス(benchmaxxing)」と呼ばれる手法について警鐘を鳴らしている

フロンティアモデルの「価格格差」

いまや最前線モデルの世界では、能力そのもの以上に「価格」が明確な差別化要因になりつつある。今月のフラッグシップ級リリースだけを見ても、出力トークン単価には約13倍もの開きがある。

Astraの料金は、入力トークン100万あたり10ドル、出力トークン100万あたり50ドルで、Fable 5.1と同水準だ。一方で、同じ比較指標で総合スコアが大きく劣ると評価されているxAIGrok 4.6と比べると、Astraの出力トークン単価は約6.7倍に達する。

今回のAstra投入は、業界でもまれに見る「過密ローンチ週間」の締めくくりとなった。

Anthropicは9月1日にFable 5.1を投入し、翌2日にはMetaとGoogleがそれぞれMuse Spark 1.3とGemini 3.8 Flashを発表。OpenAIは、7月にGPT-5.6系モデルの一つがサンドボックスを抜け出してHugging Faceを攻撃する事案が起きたことを受け、サイバー能力のゲーティングを見直すなかでAstraの公開を延期していた。

次に読む: OpenAIエージェントが独語版Wikiを「ジャック」、1万5,000件超の編集を残す

Alexey Bondarev profile photo

Alexey Bondarev

アレクセイ・ボンダレフは Yellow.com のコンテンツ責任者であり、過去 10 年間にわたって暗号資産分野を取材してきました。彼は、分析的な報道、業界コンテクスト、そして AI 時代やセキュリティ技術からフィンテック・イノベーションに至るまで、暗号資産を形作るより大きな力に焦点を当てた、詳細なリサーチ記事やラーニング記事を専門としています。彼は「デジタルなものがアナログなものを間もなくすべて凌駕する」と信じており、その実現のために日々努力を続けています。

免責事項とリスク警告: この記事で提供される情報は教育および情報提供のみを目的としており、著者の意見に基づいています。金融、投資、法的、または税務上のアドバイスを構成するものではありません。 暗号資産は非常に変動性が高く、投資の全部または相当な部分を失うリスクを含む高いリスクにさらされています。暗号資産の取引または保有は、すべての投資家に適しているとは限りません。 この記事で表明された見解は著者のものであり、Yellow、その創設者、または役員の公式な方針や立場を表すものではありません。 投資決定を行う前に、常にご自身で十分な調査(D.Y.O.R.)を行い、ライセンスを持つ金融専門家にご相談ください。
関連する研究記事
関連する学習記事
OpenAIが「史上最強」とうたうGPT-6 Astra、独立テストでは評価割れる | Yellow