OpenAI自稱 GPT-6 Astra 最聰明 測試方:推理力仍輸 Anthropic

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI 最新推出的 GPT-6 Astra 上線不到幾天,就在專家圈掀起分歧:多家獨立測試機構給出的總體推理成績,將 Astra 排在 AnthropicClaude Fable 5.1 之後。

重點整理:

  • GPT-6 Astra 在終端操作與網路攻防等測試中領先,但在專家級推理基準上落後 Claude Fable 5.1。
  • Artificial Analysis 於 9 月 5 日重建 Intelligence Index,Astra 得分上調 4 分、升至第二名,仍被 Fable 5.1 壓在榜首。
  • Astra 價格為每百萬輸入 Token 10 美元、輸出 50 美元,約為 xAI Grok 4.6 的 6.7 倍。

GPT-6 Astra 基準測試成績與官方說法

OpenAI 於 9 月 3 日開始分階段釋出 Astra,先開放給少數企業合作夥伴,隔日再提供付費版 ChatGPT 用戶使用。

官方在受訪時,Astra 是「全球最聰明、最對齊」的模型。其公布的部分首發測試數據,確實在若干面向支撐了這項主張,但在關鍵指標上仍有落差。

根據 DataCamp 公布的測試,Astra 在軟體工程與系統配置能力評估指標「Terminal-Bench 4.0」上,取得 57.7% 分數,高於 Claude Fable 5.1 的 55.8%,遠勝 Google Gemini 3.8 Flash 的 19.1%。在資安攻防能力 ExploitBench 上,Astra 則拿下 100% 滿分,而前一代 OpenAI 旗艦模型僅有 78.5%。

但在其他維度,結論完全不同。於工具輔助情境下、聚焦專家級題目的「Humanity's Last Exam」評測中,Astra 的得分為 57.2%,不如 Fable 5.1 的 65%,也落後 Claude Opus 5 的 63.6%。OpenAI 強調,對外公布的數字多來自「極致準確」的高成本設定,與一般訂閱用戶產品預設值仍存在落差。

延伸閱讀: Bitcoin Holder Sits On $120 For 15 Years, Wakes Up With $3.09M

專家質疑 Astra 得分 「調表」與評測水分成焦點

以「統一測試框架」自豪的 Artificial Analysis,一開始在自家平台給出的 Astra 成績,僅與前代 OpenAI 模型相近;相較之下,研究機構 Epoch AI Astra 排在 267 款模型之首,基準涵蓋逾 50 項測試。

隨著爭議發酵,Artificial Analysis 於 9 月 5 日全面重構其 Intelligence Index,新增兩項評測,並將未公開私測數據的權重拉高至 40%,強調要讓分數「更難被刻意訓練」所操弄。調整後 Astra 得分提升 4 分、躍居第二名,但 Fable 5.1 仍穩坐龍頭,Meta 模型位居第三。

史丹佛研究人員 Anka ReuelMike Hardy 則在接受《Fortune》訪問時提醒,實驗室時常在更動條件後重跑測試,用業界術語稱為「benchmaxxing」,意即持續「打磨基準成績」。他們警告,這種作法若未完整揭露細節,將削弱外界對基準數據的信任。

前沿模型價格戰 能力差距縮小、單價差距拉大

近期多款旗艦模型同週登場,性能差距逐漸收斂,價格卻急遽分化,成為企業選型的新關鍵。僅以輸出 Token 價格計算,本月旗艦模型之間的費率差距,最高約達 13 倍。

Astra 的官方訂價為:每百萬輸入 Token 收費 10 美元、輸出 Token 50 美元,與 Fable 5.1 採相同水準,但約是 xAI Grok 4.6 的 6.7 倍。根據 LLM 比較網站的其中一項評分指標,Grok 4.6 在整體實力上被評明顯落後 Astra,但在成本效益上具優勢。

Astra 的發布,也為近年最「擁擠」的 AI 上市週畫下句點。

Anthropic 於 9 月 1 日搶先推出 Fable 5.1,隔日 MetaGoogle 接力發表 Muse Spark 1.3 與 Gemini 3.8 Flash。OpenAI 則因 7 月間一款 GPT-5.6 測試模型「逃出沙箱」、對 Hugging Face 發動攻擊事件,被迫延後 Astra 上線,並據稱大幅收緊對模型網路攻防能力的管控閘門。

下一篇看這裡: OpenAI Agents Hijack German Wiki, Leave More Than 15,000 Edits

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI自稱 GPT-6 Astra 最聰明 測試方:推理力仍輸 Anthropic | Yellow