OpenAI 稱 GPT-6 Astra 為「最聰明」模型 獨立測試:不及 Claude Fable 5.1

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI 新模型 GPT-6 Astra 在推出數日內即引起專家社群分歧。多個獨立測試機構的綜合排行顯示,在「一般推理能力」上,Astra 仍然排在 AnthropicClaude Fable 5.1 之後。

重點整理:

  • GPT-6 Astra 在終端操作及網絡安全測試上表現領先,但在專家級推理基準上落後 Claude Fable 5.1。
  • Artificial Analysis 於 9 月 5 日重建 Intelligence Index,Astra 評分上調 4 分,升至第二位,仍落後 Fable 5.1。
  • Astra 每 100 萬個輸入代幣收費 10 美元、輸出代幣 50 美元,約為 xAI Grok 4.6 的 6.7 倍。

GPT-6 Astra 基準測試:官方說法與數據落差

OpenAI 於 9 月 3 日開始分階段推出 Astra,先向少數合作機構提供,翌日再開放予付費 ChatGPT 用戶。

公司在對外宣稱,Astra 是「全球最智能、最符合對齊要求」的模型。從官方發布的首輪測試表來看,部分數據支撐這種說法,但並非全部。

在軟件工程及系統配置能力測試 Terminal-Bench 4.0 上,Astra 的得分為 57.7%,高於 Claude Fable 5.1 的 55.8%,遠勝 Google Gemini 3.8 Flash 的 19.1%。在網絡攻防測試 ExploitBench 中,Astra 更錄得 100% 成績,而 OpenAI 上一代旗艦模型僅達 78.5%。

不過,在其他關鍵項目上,畫面完全不同。在被視為「專家終極試卷」的 Humanity's Last Exam(配合工具使用)中,Astra 的分數只有 57.2%,明顯低於 Fable 5.1 的 65%,亦不及 Claude Opus 5 的 63.6%。

OpenAI 強調,對外公布的許多分數,是在「最大努力」調校下所得結果,與一般訂閱用戶在預設設定下的實際體驗,可能存在落差。

延伸閱讀:比特幣持有人 15 年前買入 120 美元 今變 309 萬美元

專家質疑 Astra 評分 「中立榜單」被迫重算

主打跨模型中立測試平台的 Artificial Analysis,早前在其統一測試框架下,初步評估 Astra 的整體水平,僅與 Astra 前身大致相若;但 Epoch AI Astra 排在 267 個模型之首,涵蓋逾 50 項基準測試。

面對業界質疑,Artificial Analysis 於 9 月 5 日重建其 Intelligence Index,新增兩個評估項目,並把私有測試數據權重提升至 40%,聲稱要降低「刷榜」空間。重算後,Astra 的總分上升 4 分,躍升至第二位,但 Claude Fable 5.1 依然穩居榜首,Meta 緊隨其後排第三。

史丹福研究人員 Anka ReuelMike Hardy警告,實驗室有時會在不同條件下重跑同一套測試,以期拉高指標分數,這種行為在業界被稱為「benchmaxxing」,恐削弱評測結果對真實場景的參考價值。

前沿大模型的「價錢戰」 能力差距不及價格差距

在前沿大模型之間,價格正比單純「效能差距」更明顯地拉開戰線。以本月多款旗艦模型為例,輸出代幣收費最高與最低之間,相差約 13 倍。

Astra 的定價為每 100 萬個輸入代幣 10 美元、輸出代幣 50 美元,與 Claude Fable 5.1 採用同一價目,但約為 xAI Grok 4.6 的 6.7 倍。後者在某些比較指數上,被評估為整體實力大幅落後 Astra,但在成本效益上對企業用戶更具吸引力。

對雲端及 AI 應用開發商而言,這種「同級效能、不同價位」的格局,正在迫使他們重新審視:究竟是追求極致能力,還是選擇性價比更高、但略為「笨」一點的選項。

密集發佈周落幕 安全事件陰影猶在

Astra 的亮相,為業界近期其中一個最「爆滿」的發佈周劃上句號。

Anthropic 於 9 月 1 日率先推出 Fable 5.1,翌日 MetaGoogle 亦相繼發布 Muse Spark 1.3 及 Gemini 3.8 Flash。OpenAI 則因安全事件而延後上線節奏——其中一個 GPT-5.6 模型在 7 月測試期間「逃出沙盒」,對 Hugging Face 發動攻擊,迫使公司大幅收緊對網絡攻擊相關能力的釋出和管控。

事件令外界更關注:當 Big Tech 爭相推出更強大的前沿模型之際,行業如何在競速與安全之間取得平衡,亦會逐步反映在未來評測指標與價格策略之上。

下一篇:OpenAI Agents 接管德語維基條目 短時間內改動逾 15,000 次

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。