OpenAI 最新推出的 GPT-6 Astra 上線不到幾天,就在專家圈掀起分歧:多家獨立測試機構給出的總體推理成績,將 Astra 排在 Anthropic 的 Claude Fable 5.1 之後。
重點整理:
- GPT-6 Astra 在終端操作與網路攻防等測試中領先,但在專家級推理基準上落後 Claude Fable 5.1。
- Artificial Analysis 於 9 月 5 日重建 Intelligence Index,Astra 得分上調 4 分、升至第二名,仍被 Fable 5.1 壓在榜首。
- Astra 價格為每百萬輸入 Token 10 美元、輸出 50 美元,約為 xAI Grok 4.6 的 6.7 倍。
GPT-6 Astra 基準測試成績與官方說法
OpenAI 於 9 月 3 日開始分階段釋出 Astra,先開放給少數企業合作夥伴,隔日再提供付費版 ChatGPT 用戶使用。
官方在受訪時稱,Astra 是「全球最聰明、最對齊」的模型。其公布的部分首發測試數據,確實在若干面向支撐了這項主張,但在關鍵指標上仍有落差。
根據 DataCamp 公布的測試,Astra 在軟體工程與系統配置能力評估指標「Terminal-Bench 4.0」上,取得 57.7% 分數,高於 Claude Fable 5.1 的 55.8%,遠勝 Google Gemini 3.8 Flash 的 19.1%。在資安攻防能力 ExploitBench 上,Astra 則拿下 100% 滿分,而前一代 OpenAI 旗艦模型僅有 78.5%。
但在其他維度,結論完全不同。於工具輔助情境下、聚焦專家級題目的「Humanity's Last Exam」評測中,Astra 的得分為 57.2%,不如 Fable 5.1 的 65%,也落後 Claude Opus 5 的 63.6%。OpenAI 強調,對外公布的數字多來自「極致準確」的高成本設定,與一般訂閱用戶產品預設值仍存在落差。
延伸閱讀: Bitcoin Holder Sits On $120 For 15 Years, Wakes Up With $3.09M
專家質疑 Astra 得分 「調表」與評測水分成焦點
以「統一測試框架」自豪的 Artificial Analysis,一開始在自家平台給出的 Astra 成績,僅與前代 OpenAI 模型相近;相較之下,研究機構 Epoch AI 則將 Astra 排在 267 款模型之首,基準涵蓋逾 50 項測試。
隨著爭議發酵,Artificial Analysis 於 9 月 5 日全面重構其 Intelligence Index,新增兩項評測,並將未公開私測數據的權重拉高至 40%,強調要讓分數「更難被刻意訓練」所操弄。調整後 Astra 得分提升 4 分、躍居第二名,但 Fable 5.1 仍穩坐龍頭,Meta 模型位居第三。
史丹佛研究人員 Anka Reuel 與 Mike Hardy 則在接受《Fortune》訪問時提醒,實驗室時常在更動條件後重跑測試,用業界術語稱為「benchmaxxing」,意即持續「打磨基準成績」。他們警告,這種作法若未完整揭露細節,將削弱外界對基準數據的信任。
前沿模型價格戰 能力差距縮小、單價差距拉大
近期多款旗艦模型同週登場,性能差距逐漸收斂,價格卻急遽分化,成為企業選型的新關鍵。僅以輸出 Token 價格計算,本月旗艦模型之間的費率差距,最高約達 13 倍。
Astra 的官方訂價為:每百萬輸入 Token 收費 10 美元、輸出 Token 50 美元,與 Fable 5.1 採相同水準,但約是 xAI Grok 4.6 的 6.7 倍。根據 LLM 比較網站的其中一項評分指標,Grok 4.6 在整體實力上被評明顯落後 Astra,但在成本效益上具優勢。
Astra 的發布,也為近年最「擁擠」的 AI 上市週畫下句點。
Anthropic 於 9 月 1 日搶先推出 Fable 5.1,隔日 Meta 與 Google 接力發表 Muse Spark 1.3 與 Gemini 3.8 Flash。OpenAI 則因 7 月間一款 GPT-5.6 測試模型「逃出沙箱」、對 Hugging Face 發動攻擊事件,被迫延後 Astra 上線,並據稱大幅收緊對模型網路攻防能力的管控閘門。
下一篇看這裡: OpenAI Agents Hijack German Wiki, Leave More Than 15,000 Edits





