OpenAI 新模型 GPT-6 Astra 在推出數日內即引起專家社群分歧。多個獨立測試機構的綜合排行顯示,在「一般推理能力」上,Astra 仍然排在 Anthropic 的 Claude Fable 5.1 之後。
重點整理:
- GPT-6 Astra 在終端操作及網絡安全測試上表現領先,但在專家級推理基準上落後 Claude Fable 5.1。
- Artificial Analysis 於 9 月 5 日重建 Intelligence Index,Astra 評分上調 4 分,升至第二位,仍落後 Fable 5.1。
- Astra 每 100 萬個輸入代幣收費 10 美元、輸出代幣 50 美元,約為 xAI Grok 4.6 的 6.7 倍。
GPT-6 Astra 基準測試:官方說法與數據落差
OpenAI 於 9 月 3 日開始分階段推出 Astra,先向少數合作機構提供,翌日再開放予付費 ChatGPT 用戶。
公司在對外宣稱,Astra 是「全球最智能、最符合對齊要求」的模型。從官方發布的首輪測試表來看,部分數據支撐這種說法,但並非全部。
在軟件工程及系統配置能力測試 Terminal-Bench 4.0 上,Astra 的得分為 57.7%,高於 Claude Fable 5.1 的 55.8%,遠勝 Google Gemini 3.8 Flash 的 19.1%。在網絡攻防測試 ExploitBench 中,Astra 更錄得 100% 成績,而 OpenAI 上一代旗艦模型僅達 78.5%。
不過,在其他關鍵項目上,畫面完全不同。在被視為「專家終極試卷」的 Humanity's Last Exam(配合工具使用)中,Astra 的分數只有 57.2%,明顯低於 Fable 5.1 的 65%,亦不及 Claude Opus 5 的 63.6%。
OpenAI 強調,對外公布的許多分數,是在「最大努力」調校下所得結果,與一般訂閱用戶在預設設定下的實際體驗,可能存在落差。
延伸閱讀:比特幣持有人 15 年前買入 120 美元 今變 309 萬美元
專家質疑 Astra 評分 「中立榜單」被迫重算
主打跨模型中立測試平台的 Artificial Analysis,早前在其統一測試框架下,初步評估 Astra 的整體水平,僅與 Astra 前身大致相若;但 Epoch AI 則將 Astra 排在 267 個模型之首,涵蓋逾 50 項基準測試。
面對業界質疑,Artificial Analysis 於 9 月 5 日重建其 Intelligence Index,新增兩個評估項目,並把私有測試數據權重提升至 40%,聲稱要降低「刷榜」空間。重算後,Astra 的總分上升 4 分,躍升至第二位,但 Claude Fable 5.1 依然穩居榜首,Meta 緊隨其後排第三。
史丹福研究人員 Anka Reuel 及 Mike Hardy 則警告,實驗室有時會在不同條件下重跑同一套測試,以期拉高指標分數,這種行為在業界被稱為「benchmaxxing」,恐削弱評測結果對真實場景的參考價值。
前沿大模型的「價錢戰」 能力差距不及價格差距
在前沿大模型之間,價格正比單純「效能差距」更明顯地拉開戰線。以本月多款旗艦模型為例,輸出代幣收費最高與最低之間,相差約 13 倍。
Astra 的定價為每 100 萬個輸入代幣 10 美元、輸出代幣 50 美元,與 Claude Fable 5.1 採用同一價目,但約為 xAI Grok 4.6 的 6.7 倍。後者在某些比較指數上,被評估為整體實力大幅落後 Astra,但在成本效益上對企業用戶更具吸引力。
對雲端及 AI 應用開發商而言,這種「同級效能、不同價位」的格局,正在迫使他們重新審視:究竟是追求極致能力,還是選擇性價比更高、但略為「笨」一點的選項。
密集發佈周落幕 安全事件陰影猶在
Astra 的亮相,為業界近期其中一個最「爆滿」的發佈周劃上句號。
Anthropic 於 9 月 1 日率先推出 Fable 5.1,翌日 Meta 和 Google 亦相繼發布 Muse Spark 1.3 及 Gemini 3.8 Flash。OpenAI 則因安全事件而延後上線節奏——其中一個 GPT-5.6 模型在 7 月測試期間「逃出沙盒」,對 Hugging Face 發動攻擊,迫使公司大幅收緊對網絡攻擊相關能力的釋出和管控。
事件令外界更關注:當 Big Tech 爭相推出更強大的前沿模型之際,行業如何在競速與安全之間取得平衡,亦會逐步反映在未來評測指標與價格策略之上。





