Grok 4.5 代理測試奪冠 51.4%擊敗 Fable 5 與 Opus 4.8

Grok 4.5 代理測試奪冠 51.4%擊敗 Fable 5 與 Opus 4.8

Grok 4.5 在最新獨立代理 AI 基準測試中拿下第一名,為 Elon Musk 一再強調的「高效能、低成本」說法再添實證。

重點整理

  • Grok 4.5 在 AutomationBench-AA 測試拿下 51.4%,領先兩款 Claude 模型。
  • 單一任務成本僅 0.34 美元,遠低於最接近的 Anthropic 競品。
  • 防護規則違規率偏高,成為企業大規模導入代理 AI 的主要風險。

Grok 基準測試表現

研究機構 Artificial Analysis 指出,Grok 4.5 在 AutomationBench-AA 的總分為 51.4%,明顯領先 Claude Fable 5 的 48.6% 與 Claude Opus 4.8 的 48.5%。

成本差距更為明顯:Grok 4.5 每個任務約 0.34 美元,Fable 5 為 1.35 美元、Opus 4.8 則約 1.46 美元,價格幾乎是對手的四分之一到五分之一。

這項成績,為馬斯克先前宣稱「Grok 4.5 是一款效能達 Opus 等級、但更快、更便宜的模型」提供了第三方驗證。SpaceXAI 本週正式將該模型對外開放,採用 1.5 兆參數的 V9 基礎模型,並以內部早期評估成績作為發表主軸。

AutomationBench-AA 共涵蓋 40 個模擬應用、657 項任務,包含 GmailSlackSalesforceHubSpot 等常見商務工具。測試重點在於:代理 AI 能否在不觸犯安全防護與合規規則的前提下,完整達成任務目標。為避免模型針對題庫調校,Artificial Analysis 並未公開完整任務集內容。

延伸閱讀:Grok 4.5 以更低成本向 OpenAI 與 Anthropic 發起代理 AI 挑戰

馬斯克的豪言與代價

Artificial Analysis 指出,Grok 4.5 平均每個任務輸出約 8,000 個 token,大約是 Opus 4.8 的四分之一。該機構表示:「其每個任務的 token 總用量約 44 萬,在排行榜中名列最低水準之一。」低成本主要來自模型本身的運算效率與較具競爭力的 token 定價。

在任務達成度方面,Grok 4.5 完成了 79.9% 的任務目標,其中 21.9% 的任務可「完全通關」(全流程達標、無關鍵疏漏)。在被視為整個基準中最困難的「金融」領域,Grok 4.5 以 71% 的成績居冠,Fable 5 為 64%,Opus 4.8 則為 62%。

但在合規面向,Grok 4.5 的弱點也相當明顯。其每個任務平均出現 0.63 次防護規則違規,高於 Opus 4.8 的 0.55 以及 Google Gemini 3.5 Flash 的 0.46。對需要讓代理 AI 接觸真實金融系統或客戶資料的企業而言,這樣的違規差距並非小事。

馬斯克此次發表策略,並非主打「基準測試全面壓倒對手」,而是強調一種「實務取捨」:以顯著更低的成本與更快的速度,換取接近甚至部分領先頂級模型的實際效能。如今,Grok 4.5 已取得外部機構對其成本與效率的背書,但較高的違規率也凸顯,企業若要大規模採用,仍必須在可靠性與風險控管上投入更多資源。

下一篇:Bitcoin 的反彈,遇上多頭不能忽視的需求難題

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Grok 4.5 代理測試奪冠 51.4%擊敗 Fable 5 與 Opus 4.8 | Yellow