Grok 4.5 在最新獨立代理 AI 基準測試中拿下第一名,為 Elon Musk 一再強調的「高效能、低成本」說法再添實證。
重點整理
- Grok 4.5 在 AutomationBench-AA 測試拿下 51.4%,領先兩款 Claude 模型。
- 單一任務成本僅 0.34 美元,遠低於最接近的 Anthropic 競品。
- 防護規則違規率偏高,成為企業大規模導入代理 AI 的主要風險。
Grok 基準測試表現
研究機構 Artificial Analysis 指出,Grok 4.5 在 AutomationBench-AA 的總分為 51.4%,明顯領先 Claude Fable 5 的 48.6% 與 Claude Opus 4.8 的 48.5%。
成本差距更為明顯:Grok 4.5 每個任務約 0.34 美元,Fable 5 為 1.35 美元、Opus 4.8 則約 1.46 美元,價格幾乎是對手的四分之一到五分之一。
這項成績,為馬斯克先前宣稱「Grok 4.5 是一款效能達 Opus 等級、但更快、更便宜的模型」提供了第三方驗證。SpaceXAI 本週正式將該模型對外開放,採用 1.5 兆參數的 V9 基礎模型,並以內部早期評估成績作為發表主軸。
AutomationBench-AA 共涵蓋 40 個模擬應用、657 項任務,包含 Gmail、Slack、Salesforce 與 HubSpot 等常見商務工具。測試重點在於:代理 AI 能否在不觸犯安全防護與合規規則的前提下,完整達成任務目標。為避免模型針對題庫調校,Artificial Analysis 並未公開完整任務集內容。
延伸閱讀:Grok 4.5 以更低成本向 OpenAI 與 Anthropic 發起代理 AI 挑戰
馬斯克的豪言與代價
Artificial Analysis 指出,Grok 4.5 平均每個任務輸出約 8,000 個 token,大約是 Opus 4.8 的四分之一。該機構表示:「其每個任務的 token 總用量約 44 萬,在排行榜中名列最低水準之一。」低成本主要來自模型本身的運算效率與較具競爭力的 token 定價。
在任務達成度方面,Grok 4.5 完成了 79.9% 的任務目標,其中 21.9% 的任務可「完全通關」(全流程達標、無關鍵疏漏)。在被視為整個基準中最困難的「金融」領域,Grok 4.5 以 71% 的成績居冠,Fable 5 為 64%,Opus 4.8 則為 62%。
但在合規面向,Grok 4.5 的弱點也相當明顯。其每個任務平均出現 0.63 次防護規則違規,高於 Opus 4.8 的 0.55 以及 Google Gemini 3.5 Flash 的 0.46。對需要讓代理 AI 接觸真實金融系統或客戶資料的企業而言,這樣的違規差距並非小事。
馬斯克此次發表策略,並非主打「基準測試全面壓倒對手」,而是強調一種「實務取捨」:以顯著更低的成本與更快的速度,換取接近甚至部分領先頂級模型的實際效能。如今,Grok 4.5 已取得外部機構對其成本與效率的背書,但較高的違規率也凸顯,企業若要大規模採用,仍必須在可靠性與風險控管上投入更多資源。





