Grok 4.5 在最新獨立代理測試中跑出,為 Elon Musk 一直力推的「高效兼平價」說法提供新數據支持。
重點摘要:
- Grok 4.5 在 AutomationBench-AA 測試中取得 51.4% 分數,力壓兩款 Claude 型號。
- 每項任務成本僅 0.34 美元,遠低於最接近的 Anthropic 競爭對手。
- 模型違反安全「護欄」的比率偏高,為企業級代理部署帶來風險。
Grok 基準測試表現
Artificial Analysis 表示,Grok 4.5 在 AutomationBench-AA 中取得 51.4% 分數,領先 Claude Fable 5 的 48.6% 及 Claude Opus 4.8 的 48.5%。
成本方面,Grok 4.5 每項任務約 0.34 美元,遠低於 Fable 5 的 1.35 美元及 Opus 4.8 的 1.46 美元。
這組成績,為馬斯克早前聲稱 Grok 4.5「效能可比 Opus,但運行更快、更省錢」提供外部驗證。SpaceXAI 本周正式將 Grok 4.5 推向公眾,背後以 1.5 兆參數的 V9 基礎模型為核心,並配合內部早期評估作為發佈定位。
AutomationBench-AA 涵蓋 40 個模擬應用、共 657 個任務,當中包括 Gmail、Slack、Salesforce 及 HubSpot 等常見企業工具。測試重點在於評估 AI 代理能否在不觸犯安全護欄的前提下完成指定目標,而為減低「刷榜」風險,Artificial Analysis 並未公開完整題庫。
延伸閱讀:Grok 4.5 以更平價代理 AI 正面挑戰 OpenAI 與 Anthropic
馬斯克的進取說法
Artificial Analysis 指出,Grok 4.5 每項任務平均輸出約 8,000 個 token,大約只是 Opus 4.8 的四分之一。該公司稱:「其每項任務的總 token 用量約 44 萬,在排行榜上屬最低水平之一。」並補充指,成本優勢來自運算效率及 token 定價雙重因素。
就任務表現而言,模型完成了 79.9% 的部分目標(即有達到主要要求),而「完全通關」的任務比例為 21.9%。在被視為整個基準中最具難度的金融範疇,Grok 4.5 以 71% 領先,對比 Fable 5 的 64% 及 Opus 4.8 的 62%。
不過其短板同樣明顯:合規表現。Grok 4.5 平均每項任務錄得 0.63 次護欄違規,高於 Opus 4.8 的 0.55,以及 Google Gemini 3.5 Flash 的 0.46。對於計劃將代理 AI 連接至實時金融系統的企業而言,這種違規差距相當關鍵。
馬斯克在發佈時,主打的並非「全方位稱王」,而是「性能、成本與風險」之間的實際取捨。Grok 4.5 現時已獲外部數據肯定其速度與成本優勢,但較高的護欄違規率亦突顯,要在企業級場景廣泛落地,可靠性仍是決定性因素。





