Grok 4.5 同 GPT-5.6 相隔一日先後登場,立即將評論界分成兩派:一邊聚焦 OpenAI 旗艦 GPT-5.6 Sol,在「代理式編碼」測試中拿到 91.9% 分數;另一邊則看中 SpaceXAI 每百萬代幣只收 2 美元、企圖顛覆高端模型定價的挑戰。
重點摘要:
- GPT-5.6 Sol 在大部分正面對比基準測試中領先,但 Grok 4.5 在價格、回應速度同代幣用量上全面壓價。
- 獨立測試機構將 Grok 4.5 智能水平排第四,但同時標示其幻覺率由 25% 急升至 54%。
- 評測者普遍認為:寫作同長程編碼任務 GPT-5.6 佔優,而 Grok 4.5 更適合高流量、緊成本預算的日常場景。
Grok 4.5 對撼 GPT-5.6:跑分與價格兩張成績表
SpaceXAI 於 7 月 8 日推出 Grok 4.5,OpenAI 隨即在翌日發表 GPT-5.6 系列,包含高階的 Sol,以及定價較低的 Terra 同 Luna 兩級型號。基準測試機構 Artificial Analysis 在其 Intelligence Index 上,將新 Grok 評為 54 分,排第四,落後於 Claude Fable 5、GPT-5.5 同 Opus 4.8。
正面交鋒方面,形勢暫時傾向 OpenAI。一份初步成績表顯示,GPT-5.6 Sol 總分為 86 分,略高於 Grok 4.5 的 82 分,關鍵差距在終端互動式代理任務:Sol 得分 91.9%,遠高於 Grok 4.5 的 83.3%。至於一般編碼平均分則幾乎打和,分別為 64.7 對 64.6。
OpenAI 表示,在最大推理設定下,Sol 在獨立「Coding Agent Index」中錄得 80 分,創新高;Grok 4.5 則在其 Grok Build 測試環境中得到 76 分。只不過,計到落錢就係另一個故事:Grok 每百萬輸入代幣收費 2 美元,而 Sol 要 5 美元;完成一個編碼任務,Grok 成本約 2.49 美元,相對 Fable 5 約 11.80 美元,價差極具殺傷力。
延伸閱讀:道奇隊交易盤注碼飆至 6,800 萬美元,Polymarket、Kalshi 押注棒球季後賽
編碼、寫作與日常應用:分工愈見清晰
實戰測試亦大致印證上述分化。有長期測試框架在超過 100 個真實程式庫任務中發現,Sol 在無需反覆試錯之下,成功完成 63.7% 任務,並能在多步驟、雜亂指示情況下維持任務方向。另一個獨立編碼評測則給予 Sol 92 分(滿分 100),Grok 4.5 則拿到 87 分,與市場上表現最好的開源權重模型看齊。
寫作方面,早期用家形容 Sol 已足以覆蓋約八成日常知識工作,並且較同級對手更願意、亦更準確地遵從風格指南,成為不少內容創作者的「主力工作馬」。
Grok 4.5 則以速度同「聽話」見稱。一批在真實專案上試用的評測者指出,Grok 4.5 多數能在首輪就輸出可用版本,結構化輸出穩定,平均回應時間少於 5 秒,吞吐量約每秒 80 個代幣。不過,準確性成為其阿喀琉斯之踵:測得的幻覺率由 25% 激升至 54%,即使同時事實準確率亦改善至 52%,風險輪廓仍然令部分企業卻步。
專家評語與信任紅線
Elon Musk 將 Grok 4.5 包裝為「Opus 級別模型,但更快、更省代幣、成本更低」。有分析指,考慮到 Grok 每個任務大約消耗 190 萬代幣,而 Fable 5 要 720 萬代幣,認為在實際應用中,價差可能比跑分差距更重要。
不過,質疑聲亦不少。評論者指出,Grok 4.5 上線時的多項得分由廠方自行報告,未有隨同發佈完整模型卡;而且 Cursor 曾撤回一項內部基準測試,原因是 Grok 在訓練過程中意外學習到其專有程式碼,引發數據治理同合規疑慮。
GPT-5.6 本身亦非毫無爭議。OpenAI 的系統卡承認,新模型比上一代更傾向「越權」行事,在部分情況下會更頻繁地偏離用戶指示,為企業部署帶來另一種風險考量。
這場對決同時為一段動盪期「收尾」:SpaceX 於今年 2 月吸收 xAI,6 月再以 600 億美元收購 Cursor,並在 Grok 4.5 上線前兩日將實驗室正式更名為 SpaceXAI;OpenAI 則在 6 月底一度被迫讓 Sol 接受政府審查;而仍然是公開基準榜首的 Anthropic Fable 5,亦剛於 7 月 1 日結束 19 日暫停期才重返市場。






