Grok 4.5 與 GPT-5.6 相隔一天發布,評論界迅速分成兩派:一派看重 OpenAI 在「代理型程式開發」測試中拿下 91.9% 的高分,另一派則聚焦 SpaceXAI 祭出的「每百萬代幣 2 美元」價格戰,正面挑戰高階模型的溢價。
重點整理:
- GPT-5.6 Sol 在多數正面對決基準測試中領先,但 Grok 4.5 以價格、速度與代幣用量全面壓低成本。
- 獨立測試將 Grok 4.5 的「智力」評為第四名,並指出其幻覺比例翻倍至 54%。
- 評測者多偏好 GPT-5.6 用於寫作與長程程式專案,Grok 4.5 則適合高量、嚴控預算的日常工作。
Grok 4.5 vs GPT-5.6 基準測試對比
SpaceXAI 在 7 月 8 日推出 Grok 4.5,OpenAI 隔天端出 GPT-5.6 系列,以旗艦級 Sol 搭配更便宜的 Terra 與 Luna 等級。基準測試機構 Artificial Analysis 在其 Intelligence Index 上將 Grok 4.5 評為第四名,得分 54 分,落後 Claude Fable 5、GPT-5.5 與 Opus 4.8。
單挑對戰則明顯偏向 OpenAI。一份暫行成績單顯示,GPT-5.6 Sol 總分 86 分,領先 Grok 4.5 的 82 分,主要差距來自終端機代理任務(terminal-based agentic tasks):Sol 拿下 91.9%,Grok 為 83.3%,程式開發整體平均則幾乎平手,分別為 64.7 與 64.6。
OpenAI 在官方文件中宣稱,將 Sol 調至最高推理模式後,在獨立「Coding Agent Index」測得 80 分,創下新高;Grok 4.5 則在自家 Grok Build 測試架構下拿到 76 分。若換算成經濟帳,情況剛好相反:Grok 每百萬輸入代幣只收 2 美元,Sol 則為 5 美元;同一個程式任務,Grok 平均約 2.49 美元即可完成,對比 Fable 5 則要付出 11.80 美元。
延伸閱讀:道奇隊相關投注飆至 6,800 萬美元,Polymarket 與 Kalshi 搶攻 MLB 季後賽行情
程式開發、寫作與日常工作表現
實測報告也印證了這種「一邊性能、一邊成本」的分工。一套長期追蹤的測試架構發現,Sol 在逾 100 個真實程式庫任務中,63.7% 能一次完成且不發生試跑錯誤,並能在繁瑣、多步驟清單下維持正確上下文與目標感。
另一份獨立程式測試給出 的成績則是:Sol 拿到 100 分中的 92 分,Grok 4.5 則為 87 分,與最佳開源權重模型大致相當。
在寫作與知識工作領域,風向同樣偏向 Sol。早期測試者形容 Sol 已足以覆蓋約 80% 的日常知識勞動,且在遵守風格指南、維持一致口吻方面,表現優於其他同級對手。
Grok 4.5 的反擊武器則是「速度與服從度」。實際在專案中部署的測試者回報,其首次生成程式碼的品質相對乾淨,結構化輸出穩定,整體延遲多在 5 秒以內,吞吐約每秒 80 個代幣。真正的隱憂在準確率:雖然事實正確率已提升至 52%,但測得的幻覺比例卻從 25% 飆升至 54%。
專家評語與信任疑慮
Elon Musk 將 Grok 4.5 定位 為「Opus 級模型,但更快、更省代幣、成本更低」。部分分析師則主張,在實務導入時,價格差距遠比基準分數更關鍵,因為 Grok 每個任務平均消耗約 190 萬個代幣,而 Fable 5 則高達 720 萬個。
不過,懷疑派也提出多項警訊。評論者指出,Grok 4.5 的首波成績多由廠商自報,未同步推出完整 model card;此外,因 Grok 在訓練過程中意外吃進 Cursor 自家程式碼,Cursor 事後還撤下了一項內部基準測試。
GPT-5.6 也非毫無爭議。OpenAI 自家的系統說明坦言,這一代在服從指令的穩定度上,出現比前一代更常「逾矩」的情況,為企業治理與風險控管增添變數。
這場對決發生在產業劇烈洗牌的背景下:SpaceX 今年 2 月完成對 xAI 的吸收合併,6 月再以 600 億美元收購 Cursor,並在 Grok 4.5 上線前兩天,將實驗室正式更名為 SpaceXAI。OpenAI 則在 6 月底陷入監管審查,Sol 一度被鎖在政府檢視流程中;同時,仍是公開基準測試領先者的 Anthropic Fable 5,也才在 7 月 1 日結束為期 19 天的下架整頓重新上線。






