GPT-5.6 對決 Grok 4.5:專家拆解每百萬代幣 2 美元究竟買到什麼

Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)
Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)

Grok 4.5GPT-5.6 相隔一天發布,評論界迅速分成兩派:一派看重 OpenAI 在「代理型程式開發」測試中拿下 91.9% 的高分,另一派則聚焦 SpaceXAI 祭出的「每百萬代幣 2 美元」價格戰,正面挑戰高階模型的溢價。

重點整理:

  • GPT-5.6 Sol 在多數正面對決基準測試中領先,但 Grok 4.5 以價格、速度與代幣用量全面壓低成本。
  • 獨立測試將 Grok 4.5 的「智力」評為第四名,並指出其幻覺比例翻倍至 54%。
  • 評測者多偏好 GPT-5.6 用於寫作與長程程式專案,Grok 4.5 則適合高量、嚴控預算的日常工作。

Grok 4.5 vs GPT-5.6 基準測試對比

SpaceXAI 在 7 月 8 日推出 Grok 4.5,OpenAI 隔天端出 GPT-5.6 系列,以旗艦級 Sol 搭配更便宜的 Terra 與 Luna 等級。基準測試機構 Artificial Analysis 在其 Intelligence Index 上 Grok 4.5 評為第四名,得分 54 分,落後 Claude Fable 5GPT-5.5Opus 4.8

單挑對戰則明顯偏向 OpenAI。一份暫行成績單顯示,GPT-5.6 Sol 總分 86 分,領先 Grok 4.5 的 82 分,主要差距來自終端機代理任務(terminal-based agentic tasks):Sol 拿下 91.9%,Grok 為 83.3%,程式開發整體平均則幾乎平手,分別為 64.7 與 64.6。

OpenAI 在官方文件中宣稱,將 Sol 調至最高推理模式後,在獨立「Coding Agent Index」測得 80 分,創下新高;Grok 4.5 則在自家 Grok Build 測試架構下拿到 76 分。若換算成經濟帳,情況剛好相反:Grok 每百萬輸入代幣只收 2 美元,Sol 則為 5 美元;同一個程式任務,Grok 平均約 2.49 美元即可完成,對比 Fable 5 則要付出 11.80 美元。

延伸閱讀:道奇隊相關投注飆至 6,800 萬美元,Polymarket 與 Kalshi 搶攻 MLB 季後賽行情

程式開發、寫作與日常工作表現

實測報告也印證了這種「一邊性能、一邊成本」的分工。一套長期追蹤的測試架構發現,Sol 在逾 100 個真實程式庫任務中,63.7% 能一次完成且不發生試跑錯誤,並能在繁瑣、多步驟清單下維持正確上下文與目標感。

另一份獨立程式測試給出 的成績則是:Sol 拿到 100 分中的 92 分,Grok 4.5 則為 87 分,與最佳開源權重模型大致相當。

在寫作與知識工作領域,風向同樣偏向 Sol。早期測試者形容 Sol 已足以覆蓋約 80% 的日常知識勞動,且在遵守風格指南、維持一致口吻方面,表現優於其他同級對手。

Grok 4.5 的反擊武器則是「速度與服從度」。實際在專案中部署的測試者回報,其首次生成程式碼的品質相對乾淨,結構化輸出穩定,整體延遲多在 5 秒以內,吞吐約每秒 80 個代幣。真正的隱憂在準確率:雖然事實正確率已提升至 52%,但測得的幻覺比例卻從 25% 飆升至 54%。

專家評語與信任疑慮

Elon Musk 將 Grok 4.5 定位 為「Opus 級模型,但更快、更省代幣、成本更低」。部分分析師則主張,在實務導入時,價格差距遠比基準分數更關鍵,因為 Grok 每個任務平均消耗約 190 萬個代幣,而 Fable 5 則高達 720 萬個。

不過,懷疑派也提出多項警訊。評論者指出,Grok 4.5 的首波成績多由廠商自報,未同步推出完整 model card;此外,因 Grok 在訓練過程中意外吃進 Cursor 自家程式碼,Cursor 事後還撤下了一項內部基準測試。

GPT-5.6 也非毫無爭議。OpenAI 自家的系統說明坦言,這一代在服從指令的穩定度上,出現比前一代更常「逾矩」的情況,為企業治理與風險控管增添變數。

這場對決發生在產業劇烈洗牌的背景下:SpaceX 今年 2 月完成對 xAI 的吸收合併,6 月再以 600 億美元收購 Cursor,並在 Grok 4.5 上線前兩天,將實驗室正式更名為 SpaceXAI。OpenAI 則在 6 月底陷入監管審查,Sol 一度被鎖在政府檢視流程中;同時,仍是公開基準測試領先者的 Anthropic Fable 5,也才在 7 月 1 日結束為期 19 天的下架整頓重新上線。

下一步關注:以太幣漲勢追上比特幣,市場再度驗證 Tom Lee 的 2026 牛市劇本

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
GPT-5.6 對決 Grok 4.5:專家拆解每百萬代幣 2 美元究竟買到什麼 | Yellow