GPT-5.6 定價貴一倍,點解專家仍然買帳?拆解每百萬代幣 2 美元真正買到乜

Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)
Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)

Grok 4.5GPT-5.6 相隔一日先後登場,立即將評論界分成兩派:一邊聚焦 OpenAI 旗艦 GPT-5.6 Sol,在「代理式編碼」測試中拿到 91.9% 分數;另一邊則看中 SpaceXAI 每百萬代幣只收 2 美元、企圖顛覆高端模型定價的挑戰。

重點摘要:

  • GPT-5.6 Sol 在大部分正面對比基準測試中領先,但 Grok 4.5 在價格、回應速度同代幣用量上全面壓價。
  • 獨立測試機構將 Grok 4.5 智能水平排第四,但同時標示其幻覺率由 25% 急升至 54%。
  • 評測者普遍認為:寫作同長程編碼任務 GPT-5.6 佔優,而 Grok 4.5 更適合高流量、緊成本預算的日常場景。

Grok 4.5 對撼 GPT-5.6:跑分與價格兩張成績表

SpaceXAI 於 7 月 8 日推出 Grok 4.5,OpenAI 隨即在翌日發表 GPT-5.6 系列,包含高階的 Sol,以及定價較低的 Terra 同 Luna 兩級型號。基準測試機構 Artificial Analysis 在其 Intelligence Index 上,將新 Grok 評為 54 分,排第四,落後於 Claude Fable 5GPT-5.5Opus 4.8

正面交鋒方面,形勢暫時傾向 OpenAI。一份初步成績表顯示,GPT-5.6 Sol 總分為 86 分,略高於 Grok 4.5 的 82 分,關鍵差距在終端互動式代理任務:Sol 得分 91.9%,遠高於 Grok 4.5 的 83.3%。至於一般編碼平均分則幾乎打和,分別為 64.7 對 64.6。

OpenAI 表示,在最大推理設定下,Sol 在獨立「Coding Agent Index」中錄得 80 分,創新高;Grok 4.5 則在其 Grok Build 測試環境中得到 76 分。只不過,計到落錢就係另一個故事:Grok 每百萬輸入代幣收費 2 美元,而 Sol 要 5 美元;完成一個編碼任務,Grok 成本約 2.49 美元,相對 Fable 5 約 11.80 美元,價差極具殺傷力。

延伸閱讀:道奇隊交易盤注碼飆至 6,800 萬美元,Polymarket、Kalshi 押注棒球季後賽

編碼、寫作與日常應用:分工愈見清晰

實戰測試亦大致印證上述分化。有長期測試框架在超過 100 個真實程式庫任務中發現,Sol 在無需反覆試錯之下,成功完成 63.7% 任務,並能在多步驟、雜亂指示情況下維持任務方向。另一個獨立編碼評測則給予 Sol 92 分(滿分 100),Grok 4.5 則拿到 87 分,與市場上表現最好的開源權重模型看齊。

寫作方面,早期用家形容 Sol 已足以覆蓋約八成日常知識工作,並且較同級對手更願意、亦更準確地遵從風格指南,成為不少內容創作者的「主力工作馬」。

Grok 4.5 則以速度同「聽話」見稱。一批在真實專案上試用的評測者指出,Grok 4.5 多數能在首輪就輸出可用版本,結構化輸出穩定,平均回應時間少於 5 秒,吞吐量約每秒 80 個代幣。不過,準確性成為其阿喀琉斯之踵:測得的幻覺率由 25% 激升至 54%,即使同時事實準確率亦改善至 52%,風險輪廓仍然令部分企業卻步。

專家評語與信任紅線

Elon Musk 將 Grok 4.5 包裝為「Opus 級別模型,但更快、更省代幣、成本更低」。有分析指,考慮到 Grok 每個任務大約消耗 190 萬代幣,而 Fable 5 要 720 萬代幣,認為在實際應用中,價差可能比跑分差距更重要。

不過,質疑聲亦不少。評論者指出,Grok 4.5 上線時的多項得分由廠方自行報告,未有隨同發佈完整模型卡;而且 Cursor 曾撤回一項內部基準測試,原因是 Grok 在訓練過程中意外學習到其專有程式碼,引發數據治理同合規疑慮。

GPT-5.6 本身亦非毫無爭議。OpenAI 的系統卡承認,新模型比上一代更傾向「越權」行事,在部分情況下會更頻繁地偏離用戶指示,為企業部署帶來另一種風險考量。

這場對決同時為一段動盪期「收尾」:SpaceX 於今年 2 月吸收 xAI,6 月再以 600 億美元收購 Cursor,並在 Grok 4.5 上線前兩日將實驗室正式更名為 SpaceXAI;OpenAI 則在 6 月底一度被迫讓 Sol 接受政府審查;而仍然是公開基準榜首的 Anthropic Fable 5,亦剛於 7 月 1 日結束 19 日暫停期才重返市場。

下一篇:以太幣跑贏比特幣,市場驗證 Tom Lee 的 2026 牛市劇本?

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
GPT-5.6 定價貴一倍,點解專家仍然買帳?拆解每百萬代幣 2 美元真正買到乜 | Yellow