阿里巴巴 Qwen3.8-Max 對撼 GPT-5.6:2.4 兆參數硬撼 OpenAI 旗艦模型

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

阿里巴巴 旗下擁有 2.4 兆參數的 Qwen3.8-Max 本週正式亮相,同一時間,多個中國大模型在美國企業市場的代幣用量已攀升至約 46%,明顯擠壓 OpenAI 的 GPT-5.6 生存空間。

重點摘要:

  • 阿里巴巴 Qwen3.8-Max 標稱總參數達 2.4 兆,每次推理實際啟用約 950 億參數,並承諾於下周開放權重。
  • 在阿里自行公布的智能代理編碼基準測試中,GPT-5.6 Sol 仍略勝一籌,不過差距有限,且暫未獲第三方實驗室驗證。
  • GPT-5.6 系列推出僅三星期,OpenAI 已於 7 月 30 日將最便宜方案減價八成,明顯回應中國模型搶走用量的壓力。

Qwen3.8-Max 基準測試正面硬撼 GPT-5.6 Sol

阿里巴巴於 8 月 3 日正式公布 Qwen3.8-Max。這是一款採用「專家混合」(MoE)架構的大模型,雖然總參數宣稱達 2.4 兆,但每次推理只會動用約 950 億參數,以換取效能與成本之間的平衡。

官方同時表示,將於下周把這款旗艦模型,以及一個約 270 億參數的精簡版本開源,權重會上載至公開代碼庫,扭轉其高端模型線近日偏向「封閉發佈」的策略。阿里亦已公開完整基準測試表。

按阿里數據,Qwen3.8-Max 在 Terminal-Bench 2.1(主打代理式程式開發)中取得 86.6 分,而 OpenAI GPT-5.6 Sol 則為 88.8 分,仍然保住頭名位置,但差距不算懸殊。在更嚴苛的 SWE-bench Pro 軟件工程測試上,Qwen3.8-Max 得分 67.7,明顯落後 Anthropic 的 Claude Fable 5(80.0 分);至於 OSWorld-Verified 電腦操作測試,阿里聲稱 Qwen3.8-Max 取得 86.1 分,略高於 Sol 的 83.2 分。

不過,這批成績暫時未獲獨立實驗室重複驗證。阿里巴巴表示,Qwen3.8-Max 曾用 16 日時間,全程在無人干預下開發一套命令列工具:從接收用戶需求、編寫可執行代碼,到自行設計與運行測試流程均由模型主導。這場示範隨即引來開發者質疑,不單對展示流程存疑,亦關注相關授權條款是否對企業用戶構成限制。

延伸閱讀: iPhone 18 Pro Max 或成首款採用 Apple 2nm 晶片、效能提升達 15% 的旗艦

Ion Stoica:中美模型差距收窄至兩三個月

加州大學柏克萊分校計算機科學家、Arena 基準平台共同創辦人 Ion Stoica 於 7 月下旬在一篇分析中指出,中國一眾開源大模型與美國「前沿實驗室」的領先距離,已收窄至約兩至三個月。他早前的估算仍為六至九個月,這一變化與過去一年內 DeepSeekZ.ai GLM 系列不斷開源釋出的節奏相當吻合。

Vercel 負責智能代理基礎設施的 Harpreet Arora 指出,「價格正在驅動一切」,越來越多工程團隊會把一般工作,動態路由到「只要夠用且最便宜」的模型上。OpenRouterJustin Summerville 則在一份分析中測算,中國開源模型的調用成本普遍較美系對手便宜 60% 至 90%。在企業層面,路由選擇最後多半跟着數學算盤走。

GPT-5.6 減價保住大客流量層

面對成本壓力與流量流失,OpenAI 於 7 月 30 日宣佈大幅削價:在 GPT-5.6 家族推出僅三星期後,將入門級 Luna 收費削減 80%,至每百萬輸入代幣 0.20 美元、每百萬輸出代幣 1.20 美元;中階 Terra 減價約兩成。至於旗艦 Sol 則維持原價,輸入與輸出代幣分別為 5 美元及 30 美元。

此一價格結構,反映 OpenAI 仍希望在高端市場維持「溢價」定位,同時利用較便宜的層級,搶回今年以來被中國實驗室侵蝕的代幣用量。

數據顯示,中國出身的大模型在某大型路由平台上的美國代幣流量,自 2025 年上半年僅約 4.5%,一路攀升至今年 2 月起每星期穩定突破 30%,最高更達 46%。與此同時,斯坦福大學研究團隊在最新一份 AI 指數報告中記錄,美國最頂級模型在標準基準測試上的優勢,至今年 3 月只剩約 2.7 個百分點;而在 2023 年,這個差距一度高達 31.6 個百分點。

下一篇: Bitcoin 極端恐慌或成燃料,為比特幣衝擊 75,000 美元鋪路

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
阿里巴巴 Qwen3.8-Max 對撼 GPT-5.6:2.4 兆參數硬撼 OpenAI 旗艦模型 | Yellow