阿里巴巴 Qwen3.8-Max 對決 GPT-5.6:2.4 兆參數硬碰 OpenAI 旗艦模型

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

阿里巴巴最新發布、擁有 2.4 兆參數的 Qwen3.8-Max 本週正式登場, 正逢陸系模型在美國企業端的 Token 流量一路攀升、最高吃下約 46% 之際,進一步壓縮 OpenAI 旗艦 GPT-5.6 的使用空間。

重點速記:

  • Qwen3.8-Max 採混合專家架構,總參數規模 2.4 兆,但單次請求僅啟用 950 億參數;阿里巴巴預告,下週開放權重下載。
  • 在阿里自行公布的代理式程式設計基準測試中,GPT-5.6 Sol 仍保住領先,不過差距已相當有限,且尚未經第三方實驗室驗證。
  • OpenAI 在 7 月 30 日大幅下調最低價位 Luna 階層 8 折(降價 80%),距 GPT-5.6 家族發表僅三週,反映陸系模型搶走大量用量。

Qwen3.8-Max 基準測試正面對槓 GPT-5.6 Sol

阿里巴巴在 8 月 3 日正式公開 Qwen3.8-Max, 採用「Mixture-of-Experts(混合專家)」架構:整體參數量高達 2.4 兆,但每次推論實際啟用的專家子網路合計約 950 億參數, 在效能與成本之間尋求平衡。

阿里同時表示,旗艦版以及縮小至 270 億參數的版本,將於下週陸續釋出開源權重,扭轉其高階模型近來偏向封閉授權的策略。 公司也同步公布完整基準測試成績表。

依其數據,Qwen3.8-Max 在代理式程式設計測試 Terminal-Bench 2.1 中拿下 86.6 分, 略低於 OpenAI GPT-5.6 Sol 的 88.8 分。SWE-bench Pro 測試中,Qwen3.8-Max 得分 67.7, 明顯落後 Anthropic Claude Fable 5 的 80.0;但在電腦操作能力測試 OSWorld-Verified 上, 它則宣稱拿到 86.1 分, 超過 Sol 的 83.2 分。

目前尚無獨立實驗室復現這些結果。阿里巴巴表示,Qwen3.8-Max 曾在完全無人工介入下,花 16 天時間自行打造一套命令列工具, 從使用者需求到可執行程式碼與測試全程自動化。不過開發者社群對這場展示及其授權條款提出質疑

延伸閱讀:iPhone 18 Pro Max 傳將首搭蘋果 2nm 晶片,效能可望提升 15%

Ion Stoica:中美模型差距縮至「兩三個月」

加州大學柏克萊分校電腦科學家、Arena 基準平台共同創辦人 Ion Stoica 日前在 7 月底 評估 指出, 中國開源權重模型相較美國前沿實驗室的領先者,落後幅度已縮小到約「兩到三個月」。 他在更早之前的看法是「落後六到九個月」,改變幅度相當顯著,也與過去一年 DeepSeek 以及 Z.ai GLM 系列頻繁開源推出新模型的節奏相呼應。

「現在是價格在決定勝負。」負責 Vercel 代理式基礎設施的 Harpreet Arora 認為, 工程團隊越來越傾向把一般性工作,導向「只要能達到品質門檻、但單價最低」的模型。 OpenRouterJustin Summerville實測發現, 開源的中國模型整體成本較美系對手便宜約 60% 至 90%,路由策略自然跟著成本「用數學說話」。

GPT-5.6 價格策略:守住高階溢價、犧牲量販階層

OpenAI 在 7 月 30 日宣布, 將 GPT-5.6 家族中主打用量的 Luna 階層大降價:輸入每百萬 Token 價格砍至 0.2 美元、輸出則為 1.2 美元, 較三週前發表時便宜 80%。中階 Terra 價格同步下修 20%,但旗艦 Sol 則維持輸入每百萬 Token 5 美元、 輸出每百萬 Token 30 美元不變。

這種「上守溢價、下戰價格」的結構,意在維持頂級模型的品牌與毛利,同時讓中低階產品線去搏陸系模型 全年來不斷蠶食的巨大用量。

統計顯示,中國出身的模型在某大型多模型路由平台上的美國開發者 Token 流量占比, 從 2025 年上半年約 4.5%,一路攀升 至今年 2 月後每週穩定超過 30%,高峰更達 46%。與此同時, Stanford University 研究團隊在其報告中記錄, 今年 3 月美國最強模型在主要基準測試的領先幅度,平均僅剩 2.7 個百分點, 與 2023 年最多相差 31.6 個百分點的局面相比,優勢已大幅收斂。

下一篇推薦閱讀:Bitcoin 可能將「極度恐慌」轉化為上攻 7.5 萬美元的燃料

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
阿里巴巴 Qwen3.8-Max 對決 GPT-5.6:2.4 兆參數硬碰 OpenAI 旗艦模型 | Yellow