阿里巴巴最新發布、擁有 2.4 兆參數的 Qwen3.8-Max 本週正式登場, 正逢陸系模型在美國企業端的 Token 流量一路攀升、最高吃下約 46% 之際,進一步壓縮 OpenAI 旗艦 GPT-5.6 的使用空間。
重點速記:
- Qwen3.8-Max 採混合專家架構,總參數規模 2.4 兆,但單次請求僅啟用 950 億參數;阿里巴巴預告,下週開放權重下載。
- 在阿里自行公布的代理式程式設計基準測試中,GPT-5.6 Sol 仍保住領先,不過差距已相當有限,且尚未經第三方實驗室驗證。
- OpenAI 在 7 月 30 日大幅下調最低價位 Luna 階層 8 折(降價 80%),距 GPT-5.6 家族發表僅三週,反映陸系模型搶走大量用量。
Qwen3.8-Max 基準測試正面對槓 GPT-5.6 Sol
阿里巴巴在 8 月 3 日正式公開 Qwen3.8-Max, 採用「Mixture-of-Experts(混合專家)」架構:整體參數量高達 2.4 兆,但每次推論實際啟用的專家子網路合計約 950 億參數, 在效能與成本之間尋求平衡。
阿里同時表示,旗艦版以及縮小至 270 億參數的版本,將於下週陸續釋出開源權重,扭轉其高階模型近來偏向封閉授權的策略。 公司也同步公布完整基準測試成績表。
依其數據,Qwen3.8-Max 在代理式程式設計測試 Terminal-Bench 2.1 中拿下 86.6 分, 略低於 OpenAI GPT-5.6 Sol 的 88.8 分。SWE-bench Pro 測試中,Qwen3.8-Max 得分 67.7, 明顯落後 Anthropic Claude Fable 5 的 80.0;但在電腦操作能力測試 OSWorld-Verified 上, 它則宣稱拿到 86.1 分, 超過 Sol 的 83.2 分。
目前尚無獨立實驗室復現這些結果。阿里巴巴表示,Qwen3.8-Max 曾在完全無人工介入下,花 16 天時間自行打造一套命令列工具, 從使用者需求到可執行程式碼與測試全程自動化。不過開發者社群對這場展示及其授權條款提出質疑。
延伸閱讀:iPhone 18 Pro Max 傳將首搭蘋果 2nm 晶片,效能可望提升 15%
Ion Stoica:中美模型差距縮至「兩三個月」
加州大學柏克萊分校電腦科學家、Arena 基準平台共同創辦人 Ion Stoica 日前在 7 月底 評估 指出, 中國開源權重模型相較美國前沿實驗室的領先者,落後幅度已縮小到約「兩到三個月」。 他在更早之前的看法是「落後六到九個月」,改變幅度相當顯著,也與過去一年 DeepSeek 以及 Z.ai GLM 系列頻繁開源推出新模型的節奏相呼應。
「現在是價格在決定勝負。」負責 Vercel 代理式基礎設施的 Harpreet Arora 認為, 工程團隊越來越傾向把一般性工作,導向「只要能達到品質門檻、但單價最低」的模型。 OpenRouter 的 Justin Summerville 則實測發現, 開源的中國模型整體成本較美系對手便宜約 60% 至 90%,路由策略自然跟著成本「用數學說話」。
GPT-5.6 價格策略:守住高階溢價、犧牲量販階層
OpenAI 在 7 月 30 日宣布, 將 GPT-5.6 家族中主打用量的 Luna 階層大降價:輸入每百萬 Token 價格砍至 0.2 美元、輸出則為 1.2 美元, 較三週前發表時便宜 80%。中階 Terra 價格同步下修 20%,但旗艦 Sol 則維持輸入每百萬 Token 5 美元、 輸出每百萬 Token 30 美元不變。
這種「上守溢價、下戰價格」的結構,意在維持頂級模型的品牌與毛利,同時讓中低階產品線去搏陸系模型 全年來不斷蠶食的巨大用量。
統計顯示,中國出身的模型在某大型多模型路由平台上的美國開發者 Token 流量占比, 從 2025 年上半年約 4.5%,一路攀升 至今年 2 月後每週穩定超過 30%,高峰更達 46%。與此同時, Stanford University 研究團隊在其報告中記錄, 今年 3 月美國最強模型在主要基準測試的領先幅度,平均僅剩 2.7 個百分點, 與 2023 年最多相差 31.6 個百分點的局面相比,優勢已大幅收斂。






