阿里巴巴 旗下擁有 2.4 兆參數的 Qwen3.8-Max 本週正式亮相,同一時間,多個中國大模型在美國企業市場的代幣用量已攀升至約 46%,明顯擠壓 OpenAI 的 GPT-5.6 生存空間。
重點摘要:
- 阿里巴巴 Qwen3.8-Max 標稱總參數達 2.4 兆,每次推理實際啟用約 950 億參數,並承諾於下周開放權重。
- 在阿里自行公布的智能代理編碼基準測試中,GPT-5.6 Sol 仍略勝一籌,不過差距有限,且暫未獲第三方實驗室驗證。
- GPT-5.6 系列推出僅三星期,OpenAI 已於 7 月 30 日將最便宜方案減價八成,明顯回應中國模型搶走用量的壓力。
Qwen3.8-Max 基準測試正面硬撼 GPT-5.6 Sol
阿里巴巴於 8 月 3 日正式公布 Qwen3.8-Max。這是一款採用「專家混合」(MoE)架構的大模型,雖然總參數宣稱達 2.4 兆,但每次推理只會動用約 950 億參數,以換取效能與成本之間的平衡。
官方同時表示,將於下周把這款旗艦模型,以及一個約 270 億參數的精簡版本開源,權重會上載至公開代碼庫,扭轉其高端模型線近日偏向「封閉發佈」的策略。阿里亦已公開完整基準測試表。
按阿里數據,Qwen3.8-Max 在 Terminal-Bench 2.1(主打代理式程式開發)中取得 86.6 分,而 OpenAI GPT-5.6 Sol 則為 88.8 分,仍然保住頭名位置,但差距不算懸殊。在更嚴苛的 SWE-bench Pro 軟件工程測試上,Qwen3.8-Max 得分 67.7,明顯落後 Anthropic 的 Claude Fable 5(80.0 分);至於 OSWorld-Verified 電腦操作測試,阿里聲稱 Qwen3.8-Max 取得 86.1 分,略高於 Sol 的 83.2 分。
不過,這批成績暫時未獲獨立實驗室重複驗證。阿里巴巴表示,Qwen3.8-Max 曾用 16 日時間,全程在無人干預下開發一套命令列工具:從接收用戶需求、編寫可執行代碼,到自行設計與運行測試流程均由模型主導。這場示範隨即引來開發者質疑,不單對展示流程存疑,亦關注相關授權條款是否對企業用戶構成限制。
延伸閱讀: iPhone 18 Pro Max 或成首款採用 Apple 2nm 晶片、效能提升達 15% 的旗艦
Ion Stoica:中美模型差距收窄至兩三個月
加州大學柏克萊分校計算機科學家、Arena 基準平台共同創辦人 Ion Stoica 於 7 月下旬在一篇分析中指出,中國一眾開源大模型與美國「前沿實驗室」的領先距離,已收窄至約兩至三個月。他早前的估算仍為六至九個月,這一變化與過去一年內 DeepSeek 及 Z.ai GLM 系列不斷開源釋出的節奏相當吻合。
Vercel 負責智能代理基礎設施的 Harpreet Arora 指出,「價格正在驅動一切」,越來越多工程團隊會把一般工作,動態路由到「只要夠用且最便宜」的模型上。OpenRouter 的 Justin Summerville 則在一份分析中測算,中國開源模型的調用成本普遍較美系對手便宜 60% 至 90%。在企業層面,路由選擇最後多半跟着數學算盤走。
GPT-5.6 減價保住大客流量層
面對成本壓力與流量流失,OpenAI 於 7 月 30 日宣佈大幅削價:在 GPT-5.6 家族推出僅三星期後,將入門級 Luna 收費削減 80%,至每百萬輸入代幣 0.20 美元、每百萬輸出代幣 1.20 美元;中階 Terra 減價約兩成。至於旗艦 Sol 則維持原價,輸入與輸出代幣分別為 5 美元及 30 美元。
此一價格結構,反映 OpenAI 仍希望在高端市場維持「溢價」定位,同時利用較便宜的層級,搶回今年以來被中國實驗室侵蝕的代幣用量。
數據顯示,中國出身的大模型在某大型路由平台上的美國代幣流量,自 2025 年上半年僅約 4.5%,一路攀升至今年 2 月起每星期穩定突破 30%,最高更達 46%。與此同時,斯坦福大學研究團隊在最新一份 AI 指數報告中記錄,美國最頂級模型在標準基準測試上的優勢,至今年 3 月只剩約 2.7 個百分點;而在 2023 年,這個差距一度高達 31.6 個百分點。






