Qwen3.8-Max đối đầu GPT-5.6: câu trả lời 2,4 nghìn tỷ tham số cho dòng sản phẩm chủ lực của OpenAI

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Alibaba với mô hình Qwen3.8-Max 2,4 nghìn tỷ tham số ra mắt tuần này, đúng lúc các hệ thống Trung Quốc chiếm tới 46% lưu lượng token doanh nghiệp tại Mỹ, tạo áp lực cạnh tranh trực diện lên GPT-5.6 của OpenAI.

Các điểm chính:

  • Qwen3.8-Max của Alibaba có tổng 2,4 nghìn tỷ tham số, nhưng chỉ kích hoạt 95 tỷ tham số cho mỗi lượt gọi, với cam kết mở trọng số ngay tuần tới.
  • GPT-5.6 Sol vẫn dẫn đầu bài test lập trình tác vụ tự động mà Alibaba công bố, song khoảng cách khá sít sao và chưa được phòng thí nghiệm độc lập xác nhận.
  • OpenAI đã giảm 80% giá tầng dịch vụ rẻ nhất ngày 30/7, chỉ ba tuần sau khi ra mắt, trong bối cảnh mô hình Trung Quốc hút dần về khối lượng sử dụng.

Benchmark Qwen3.8-Max “so găng” với GPT-5.6 Sol

Alibaba giới thiệu Qwen3.8-Max ngày 3/8, một hệ thống “mixture-of-experts” (hỗn hợp chuyên gia) với 2,4 nghìn tỷ tham số tổng, nhưng với mỗi yêu cầu chỉ kích hoạt 95 tỷ tham số.

Tập đoàn cho biết trọng số mở (open weights) của bản chủ lực và một biến thể nhỏ hơn 27 tỷ tham số sẽ được đưa lên các kho mã công khai trong tuần tới, đảo chiều chuỗi ra mắt mang tính “đóng” trước đó của dòng mô hình cao cấp. Alibaba cũng đã công bố bảng benchmark chi tiết.

Theo số liệu này, Qwen3.8-Max đạt 86,6 điểm trên Terminal-Bench 2.1, một bộ đo khả năng lập trình tác vụ tự động, nơi GPT-5.6 Sol của OpenAI vẫn dẫn đầu với 88,8 điểm. Trên SWE-bench Pro, Qwen3.8-Max đạt 67,7 điểm, so với 80,0 điểm của Claude Fable 5 (Anthropic). Ở OSWorld-Verified – bài test sử dụng máy tính tự động – Qwen3.8-Max tuyên bố đạt 86,1 điểm, vượt mức 83,2 điểm của Sol.

Chưa có phòng thí nghiệm độc lập nào tái lập những kết quả này. Alibaba cho biết mô hình đã dành 16 ngày xây dựng một công cụ dòng lệnh hoàn toàn tự động, tự chuyển yêu cầu người dùng thành mã chạy được và tự viết bộ kiểm thử. Nhiều nhà phát triển đã đặt dấu hỏi với màn trình diễn này lẫn điều khoản giấy phép.

Bài liên quan: iPhone 18 Pro Max có thể là mẫu đầu tiên dùng chip 2nm của Apple, nhanh hơn 15%

Ion Stoica: Khoảng cách công nghệ Mỹ – Trung đang thu hẹp

Ion Stoica, nhà khoa học máy tính Đại học California, Berkeley, đồng sáng lập nền tảng benchmark Arena, nhận định trong một bài đánh giá cuối tháng 7 rằng các mô hình open-weight của Trung Quốc hiện chỉ đi sau nhóm phòng thí nghiệm hàng đầu của Mỹ khoảng hai đến ba tháng. Trước đó, ông ước tính khoảng cách là sáu đến chín tháng – sự thu hẹp này trùng với một năm bùng nổ các bản phát hành mở của DeepSeek và dòng GLM của Z.ai.

“Giá đang làm phần lớn công việc,” Harpreet Arora, phụ trách hạ tầng agentic tại Vercel, nhận xét, cho biết nhiều đội kỹ sư đang định tuyến các tác vụ thường ngày sang bất kỳ mô hình rẻ nào nhưng vẫn đạt ngưỡng chất lượng chấp nhận được. Justin Summerville của OpenRouter tính toán rằng các mô hình mở của Trung Quốc rẻ hơn từ 60% đến 90%. Chiến lược định tuyến lưu lượng đơn giản là bám theo phép tính chi phí.

Chiến lược giá GPT-5.6: Bảo vệ phân khúc khối lượng lớn

OpenAI đã giảm giá gói Luna – tầng rẻ nhất của họ – tới 80% vào ngày 30/7, chỉ ba tuần sau khi họ trình làng họ GPT-5.6, xuống còn 0,20 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra. Gói Terra hạ 20% giá, trong khi bản chủ lực Sol vẫn giữ nguyên ở mức 5 USD và 30 USD.

Cách định giá này giữ “premium” cho dòng cao cấp, đồng thời đẩy các tầng rẻ vào cuộc đua tranh khối lượng với các mô hình Trung Quốc – lực lượng đã hút bớt thị phần suốt từ đầu năm.

Các mô hình có nguồn gốc Trung Quốc đã tăng thị phần từ 4,5% tổng lượng token tại Mỹ trên một nền tảng định tuyến lớn trong nửa đầu 2025, lên hơn 30% mỗi tuần kể từ tháng 2, có tuần chạm đỉnh 46%. Các nhà nghiên cứu Đại học Stanford ghi nhận khoảng cách điểm benchmark giữa mô hình dẫn đầu của Mỹ và phần còn lại chỉ còn 2,7% vào tháng 3, so với biên độ từng lên tới 31,6 điểm phần trăm năm 2023.

Đọc tiếp: Bitcoin có thể biến tâm lý “sợ hãi tột độ” thành động lực cho cú tăng lên 75.000 USD

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Qwen3.8-Max đối đầu GPT-5.6: câu trả lời 2,4 nghìn tỷ tham số cho dòng sản phẩm chủ lực của OpenAI | Yellow