GPT-5.6 hay Grok 4.5? Chuyên gia giải mã thật sự mua được gì với mức giá 2 USD mỗi triệu token

Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)
Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)

Grok 4.5GPT-5.6 ra mắt cách nhau đúng một ngày, nhanh chóng chia giới đánh giá thành hai phe: ủng hộ điểm số 91,9% trong các bài test “agentic coding” của OpenAI, hoặc đứng về phía SpaceXAI với lời thách thức mặt bằng giá: 2 USD cho mỗi triệu token.

Những điểm chính:

  • GPT-5.6 Sol dẫn trước trong phần lớn bài đối đầu trực tiếp, trong khi Grok 4.5 lại chiếm ưu thế về giá, tốc độ và mức tiêu thụ token.
  • Các nhóm kiểm thử độc lập xếp Grok 4.5 đứng thứ tư về trí tuệ, đồng thời cảnh báo tỷ lệ “bịa” tăng gấp đôi lên 54%.
  • Giới dùng thử ưu ái GPT-5.6 cho viết lách và các phiên code dài, còn Grok 4.5 phù hợp với khối lượng công việc lớn, ngân sách hạn chế.

So kè benchmark: Grok 4.5 vs GPT-5.6

SpaceXAI phát hành Grok 4.5 ngày 8/7. OpenAI đáp trả ngay hôm sau bằng GPT-5.6, một họ model gồm bản đầu bảng Sol cùng hai tầng giá rẻ hơn là Terra và Luna. Đơn vị đo lường Artificial Analysis xếp hạng Grok mới đứng thứ tư trên Intelligence Index với 54 điểm, sau Claude Fable 5, GPT-5.5Opus 4.8.

Đối đầu trực diện đang nghiêng về OpenAI. Một bảng điểm tạm thời cho thấy GPT-5.6 Sol đạt 86 điểm so với 82 điểm của Grok 4.5, chủ yếu nhờ khoảng cách 91,9% so với 83,3% trong các bài tác vụ agentic trên terminal, trong khi điểm trung bình coding gần như ngang ngửa: 64,7 so với 64,6.

OpenAI tuyên bố Sol ở chế độ suy luận tối đa đã lập kỷ lục 80 điểm trên Coding Agent Index độc lập; Grok 4.5 ghi 76 điểm trong khung thử nghiệm Grok Build của riêng mình. Nhưng bài toán kinh tế lại đảo chiều: Grok tính 2 USD cho mỗi triệu token đầu vào, so với 5 USD của Sol; còn chi phí hoàn thành một tác vụ coding trọn vẹn vào khoảng 2,49 USD, thấp rất xa so với 11,80 USD của Fable 5.

Đọc thêm: Cược Dodgers chạm 68 triệu USD khi Polymarket và Kalshi đổ tiền vào cuộc đua playoff bóng chày

Coding, viết lách và tác vụ thường ngày

Các báo cáo thử nghiệm thực tế cũng cho thấy bức tranh tương tự. Một bộ thử nghiệm dài hạn ghi nhận Sol hoàn thành 63,7% hơn 100 tác vụ trên repository thật mà không mắc lỗi thử-sai, giữ được ngữ cảnh xuyên suốt những checklist nhiều bước, lộn xộn. Một bài test code độc lập khác chấm điểm Sol 92/100 và Grok 4.5 ở mức 87, tương đương nhóm model open-weights tốt nhất.

Giới viết lách cũng nghiêng về phía Sol: những người dùng sớm nhận xét GPT-5.6 Sol đã đủ tốt để trở thành công cụ “daily driver”, bao phủ khoảng 80% khối lượng công việc tri thức thường nhật và tuân thủ cẩm nang phong cách tốt hơn các đối thủ.

Grok 4.5 phản công bằng tốc độ và tính “ngoan ngoãn”. Những reviewer chạy model này trên công việc thật báo cáo các bản build lần đầu khá sạch, output có cấu trúc ổn định và thời gian phản hồi dưới 5 giây ở tốc độ khoảng 80 token/giây. Điểm nghẽn nằm ở độ chính xác: tỷ lệ “hallucination” đo được tăng từ 25% lên 54%, ngay cả khi độ chính xác thực tế cũng cải thiện lên 52%.

Góc nhìn chuyên gia và câu hỏi niềm tin

Elon Musk quảng bá Grok 4.5 là “một model đẳng cấp Opus nhưng nhanh hơn, tiết kiệm token hơn và chi phí rẻ hơn.” Một số nhà phân tích lập luận khoảng cách giá có thể quan trọng hơn chênh lệch điểm số, bởi Grok tiêu thụ khoảng 1,9 triệu token mỗi tác vụ, so với 7,2 triệu của Fable 5.

Phe hoài nghi cho rằng vẫn có lý do để thận trọng. Nhiều reviewer chỉ ra điểm số lúc ra mắt phần lớn do nhà cung cấp tự báo cáo, không có model card đi kèm, và Cursor đã phải rút lại một benchmark nội bộ sau khi phát hiện Grok vô tình được huấn luyện trên chính codebase của họ. GPT-5.6 cũng có dấu sao riêng, khi system card của OpenAI thừa nhận model này “lờ” hướng dẫn người dùng thường xuyên hơn so với thế hệ trước.

Cuộc cạnh tranh này khép lại một giai đoạn đầy biến động: SpaceX sáp nhập xAI hồi tháng 2, chi 60 tỷ USD mua Cursor vào tháng 6 và đổi tên phòng thí nghiệm thành SpaceXAI chỉ hai ngày trước khi Grok 4.5 xuất hiện. OpenAI thì dành nửa cuối tháng 6 với Sol bị “khóa” trong quá trình rà soát của cơ quan quản lý, trong khi Fable 5 của Anthropic – model vẫn đang dẫn đầu bảng benchmark công bố – chỉ mới hoạt động trở lại ngày 1/7 sau 19 ngày bị đình chỉ.

Đọc tiếp: Ethereum tăng tốc so với Bitcoin, thử thách kịch bản “bull case 2026” của Tom Lee

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
GPT-5.6 hay Grok 4.5? Chuyên gia giải mã thật sự mua được gì với mức giá 2 USD mỗi triệu token | Yellow