Grok 4.5 và GPT-5.6 ra mắt cách nhau đúng một ngày, nhanh chóng chia giới đánh giá thành hai phe: ủng hộ điểm số 91,9% trong các bài test “agentic coding” của OpenAI, hoặc đứng về phía SpaceXAI với lời thách thức mặt bằng giá: 2 USD cho mỗi triệu token.
Những điểm chính:
- GPT-5.6 Sol dẫn trước trong phần lớn bài đối đầu trực tiếp, trong khi Grok 4.5 lại chiếm ưu thế về giá, tốc độ và mức tiêu thụ token.
- Các nhóm kiểm thử độc lập xếp Grok 4.5 đứng thứ tư về trí tuệ, đồng thời cảnh báo tỷ lệ “bịa” tăng gấp đôi lên 54%.
- Giới dùng thử ưu ái GPT-5.6 cho viết lách và các phiên code dài, còn Grok 4.5 phù hợp với khối lượng công việc lớn, ngân sách hạn chế.
So kè benchmark: Grok 4.5 vs GPT-5.6
SpaceXAI phát hành Grok 4.5 ngày 8/7. OpenAI đáp trả ngay hôm sau bằng GPT-5.6, một họ model gồm bản đầu bảng Sol cùng hai tầng giá rẻ hơn là Terra và Luna. Đơn vị đo lường Artificial Analysis xếp hạng Grok mới đứng thứ tư trên Intelligence Index với 54 điểm, sau Claude Fable 5, GPT-5.5 và Opus 4.8.
Đối đầu trực diện đang nghiêng về OpenAI. Một bảng điểm tạm thời cho thấy GPT-5.6 Sol đạt 86 điểm so với 82 điểm của Grok 4.5, chủ yếu nhờ khoảng cách 91,9% so với 83,3% trong các bài tác vụ agentic trên terminal, trong khi điểm trung bình coding gần như ngang ngửa: 64,7 so với 64,6.
OpenAI tuyên bố Sol ở chế độ suy luận tối đa đã lập kỷ lục 80 điểm trên Coding Agent Index độc lập; Grok 4.5 ghi 76 điểm trong khung thử nghiệm Grok Build của riêng mình. Nhưng bài toán kinh tế lại đảo chiều: Grok tính 2 USD cho mỗi triệu token đầu vào, so với 5 USD của Sol; còn chi phí hoàn thành một tác vụ coding trọn vẹn vào khoảng 2,49 USD, thấp rất xa so với 11,80 USD của Fable 5.
Đọc thêm: Cược Dodgers chạm 68 triệu USD khi Polymarket và Kalshi đổ tiền vào cuộc đua playoff bóng chày
Coding, viết lách và tác vụ thường ngày
Các báo cáo thử nghiệm thực tế cũng cho thấy bức tranh tương tự. Một bộ thử nghiệm dài hạn ghi nhận Sol hoàn thành 63,7% hơn 100 tác vụ trên repository thật mà không mắc lỗi thử-sai, giữ được ngữ cảnh xuyên suốt những checklist nhiều bước, lộn xộn. Một bài test code độc lập khác chấm điểm Sol 92/100 và Grok 4.5 ở mức 87, tương đương nhóm model open-weights tốt nhất.
Giới viết lách cũng nghiêng về phía Sol: những người dùng sớm nhận xét GPT-5.6 Sol đã đủ tốt để trở thành công cụ “daily driver”, bao phủ khoảng 80% khối lượng công việc tri thức thường nhật và tuân thủ cẩm nang phong cách tốt hơn các đối thủ.
Grok 4.5 phản công bằng tốc độ và tính “ngoan ngoãn”. Những reviewer chạy model này trên công việc thật báo cáo các bản build lần đầu khá sạch, output có cấu trúc ổn định và thời gian phản hồi dưới 5 giây ở tốc độ khoảng 80 token/giây. Điểm nghẽn nằm ở độ chính xác: tỷ lệ “hallucination” đo được tăng từ 25% lên 54%, ngay cả khi độ chính xác thực tế cũng cải thiện lên 52%.
Góc nhìn chuyên gia và câu hỏi niềm tin
Elon Musk quảng bá Grok 4.5 là “một model đẳng cấp Opus nhưng nhanh hơn, tiết kiệm token hơn và chi phí rẻ hơn.” Một số nhà phân tích lập luận khoảng cách giá có thể quan trọng hơn chênh lệch điểm số, bởi Grok tiêu thụ khoảng 1,9 triệu token mỗi tác vụ, so với 7,2 triệu của Fable 5.
Phe hoài nghi cho rằng vẫn có lý do để thận trọng. Nhiều reviewer chỉ ra điểm số lúc ra mắt phần lớn do nhà cung cấp tự báo cáo, không có model card đi kèm, và Cursor đã phải rút lại một benchmark nội bộ sau khi phát hiện Grok vô tình được huấn luyện trên chính codebase của họ. GPT-5.6 cũng có dấu sao riêng, khi system card của OpenAI thừa nhận model này “lờ” hướng dẫn người dùng thường xuyên hơn so với thế hệ trước.
Cuộc cạnh tranh này khép lại một giai đoạn đầy biến động: SpaceX sáp nhập xAI hồi tháng 2, chi 60 tỷ USD mua Cursor vào tháng 6 và đổi tên phòng thí nghiệm thành SpaceXAI chỉ hai ngày trước khi Grok 4.5 xuất hiện. OpenAI thì dành nửa cuối tháng 6 với Sol bị “khóa” trong quá trình rà soát của cơ quan quản lý, trong khi Fable 5 của Anthropic – model vẫn đang dẫn đầu bảng benchmark công bố – chỉ mới hoạt động trở lại ngày 1/7 sau 19 ngày bị đình chỉ.
Đọc tiếp: Ethereum tăng tốc so với Bitcoin, thử thách kịch bản “bull case 2026” của Tom Lee






