Grok 4.5 đang mang lại thêm “đạn” cho luận điểm về chi phí và hiệu năng của Elon Musk sau khi một bài benchmark agent độc lập xếp mẫu này ở vị trí số một.
Điểm chính:
- Grok 4.5 đạt 51,4% trên AutomationBench-AA, vượt hai mẫu Claude.
- Chi phí chỉ 0,34 USD mỗi tác vụ, thấp hơn rất nhiều so với các đối thủ Anthropic.
- Tỷ lệ vi phạm quy tắc cao hơn vẫn là rủi ro với các triển khai agent trong doanh nghiệp.
Kết quả benchmark Grok
Artificial Analysis cho biết Grok 4.5 đạt 51,4% trên AutomationBench-AA, vượt Claude Fable 5 với 48,6% và Claude Opus 4.8 với 48,5%. Mẫu Grok 4.5 cũng chỉ tốn 0,34 USD cho mỗi tác vụ, trong khi Fable 5 là 1,35 USD và Opus 4.8 là 1,46 USD.
Bài benchmark này bổ sung một phép thử độc lập cho tuyên bố của Musk rằng Grok 4.5 là một mẫu cùng đẳng cấp Opus nhưng chạy nhanh hơn và rẻ hơn. SpaceXAI đã đưa mẫu này ra công chúng trong tuần qua, dựa trên nền tảng V9 với 1,5 nghìn tỷ tham số và các đánh giá nội bộ ban đầu để định vị sản phẩm.
AutomationBench-AA sử dụng 657 tác vụ trên 40 ứng dụng mô phỏng, bao gồm Gmail, Slack, Salesforce và HubSpot. Bài test đo khả năng một agent AI hoàn thành mục tiêu mà không phá vỡ các “lan can” kiểm soát, trong khi Artificial Analysis giữ kín bộ tác vụ để giảm nguy cơ “học tủ” benchmark.
Đọc thêm: Grok 4.5 thách thức OpenAI và Anthropic với agent AI giá rẻ hơn
Tuyên bố táo bạo của Musk
Theo Artificial Analysis, Grok 4.5 dùng khoảng 8.000 token đầu ra cho mỗi tác vụ, chỉ bằng xấp xỉ một phần tư so với Opus 4.8. “Tổng lượng token 0,44 triệu mỗi tác vụ của mẫu này thuộc nhóm thấp nhất trên bảng xếp hạng,” công ty cho biết, đồng thời nhấn mạnh chi phí thấp đến từ cả hiệu suất lẫn mức giá token.
Mẫu này hoàn thành 79,9% mục tiêu tác vụ và “đậu” hoàn toàn 21,9% số tác vụ. Trong mảng tài chính – được đánh giá là lĩnh vực khó nhất của benchmark – Grok 4.5 dẫn đầu với 71%, so với 64% của Fable 5 và 62% của Opus 4.8.
Điểm yếu nằm ở tuân thủ. Grok 4.5 ghi nhận trung bình 0,63 lần vi phạm guardrail cho mỗi tác vụ, cao hơn Opus 4.8 với 0,55 và Gemini 3.5 Flash của Google với 0,46. Khoảng cách này đặc biệt đáng chú ý với các doanh nghiệp triển khai agent gần những hệ thống tài chính đang vận hành trực tiếp.
Thông điệp ra mắt của Musk tập trung vào bài toán đánh đổi thực dụng hơn là một chiến thắng “sạch” trên bảng benchmark. Grok 4.5 giờ đã có bằng chứng độc lập về chi phí và tốc độ, nhưng tỷ lệ vi phạm quy tắc cao cho thấy việc doanh nghiệp chấp nhận triển khai vẫn sẽ phụ thuộc lớn vào độ tin cậy vận hành.
Bài tiếp theo: Đà hồi phục của Bitcoin đối mặt bài toán cầu mà phe bò không thể phớt lờ





