Grok 4.5 vượt Fable 5 và Opus 4.8 trong bài test Agent AI với điểm số 51,4%

Grok 4.5 vượt Fable 5 và Opus 4.8 trong bài test Agent AI với điểm số 51,4%

Grok 4.5 đang mang lại thêm “đạn” cho luận điểm về chi phí và hiệu năng của Elon Musk sau khi một bài benchmark agent độc lập xếp mẫu này ở vị trí số một.

Điểm chính:

  • Grok 4.5 đạt 51,4% trên AutomationBench-AA, vượt hai mẫu Claude.
  • Chi phí chỉ 0,34 USD mỗi tác vụ, thấp hơn rất nhiều so với các đối thủ Anthropic.
  • Tỷ lệ vi phạm quy tắc cao hơn vẫn là rủi ro với các triển khai agent trong doanh nghiệp.

Kết quả benchmark Grok

Artificial Analysis cho biết Grok 4.5 đạt 51,4% trên AutomationBench-AA, vượt Claude Fable 5 với 48,6% và Claude Opus 4.8 với 48,5%. Mẫu Grok 4.5 cũng chỉ tốn 0,34 USD cho mỗi tác vụ, trong khi Fable 5 là 1,35 USD và Opus 4.8 là 1,46 USD.

Bài benchmark này bổ sung một phép thử độc lập cho tuyên bố của Musk rằng Grok 4.5 là một mẫu cùng đẳng cấp Opus nhưng chạy nhanh hơn và rẻ hơn. SpaceXAI đã đưa mẫu này ra công chúng trong tuần qua, dựa trên nền tảng V9 với 1,5 nghìn tỷ tham số và các đánh giá nội bộ ban đầu để định vị sản phẩm.

AutomationBench-AA sử dụng 657 tác vụ trên 40 ứng dụng mô phỏng, bao gồm Gmail, Slack, SalesforceHubSpot. Bài test đo khả năng một agent AI hoàn thành mục tiêu mà không phá vỡ các “lan can” kiểm soát, trong khi Artificial Analysis giữ kín bộ tác vụ để giảm nguy cơ “học tủ” benchmark.

Đọc thêm: Grok 4.5 thách thức OpenAI và Anthropic với agent AI giá rẻ hơn

Tuyên bố táo bạo của Musk

Theo Artificial Analysis, Grok 4.5 dùng khoảng 8.000 token đầu ra cho mỗi tác vụ, chỉ bằng xấp xỉ một phần tư so với Opus 4.8. “Tổng lượng token 0,44 triệu mỗi tác vụ của mẫu này thuộc nhóm thấp nhất trên bảng xếp hạng,” công ty cho biết, đồng thời nhấn mạnh chi phí thấp đến từ cả hiệu suất lẫn mức giá token.

Mẫu này hoàn thành 79,9% mục tiêu tác vụ và “đậu” hoàn toàn 21,9% số tác vụ. Trong mảng tài chính – được đánh giá là lĩnh vực khó nhất của benchmark – Grok 4.5 dẫn đầu với 71%, so với 64% của Fable 5 và 62% của Opus 4.8.

Điểm yếu nằm ở tuân thủ. Grok 4.5 ghi nhận trung bình 0,63 lần vi phạm guardrail cho mỗi tác vụ, cao hơn Opus 4.8 với 0,55 và Gemini 3.5 Flash của Google với 0,46. Khoảng cách này đặc biệt đáng chú ý với các doanh nghiệp triển khai agent gần những hệ thống tài chính đang vận hành trực tiếp.

Thông điệp ra mắt của Musk tập trung vào bài toán đánh đổi thực dụng hơn là một chiến thắng “sạch” trên bảng benchmark. Grok 4.5 giờ đã có bằng chứng độc lập về chi phí và tốc độ, nhưng tỷ lệ vi phạm quy tắc cao cho thấy việc doanh nghiệp chấp nhận triển khai vẫn sẽ phụ thuộc lớn vào độ tin cậy vận hành.

Bài tiếp theo: Đà hồi phục của Bitcoin đối mặt bài toán cầu mà phe bò không thể phớt lờ

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.