Các nhóm kiểm thử độc lập vừa chấm điểm mô hình mới Claude Opus 5 của Anthropic ở mức 159 trên một chỉ số năng lực, kém Claude Fable 5 hai điểm, trong khi cộng đồng đánh giá tỏ ra chia rẽ sâu sắc về khả năng review mã nguồn của mô hình này. Kết quả trái chiều khiến thị trường AI doanh nghiệp đặc biệt chú ý.
Những điểm chính:
- Epoch AI chấm Claude Opus 5 đạt 159 điểm trên chỉ số năng lực, so với 161 điểm của Claude Fable 5; cả hai ngang nhau về khả năng kỹ sư phần mềm.
- CodeRabbit ghi nhận độ chính xác 39,3% đối với các bình luận review mang tính hành động, tăng từ mức tham chiếu 35,2%, nhưng số “bắt lỗi vặt” lại gấp 4 lần.
- Khách hàng doanh nghiệp tại Cognition và Zapier báo cáo cải thiện rõ rệt về debug và tự động hóa quy trình kinh doanh đầu-cuối.
Thang đo hiệu năng Claude Opus 5 sớm bị soi kỹ
Anthropic phát hành Opus 5 vào thứ Sáu và cho biết mô hình này tiến rất gần “trí tuệ tuyến đầu” của Fable 5 với mức giá chỉ bằng một nửa, định vị sản phẩm như công cụ dùng hàng ngày thay vì một mô hình chuyên biệt. Phần lớn bên chấm điểm độc lập đồng tình với cách định vị này, nhưng bất đồng về “khoảng cách” thực sự so với Fable 5.
Theo tổng hợp của Latent Space cho thấy, Epoch AI chấm Opus 5 đạt 159 điểm trên chỉ số năng lực, trong khi Fable 5 đạt 161 điểm; về mảng kỹ sư phần mềm, hai mô hình được xem là ngang nhau.
Artificial Analysis xếp Opus 5 đứng đầu trên bộ chỉ số về “tác nhân tri thức” (agentic knowledge work), vượt Fable 5 gần 150 Elo, đồng thời giảm khoảng 20% chi phí mỗi nhiệm vụ. Tuy vậy, một số nhà phát triển phản bác ý nghĩa của chỉ số này, cho rằng việc Opus 5 chỉ nhỉnh hơn Opus 4.8 đúng 1 điểm hoàn toàn không phản ánh đúng những gì họ quan sát trong sử dụng hằng ngày. Một đơn vị đánh giá còn nhận thấy mức “nỗ lực trung bình” cho kết quả tốt hơn mức cấu hình cao nhất trong một bài test lập trình.
Xem thêm: BitMEX đóng cửa sau 11 năm khi không tìm được người mua
Kết luận trái chiều về khả năng review mã
CodeRabbit đưa Opus 5 vào bài test với khoảng 100 mẫu lỗi trích từ các pull request mã nguồn mở thực tế, mỗi cấu hình được chạy ba vòng, và ghi nhận độ chính xác 39,3% đối với các bình luận review “có thể hành động được”.
Con số này cao hơn mức tham chiếu 35,2% của reviewer đang chạy trong sản xuất, nhưng Opus 5 lại phát hiện ít lỗi đã biết hơn và tạo ra lượng “nitpick” – những góp ý lặt vặt, giá trị thấp mà kỹ sư vẫn phải đọc và xử lý thủ công – nhiều gấp bốn lần.
Ở mức “nỗ lực mặc định”, độ chính xác rơi xuống còn 26,4%. Kết luận của CodeRabbit là các đội kỹ sư nên coi Opus 5 như một reviewer thứ hai, tập trung vào độ chính xác, thay vì thay thế trực tiếp cho pipeline review đã vận hành ổn định. Claire Vo, người vận hành bộ đánh giá với bảy mô hình dành cho đội sản phẩm, nhận xét Opus 5 “vừa xuất sắc vừa gây khó chịu”, nhắc tới một “tính cách ám ảnh chi tiết” và trường hợp mô hình kiên quyết không xử lý một xung đột merge.
Khách hàng Anthropic ghi nhận cải thiện về tác nhân tự động
Scott Wu, CEO Cognition, cho biết trong sản phẩm Devin, Opus 5 cho hiệu năng tiệm cận Fable với chi phí chỉ bằng một nửa, đặc biệt mạnh về debug và phân tích nguyên nhân gốc rễ (root-cause analysis). Wade Foster, CEO Zapier, nói Opus 5 đứng đầu bảng xếp hạng mô hình tự động hóa của công ty mà không tiêu tốn nhiều token hơn các bản Claude trước đó, vốn có cùng mức giá 5 USD cho mỗi triệu token đầu vào.
Làn sóng khen ngợi đi kèm những lưu ý thận trọng. Anthropic thừa nhận Opus 5 thua kém mô hình Mythos 5 trong các tác vụ tấn công mạng (offensive cybersecurity), và mọi yêu cầu bị hệ thống phân loại an toàn gắn cờ sẽ tự động được chuyển ngược về Opus 4.8.
Sự thận trọng này đến sau một giai đoạn bất ổn ở phân khúc cao cấp: Fable 5 ra mắt hồi tháng 6, nhưng nhanh chóng bị rút khỏi dịch vụ chỉ sau vài ngày, rồi mới được đưa trở lại tay người dùng vào đầu tháng 7.
Đọc tiếp: Cổ phiếu HubSpot giảm 12,7% khi giới phân tích chỉ thẳng vào agent mới của OpenAI





