Giới chuyên môn tranh luận gay gắt về Claude Opus 5 sau những bài test độc lập đầu tiên

Giới chuyên môn tranh luận gay gắt về Claude Opus 5 sau những bài test độc lập đầu tiên

Các nhóm đánh giá độc lập chấm điểm mô hình mới Anthropic Claude Opus 5 ở mức 159 trên một chỉ số năng lực, kém Claude Fable 5 hai điểm, trong khi giới đánh giá chia rẽ sâu sắc về khả năng review code của mô hình.

Những điểm chính:

  • Epoch AI chấm Claude Opus 5 đạt 159 điểm trên chỉ số năng lực, so với 161 điểm của Claude Fable 5; hai mô hình ngang nhau về mảng kỹ nghệ phần mềm.
  • CodeRabbit ghi nhận độ chính xác 39,3% với các bình luận review “hành động được”, tăng từ mức cơ sở 35,2%, nhưng số nhận xét vặt tăng gấp bốn lần.
  • Các doanh nghiệp thử nghiệm tại Cognition và Zapier ghi nhận cải thiện rõ rệt về debug và tự động hóa quy trình nghiệp vụ đầu-cuối.

Thang đo hiệu năng Claude Opus 5 sớm bị soi kỹ

Anthropic phát hành mô hình này vào thứ Sáu và khẳng định Opus 5 tiệm cận “trí tuệ tuyến đầu” của Fable 5 với mức giá chỉ bằng một nửa, định vị đây là công cụ dùng hằng ngày thay vì một mô hình chuyên dụng cao cấp. Phần lớn bên đánh giá độc lập đồng tình về xu hướng chung, nhưng bất đồng về “khoảng cách” thực tế.

Epoch AI chấm Opus 5 đạt 159 điểm trên chỉ số năng lực, so với 161 điểm của Fable 5, và đánh giá hai mô hình ngang nhau về kỹ nghệ phần mềm, theo tổng hợp của Latent Space cho thấy.

Artificial Analysis xếp Opus 5 đứng đầu trên bộ benchmark về “agent” làm việc tri thức, vượt Fable 5 gần 150 Elo đồng thời cắt 20% chi phí mỗi tác vụ. Một số nhà phát triển lại phản biện chỉ số năng lực này, cho rằng mức tăng vỏn vẹn 1 điểm so với Opus 4.8 cũ là đánh giá quá thấp những gì họ chứng kiến trong sử dụng hàng ngày. Một bên chấm điểm còn phát hiện thiết lập “medium effort” cho kết quả bài test lập trình tốt hơn các mức cao hơn.

Đọc thêm: BitMEX đóng cửa sau 11 năm khi không tìm được bên mua

Kết quả review code chia rẽ giới thử nghiệm

CodeRabbit cho Opus 5 chạy qua khoảng 100 mẫu lỗi rút ra từ các pull request mã nguồn mở thực tế, ba lượt cho mỗi cấu hình, và đo được độ chính xác 39,3% đối với các bình luận review có thể chuyển hóa thành hành động.

Con số này cao hơn mức cơ sở 35,2% do hệ thống reviewer đang chạy thực tế của họ thiết lập, nhưng mô hình lại phát hiện ít lỗi đã biết hơn, đồng thời tạo ra lượng “nitpick” – những góp ý lặt vặt, giá trị thấp mà kỹ sư phải tự lọc – gấp bốn lần.

Ở mức effort mặc định, độ chính xác tụt xuống còn 26,4%. Công ty kết luận các nhóm kỹ sư nên coi Opus 5 như một reviewer thứ hai thiên về độ chính xác, thay vì nâng cấp trực tiếp cho pipeline review hiện có vốn đang vận hành ổn. Claire Vo, người điều hành một bộ đánh giá bảy mô hình dành cho đội sản phẩm, nhận xét mô hình “rất thông minh nhưng gây bực mình”, ám chỉ xu hướng “nhạy cảm thần kinh” và việc nó kiên quyết từ chối xử lý một xung đột merge.

Khách hàng Anthropic ghi nhận bước tiến về agent

Scott Wu, CEO Cognition, cho biết bên trong Devin, Opus 5 tiến rất gần hiệu năng Fable với chi phí chỉ bằng một nửa, đặc biệt mạnh ở khâu debug và phân tích nguyên nhân gốc rễ. Wade Foster, CEO Zapier, nói mô hình này đứng đầu bảng xếp hạng tự động hóa nội bộ của công ty mà không đốt thêm token so với các bản Claude trước đó, vốn cùng mức giá 5 USD cho mỗi triệu token đầu vào.

Dẫu vậy, những lời khen này đi kèm ngoại lệ. Anthropic lưu ý Opus 5 vẫn thua mô hình Mythos 5 của hãng về các tác vụ tấn công an ninh mạng, và mọi yêu cầu bị bộ phân loại an toàn của công ty gắn cờ sẽ tự động được chuyển về Opus 4.8.

Động thái thận trọng này diễn ra sau một giai đoạn trắc trở ở phân khúc cao cấp: Fable 5 ra mắt hồi tháng 6, bị rút khỏi dịch vụ chỉ sau vài ngày, rồi mới quay lại với người dùng vào đầu tháng 7.

Bài tiếp theo: Cổ phiếu HubSpot rơi 12,7% khi giới phân tích chỉ thẳng vào agent mới của OpenAI

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Giới chuyên môn tranh luận gay gắt về Claude Opus 5 sau những bài test độc lập đầu tiên | Yellow