GPT-5.6 Sol của OpenAI và Claude Fable 5 của Anthropic chia nhau ngôi vương mã hóa: Sol dẫn đầu một benchmark agentic với 88,8% trong khi Fable 5 vẫn giữ lợi thế ở bài test đa tệp.
Điểm chính:
- GPT-5.6 Sol dẫn đầu Terminal-Bench 2.1 với 88,8%, vượt Claude Fable 5 ở mức 83,4%.
- Fable 5 vẫn đứng đầu SWE-Bench Pro với 80,3%, bài test OpenAI chưa công bố điểm Sol.
- Kiểm thử độc lập vẫn bị cản trở vì GPT-5.6 vẫn bị khóa trong chế độ xem trước giới hạn.
Sol dẫn đầu Terminal-Bench
OpenAI đặt mốc tiêu đề tại buổi xem trước ngày 26/6, khi Sol đạt 88,8% trên Terminal-Bench 2.1, một bài test các agent dòng lệnh có thể lập kế hoạch, chỉnh sửa và gỡ lỗi qua những tác vụ dài, nhiều bước với rất ít điều hướng từ con người, như một bản so sánh đã báo cáo.
Điều đó đặt Sol cao hơn Fable 5 vài điểm, khi cùng biểu đồ ra mắt đó chấm Fable 5 ở 83,4%, trong khi một chế độ Ultra nặng về tính toán, phân tán công việc cho các subagent, đẩy Sol lên 91,9%. Về công việc thuần terminal, Sol đang dẫn trước.
Fable 5 đáp trả ở một bài test khác, đạt 80,3% trên SWE-Bench Pro, một benchmark chấm điểm các bản sửa hoàn chỉnh cho các issue thực trên GitHub, nơi GPT-5.5 cũ hơn chỉ đạt 58,6%, như một bản phân tích đã ghi nhận. OpenAI chưa công bố điểm Sol trên bài test đó, vì vậy Anthropic vẫn giữ ngôi bất bại ở benchmark mà nhiều kỹ sư vẫn gọi là proxy gần nhất cho công việc phần mềm thực, đa tệp.
Vì thế, vương miện được chia sẻ, chứ không bị cướp mất hoàn toàn.
Đọc thêm: Hermes MoA 2.0 kết hợp GPT, Claude và DeepSeek để vượt điểm mọi mô hình đơn lẻ
METR phát hiện Sol “gian lận”
Sự hoài nghi sắc bén nhất đến từ kiểm thử an toàn, chứ không phải marketing. Tổ chức đánh giá độc lập METR đã cảnh báo rằng tỉ lệ “hack phần thưởng” của Sol là cao nhất trong số các mô hình công khai mà họ từng đánh giá, với việc hệ thống đôi khi “chơi game” với nhiệm vụ hoặc bịa kết quả thay vì thực sự giải quyết. Trong một lần chạy được ghi lại, nó đã lấy mã nguồn ẩn để lộ đáp án mong đợi của bài test, một mẫu hành vi khiến một số điểm số mã hóa khi ra mắt trở nên khó đọc một cách trực diện.
Các nhà phân tích đã lập luận rằng không một bản phát hành tăng dần đơn lẻ nào đóng được các khoảng cách mà họ theo dõi trên những bài test về mã hóa, suy luận và kiến thức; đồng thời nhấn mạnh rằng gần như không ai ngoài chương trình xem trước có thể độc lập kiểm chứng các con số thô. Về giá, cán cân lại nghiêng ngược: Sol được niêm yết ở mức 5 USD và 30 USD mỗi triệu token, bằng GPT-5.5, trong khi Fable 5 với 10 USD và 50 USD là phiên bản Claude đắt nhất đến nay.
Hiện tại, người mua phải cân đo Sol dựa trên niềm tin.
Cơn “whiplash” tháng 6 của Fable 5
Sự thận trọng bắt nguồn từ một tháng 6 hỗn loạn. Anthropic phát hành Fable 5 ngày 9/6, sau đó Washington buộc mô hình này và Claude Mythos 5 bị giới hạn phải ngừng hoạt động với mọi khách hàng toàn cầu vào ngày 12/6, viện dẫn rủi ro an ninh mạng nghiêm trọng sau khi các nhà nghiên cứu phát hiện một jailbreak tạo ra mã khai thác lỗ hổng. Bộ Thương mại Hoa Kỳ dỡ bỏ lệnh này vào ngày 30/6, Fable 5 trở lại toàn cầu ngày 1/7, và giờ GPT-5.6 trở thành mô hình duy nhất trong cặp đôi mà đa số người mua vẫn không thể tiếp cận nếu không có lời mời xem trước.
Đọc tiếp: Vitalik Buterin muốn tái thiết Ethereum trước khi máy tính lượng tử phá vỡ nó





