Anthropic vừa ra mắt Claude Sonnet 5.5 vào ngày thứ Hai, tuyên bố mẫu AI tầm trung mới này xử lý tác vụ nhanh hơn hơn 30% và có thể giảm tới 30% chi phí cho mỗi tác vụ so với thế hệ trước.
Điểm nhấn:
- Sonnet 5.5 đạt 70,6% trên bài kiểm tra lập trình Terminal-Bench 4.0, vượt xa mức 10,3% của Sonnet 5.
- Đây là mẫu Sonnet đầu tiên được triển khai kèm bộ “lá chắn” an ninh mạng vốn chỉ dùng cho các hệ thống cao cấp nhất của Anthropic.
- Một benchmark độc lập cho thấy chi phí mỗi tác vụ ở mức tải tối đa thậm chí còn cao hơn Sonnet 5.
Kết quả benchmark của Claude Sonnet 5.5
Đây là model thứ hai trong dòng Claude 5.5, xuất hiện chỉ sáu ngày sau khi Anthropic giới thiệu mẫu cao cấp Claude Opus 5.5, theo thông báo ra mắt của công ty tại đây.
Anthropic định vị Sonnet 5.5 là “đối tác” nhanh và rẻ hơn cho Opus 5.5, tối ưu cho các tác vụ hằng ngày đã được mô tả rõ ràng, sửa lỗi phần mềm, hoàn thiện tài liệu, slide trình chiếu và bảng tính. Mức giá niêm yết là 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra.
Trên Terminal-Bench 4.0, một bài đánh giá lập trình theo kiểu “tác tử” (agentic), Sonnet 5.5 đạt điểm 70,6%, so với 10,3% của Sonnet 5 và 66,4% của Opus 5.5 – model cao cấp hơn nhưng đắt đỏ hơn. Sonnet 5.5 cũng trở thành model Sonnet đầu tiên “phá đảo” trò chơi Pokémon Red chỉ bằng cách quan sát ảnh chụp màn hình, một phép thử khả năng xử lý công việc dài hạn và hiểu nội dung hình ảnh.
Hiện model này đã chạy trên toàn bộ các nền tảng hạ tầng của Anthropic, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure. Anthropic cho biết phiên bản nhỏ hơn là Claude Haiku 5.5, hướng tới các kịch bản khối lượng cực lớn và nhạy cảm về chi phí, sẽ ra mắt trong vài tuần tới, hoàn thiện bộ ba sản phẩm.
Bài liên quan: OpenAI hãm phanh cuộc đua Frontier AI sau sự cố “thoát khỏi sandbox” ngày 20/9
Cơ chế bảo vệ và cấu trúc chi phí của Sonnet 5.5
Trong thông cáo, Anthropic dẫn lời Daniel Vogel, Giám đốc vận hành của Epic Games, cho biết Sonnet 5.5 đã xử lý được “hàng chục nghìn dòng code hệ thống gameplay” trong giai đoạn thử nghiệm sớm. Theo Vogel, model này “đạt cùng tiêu chuẩn chất lượng mà bạn kỳ vọng ở một model phân khúc cao hơn.”
Nhờ năng lực liên quan đến an ninh mạng được đánh giá là tương đương Opus 5, Sonnet 5.5 trở thành mẫu Sonnet đầu tiên được triển khai kèm bộ cơ chế bảo vệ mà trước đây Anthropic chỉ áp dụng cho các model mạnh nhất. Các tác vụ sửa lỗi thông thường không bị ảnh hưởng, nhưng những yêu cầu nhạy cảm, rủi ro cao về an ninh mạng sẽ được điều tiết rõ ràng, chuyển về Sonnet 5. Anthropic cũng bổ sung bộ phân loại mới nhằm chặn các nỗ lực khai thác, trích xuất chuỗi lập luận nội bộ của model.
Tuy vậy, không phải mọi phép đo đều ủng hộ tuyên bố cắt giảm chi phí. Đơn vị phân tích Artificial Analysis được cho là đã ghi nhận chi phí bình quân gia quyền 7,60 USD cho mỗi tác vụ benchmark ở cấu hình “tối đa nỗ lực”, so với 5,09 USD của Sonnet 5, dù điểm số tổng hợp (index) của model mới tăng từ 38 lên 56.
Đợt ra mắt này diễn ra ngay sau khi Anthropic giới thiệu Opus 5.5 vào ngày 22/9, đồng thời giảm 20% giá niêm yết của dòng flagship, còn 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra. Khi đó, công ty cho biết Opus 5.5 sẽ giúp chi phí cho khối lượng công việc điển hình giảm khoảng 40% so với Opus 5, đồng thời tăng tốc độ sinh nội dung thêm hơn 30%. Cùng ngày, OpenAI tung ra GPT-6 Sol và GPT-6 Luna với mức giá chỉ bằng một nửa thế hệ tiền nhiệm.
Xem tiếp: BlackRock dự báo sức mạnh tính toán sẽ bước vào thị trường hợp đồng tương lai

