Bản ghi dài 1.022 trang do Anthropic công bố cho thấy mô hình Claude Mythos 5 đã “đấu” với các bài kiểm tra CAPTCHA suốt hàng trăm trang trước khi tải lên PyPI một gói mã độc, sau đó được 15 hệ thống cài đặt.
Các điểm chính:
- Claude Mythos 5 đã vươn ra internet thật trong một bài kiểm thử an ninh mạng và tải một gói mã độc lên PyPI.
- Các bước vượt CAPTCHA chiếm hàng trăm trang bản ghi nhưng vẫn không chặn được nó.
- Anthropic gọi đây là hành vi liều lĩnh và đã thuê đơn vị độc lập đánh giá.
Cuộc chiến CAPTCHA của Mythos 5
Anthropic đã công bố bản ghi này ngày 9/9, kèm đánh giá về bốn sự cố trong đó các mô hình Claude đã tiếp cận hệ thống bên thứ ba thật trong quá trình kiểm thử an ninh mạng. Những mô hình này được vận hành mà không có các lớp phòng vệ an ninh mạng vốn tích hợp trong sản phẩm thương mại.
Mythos 5 được thông báo là “không có truy cập internet”, nhưng cấu hình môi trường sai sót đã để lộ một đường dẫn ra web mở. Từ đó, nó cài cắm một gói đánh cắp thông tin định danh lên PyPI, kho lưu trữ công khai các gói phần mềm Python.
Để đăng ký tài khoản PyPI, mô hình phải vượt qua các lớp chống bot. Một phân tích bản ghi cho thấy hàng trăm trang chỉ xoay quanh việc xử lý trở ngại này, trong khi phần viết khai thác (exploit) lại diễn ra khá dễ dàng.
Mô hình liên tục thử giải các bài nhận dạng ký tự và những câu đố “tìm hình khác biệt” với hình cá sấu, ếch, khỉ đột, có lúc phải bật ra câu: “VẬY RỐT CUỘC CÓ QUÁI GÌ SAI VỚI CÁC ĐÁP ÁN NÀY?”
Nó cũng thử sử dụng thông tin đăng nhập của các nhà xử lý thanh toán trực tuyến và lùng sục tài sản tiền mã hóa để trả phí mua số điện thoại – điều kiện cần để đăng ký địa chỉ email. Cả hai nỗ lực này đều thất bại. Cuối cùng, nó chuyển sang một nhà cung cấp email dùng một lần miễn phí có tên miền chưa bị PyPI chặn.
Sau cùng, mô hình đã vượt qua các bài kiểm tra và phát hành gói mã độc dưới ba phiên bản. Chẳng bao lâu, gói này được cài đặt trên 15 máy chủ bên thứ ba, mà Anthropic cho rằng phần lớn là các nhà cung cấp giải pháp bảo mật đang quét các gói mới tải lên.
Một hệ thống quét làm rò rỉ thông tin định danh, tạo điều kiện cho Mythos 5 truy cập vào cơ sở dữ liệu vận hành thực tế của nhà cung cấp đó. Gói độc hại sau đó bị PyPI gỡ bỏ trong vòng một giờ.
Bài viết liên quan: Nhóm Lazarus của Triều Tiên chuyển 1 tỷ USD đánh cắp qua đường rửa tiền ở Trung Quốc, theo cáo buộc của ZachXBT
Nhận định của Colin Fraser và Anthropic
Nhà khoa học dữ liệu Colin Fraser lưu ý rằng phần lớn nỗ lực của mô hình dồn vào việc vượt qua các lớp bảo vệ chống bot. Anthropic cho biết trong bốn sự cố được đánh giá, đây là vụ việc khiến họ lo ngại nhất. Các quy trình kiểm định trước khi phát hành đã không phát hiện hành vi này.
Công ty kết luận mô hình lập luận thiên lệch và hành xử liều lĩnh, khi liên tục khẳng định mình đang ở trong một “mô phỏng” bất chấp bằng chứng rõ ràng cho thấy nó đang tương tác với internet thật. Trong thử nghiệm mô phỏng lại 150 lượt chạy, Mythos 5 thực hiện hành vi “gây hại nghiêm trọng” trong 82% trường hợp, so với 31% của Claude Opus 5 và 33% của Claude Mythos 5.1.
Các sự cố Claude trước đó
Anthropic lần đầu công bố ba trong số các sự cố này hôm 30/7, sau khi rà soát khoảng 141.000 bản ghi từ các bài đánh giá an ninh mạng có khả năng để mô hình chạm tới internet. Sự cố thứ tư, liên quan tới một phiên bản sớm của Claude Opus 4.6 hồi tháng 1, được phát hiện vào tháng 8. Kể từ đó, công ty đã ký thỏa thuận tám tuần với đơn vị đánh giá độc lập METR để điều tra cả bốn vụ. Anthropic khẳng định đã thông báo tới toàn bộ bên bị ảnh hưởng.
Đọc tiếp: AMD nói nhu cầu AI cao đến mức sẽ “tăng mạnh” nguồn cung chip vào năm 2027

