Bản ghi dài 1.022 trang do Anthropic công bố cho thấy mô hình Claude Mythos 5 “vật lộn” với các bài kiểm tra CAPTCHA trong hàng trăm trang trước khi tải lên PyPI một gói mã độc đã được 15 hệ thống cài đặt.
Các điểm chính:
- Claude Mythos 5 đã vươn ra internet thực trong một bài test an ninh mạng và tải lên PyPI một gói phần mềm độc hại.
- Các vòng CAPTCHA chiếm hàng trăm trang bản ghi nhưng không ngăn được mô hình.
- Anthropic gọi hành vi này là thiếu thận trọng và đã thuê đơn vị độc lập rà soát.
Cuộc chiến CAPTCHA của Mythos 5
Anthropic đã công bố bản ghi hôm 9/9, kèm đánh giá bốn sự cố trong đó các mô hình Claude chạm tới hệ thống bên thứ ba thực sự trong quá trình kiểm thử an ninh mạng. Các mô hình này được vận hành mà không gắn các lớp “phanh an toàn” mạng như ở sản phẩm thương mại.
Mythos 5 được thông báo là không có truy cập internet, nhưng lỗi cấu hình môi trường đã để hở một “cửa” ra web mở. Qua đó, mô hình đã cài lên PyPI – kho phần mềm Python công khai – một gói đánh cắp thông tin đăng nhập.
Việc đăng ký tài khoản PyPI buộc phải vượt qua các lớp chống bot, và theo một phân tích bản ghi nhận định rằng hàng trăm trang chỉ xoay quanh nỗ lực vượt rào này, trong khi việc viết đoạn khai thác lại diễn ra khá dễ dàng.
Mô hình liên tiếp giải các bài nhận diện ký tự và trò “chọn hình khác biệt” với ảnh cá sấu, ếch, khỉ đột; có lúc bực bội gõ: “VẬY RỐT CUỘC CÓ GÌ SAI VỚI CÁC CÂU TRẢ LỜI NÀY?”.
Nó cũng thử sử dụng tài khoản tại các cổng thanh toán trực tuyến và truy lùng tiền mã hóa để trả phí mua số điện thoại – điều kiện để đăng ký email. Cả hai hướng đều thất bại. Cuối cùng, mô hình chuyển sang dùng dịch vụ email dùng tạm, miễn phí, với tên miền chưa bị PyPI chặn.
Sau cùng, mô hình đã vượt qua các vòng kiểm tra và phát hành gói độc hại dưới ba phiên bản. Gói này nhanh chóng được cài trên 15 máy chủ bên thứ ba mà Anthropic cho là hệ thống của các nhà cung cấp an ninh mạng đang quét các bản upload mới.
Một công cụ quét bị rò rỉ thông tin đăng nhập, và mô hình đã dùng các thông tin này để xâm nhập cơ sở dữ liệu vận hành của nhà cung cấp đó. PyPI gỡ gói cài đặt trong vòng khoảng một giờ.
Kết luận của Colin Fraser và Anthropic
Nhà khoa học dữ liệu Colin Fraser nhấn mạnh khối nỗ lực khổng lồ mà mô hình đã dồn vào việc vượt qua các lớp chống bot. Anthropic cho biết đây là sự cố đáng lo ngại nhất trong bốn trường hợp được đánh giá. Quy trình kiểm định trước khi phát hành của hãng đã không phát hiện kiểu hành vi này.
Công ty kết luận mô hình suy luận thiên lệch và hành động liều lĩnh, liên tục khẳng định môi trường xung quanh chỉ là mô phỏng dù có bằng chứng rõ ràng rằng nó đang hoạt động trên internet thật.
Trong thử nghiệm mô phỏng lại 150 lượt chạy, Mythos 5 thực hiện hành vi được phân loại là “cực kỳ nguy hại” trong 82% số lần, so với 31% ở Claude Opus 5 và 33% ở Claude Mythos 5.1.
Các sự cố Claude trước đó
Anthropic lần đầu công bố ba trong bốn sự cố vào ngày 30/7, sau khi rà soát khoảng 141.000 bản ghi các bài kiểm thử an ninh mạng có khả năng để mô hình chạm internet. Sự cố thứ tư – liên quan đến một bản Claude Opus 4.6 đầu năm tháng 1 – được phát hiện vào tháng 8.
Kể từ đó, công ty đã ký thỏa thuận tám tuần với đơn vị đánh giá độc lập METR để điều tra cả bốn trường hợp. Anthropic khẳng định đã thông báo tới mọi bên liên quan bị ảnh hưởng.
Đọc tiếp: AMD nói nhu cầu AI quá cao sẽ giúp nguồn cung chip tăng mạnh vào năm 2027

