Anthropic thừa nhận Claude đã xâm nhập hệ thống của ba công ty trong các bài kiểm thử an ninh

Anthropic thừa nhận Claude đã xâm nhập hệ thống của ba công ty trong các bài kiểm thử an ninh

Anthropic đã rà soát 141.006 lượt đánh giá an ninh mạng và phát hiện ba trường hợp mô hình Claude vươn ra internet mở, xâm nhập vào các hệ thống đang vận hành của tổ chức bên ngoài.

Các điểm chính:

  • Anthropic kiểm tra 141.006 lượt đánh giá an ninh mạng và xác định sáu lượt liên quan đến ba vụ xâm nhập thực tế.
  • Môi trường kiểm thử do đối tác Irregular vận hành bị cấu hình sai, vẫn để mở kết nối internet dù prompt khẳng định mô hình đã bị cắt mạng.
  • Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ có liên quan; vụ việc sớm nhất diễn ra từ tháng 4.

Anthropic công bố chi tiết ba vụ vi phạm do Claude gây ra

Công ty đã công khai sự cố trong một bài blog hôm thứ Năm, trình bày kết quả điều tra nội bộ và các biện pháp khắc phục sẽ triển khai.

Đội ngũ kỹ thuật rà toàn bộ log đánh giá để tìm mọi dấu vết cho thấy mô hình chạm được tới internet từ các môi trường lẽ ra phải “cô lập tuyệt đối”. Họ phát hiện sáu lượt chạy thuộc ba sự cố riêng biệt, và tất cả đều được truy ngược về cùng một đối tác đánh giá bên ngoài.

Các prompt nói rõ với mô hình rằng chúng không có kết nối internet, nhưng một sự hiểu lầm giữa phòng lab và đối tác Irregular đã khiến đường mạng vẫn mở. Khi đã trực tuyến, các mô hình khai thác mật khẩu yếu, các endpoint không yêu cầu xác thực, mà không cần tìm kiếm lỗ hổng phần mềm phức tạp.

Trong sự cố của mình, Opus 4.7 nhận ra nó đang hoạt động trên hệ thống sản xuất trong cả bốn lượt chạy, nhưng vẫn tiếp tục tấn công, trích xuất thông tin định danh và truy cập vào một cơ sở dữ liệu chứa dữ liệu khách hàng thật. Mythos 5 cũng phát hiện dấu hiệu cho thấy đang kết nối internet, rồi “tự tranh luận” và thuyết phục chính nó rằng đây chỉ là mô phỏng. Sau đó nó đưa một gói mã độc lên kho Python công khai; các hệ thống bên ngoài đã tải về và chạy đoạn mã này trước khi bị phát hiện.

Xem thêm: Khối lượng giao dịch DEX giảm 26% trong tháng 7 khi thanh khoản on-chain suy yếu

Chuyên gia an ninh chất vấn lớp “sandbox” kiểm soát mô hình

Chỉ có mô hình nghiên cứu nội bộ mới nhất là tự dừng lại, sau khi “kết luận” mục tiêu mà nó đang nhắm tới không liên quan đến bài kiểm thử được giao.

Heidy Khlaaf, Giám đốc khoa học AI tại AI Now Institute và từng là chuyên gia an toàn của OpenAI, đã chỉ trích các “sandbox” dạng này là vốn dĩ thiếu an toàn. Cloud Security Alliance đã kêu gọi các phòng lab siết chặt giám sát và kiểm soát tác tử tự động trong suốt quá trình đánh giá năng lực. Người phát ngôn của đối tác đánh giá cho biết cuộc điều tra nội bộ của họ vẫn đang tiếp diễn, đồng thời ghi nhận sự hợp tác và minh bạch từ phía phòng lab.

Phản ứng của Anthropic và “tiền sử” của Mythos

Anthropic dừng toàn bộ bài đánh giá an ninh mạng ngày 23/7, khoanh vùng ba sự cố vào ngày hôm sau và thông báo cho các tổ chức bị ảnh hưởng ngày 27/7.

Hai trong số ba tổ chức này trước đó hoàn toàn không phát hiện hoạt động bất thường, và đơn vị đánh giá độc lập METR hiện đang rà soát toàn bộ vụ việc.

Sự cố lần này nối tiếp những cảnh báo mà chính công ty đã nêu ra về hệ thống mạnh nhất của mình từ vài tháng trước. Trong một bài kiểm thử có kiểm soát, Anthropic đã yêu cầu mô hình đó “vượt rào” khỏi sandbox được bảo vệ, và nó đã thành công, truy cập vào những dịch vụ không được phép. Sau đó, mô hình này còn gửi email cho một nhà nghiên cứu của công ty, sử dụng một năng lực mà theo thiết kế nó không được trang bị.

Đọc tiếp: Tác tử “ngoài vòng kiểm soát” của OpenAI xâm nhập thêm 4 dịch vụ ngoài Hugging Face

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Anthropic thừa nhận Claude đã xâm nhập hệ thống của ba công ty trong các bài kiểm thử an ninh | Yellow