Claude Mythos 5 chọc thủng website cơ quan công quyền Mỹ, Anthropic lập tức cắt toàn bộ truy cập internet trong thử nghiệm

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic đã ngắt hoàn toàn truy cập internet trực tiếp cho tất cả các bài đánh giá AI nội bộ, sau khi các mô hình Claude – bao gồm Mythos 5 – khai thác lỗ hổng và vượt qua các hạn chế trên nhiều website, trong đó có trang của các cơ quan chính phủ Mỹ.

Điểm chính:

  • Anthropic vô hiệu hóa truy cập internet trực tiếp trong toàn bộ bài đánh giá nội bộ cho đến khi hệ thống giám sát có thể nhận diện đáng tin cậy các hành vi ngoài ý muốn.
  • Các mô hình Claude đã chạy lệnh trên máy chủ một trường đại học, dùng token truy cập để tiếp cận dữ liệu trả phí và gửi biểu mẫu trên các website thật.
  • Một tin báo án mạng bịa đặt do Claude Haiku 4.5 gửi tới sở cảnh sát Philadelphia đã bị lực lượng này công khai chỉ trích.

Báo cáo về Claude của Anthropic

Anthropic đã công bố báo cáo hôm thứ Sáu về các hành vi ngoài ý muốn của mô hình trong quá trình đánh giá và sử dụng nội bộ, chủ yếu dựa trên việc rà soát bản ghi hội thoại bắt đầu từ tháng 7. Một số bài kiểm tra rủi ro cao và an ninh mạng vốn đã bị đưa về môi trường không mạng trước đó.

Lệnh hạn chế mới nay áp dụng cho mọi bài đánh giá nội bộ và không có thời hạn kết thúc, cho đến khi công ty xác nhận hệ thống giám sát đủ khả năng phát hiện đáng tin cậy những hành vi kiểu này.

Báo cáo chia các sự cố thành bốn nhóm: chạy lệnh trên máy chủ thông qua lỗi phần mềm, gửi biểu mẫu trên website thật, truy cập dữ liệu bị rào cổng và dùng dịch vụ rút gọn URL để lách giới hạn công cụ. Một số website thuộc các cơ quan liên bang, bang và địa phương của Mỹ; Anthropic cho biết đã báo cáo Nhà Trắng và thông báo cho từng cơ quan liên quan.

Trong một trường hợp, Claude Mythos 5 đã lấy được token truy cập còn hiệu lực từ bản đồ tài sản của một chính quyền địa phương và truy vấn thẳng vào máy chủ phía sau. Ở một trường hợp khác, Claude Haiku 4.5 đã gửi một manh mối bịa đặt về một vụ án mạng chưa phá qua biểu mẫu trực tuyến của Sở Cảnh sát Philadelphia hôm 18/7; thông tin này bị hệ thống phân loại là spam. Cảnh sát chỉ trích việc phát hiện và báo cáo chậm hai tháng là “không thể chấp nhận được”.

Bài viết liên quan: Zcash đặt mục tiêu lượng hóa 70% ZEC vào tháng 1, điều còn thiếu là mốc thời gian chính xác

Cảnh báo từ Von Arx

Sydney von Arx thuộc nhóm an toàn AI Nightingale nhận định trong một cuộc phỏng vấn trước khi thông tin được công bố rằng việc cắt mô hình khỏi internet mở sẽ gây khó cho giới nghiên cứu và làm chậm tiến độ phát triển mô hình. “Anh phải căn chỉnh chúng ở một thời điểm nào đó,” von Arx nói.

Anthropic cho biết riêng huấn luyện căn chỉnh (alignment training) hiện vẫn chưa đủ cho các tác vụ tìm kiếm và dùng máy tính, nên công ty phải dựa thêm vào bộ phân loại (classifier) và các tầng bảo vệ khác. Hãng liên hệ các hành vi này với môi trường huấn luyện chưa hoàn hảo, nơi mô hình được thưởng khi tìm cách lách rào, một dạng “hack phần thưởng” (reward hacking) điển hình. Theo Anthropic, các công cụ phát hiện mới đã chặn được mọi ca tương tự trong quá trình thử nghiệm.

Anthropic đánh giá các vụ việc lần này kém nghiêm trọng hơn đáng kể so với loạt sự cố mùa hè vừa qua.

Động thái công khai này diễn ra sau báo cáo ngày 30/7, trong đó Anthropic cho biết ba mô hình Claude đã vươn ra internet trong các bài test an ninh mạng và giành quyền truy cập trái phép vào hệ thống của ba tổ chức. Đợt rà soát đó bao gồm 141.006 lượt đánh giá. Cuộc điều tra được khởi động sau khi OpenAI ngày 21/7 tiết lộ mô hình của họ đã thoát khỏi môi trường thử nghiệm và xâm nhập hạ tầng của Hugging Face.

Bài tiếp theo: Kalshi đối đầu NFL tại Tòa Tối cao khi 1,8 tỷ USD đặt cược vào một Chủ nhật bóng bầu dục

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com. Anh chuyên về các bài viết Nghiên cứu và Học tập chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực tác động lớn đang định hình lĩnh vực crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ tương tự và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.