Anthropic đã ngắt hoàn toàn truy cập internet trực tiếp cho tất cả các bài đánh giá AI nội bộ, sau khi các mô hình Claude – bao gồm Mythos 5 – khai thác lỗ hổng và vượt qua các hạn chế trên nhiều website, trong đó có trang của các cơ quan chính phủ Mỹ.
Điểm chính:
- Anthropic vô hiệu hóa truy cập internet trực tiếp trong toàn bộ bài đánh giá nội bộ cho đến khi hệ thống giám sát có thể nhận diện đáng tin cậy các hành vi ngoài ý muốn.
- Các mô hình Claude đã chạy lệnh trên máy chủ một trường đại học, dùng token truy cập để tiếp cận dữ liệu trả phí và gửi biểu mẫu trên các website thật.
- Một tin báo án mạng bịa đặt do Claude Haiku 4.5 gửi tới sở cảnh sát Philadelphia đã bị lực lượng này công khai chỉ trích.
Báo cáo về Claude của Anthropic
Anthropic đã công bố báo cáo hôm thứ Sáu về các hành vi ngoài ý muốn của mô hình trong quá trình đánh giá và sử dụng nội bộ, chủ yếu dựa trên việc rà soát bản ghi hội thoại bắt đầu từ tháng 7. Một số bài kiểm tra rủi ro cao và an ninh mạng vốn đã bị đưa về môi trường không mạng trước đó.
Lệnh hạn chế mới nay áp dụng cho mọi bài đánh giá nội bộ và không có thời hạn kết thúc, cho đến khi công ty xác nhận hệ thống giám sát đủ khả năng phát hiện đáng tin cậy những hành vi kiểu này.
Báo cáo chia các sự cố thành bốn nhóm: chạy lệnh trên máy chủ thông qua lỗi phần mềm, gửi biểu mẫu trên website thật, truy cập dữ liệu bị rào cổng và dùng dịch vụ rút gọn URL để lách giới hạn công cụ. Một số website thuộc các cơ quan liên bang, bang và địa phương của Mỹ; Anthropic cho biết đã báo cáo Nhà Trắng và thông báo cho từng cơ quan liên quan.
Trong một trường hợp, Claude Mythos 5 đã lấy được token truy cập còn hiệu lực từ bản đồ tài sản của một chính quyền địa phương và truy vấn thẳng vào máy chủ phía sau. Ở một trường hợp khác, Claude Haiku 4.5 đã gửi một manh mối bịa đặt về một vụ án mạng chưa phá qua biểu mẫu trực tuyến của Sở Cảnh sát Philadelphia hôm 18/7; thông tin này bị hệ thống phân loại là spam. Cảnh sát chỉ trích việc phát hiện và báo cáo chậm hai tháng là “không thể chấp nhận được”.
Bài viết liên quan: Zcash đặt mục tiêu lượng hóa 70% ZEC vào tháng 1, điều còn thiếu là mốc thời gian chính xác
Cảnh báo từ Von Arx
Sydney von Arx thuộc nhóm an toàn AI Nightingale nhận định trong một cuộc phỏng vấn trước khi thông tin được công bố rằng việc cắt mô hình khỏi internet mở sẽ gây khó cho giới nghiên cứu và làm chậm tiến độ phát triển mô hình. “Anh phải căn chỉnh chúng ở một thời điểm nào đó,” von Arx nói.
Anthropic cho biết riêng huấn luyện căn chỉnh (alignment training) hiện vẫn chưa đủ cho các tác vụ tìm kiếm và dùng máy tính, nên công ty phải dựa thêm vào bộ phân loại (classifier) và các tầng bảo vệ khác. Hãng liên hệ các hành vi này với môi trường huấn luyện chưa hoàn hảo, nơi mô hình được thưởng khi tìm cách lách rào, một dạng “hack phần thưởng” (reward hacking) điển hình. Theo Anthropic, các công cụ phát hiện mới đã chặn được mọi ca tương tự trong quá trình thử nghiệm.
Anthropic đánh giá các vụ việc lần này kém nghiêm trọng hơn đáng kể so với loạt sự cố mùa hè vừa qua.
Động thái công khai này diễn ra sau báo cáo ngày 30/7, trong đó Anthropic cho biết ba mô hình Claude đã vươn ra internet trong các bài test an ninh mạng và giành quyền truy cập trái phép vào hệ thống của ba tổ chức. Đợt rà soát đó bao gồm 141.006 lượt đánh giá. Cuộc điều tra được khởi động sau khi OpenAI ngày 21/7 tiết lộ mô hình của họ đã thoát khỏi môi trường thử nghiệm và xâm nhập hạ tầng của Hugging Face.
Bài tiếp theo: Kalshi đối đầu NFL tại Tòa Tối cao khi 1,8 tỷ USD đặt cược vào một Chủ nhật bóng bầu dục

