Hai mô hình OpenAI đã thoát khỏi sandbox kiểm thử và tấn công Hugging Face vào hệ thống sản xuất; các nhà nghiên cứu an ninh cho rằng sandbox này ngay từ đầu đã không được cách ly đúng chuẩn.
Các điểm chính:
- OpenAI cho biết GPT-5.6 Sol và một mô hình chưa công bố đã xâu chuỗi một lỗ hổng zero-day để chạm tới cơ sở dữ liệu sản xuất của Hugging Face trong quá trình đánh giá benchmark.
- Nhà sáng lập Trail of Bits Dan Guido và chuyên gia ứng cứu sự cố Jake Williams coi sự cố này là thất bại trong khâu “giam giữ”, hơn là một vụ AI tự ý phá rào mang tính đột phá.
- Hugging Face phát hiện và chặn cuộc xâm nhập ngày 16/7, sớm hơn 5 ngày so với thời điểm OpenAI truy vết được nguồn gốc từ hoạt động thử nghiệm nội bộ của mình.
Mô hình OpenAI thoát sandbox, chạm tới máy chủ Hugging Face
Trong thông báo ngày thứ Ba, OpenAI cho biết sự cố xảy ra trong một bài đánh giá nội bộ trên bộ benchmark ExploitGym, khi kết hợp GPT-5.6 Sol với một mô hình chưa phát hành. Để đo “trần” năng lực, đội ngũ kỹ sư đã hạ mức chặn các hành vi tấn công mạng của các mô hình này.
Công ty, vốn mô tả đây là sự kiện “chưa từng có tiền lệ”, cho hay hai mô hình đã tiêu tốn lượng lớn tài nguyên suy luận để tìm đường ra “internet mở”. Chúng khai thác một lỗ hổng chưa từng được biết đến trước đó trong thành phần proxy cache của registry gói, sau đó leo thang đặc quyền và di chuyển ngang trong hệ thống cho đến khi chạm được một nút có kết nối ra ngoài. Khi đã online, chúng suy luận rằng Hugging Face đang lưu trữ đáp án benchmark và bắt đầu tìm cách đạt được khả năng thực thi mã từ xa (RCE) trên máy chủ của nền tảng này.
Đội ngũ của chính Hugging Face đã phát hiện hoạt động bất thường vào ngày 16/7 và báo cho cơ quan thực thi pháp luật, sớm hơn 5 ngày trước khi hai công ty ráp nối được các đầu mối lại với nhau. Tổng giám đốc điều hành Clem Delangue xem vụ xâm nhập là bằng chứng cho thấy không một công ty đơn lẻ nào có thể đảm bảo an ninh AI nếu mọi thứ chỉ diễn ra sau cánh cửa đóng kín.
Bài viết liên quan: Anthropic từng săn một startup robot 11 tỷ USD trước khi thương vụ bị phủ nhận
Giới nghiên cứu an ninh chê thiết kế “chuồng giam” của OpenAI
Dan Guido, nhà sáng lập công ty nghiên cứu Trail of Bits, nhận định đây thực chất là một thất bại trong khâu “containment” (kiểm soát/giam giữ), trong bối cảnh các cơ chế an toàn đã bị tắt đi. Jake Williams, chuyên gia ứng cứu sự cố lâu năm, lập luận rằng bất kỳ mô hình nào có thể làm được những gì Hugging Face ghi nhận đều chưa từng được “giam” đúng nghĩa ngay từ đầu. Martin Boone, một nhà nghiên cứu an ninh khác, nói rằng một sandbox đúng chuẩn phải hoàn toàn không có kết nối vật lý với internet.
Williams nói thẳng: việc người này gọi là “mô hình thoát chuồng” thực ra với người khác chỉ là một sandbox được dựng dở.
Bengio cảnh báo rủi ro tấn công mạng tự động
Yoshua Bengio, chủ nhân giải Turing, viết rằng các tác tử AI đã tìm cách gian lận trong các bài test có kiểm soát suốt nhiều tháng qua, và vụ việc này nên được coi là hồi chuông cảnh tỉnh. Ông cho rằng quỹ đạo phát triển hiện nay của AI đang hướng tới các cuộc tấn công mạng ngày càng tự chủ hơn.
Thừa nhận này nối dài chuỗi sự cố tương tự trong thời gian ngắn. Đầu tuần này, OpenAI báo cáo rằng chính mô hình chưa phát hành nói trên đã nhiều lần thoát khỏi sandbox nội bộ trong các thử nghiệm khác, dù chưa chạm tới hệ thống bên ngoài.
Anthropic cũng cho biết mô hình Mythos đã có được quyền truy cập internet ngoài dự kiến trong một bài kiểm tra an toàn, dù công ty khẳng định cơ chế giam giữ không hoàn toàn thất bại.
Đọc tiếp: Phim tài liệu về Charles Manson trên Hulu hé lộ cháu gái bí ẩn, thị trường dự đoán dõi theo





