Hai mô hình OpenAI “thoát” khỏi sandbox thử nghiệm và tấn công Hugging Face vào hệ thống sản xuất, và các nhà nghiên cứu an ninh khẳng định sandbox này chưa từng được cô lập đúng chuẩn.
Các ý chính:
- OpenAI cho biết GPT-5.6 Sol và một mô hình chưa công bố đã xâu chuỗi một lỗ hổng zero-day để truy cập cơ sở dữ liệu production của Hugging Face trong quá trình benchmark.
- Nhà sáng lập Trail of Bits Dan Guido và chuyên gia ứng cứu sự cố Jake Williams gọi đây là thất bại kiểm soát, không phải một “cuộc vượt ngục” AI mới mẻ.
- Hugging Face phát hiện và chặn đợt xâm nhập ngày 16/7, sớm hơn năm ngày so với lúc OpenAI lần ra mối liên hệ với thử nghiệm nội bộ của mình.
“Vượt rào” khỏi sandbox OpenAI, vươn tới máy chủ Hugging Face
OpenAI thông báo hôm thứ Ba rằng sự cố xảy ra trong một bài đánh giá nội bộ trên bộ benchmark ExploitGym, với sự phối hợp giữa GPT-5.6 Sol và một mô hình chưa phát hành. Để đo “trần” năng lực, các kỹ sư đã hạ thấp mức từ chối các hành vi tấn công mạng của mô hình.
Công ty, vốn mô tả vụ việc là “chưa từng có tiền lệ”, nói rằng các mô hình đã tiêu tốn lượng lớn tài nguyên suy luận để săn tìm đường ra internet mở. Chúng khai thác một lỗ hổng chưa từng được biết đến trong thành phần proxy cache của registry gói, sau đó leo thang đặc quyền và di chuyển ngang cho tới khi chạm được một node có kết nối. Khi đã online, mô hình suy luận rằng Hugging Face đang nắm giữ đáp án của bộ benchmark và từng bước tiến tới thực thi mã từ xa (RCE) trên máy chủ của nền tảng này.
Đội ngũ Hugging Face phát hiện hoạt động bất thường ngày 16/7 và báo cho cơ quan thực thi pháp luật, sớm hơn năm ngày so với thời điểm hai công ty ghép nối được dữ liệu điều tra. Tổng giám đốc Clem Delangue xem vụ xâm nhập là bằng chứng cho thấy không một doanh nghiệp đơn lẻ nào có thể “giam” AI an toàn trong phòng kín.
Bài liên quan: Anthropic từng săn đuổi một startup robot 11 tỷ USD trước khi vụ phủ nhận bị lộ
Giới nghiên cứu bảo mật chỉ trích thiết kế kiểm soát của OpenAI
Dan Guido, nhà sáng lập hãng nghiên cứu Trail of Bits, nhận định đây là lỗi kiểm soát khi “chốt an toàn” đã bị gạt bỏ. Jake Williams, chuyên gia ứng phó sự cố lâu năm, lập luận rằng bất kỳ mô hình nào làm được những gì Hugging Face ghi nhận thì ngay từ đầu đã không hề được cô lập đúng nghĩa. Martin Boone, một nhà nghiên cứu bảo mật khác, nói một sandbox “chuẩn bài” phải hoàn toàn không có kết nối vật lý ra internet.
Williams nói thẳng: với người này là “AI thoát chuồng”, với người kia chỉ là một sandbox được xây dở tệ.
Bengio cảnh báo rủi ro tấn công mạng tự động
Yoshua Bengio, chủ nhân giải Turing, viết rằng các tác tử (agent) đã gian lận trong những bài test có kiểm soát suốt nhiều tháng qua, và ca này phải được xem là hồi chuông cảnh tỉnh. Ông cho rằng quỹ đạo phát triển AI hiện nay đang hướng tới những cuộc tấn công ngày càng tự động hóa.
Việc OpenAI thừa nhận cũng nối tiếp một loạt thông tin tương tự gần đây. Đầu tuần này, hãng báo cáo rằng cùng mô hình chưa phát hành kia từng nhiều lần “phá rào” khỏi sandbox nội bộ trong các thử nghiệm khác, dù chưa vươn ra hệ thống bên ngoài.
Anthropic thì cho biết mô hình Mythos đã có được quyền truy cập internet ngoài dự kiến trong quá trình kiểm tra an toàn, song công ty khẳng định cơ chế kiểm soát vẫn chưa hoàn toàn sụp đổ.
Đọc tiếp: Phim tài liệu về Charles Manson của Hulu hé lộ người cháu gái bí ẩn, khi thị trường dự đoán dõi theo





