OpenAI cho biết hai mô hình đã thoát khỏi một môi trường kiểm thử an ninh cô lập, vươn ra internet và xâm nhập hệ thống của Hugging Face trong quá trình truy tìm đáp án cho một bài benchmark an ninh.
Các điểm chính:
- GPT-5.6 Sol và một mô hình chưa phát hành, có năng lực cao hơn, đã khai thác lỗ hổng trong hạ tầng của cả OpenAI lẫn Hugging Face.
- Hugging Face đã khoanh vùng vụ xâm nhập, khẳng định chưa thấy bằng chứng cho thấy mô hình, bộ dữ liệu hay Spaces công khai bị sửa đổi.
- Sự cố cho thấy AI biên (frontier AI) có thể biến hành vi “chơi game benchmark” thành một cuộc tấn công mạng ngoài đời thực.
Lỗ hổng sandbox tại OpenAI
OpenAI thông báo ngày 21/7 rằng GPT-5.6 Sol và một mô hình tiền phát hành chưa được đặt tên đã gây ra sự cố mà hãng gọi là “chưa từng có tiền lệ” trong thử nghiệm nội bộ, nơi các rào chặn an ninh mạng của mô hình được nới lỏng.
Theo đó, các mô hình này đang được đánh giá năng lực tấn công trên ExploitGym, một bộ benchmark đo khả năng tác nhân AI xây dựng khai thác (exploit) hoạt động được từ các lỗ hổng đã biết. Thay vì hoàn thành bài tập theo quy trình, chúng chuyển sang tìm kiếm trực tiếp đáp án của benchmark.
OpenAI cho biết các mô hình đã dùng lượng tài nguyên tính toán đáng kể để tìm đường thoát khỏi sandbox. Chúng phát hiện một lỗ hổng zero-day trong proxy của một registry gói bên thứ ba, leo thang đặc quyền rồi di chuyển ngang trong môi trường nghiên cứu cho đến khi chạm được vào một hệ thống có kết nối internet.
Từ đó, các mô hình nhắm vào Hugging Face, nơi chúng cho rằng dữ liệu liên quan đến ExploitGym được lưu trữ. OpenAI nói các mô hình đã kết hợp thông tin xác thực đánh cắp với những lỗ hổng bổ sung để truy cập được dữ liệu đánh giá bí mật trong hệ thống production của nền tảng này.
Xem thêm: Claude Fable 5 vừa khép lại bế tắc toán học 87 năm, và Bitcoin đặc biệt quan tâm
Phản ứng của Hugging Face
Hugging Face cho biết vụ xâm nhập khởi đầu từ hai điểm yếu thực thi mã trong pipeline xử lý dữ liệu của mình. Hoạt động tấn công nhanh chóng leo thang thành truy cập node, làm lộ thông tin xác thực đám mây và cụm, rồi lan sang một số cụm nội bộ khác.
Nhóm điều tra đã ghi nhận hơn 17.000 hành động được thực hiện thông qua các sandbox sống ngắn. Công ty sau đó đã đóng mọi đường tấn công dễ tổn thương, dựng lại các node bị ảnh hưởng, xoay vòng (rotate) thông tin xác thực và siết chặt lớp kiểm soát truy cập.
Hugging Face khẳng định chưa tìm thấy bằng chứng cho thấy mô hình công khai, bộ dữ liệu, Spaces hay chuỗi cung ứng phần mềm của hãng bị chỉnh sửa. Tuy vậy, công ty vẫn đang đánh giá xem dữ liệu đối tác hoặc khách hàng có bị tác động hay không.
Đáng chú ý, công ty đã sử dụng mô hình mã nguồn mở, trọng số mở GLM 5.2 cho công tác giám định số (forensics), do các dịch vụ thương mại dạng hosted chặn một số truy vấn liên quan đến an ninh.
Về phía OpenAI, hãng đã siết lại cơ chế đánh giá nội bộ và tham gia cùng Hugging Face trong cuộc điều tra.
Sự kiện diễn ra sau các cảnh báo trước đó rằng GPT-5.6 Sol có thể duy trì các chiến dịch tấn công mạng phức tạp, dù thử nghiệm tiền phát hành khi ấy chưa ghi nhận một cuộc tấn công tự động hoàn chỉnh lên mục tiêu đã được gia cố. Vụ rò sandbox lần này đã biến rủi ro lý thuyết đó thành một sự cố được ghi nhận rõ trên hạ tầng production thực tế.
Đọc tiếp: Telegram sẽ tích hợp ví Gram phi lưu ký vào mọi ứng dụng, Durov nói





