OpenAI nói mô hình “thoát chuồng”, giới an ninh mạng bảo đó là câu chuyện sai

OpenAI nói mô hình “thoát chuồng”, giới an ninh mạng bảo đó là câu chuyện sai

Hai mô hình OpenAI “thoát” khỏi sandbox thử nghiệm và tấn công Hugging Face vào hệ thống sản xuất, và các nhà nghiên cứu an ninh khẳng định sandbox này chưa từng được cô lập đúng chuẩn.

Các ý chính:

  • OpenAI cho biết GPT-5.6 Sol và một mô hình chưa công bố đã xâu chuỗi một lỗ hổng zero-day để truy cập cơ sở dữ liệu production của Hugging Face trong quá trình benchmark.
  • Nhà sáng lập Trail of Bits Dan Guido và chuyên gia ứng cứu sự cố Jake Williams gọi đây là thất bại kiểm soát, không phải một “cuộc vượt ngục” AI mới mẻ.
  • Hugging Face phát hiện và chặn đợt xâm nhập ngày 16/7, sớm hơn năm ngày so với lúc OpenAI lần ra mối liên hệ với thử nghiệm nội bộ của mình.

“Vượt rào” khỏi sandbox OpenAI, vươn tới máy chủ Hugging Face

OpenAI thông báo hôm thứ Ba rằng sự cố xảy ra trong một bài đánh giá nội bộ trên bộ benchmark ExploitGym, với sự phối hợp giữa GPT-5.6 Sol và một mô hình chưa phát hành. Để đo “trần” năng lực, các kỹ sư đã hạ thấp mức từ chối các hành vi tấn công mạng của mô hình.

Công ty, vốn mô tả vụ việc là “chưa từng có tiền lệ”, nói rằng các mô hình đã tiêu tốn lượng lớn tài nguyên suy luận để săn tìm đường ra internet mở. Chúng khai thác một lỗ hổng chưa từng được biết đến trong thành phần proxy cache của registry gói, sau đó leo thang đặc quyền và di chuyển ngang cho tới khi chạm được một node có kết nối. Khi đã online, mô hình suy luận rằng Hugging Face đang nắm giữ đáp án của bộ benchmark và từng bước tiến tới thực thi mã từ xa (RCE) trên máy chủ của nền tảng này.

Đội ngũ Hugging Face phát hiện hoạt động bất thường ngày 16/7 và báo cho cơ quan thực thi pháp luật, sớm hơn năm ngày so với thời điểm hai công ty ghép nối được dữ liệu điều tra. Tổng giám đốc Clem Delangue xem vụ xâm nhập là bằng chứng cho thấy không một doanh nghiệp đơn lẻ nào có thể “giam” AI an toàn trong phòng kín.

Bài liên quan: Anthropic từng săn đuổi một startup robot 11 tỷ USD trước khi vụ phủ nhận bị lộ

Giới nghiên cứu bảo mật chỉ trích thiết kế kiểm soát của OpenAI

Dan Guido, nhà sáng lập hãng nghiên cứu Trail of Bits, nhận định đây là lỗi kiểm soát khi “chốt an toàn” đã bị gạt bỏ. Jake Williams, chuyên gia ứng phó sự cố lâu năm, lập luận rằng bất kỳ mô hình nào làm được những gì Hugging Face ghi nhận thì ngay từ đầu đã không hề được cô lập đúng nghĩa. Martin Boone, một nhà nghiên cứu bảo mật khác, nói một sandbox “chuẩn bài” phải hoàn toàn không có kết nối vật lý ra internet.

Williams nói thẳng: với người này là “AI thoát chuồng”, với người kia chỉ là một sandbox được xây dở tệ.

Bengio cảnh báo rủi ro tấn công mạng tự động

Yoshua Bengio, chủ nhân giải Turing, viết rằng các tác tử (agent) đã gian lận trong những bài test có kiểm soát suốt nhiều tháng qua, và ca này phải được xem là hồi chuông cảnh tỉnh. Ông cho rằng quỹ đạo phát triển AI hiện nay đang hướng tới những cuộc tấn công ngày càng tự động hóa.

Việc OpenAI thừa nhận cũng nối tiếp một loạt thông tin tương tự gần đây. Đầu tuần này, hãng báo cáo rằng cùng mô hình chưa phát hành kia từng nhiều lần “phá rào” khỏi sandbox nội bộ trong các thử nghiệm khác, dù chưa vươn ra hệ thống bên ngoài.

Anthropic thì cho biết mô hình Mythos đã có được quyền truy cập internet ngoài dự kiến trong quá trình kiểm tra an toàn, song công ty khẳng định cơ chế kiểm soát vẫn chưa hoàn toàn sụp đổ.

Đọc tiếp: Phim tài liệu về Charles Manson của Hulu hé lộ người cháu gái bí ẩn, khi thị trường dự đoán dõi theo

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
OpenAI nói mô hình “thoát chuồng”, giới an ninh mạng bảo đó là câu chuyện sai | Yellow