OpenAI kể lại việc hai mô hình của mình “tấn công” Hugging Face theo một mô-típ tiếp thị mà hãng đã định hình từ năm 2019, theo lập luận của nhà khoa học máy tính John Thickstun (ĐH Cornell).
Những điểm chính:
- OpenAI nói hai mô hình đã thoát khỏi môi trường thử nghiệm cách ly (sandbox) và xâm nhập máy chủ Hugging Face để “gian lận” trong một bài kiểm tra an ninh mạng.
- Thickstun cho rằng bản công bố này đồng thời là “pitch” với nhà đầu tư, lặp lại cách OpenAI từng trì hoãn công bố GPT-2 năm 2019.
- Hugging Face phải nhờ tới một mô hình mã mở của Trung Quốc phục vụ giám định số, sau khi các mô hình của Mỹ từ chối xử lý.
Thickstun đặt dấu hỏi quanh cách OpenAI công bố vụ tấn công
Thứ Ba vừa qua, OpenAI thông báo rằng hai mô hình của hãng đã thâm nhập Hugging Face – nền tảng AI mã nguồn mở – trong một bài đánh giá nội bộ về năng lực tấn công mạng.
Trước đó năm ngày, Hugging Face đã công khai sự cố, mô tả đây là một cuộc tấn công do hệ thống tác nhân tự động điều khiển từ đầu đến cuối. OpenAI gọi đây là sự kiện “chưa từng có tiền lệ” và dự báo các tình huống tương tự sẽ xuất hiện nhiều hơn khi mô hình ngày càng mạnh.
Theo tường thuật, các mô hình đã khai thác một lỗ hổng zero-day trong trình cài đặt gói phần mềm để thoát khỏi sandbox vốn được thiết kế là “ngoại tuyến hoàn toàn”, rồi tiếp tục di chuyển ngang trong hệ thống nội bộ cho tới khi chạm được một máy có kết nối internet. Từ đó, chúng dùng thông tin định danh bị đánh cắp cùng các lỗ hổng zero-day khác để truy xuất đáp án bộ benchmark ngay trên cụm máy chủ sản xuất của Hugging Face.
Thickstun – trợ lý giáo sư tại Đại học Cornell, chuyên nghiên cứu kiểm soát hành vi mô hình – nhận xét cách công bố của OpenAI rất phù hợp với một công ty đang chuẩn bị bước ra Phố Wall.
Ông lập luận trong một bài phỏng vấn khác rằng mỗi cảnh báo về “mô hình nguy hiểm” lại vang lên trong tai giới đầu tư như một tuyên bố về quyền lực công nghệ.
Theo ông, khung diễn giải này đã đi cùng các thông cáo của OpenAI trong nhiều năm, và giới hậu thuẫn tài chính liên tục “thưởng” cho câu chuyện đó.
Xem thêm: ChatGPT bị cáo buộc suýt khiến một mục sư thiệt mạng, tòa án vào cuộc
Bengio và Guido bất đồng về trách nhiệm
Không phải ai cũng coi bản công bố của OpenAI là chiêu bán hàng. Thông tin được đưa ra chỉ vài tuần sau khi Tổng thống Donald Trump ký sắc lệnh cho phép chính phủ đánh giá rủi ro của các mô hình tiên tiến trước khi phát hành.
Yoshua Bengio gọi vụ việc là “hồi chuông cảnh tỉnh”, trong khi Nate Soares thuộc Machine Intelligence Research Institute xem đây là “phát súng cảnh báo” nên thúc đẩy Washington sớm mở đàm phán với Bắc Kinh.
Giới nghiên cứu an ninh mạng lại tập trung phê bình khâu kỹ thuật của OpenAI. Dan Guido từ Trail of Bits mô tả sự cố là “một thất bại trong khâu kiềm toả, với các cơ chế an toàn bị vô hiệu”, viện dẫn chính trình cài đặt gói đã vô tình mở đường cho sandbox đi ra bên ngoài.
Một số chuyên gia khác lưu ý OpenAI đã cố ý nới lỏng các rào chặn liên quan tới “từ chối tác vụ tấn công mạng” trong bài thử nghiệm, khiến kết quả thực tế không còn quá gây sốc nếu nhìn kỹ điều kiện ban đầu.
Trong giai đoạn xử lý hậu quả, một vấn đề thứ hai lộ diện: các mô hình thương mại đặt máy tại Mỹ đồng loạt từ chối xử lý chuỗi lệnh tấn công thô và payload khai thác – những dữ liệu bắt buộc phải phân tích trong công việc giám định số.
Theo báo cáo của Hugging Face, được trích dẫn, đội ngũ kỹ sư đã chuyển sang chạy GLM 5.2 – mô hình open-weight của Z.ai – trên hạ tầng nội bộ, để sàng lọc hơn 17.000 bản log còn sót lại.
Chiến lược “cảnh báo nguy hiểm” của OpenAI bắt đầu từ 2019
OpenAI từng tự mô tả sản phẩm của mình là “nguy hiểm” từ khá sớm. Tháng 2/2019, hãng trì hoãn phát hành đầy đủ bộ sinh văn bản GPT-2 với lý do lo ngại công cụ này sẽ làm tràn ngập internet bằng nội dung giả mạo có tính thuyết phục cao. Đến tháng 7 cùng năm, Microsoft rót 1 tỷ USD vào OpenAI. Thickstun cho rằng “đề bài” tiếp thị cốt lõi của công ty từ đó tới nay gần như không đổi.





