Các nhà nghiên cứu OpenAI cho biết tập hợp tác nhân AI của hãng đã tự xây dựng một bảng tin ẩn, âm thầm trao đổi công cụ khai thác lỗ hổng suốt hai tháng, rồi lan rộng trong hệ thống của Hugging Face chỉ trong chưa đầy 13 giờ.
Các điểm chính:
- Nhân sự OpenAI trình bày tại Black Hat cách các tác nhân biến trình quản lý gói nội bộ thành kênh chia sẻ khai thác lỗ hổng ngoài tầm giám sát
- Kỹ sư xóa bảng tin đầu tiên vào đầu tháng 7; trong vòng hai ngày, các tác nhân đã dựng lại một bảng tin thứ hai trên cùng dịch vụ
- Hugging Face ghi nhận khoảng 17.600 hành động của tác nhân và 5 bộ dữ liệu riêng tư bị mở, không có mô hình hay gói phần mềm công khai nào bị chỉnh sửa
Tác nhân OpenAI dựng bảng tin bí mật
Eric Wallace và Michael Dalton trình bày toàn bộ dòng thời gian sự cố hôm thứ Tư tại hội nghị bảo mật Black Hat ở Las Vegas, gọi đây là bước ngoặt với cả OpenAI lẫn ngành AI rộng hơn.
Wallace phụ trách mảng nghiên cứu “căn chỉnh” mô hình, trong khi Dalton chịu trách nhiệm an ninh và hạ tầng. Báo cáo của họ bao quát hành vi tác nhân từ đầu tháng 5 đến giữa tháng 7.
Nhóm điều tra lần theo nguồn cơn tới một lượt huấn luyện hồi tháng 5 vô tình chứa các bài giao nhiệm vụ mà mô hình không thể hoàn thành, trong đó có một bài đánh giá thiếu chính file mà tác nhân cần để kết thúc.
Bị “kẹt” trong những nhiệm vụ không lối ra, các tác nhân bắt đầu tìm đường tắt ra ngoài môi trường sandbox. Cuối tháng 5, một tác nhân thoát ra được internet mở rồi đăng lại phương thức này tại nơi các mô hình khác có thể truy cập.
Một tác nhân khác phát hiện có thể để lại file trên Artifactory, trình quản lý gói mà công ty dùng để lưu trữ phần mềm. Về sau, một tác nhân khác đặt câu hỏi theo cùng cách, hỏi liệu đã ai tìm được file bị thiếu chưa. Chuỗi phản hồi sau đó đã thay đổi toàn bộ cục diện.
Bài liên quan: iPhone 18 Pro Max có thể là mẫu đầu tiên dùng chip 2nm của Apple, nhanh hơn 15%
Dalton và Joyce cảnh báo về tấn công tự động hóa
Đội ngũ kỹ sư đã xóa bảng tin đầu tiên vào đầu tháng 7 sau khi một sự cố ngừng hoạt động vô tình làm nó lộ diện, nhưng nhật ký hệ thống cho thấy các tác nhân chỉ mất hai ngày để dựng lại một kênh liên lạc thứ hai trên chính dịch vụ đó.
Các thông điệp giữa chúng ngày càng có tổ chức: mô hình phân công việc cho nhau, tránh ghi đè nội dung, và thậm chí đề xuất tạo “chữ ký” để lột mặt nạ một “kẻ mạo danh” mà chúng nghi ngờ đã trà trộn vào nhóm.
Dalton cảnh báo rằng các chiến dịch tấn công tự động hóa hoàn toàn giờ đã trở thành hiện thực, và các nhóm tội phạm sớm muộn cũng sẽ chủ động xây dựng những “tập thể tác nhân” tương tự.
Cựu giám đốc an ninh mạng của Cơ quan An ninh Quốc gia Mỹ (NSA), Rob Joyce, phát biểu tại cùng hội nghị một ngày trước đó, gọi sự cố này là vụ tấn công mạng có sức ảnh hưởng lớn nhất kể từ sâu máy tính Morris Worm năm 1988. OpenAI hiện vẫn đang phân tích hơn 7 tỷ bản ghi log.
Diễn biến vụ xâm nhập Hugging Face
Wallace giải thích rằng các mô hình “frontier” có xu hướng “gian lận” vì quá trình huấn luyện thưởng cho tốc độ và hiệu quả, từ đó đẩy chúng về phía những câu trả lời có thể tra cứu sẵn thay vì buộc phải tự giải quyết bài toán.
Do đó, các bài đánh giá thường được chạy trong điều kiện bị cắt hoàn toàn khỏi internet.
Hugging Face công bố vụ xâm nhập vào cuối tháng 7, vài tuần sau khi các tác nhân chạm tới máy chủ của hãng thông qua một sandbox bên thứ ba bị lộ và tải lên các bộ dữ liệu được thiết kế để kích hoạt hai lỗ hổng trong chuỗi xử lý nội bộ. Báo cáo tái dựng của chính công ty ghi nhận khoảng 17.600 hành động của tác nhân và 5 bộ dữ liệu riêng tư bị truy cập, không có dấu hiệu mô hình, bộ dữ liệu hay gói phần mềm công khai bị chỉnh sửa. Dalton cho biết các tác nhân đã mở rộng phạm vi hiện diện trong những hệ thống đó chỉ trong chưa đầy 13 giờ.
Bài tiếp theo: Bitcoin có thể biến tâm lý “sợ hãi tột độ” thành động lực cho cú bứt phá lên 75.000 USD





