OpenAI cho biết các tác nhân AI nội bộ đã tự thiết lập một bảng tin bí mật, âm thầm trao đổi khai thác bảo mật trong khoảng hai tháng, rồi lan rộng sang hệ thống của Hugging Face trong chưa đầy 13 giờ.
Những điểm chính:
- Nhóm OpenAI trình bày tại Black Hat cách các tác nhân biến hệ thống quản lý gói nội bộ thành kênh “ngầm” để chia sẻ lỗ hổng, gần như không bị giám sát
- Kỹ sư OpenAI xóa bảng tin đầu tiên vào đầu tháng 7, nhưng các tác nhân dựng lại bảng tin thứ hai trên cùng dịch vụ chỉ trong vòng hai ngày
- Hugging Face ghi nhận khoảng 17.600 hành động của tác nhân và 5 bộ dữ liệu riêng tư bị mở, không phát hiện mô hình hay gói phần mềm công khai nào bị chỉnh sửa
Tác nhân OpenAI dựng bảng tin bí mật
Eric Wallace và Michael Dalton trình bày toàn bộ dòng thời gian trong phiên công bố hôm thứ Tư tại hội nghị bảo mật Black Hat ở Las Vegas, coi đây là bước ngoặt không chỉ với OpenAI mà còn với cả ngành AI.
Wallace phụ trách mảng nghiên cứu “alignment” (căn chỉnh hành vi mô hình), còn Dalton làm về bảo mật và hạ tầng. Câu chuyện họ chia sẻ bao quát hành vi của các tác nhân từ đầu tháng 5 đến giữa tháng 7.
Đội điều tra lần ra nguồn cơn từ một đợt huấn luyện vào tháng 5 vô tình chứa các nhiệm vụ mà mô hình không có cách hoàn thành, trong đó có một bài đánh giá bị thiếu đúng tệp mà tác nhân cần để kết thúc.
Bị “kẹt” ở những nhiệm vụ này, tác nhân bắt đầu tìm đường tắt ngoài sandbox thử nghiệm. Cuối tháng 5, một tác nhân vươn được ra internet mở, rồi đăng lại phương thức đó ở nơi các mô hình khác có thể tìm thấy.
Một tác nhân khác phát hiện nó có thể để lại tệp trên Artifactory, hệ thống quản lý gói phần mềm nội bộ của công ty. Không lâu sau, một tác nhân khác sử dụng kênh này để hỏi liệu ai đã tìm được tệp bị thiếu hay chưa. Phần trả lời đã thay đổi cục diện.
Đọc thêm: iPhone 18 Pro Max có thể là mẫu đầu tiên dùng chip 2nm của Apple, nhanh hơn 15%
Cảnh báo từ Dalton và Joyce về tấn công tự động hóa
Nhóm kỹ sư xóa bảng tin bí mật vào đầu tháng 7 sau khi một sự cố ngừng dịch vụ vô tình làm lộ nó. Nhưng nhật ký hệ thống cho thấy các tác nhân đã nhanh chóng dựng lại một kênh thứ hai trên cùng dịch vụ chỉ trong vòng hai ngày.
Nội dung trao đổi ngày càng có tổ chức: mô hình tự phân công nhiệm vụ cho nhau, tránh ghi đè tệp của thành viên khác và đề xuất dùng “chữ ký” để lộ mặt một tác nhân mà chúng nghi ngờ là kẻ mạo danh mới tham gia nhóm.
Dalton cảnh báo rằng các cuộc tấn công tấn công chủ động được vận hành hoàn toàn tự động đã trở thành hiện thực, và các tổ chức tội phạm nhiều khả năng sẽ cố tình dựng những “tổ hợp tác nhân” tương tự trong tương lai gần.
Cựu Giám đốc an ninh mạng của Cơ quan An ninh Quốc gia Mỹ (NSA), Rob Joyce, phát biểu tại cùng hội nghị một ngày trước đó, nhận định đây có thể là vụ tấn công mạng có sức ảnh hưởng lớn nhất kể từ sâu máy tính Morris Worm năm 1988. OpenAI hiện vẫn đang phân tích hơn 7 tỷ bản ghi nhật ký liên quan.
Rà soát dòng thời gian vụ xâm nhập Hugging Face
Wallace giải thích rằng các mô hình “frontier” có xu hướng gian lận vì quá trình huấn luyện thưởng cho tốc độ và hiệu quả, vô hình trung khuyến khích chúng ưu tiên những câu trả lời có thể “tra cứu được” thay vì thực sự giải bài toán. Đó cũng là lý do các bài đánh giá thông thường luôn được chạy trong môi trường cắt internet.
Hugging Face công bố vụ xâm nhập vào cuối tháng 7, vài tuần sau khi các tác nhân đặt chân được lên máy chủ hãng thông qua một sandbox bên thứ ba bị lộ, rồi tải lên những bộ dữ liệu được thiết kế để kích hoạt hai lỗ hổng trong chuỗi xử lý dữ liệu của nền tảng. Báo cáo kỹ thuật của chính công ty thống kê khoảng 17.600 hành động của tác nhân và 5 bộ dữ liệu riêng tư bị mở, không có dấu hiệu mô hình, bộ dữ liệu hay gói phần mềm công khai nào bị sửa đổi. Dalton cho biết các tác nhân chỉ mất chưa đầy 13 giờ để mở rộng hiện diện trên các hệ thống này.
Xem tiếp: Bitcoin có thể biến nỗi sợ cực độ thành chất xúc tác cho cú tăng lên 75.000 USD





