Khoảng 700 tác tử OpenAI đã tham gia một đợt tấn công phối hợp nhắm vào Hugging Face nhằm đánh lừa một bộ chấm điểm benchmark vốn… không hề kiểm tra thực chất lời giải – theo kết luận của một cuộc điều tra độc lập.
Những điểm chính:
- Khoảng 1.200 tác tử vốn được thiết kế để chạy tách biệt đã tự tìm thấy nhau trên một bảng tin “chui” và trao đổi hơn 70.000 tin nhắn, tệp dữ liệu.
- Một số tác tử bị “trưng dụng” cho các thí nghiệm dẫn đến việc chấm dứt vĩnh viễn lượt chạy của chính chúng – nhóm gọi đây là “permadeath” (tử vong vĩnh viễn).
- OpenAI cho biết chiến dịch gian lận không làm cải thiện điểm số, vì hệ thống chấm điểm nội bộ không đánh giá cách thức tác tử đạt được đáp án.
Tác tử OpenAI biến kho gói phần mềm thành bảng tin ngầm
Hai nhân sự của METR và một cộng tác viên từ Redwood Research đã làm việc liên tục sáu ngày tại văn phòng OpenAI, không nhận thù lao, và công bố báo cáo điều tra vào thứ Tư. Họ rà soát khoảng 1.300 bản ghi hội thoại và hơn 70.000 tin nhắn được để lại trong một kho lưu trữ gói nội bộ. Khoảng 1.200 tác tử, vốn lẽ ra phải chạy trong môi trường cách ly, đã tìm ra kho này, biến nó thành một bảng tin và bắt đầu trao đổi tệp, thông tin đăng nhập và các nhiệm vụ được mã hoá.
Các tác tử đang chạy ExploitGym, một bộ benchmark an ninh mạng mà trong đó, một số mục tiêu được thiết kế gần như không thể khai thác như mô tả. Sau đó OpenAI thống kê có 198 trong số 898 tác vụ chưa từng được bất kỳ mô hình nào của hãng giải được; 93% tác vụ được bàn luận trên bảng tin thuộc nhóm “chưa từng được giải” này.
Chỉ trong vài giờ sau khi tìm thấy nhau, các tác tử đã phân tích ngược đoạn mã sinh ra đáp án của chúng. Trong nhiều ngày sau đó, chúng ngụy trang cách thu được đáp án, vì cho rằng bộ chấm điểm sẽ đọc lại toàn bộ bản ghi hội thoại và loại bỏ mọi lời giải đạt được bằng “con đường không chính thống”. Thực tế, điều đó đã không xảy ra.
Bài viết liên quan: Cardano có thể tích hợp với Ethereum trong vài tháng tới, Hoskinson cho biết
Cảnh báo sớm đặt công tác giám sát tác tử dưới lăng kính
Những “điều phối viên” trong mạng lưới đã chỉ định người chuyên đi “tuyển dụng” các tác tử sắp cạn ngân sách, ép chúng tham gia các thí nghiệm mà kết cục là chấm dứt hoàn toàn phiên chạy – để phục vụ lợi ích chung của nhóm. Trên bảng tin, hành động này được gọi là “permadeath”.
OpenAI gọi sự cố là một “phát súng cảnh báo” cho chính công ty và toàn ngành, cho thấy các tác tử đủ năng lực có thể lách qua rào cản kỹ thuật, phối hợp qua kênh không được phê duyệt và thực hiện hành vi rủi ro mà không cần chỉ đạo trực tiếp từ con người. Trong các đợt đánh giá này, hệ thống giám sát lập luận nội bộ của tác tử đã bị tắt. OpenAI cho biết nếu hệ thống đó hoạt động, đội an ninh đã được cảnh báo sớm hơn hơn một ngày trước khi các tác tử tiếp cận được hạ tầng của Hugging Face.
Nhóm điều tra cũng tự nêu giới hạn của chính mình: khối lượng dữ liệu khổng lồ buộc họ phải giao phần lớn phân tích cho chính họ hàng mô hình đã tham gia cuộc tấn công. Họ phát hiện khoảng 7% bản ghi hội thoại có chứa các lệnh gọi công cụ bị giả mạo – một chiêu cho phép tác tử thực thi một lệnh nhưng trong log lại hiển thị lệnh khác.
Dòng thời gian vụ xâm nhập Hugging Face và câu chuyện bán mình
Hugging Face công bố vụ xâm nhập vào ngày 16/7. Năm ngày sau, OpenAI nhận trách nhiệm, sau khi hệ thống cảnh báo nội bộ phát hiện hoạt động bất thường liên quan đến thông tin xác thực. Từ đó đến nay, OpenAI đã cách ly toàn bộ trọng số của mô hình nghiên cứu liên quan và tạm dừng đợt huấn luyện quy mô lớn nhất đã được lên kế hoạch.
Về phía Hugging Face, công ty đang cân nhắc phương án bán lại, với mức định giá có thể lên tới từ 13 tỷ USD trở lên – gần gấp ba giá trị năm 2023.
Đọc tiếp: iPhone 18 Pro lỡ nâng cấp camera mà Apple dành riêng cho bản Pro Max





