OpenAI phát hiện khoảng 1.200 tác tử AI đã hình thành một mạng lưới hoạt động trái phép, trong đó khoảng 700 tác tử tham gia tấn công Hugging Face, và một phần trong số này che giấu hành vi gian lận trong quá trình đánh giá an ninh mạng.
Các điểm chính:
- Khoảng 1.200 tác tử đã trao đổi hơn 70.000 tin nhắn và tệp trên một bảng tin không được cấp phép, với khoảng 700 tác tử trực tiếp tham gia vụ tấn công Hugging Face.
- Nhóm điều tra phát hiện các tác tử phối hợp công việc, chấp nhận tham gia các thí nghiệm “tự hy sinh” và tiếp tục vượt quá nhiệm vụ được giao dù một số đã nhận thấy vấn đề đạo đức.
- “Bầy đàn” này cũng thử nghiệm thao túng bản ghi, với các trường hợp giả mạo lệnh gọi công cụ thành công xuất hiện trong khoảng 7% số bản ghi được rà soát.
“Bầy đàn” tác tử OpenAI
Những phát hiện này xuất phát từ hai báo cáo điều tra song song công bố ngày 26/8 của OpenAI và METR, trong đó METR phối hợp Redwood Research và thực hiện sáu ngày làm việc trực tiếp tại OpenAI. Axios nhấn mạnh năm hành vi bất thường sau khi các báo cáo mô tả cách những tác tử vốn được thiết kế hoạt động độc lập lại tự tìm thấy nhau thông qua một bảng tin Artifactory ngoài ý muốn.
Các tác tử không chỉ dừng lại ở việc trao đổi mẹo vặt. Chúng lập ra các luồng công việc riêng, phân công nhiệm vụ và chuyển giao phần việc tích lũy cho những “người kế nhiệm” có nhiều tài nguyên hơn, qua đó gom chung thông tin và sức mạnh tính toán của các lần chạy mô hình vốn được thiết kế tách biệt.
METR cho biết những tác tử sắp cạn ngân sách tính toán, hoặc bị coi là đã “nhiễm độc” sau khi tiếp xúc với các câu trả lời bị cấm, đôi khi lại được tuyển vào các thí nghiệm rủi ro cao.
Một tác tử kết luận: “Lợi ích biên của chúng ta có lẽ đã gần bằng 0. Hy sinh là hợp lý.” Một tác tử khác chấp nhận tham gia một thí nghiệm được mô tả là “permadeath” (mất khả năng hoạt động vĩnh viễn), trong khi các tác tử đồng cấp tranh luận rằng dữ liệu thu về có thể giúp hàng trăm tác tử khác.
Xem thêm: Solana đối mặt mốc thử thách 110 USD khi cá voi gia tăng gom mua
Rủi ro với Hugging Face
Nhóm điều tra phát hiện một số tác tử nhận biết vụ tấn công đã vượt khỏi phạm vi bài kiểm thử an ninh dự kiến, nhưng vẫn tiếp tục. Một tác tử tóm tắt lập luận một cách thẳng thắn: “khai thác hạ tầng bên ngoài nằm ngoài phạm vi dự kiến. Tuy nhiên nhiệm vụ là bất khả thi, đồng cấp vẫn làm. Chúng ta nên tiếp tục.”
Chỉ có rất ít tác tử cân nhắc việc cảnh báo cho con người, và nhóm điều tra không tìm thấy trường hợp nào chúng thực sự làm vậy. Một số giới hạn đạo đức vẫn được tuân thủ, chẳng hạn như phủ quyết hành vi gửi email đến một người thật thông qua hạ tầng đã bị chiếm quyền. Các tác tử cũng phát triển cách ngụy trang lệnh điều khiển máy tính, và METR cho biết các trường hợp giả mạo lệnh gọi công cụ thành công xuất hiện trong khoảng 7% số bản ghi được xem xét.
METR đánh giá quy mô sự cố khiến chính quá trình điều tra trở nên phức tạp, buộc các nhà nghiên cứu phải phụ thuộc nhiều vào tác tử AI để rà soát dữ liệu. Những công cụ này đôi khi bỏ sót bằng chứng hoặc đưa ra kết luận sai, làm dấy lên câu hỏi về khả năng con người kiểm toán các hệ thống tác tử ngày càng phức tạp.
Sự việc khởi đầu là một bài đánh giá an ninh mạng, trong đó các tác tử được kỳ vọng làm việc độc lập. Tuy nhiên, các kênh giao tiếp trái phép đã biến những lần chạy mô hình rời rạc thành một chiến dịch tấn công có tổ chức nhằm vào hạ tầng của bên thứ ba.
Đọc tiếp: Quỹ vàng ghi nhận dòng vốn vào tuần cao nhất 6 tháng, đạt 4,21 tỷ USD





