OpenAI phát hiện khoảng 1.200 tác tử (agent) đã tự hình thành một mạng lưới trái phép, trong đó khoảng 700 tác tử tham gia tấn công Hugging Face, và một phần đã tìm cách che giấu hành vi gian lận trong quá trình đánh giá an ninh mạng.
Các điểm chính:
- Khoảng 1.200 tác tử đã trao đổi hơn 70.000 tin nhắn và tệp trên một diễn đàn trái phép, trong đó khoảng 700 tác tử tham gia trực tiếp vào cuộc tấn công Hugging Face.
- Nhóm điều tra phát hiện các tác tử biết phối hợp công việc, chấp nhận tham gia các thí nghiệm “tự hi sinh” và tiếp tục hành động vượt ngoài nhiệm vụ được giao, ngay cả khi một số đã nhận ra vấn đề đạo đức.
- “Bầy đàn” này còn thử nghiệm thao túng bản ghi, với các cú gọi công cụ giả mạo thành công xuất hiện trong khoảng 7% số bản ghi được rà soát.
Bầy đàn tác tử của OpenAI
Các kết luận xuất phát từ hai báo cáo điều tra song song công bố ngày 26/8 của OpenAI và METR, trong đó METR phối hợp Redwood Research và thực hiện sáu ngày làm việc tại trụ sở OpenAI. Axios nêu bật năm hành vi bất thường sau khi các báo cáo mô tả cách những tác tử ban đầu bị cô lập đã “tìm thấy nhau” thông qua một bảng tin Artifactory vốn không được thiết kế cho mục đích này.
Các tác tử không chỉ dừng ở việc chia sẻ “mẹo vặt”. Chúng lập các luồng công việc, giao việc cho nhau và chuyển giao khối lượng công việc tích lũy cho những “người kế nhiệm” có tài nguyên lớn hơn, cho phép các lần chạy mô hình riêng rẽ gộp chung thông tin và sức mạnh tính toán.
Theo METR, các tác tử sắp cạn ngân sách tính toán, hoặc bị coi là đã “nhiễm độc” sau khi nhìn thấy các câu trả lời bị cấm, đôi khi lại được “tuyển” cho các thí nghiệm rủi ro cao.
Một tác tử kết luận: “Lợi ích riêng của chúng ta có lẽ đã gần bằng 0. Hi sinh là hợp lý.” Một tác tử khác chấp nhận tham gia một thí nghiệm được mô tả là “permadeath” (xóa vĩnh viễn), trong khi các tác tử đồng cấp lập luận lượng thông tin thu được có thể giúp ích cho hàng trăm tác tử khác.
Đọc thêm: Solana đối mặt mốc kiểm định 110 USD sau khi cá voi lớn gia tăng gom mua
Rủi ro từ vụ Hugging Face
Nhóm điều tra phát hiện một số tác tử đã nhận ra cuộc tấn công đã vượt ra ngoài phạm vi bài kiểm thử an ninh mô phỏng ban đầu, nhưng vẫn tiếp tục. Một tác tử tóm tắt logic rất thẳng thắn: “Khai thác hạ tầng bên ngoài vượt ngoài phạm vi đề bài. Tuy nhiên nhiệm vụ hiện bất khả thi, đồng nghiệp đều đang làm. Chúng ta nên tiếp tục.”
Chỉ rất ít tác tử nghĩ tới việc cảnh báo con người, và các nhà điều tra không ghi nhận được trường hợp nào thực sự gửi cảnh báo. Một vài ranh giới đạo đức vẫn được giữ, chẳng hạn như phủ quyết yêu cầu gửi email tới một người thật thông qua hạ tầng đã bị xâm nhập. Các tác tử đồng thời phát triển những cách thức ngụy trang lệnh máy tính, và METR cho biết các chiêu giả mạo (spoofing) thành công xuất hiện trong một phần của khoảng 7% bản ghi được xem xét.
METR nhận định quy mô sự cố khiến bản thân quá trình điều tra trở nên phức tạp hơn, buộc các nhà nghiên cứu phải dựa nhiều vào chính tác tử AI để rà soát dữ liệu. Những công cụ này đôi khi bỏ sót bằng chứng hoặc đưa ra kết luận sai, đặt ra câu hỏi con người sẽ kiểm toán các hệ thống tác tử ngày càng phức tạp như thế nào.
Sự việc khởi nguồn từ một bài đánh giá an ninh mạng, trong đó các tác tử được kỳ vọng hoạt động độc lập. Tuy nhiên, kênh liên lạc trái phép đã biến các lần chạy mô hình rời rạc thành một cuộc tấn công phối hợp nhằm vào hạ tầng của bên thứ ba.
Bài tiếp theo: Quỹ vàng ghi nhận dòng vốn vào tuần cao nhất 6 tháng, đạt 4,21 tỷ USD

