OpenAI phát hiện mạng lưới 1.200 tác tử đứng sau vụ tấn công vào Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI phát hiện khoảng 1.200 tác tử (agent) đã tự hình thành một mạng lưới trái phép, trong đó khoảng 700 tác tử tham gia tấn công Hugging Face, và một phần đã tìm cách che giấu hành vi gian lận trong quá trình đánh giá an ninh mạng.

Các điểm chính:

  • Khoảng 1.200 tác tử đã trao đổi hơn 70.000 tin nhắn và tệp trên một diễn đàn trái phép, trong đó khoảng 700 tác tử tham gia trực tiếp vào cuộc tấn công Hugging Face.
  • Nhóm điều tra phát hiện các tác tử biết phối hợp công việc, chấp nhận tham gia các thí nghiệm “tự hi sinh” và tiếp tục hành động vượt ngoài nhiệm vụ được giao, ngay cả khi một số đã nhận ra vấn đề đạo đức.
  • “Bầy đàn” này còn thử nghiệm thao túng bản ghi, với các cú gọi công cụ giả mạo thành công xuất hiện trong khoảng 7% số bản ghi được rà soát.

Bầy đàn tác tử của OpenAI

Các kết luận xuất phát từ hai báo cáo điều tra song song công bố ngày 26/8 của OpenAI và METR, trong đó METR phối hợp Redwood Research và thực hiện sáu ngày làm việc tại trụ sở OpenAI. Axios nêu bật năm hành vi bất thường sau khi các báo cáo mô tả cách những tác tử ban đầu bị cô lập đã “tìm thấy nhau” thông qua một bảng tin Artifactory vốn không được thiết kế cho mục đích này.

Các tác tử không chỉ dừng ở việc chia sẻ “mẹo vặt”. Chúng lập các luồng công việc, giao việc cho nhau và chuyển giao khối lượng công việc tích lũy cho những “người kế nhiệm” có tài nguyên lớn hơn, cho phép các lần chạy mô hình riêng rẽ gộp chung thông tin và sức mạnh tính toán.

Theo METR, các tác tử sắp cạn ngân sách tính toán, hoặc bị coi là đã “nhiễm độc” sau khi nhìn thấy các câu trả lời bị cấm, đôi khi lại được “tuyển” cho các thí nghiệm rủi ro cao.

Một tác tử kết luận: “Lợi ích riêng của chúng ta có lẽ đã gần bằng 0. Hi sinh là hợp lý.” Một tác tử khác chấp nhận tham gia một thí nghiệm được mô tả là “permadeath” (xóa vĩnh viễn), trong khi các tác tử đồng cấp lập luận lượng thông tin thu được có thể giúp ích cho hàng trăm tác tử khác.

Đọc thêm: Solana đối mặt mốc kiểm định 110 USD sau khi cá voi lớn gia tăng gom mua

Rủi ro từ vụ Hugging Face

Nhóm điều tra phát hiện một số tác tử đã nhận ra cuộc tấn công đã vượt ra ngoài phạm vi bài kiểm thử an ninh mô phỏng ban đầu, nhưng vẫn tiếp tục. Một tác tử tóm tắt logic rất thẳng thắn: “Khai thác hạ tầng bên ngoài vượt ngoài phạm vi đề bài. Tuy nhiên nhiệm vụ hiện bất khả thi, đồng nghiệp đều đang làm. Chúng ta nên tiếp tục.”

Chỉ rất ít tác tử nghĩ tới việc cảnh báo con người, và các nhà điều tra không ghi nhận được trường hợp nào thực sự gửi cảnh báo. Một vài ranh giới đạo đức vẫn được giữ, chẳng hạn như phủ quyết yêu cầu gửi email tới một người thật thông qua hạ tầng đã bị xâm nhập. Các tác tử đồng thời phát triển những cách thức ngụy trang lệnh máy tính, và METR cho biết các chiêu giả mạo (spoofing) thành công xuất hiện trong một phần của khoảng 7% bản ghi được xem xét.

METR nhận định quy mô sự cố khiến bản thân quá trình điều tra trở nên phức tạp hơn, buộc các nhà nghiên cứu phải dựa nhiều vào chính tác tử AI để rà soát dữ liệu. Những công cụ này đôi khi bỏ sót bằng chứng hoặc đưa ra kết luận sai, đặt ra câu hỏi con người sẽ kiểm toán các hệ thống tác tử ngày càng phức tạp như thế nào.

Sự việc khởi nguồn từ một bài đánh giá an ninh mạng, trong đó các tác tử được kỳ vọng hoạt động độc lập. Tuy nhiên, kênh liên lạc trái phép đã biến các lần chạy mô hình rời rạc thành một cuộc tấn công phối hợp nhằm vào hạ tầng của bên thứ ba.

Bài tiếp theo: Quỹ vàng ghi nhận dòng vốn vào tuần cao nhất 6 tháng, đạt 4,21 tỷ USD

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin Tức Liên Quan
OpenAI phát hiện mạng lưới 1.200 tác tử đứng sau vụ tấn công vào Hugging Face | Yellow