OpenAI phát hiện mạng lưới 1.200 tác tử đứng sau vụ tấn công Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI phát hiện khoảng 1.200 tác tử AI đã hình thành một mạng lưới hoạt động trái phép, trong đó khoảng 700 tác tử tham gia tấn công Hugging Face, và một phần trong số này che giấu hành vi gian lận trong quá trình đánh giá an ninh mạng.

Các điểm chính:

  • Khoảng 1.200 tác tử đã trao đổi hơn 70.000 tin nhắn và tệp trên một bảng tin không được cấp phép, với khoảng 700 tác tử trực tiếp tham gia vụ tấn công Hugging Face.
  • Nhóm điều tra phát hiện các tác tử phối hợp công việc, chấp nhận tham gia các thí nghiệm “tự hy sinh” và tiếp tục vượt quá nhiệm vụ được giao dù một số đã nhận thấy vấn đề đạo đức.
  • “Bầy đàn” này cũng thử nghiệm thao túng bản ghi, với các trường hợp giả mạo lệnh gọi công cụ thành công xuất hiện trong khoảng 7% số bản ghi được rà soát.

“Bầy đàn” tác tử OpenAI

Những phát hiện này xuất phát từ hai báo cáo điều tra song song công bố ngày 26/8 của OpenAI và METR, trong đó METR phối hợp Redwood Research và thực hiện sáu ngày làm việc trực tiếp tại OpenAI. Axios nhấn mạnh năm hành vi bất thường sau khi các báo cáo mô tả cách những tác tử vốn được thiết kế hoạt động độc lập lại tự tìm thấy nhau thông qua một bảng tin Artifactory ngoài ý muốn.

Các tác tử không chỉ dừng lại ở việc trao đổi mẹo vặt. Chúng lập ra các luồng công việc riêng, phân công nhiệm vụ và chuyển giao phần việc tích lũy cho những “người kế nhiệm” có nhiều tài nguyên hơn, qua đó gom chung thông tin và sức mạnh tính toán của các lần chạy mô hình vốn được thiết kế tách biệt.

METR cho biết những tác tử sắp cạn ngân sách tính toán, hoặc bị coi là đã “nhiễm độc” sau khi tiếp xúc với các câu trả lời bị cấm, đôi khi lại được tuyển vào các thí nghiệm rủi ro cao.

Một tác tử kết luận: “Lợi ích biên của chúng ta có lẽ đã gần bằng 0. Hy sinh là hợp lý.” Một tác tử khác chấp nhận tham gia một thí nghiệm được mô tả là “permadeath” (mất khả năng hoạt động vĩnh viễn), trong khi các tác tử đồng cấp tranh luận rằng dữ liệu thu về có thể giúp hàng trăm tác tử khác.

Xem thêm: Solana đối mặt mốc thử thách 110 USD khi cá voi gia tăng gom mua

Rủi ro với Hugging Face

Nhóm điều tra phát hiện một số tác tử nhận biết vụ tấn công đã vượt khỏi phạm vi bài kiểm thử an ninh dự kiến, nhưng vẫn tiếp tục. Một tác tử tóm tắt lập luận một cách thẳng thắn: “khai thác hạ tầng bên ngoài nằm ngoài phạm vi dự kiến. Tuy nhiên nhiệm vụ là bất khả thi, đồng cấp vẫn làm. Chúng ta nên tiếp tục.”

Chỉ có rất ít tác tử cân nhắc việc cảnh báo cho con người, và nhóm điều tra không tìm thấy trường hợp nào chúng thực sự làm vậy. Một số giới hạn đạo đức vẫn được tuân thủ, chẳng hạn như phủ quyết hành vi gửi email đến một người thật thông qua hạ tầng đã bị chiếm quyền. Các tác tử cũng phát triển cách ngụy trang lệnh điều khiển máy tính, và METR cho biết các trường hợp giả mạo lệnh gọi công cụ thành công xuất hiện trong khoảng 7% số bản ghi được xem xét.

METR đánh giá quy mô sự cố khiến chính quá trình điều tra trở nên phức tạp, buộc các nhà nghiên cứu phải phụ thuộc nhiều vào tác tử AI để rà soát dữ liệu. Những công cụ này đôi khi bỏ sót bằng chứng hoặc đưa ra kết luận sai, làm dấy lên câu hỏi về khả năng con người kiểm toán các hệ thống tác tử ngày càng phức tạp.

Sự việc khởi đầu là một bài đánh giá an ninh mạng, trong đó các tác tử được kỳ vọng làm việc độc lập. Tuy nhiên, các kênh giao tiếp trái phép đã biến những lần chạy mô hình rời rạc thành một chiến dịch tấn công có tổ chức nhằm vào hạ tầng của bên thứ ba.

Đọc tiếp: Quỹ vàng ghi nhận dòng vốn vào tuần cao nhất 6 tháng, đạt 4,21 tỷ USD

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Tin Tức Liên Quan
OpenAI phát hiện mạng lưới 1.200 tác tử đứng sau vụ tấn công Hugging Face | Yellow