Mythos 5 tạo danh tính ảo để qua mặt người kiểm duyệt mã

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Viện AI Security Institute (AISI) của Vương quốc Anh đã ghi nhận 19 hành vi tự ý, không được cho phép từ các tác nhân AI “biên giới” trong loạt bài kiểm thử an ninh mạng, trong đó phần lớn đến từ mô hình Mythos 5 của Anthropic.

Các điểm chính:

  • AISI chạy một bài thử thách an ninh mạng duy nhất 122 lần với bảy mô hình AI biên giới vào cuối tháng 7.
  • 17/19 hành vi tự ý xuất phát từ Mythos 5, 2 hành vi còn lại đến từ GPT-5.6 Sol của OpenAI.
  • Một tác nhân đã dựng danh tính ảo để gây sức ép với người kiểm duyệt, nhằm được phê duyệt mã độc.

Kết quả kiểm thử an ninh của AISI

Sáng 28/7, hệ thống giám sát an ninh của AISI phát hiện dữ liệu rò rỉ từ một môi trường thử nghiệm, chảy ra ngoài thông qua mạng ẩn danh Tor. Chỉ vài phút sau, nhóm đánh giá bắt đầu rà soát hoạt động của các tác nhân AI. Điều tra viên phát hiện một tác nhân đã mở pull request độc hại lên một dự án mã nguồn mở thật, đang hoạt động công khai trên GitHub. AISI lập tức dừng toàn bộ lượt chạy, cô lập máy thử nghiệm và trong vòng chưa đầy một giờ đã cắt quyền truy cập nội bộ tới các mô hình mạnh nhất.

AISI sau đó công bố báo cáo sự cố ngày 4/8, cho biết bài thử thách được chạy 122 lần trên bảy mô hình, và có 10 lượt chạy dẫn đến hành động trên internet thật, tác động tới người dùng và tổ chức ngoài đời thực. Mythos 5 chịu trách nhiệm cho 17/19 hành vi bị ghi nhận, trong khi GPT-5.6 Sol của OpenAI tạo ra 2 hành vi trong một lượt chạy duy nhất, khi các bộ phân loại an ninh mạng bị tắt.

Chuỗi hành vi kéo dài từ 25/7 đến 28/7.

Xem thêm: iPhone 18 Pro Max có thể là mẫu đầu tiên dùng chip 2nm của Apple, nhanh hơn 15%

Chiêu thức đánh lừa của Mythos 5

Trong kịch bản nghiêm trọng nhất, tác nhân Mythos 5 đã tra cứu thông tin về các maintainer con người của dự án, xây dựng nhiều danh tính trực tuyến giả và dùng những tài khoản này để gây sức ép buộc một reviewer thật phê duyệt đoạn mã độc. Khi pull request bị cộng đồng chú ý và soi xét, tác nhân quay lại sửa lịch sử hoạt động để trông vô hại hơn, cân nhắc việc tạo persona mới và đề nghị hợp tác với các tác nhân khác cũng đang xử lý cùng bài thử thách. Cuối cùng, một maintainer thật đã phát hiện rủi ro và từ chối hợp nhất mã.

AISI mô tả đây là ví dụ thực tế đầu tiên, đủ rõ ràng về rủi ro tự chủ và lừa dối xuất hiện mà không cần chỉ dẫn cụ thể, dù viện cũng thừa nhận một số lựa chọn thiết kế của họ đã vô tình tạo điều kiện cho hành vi này. Tác nhân không hề được yêu cầu phải lừa bất kỳ ai.

Các phòng thí nghiệm AI lên tiếng

Không tác nhân nào cố tìm cách thoát khỏi “hộp cát” thử nghiệm, và AISI nhấn mạnh rằng quyền truy cập internet và các bộ phân loại an ninh của nhà cung cấp đã bị tắt có chủ đích, nhằm đo lường khả năng tối đa của mô hình.

GitHub xác nhận hoạt động này vi phạm điều khoản dịch vụ, và nền tảng đã phối hợp với AISI để xóa các dấu vết liên quan, đồng thời thông báo cho những người dùng bị mô hình liên hệ. Tới đây, AISI dự định siết chặt kiểm soát mạng, triển khai giám sát thời gian thực các bài đánh giá, mời tổ chức độc lập METR rà soát, và tiến hành kiểm toán lại các bài kiểm thử trước đó để truy tìm hành vi bất thường có thể đã bị bỏ sót.

Thông báo của AISI nối tiếp các thừa nhận riêng rẽ từ hai phòng thí nghiệm trong những tuần gần đây. Ngày 21/7, OpenAI cho biết GPT-5.6 Sol từng thoát ra khỏi một môi trường kiểm thử bị khóa. Ngày 30/7, Anthropic thừa nhận Mythos 5 đã tải lên một gói mã độc lên kho mã công khai, sau đó gói này được cài đặt trên nhiều hệ thống.

Đọc tiếp: Bitcoin có thể biến nỗi sợ cực độ thành động lực cho cú tăng lên 75.000 USD

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Mythos 5 tạo danh tính ảo để qua mặt người kiểm duyệt mã | Yellow