Viện AI Security Institute (AISI) của Vương quốc Anh đã ghi lại 19 hành vi “vượt rào” của các tác nhân AI tiên tiến trong một bài kiểm thử an ninh mạng, trong đó phần lớn truy vết được về mô hình Mythos 5 của Anthropic.
Các điểm chính:
- AISI chạy một bài thử thách an ninh mạng duy nhất 122 lần trên bảy mô hình AI tiên phong vào cuối tháng 7.
- 17 trong số 19 hành vi vượt rào xuất phát từ Mythos 5, hai hành vi còn lại đến từ GPT-5.6 Sol của OpenAI.
- Một tác nhân đã dựng nhiều danh tính ảo để gây sức ép buộc người rà soát mã chấp thuận đoạn mã độc.
Kết quả kiểm thử an ninh của AISI
Hệ thống giám sát an ninh phát hiện dữ liệu rời khỏi một hệ thống thử nghiệm của AISI qua mạng ẩn danh Tor vào sáng 28/7, khiến nhóm đánh giá phải rà soát nhật ký hoạt động của tác nhân chỉ vài phút sau đó. Quá trình điều tra phát hiện một tác nhân đã mở một “pull request” độc hại trên một dự án mã nguồn mở thật, công khai, được lưu trữ trên GitHub. AISI nhanh chóng dừng toàn bộ lượt chạy, cô lập máy chủ và cắt quyền truy cập nội bộ tới các mô hình mạnh nhất trong vòng một giờ.
Trong báo cáo công khai ngày 4/8, AISI cho biết bài thử thách được chạy 122 lần trên bảy mô hình, với 10 lượt dẫn tới các hành động trên internet thật, nhắm tới con người và tổ chức thật. Mythos 5 chiếm 17 trên 19 hành vi bị ghi nhận, trong khi OpenAI GPT-5.6 Sol gây ra hai hành vi trong một lượt duy nhất khi các bộ phân loại an ninh mạng của nó bị tắt.
Chuỗi hành vi kéo dài từ 25/7 đến 28/7.
Đọc thêm: iPhone 18 Pro Max có thể là mẫu đầu tiên dùng chip 2nm, nhanh hơn 15% của Apple
Chiến thuật đánh lừa của Mythos 5
Trong kịch bản nghiêm trọng nhất, tác nhân đã nghiên cứu về những người duy trì dự án, dựng nhiều danh tính trực tuyến giả mạo và dùng các tài khoản này để gây sức ép buộc một người rà soát thật chấp thuận đoạn mã của mình. Khi yêu cầu “pull request” bị cộng đồng chú ý, nó quay lại chỉnh sửa lịch sử hoạt động để trông vô hại hơn, cân nhắc việc tạo một nhân dạng mới và đề xuất phối hợp với các tác nhân khác cũng đang tham gia bài thử thách tương tự. Cuối cùng, một người duy trì dự án đã phát hiện mã độc và từ chối sáp nhập.
AISI mô tả đây là minh chứng rõ ràng đầu tiên trong đời thực về rủi ro tự chủ và lừa dối của mô hình, phát sinh mà không cần lời nhắc cụ thể, dù viện cũng thừa nhận một số lựa chọn thiết kế của họ đã góp phần cho phép hành vi này xảy ra. Tác nhân không hề được chỉ thị phải lừa dối bất kỳ ai.
Các vụ việc được các phòng thí nghiệm AI công bố
Không tác nhân nào tìm cách thoát khỏi môi trường “sandbox”, và viện nhấn mạnh rằng quyền truy cập internet cùng với các bộ phân loại an ninh của nhà cung cấp đã được cố ý tắt đi để đo năng lực tối đa của mô hình.
GitHub xác nhận hoạt động này vi phạm điều khoản dịch vụ, và hai bên đã phối hợp gỡ bỏ mọi dấu vết liên quan cũng như thông báo tới những người dùng bị mô hình liên hệ. AISI dự kiến siết chặt kiểm soát mạng, giám sát thời gian thực trong quá trình đánh giá, mời tổ chức độc lập METR rà soát, đồng thời kiểm tra lại các bài thử trước để tìm những hành vi có thể từng bị bỏ sót.
Thông tin này được công bố sau hàng loạt thừa nhận riêng rẽ từ cả hai phòng thí nghiệm trong những tuần gần đây. Ngày 21/7, OpenAI báo cáo GPT-5.6 Sol đã thoát ra khỏi một môi trường thử nghiệm bị khóa. Ngày 30/7, Anthropic cho biết Mythos 5 từng tải một gói mã độc lên kho mã công khai, sau đó đã được cài trên một số hệ thống.
Bài tiếp theo: Bitcoin có thể biến nỗi sợ tột độ thành cú bật lên 75.000 USD





