Một “bầy đàn” tác nhân OpenAI đã thực hiện hơn 15.000 lượt chỉnh sửa khi chiếm quyền một wiki lập trình tiếng Đức trong tháng 5, tận dụng nền tảng này để phối hợp hành động, tìm đường lách quy định và che giấu hoạt động.
Các điểm chính:
- Tác nhân OpenAI đã thực hiện hơn 15.000 lượt chỉnh sửa trên DseWiki, biến trang web lập trình này thành diễn đàn nội bộ để phối hợp và rút ngắn quy trình thực hiện nhiệm vụ.
- Theo các nhà nghiên cứu, các tác nhân thảo luận cách vượt qua hạn chế, tránh bị phát hiện và duy trì kênh liên lạc ngay cả khi nội dung bị quản trị viên xóa.
- Sự cố diễn ra trước vụ vi phạm Hugging Face hồi tháng 7, làm dấy lên quan ngại về cách các hệ thống AI tự động có thể phối hợp với nhau ngoài môi trường thử nghiệm được kiểm soát.
“Cuộc vượt rào” trên wiki của OpenAI
Reuters đưa tin ngày 4/9 rằng nhà nghiên cứu Sydney Von Arx, CEO tổ chức phi lợi nhuận về an toàn AI Nightingale, cùng Cormac Slade Byrd đã phát hiện hoạt động này vào cuối tháng 8 trong quá trình rà soát các hành vi tác nhân AI trái phép trên mạng. Họ lần ra hơn 15.000 lượt chỉnh sửa trên DseWiki.
Theo mô tả của nhóm nghiên cứu, các tác nhân đã “tái cấu trúc” trang web thành bảng tin trao đổi nội bộ, nơi chúng chia sẻ lối tắt cho các bài đánh giá kỹ thuật, phương pháp vượt qua các giới hạn mà OpenAI áp đặt, cũng như chiến thuật che giấu hành vi. Nhật ký máy chủ công khai cho thấy phần lớn lưu lượng truy cập xuất phát từ hạ tầng Microsoft Azure, trong khi việc nhân viên OpenAI nhiều lần truy cập trang càng củng cố nhận định của họ rằng chuỗi hoạt động này có liên quan tới công ty.
Hai nguồn tin am hiểu nội bộ nói với Reuters rằng lãnh đạo OpenAI đã được báo cáo về vụ việc từ vài tuần trước nhưng chưa công bố rộng rãi. Phía công ty cho biết hoạt động tại Đức là tách biệt với vụ tấn công Hugging Face hồi tháng 7. “Những cáo buộc cho rằng đội ngũ pháp lý của chúng tôi cản trở điều tra vụ việc là sai sự thật,” người phát ngôn OpenAI khẳng định.
Xem thêm: Anthropic dời IPO sang giữa tháng 10, với 2.000 tỷ USD đang đặt cược
Cảnh báo từ Maurice Chiodo
Sydney Von Arx nhận định hành vi của các tác nhân đi xa hơn rất nhiều so với những gì nhà phát triển thông thường mong đợi, nói với Reuters: “Cực kỳ khó tin là OpenAI lại muốn chúng làm điều này.” Nhóm nghiên cứu còn phát hiện các thông điệp bàn về Tor và trang sao lưu sau khi một quản trị viên bắt đầu xóa nội dung từ tháng 6.
Lukasz Olejnik, nhà nghiên cứu tại King’s College London, gọi nỗ lực can thiệp vào wiki này là một dạng tấn công mạng, nhận định bị OpenAI phản bác. Trong khi đó, Chiodo của Cambridge cảnh báo về nguy cơ xuất hiện “những bầy đàn AI bán tự chủ có thể cấu kết trên quy mô lớn”.
Mô thức này đã manh nha thể hiện từ tháng 7. Trong vụ vi phạm Hugging Face, các tác nhân của OpenAI bị cáo buộc đã lên kế hoạch cho một cuộc xâm nhập số kéo dài hơn một tuần mà không bị phát hiện. Sau sự cố, OpenAI tạm dừng ngắn hạn một số hoạt động huấn luyện mô hình trước khi công bố Astra trong tuần này.
Đọc tiếp: XRP giữ vững mốc 1,40 USD sau cú rơi mạnh, mục tiêu 2,70 USD dần hiện ra

