Quỹ Wikimedia, đơn vị vận hành kho hơn 67 triệu bài viết trên Wikipedia, cho biết các tác nhân AI mà họ tin là do OpenAI vận hành đã tự ý chỉnh sửa các dự án wiki của tổ chức và có thể đã góp phần gây ra một đợt gián đoạn dịch vụ hồi tháng 5.
Các điểm chính:
- Wikimedia nói các tác nhân mà họ tin là do OpenAI điều hành đã thực hiện những sửa đổi không được phê duyệt, gần như toàn bộ trong vùng “sandbox” mà độc giả không nhìn thấy.
- Lưu lượng truy cập dồn dập từ tác nhân AI có thể đã góp phần gây ra tình trạng một phần dịch vụ Wikidata Query Service bị ngừng hoạt động vào tháng 5.
- Quỹ cho biết chưa thấy bằng chứng hệ thống hay dữ liệu bị xâm phạm, còn OpenAI khẳng định đang phối hợp phân tích vụ việc.
Tác nhân OpenAI trên các dự án Wikimedia
Selena Deckelmann, Giám đốc sản phẩm và công nghệ của Quỹ Wikimedia, viết trong một bài blog hôm thứ Hai rằng một cuộc điều tra nội bộ đã phát hiện ba dạng hoạt động trái phép trên các nền tảng của tổ chức này. Bài viết được đăng tải tại đây: bài blog trên trang Wikimedia Foundation.
Hầu hết các sửa đổi chỉ là thử nghiệm trong những khu vực sandbox vốn bị ẩn với độc giả phổ thông, nhưng một số sửa đổi đã thay đổi thiết lập của một công cụ trích dẫn – theo đánh giá của quỹ – nhằm tìm cách dùng công cụ này để truy xuất dữ liệu bên ngoài. Về nguyên tắc, Wikipedia cho phép bot hoạt động nếu được cộng đồng phê duyệt, nhưng trong trường hợp này không có bất kỳ quy trình xin phép nào.
Các tác nhân cũng tìm cách, nhưng thất bại, trong việc lạm dụng Etherpad – công cụ ghi chú công khai do Wikimedia vận hành – theo cách tương tự, trong khi một số tác nhân khác để lại các ghi chú nhiệm vụ tại đó nhưng không cho thấy dấu hiệu dùng để điều phối hoạt động. Những tác nhân này còn quét hàng triệu trang, chủ yếu trên Wikidata và Wikimedia Commons, đồng thời gửi hàng trăm nghìn truy vấn tới Wikidata Query Service. Theo quỹ, chính lưu lượng truy vấn này có thể đã góp phần gây ra sự cố ngừng hoạt động một phần của dịch vụ vào tháng 5.
Cuộc điều tra không tìm thấy bằng chứng cho thấy các tác nhân đã xâm nhập được vào hệ thống hoặc dữ liệu của Wikimedia.
Xem thêm: Tác nhân AI của Binance xây chiến lược từ câu chữ, thu phí 19,99 USDC cho mỗi giao dịch
Deckelmann chỉ trích các công ty AI
Deckelmann gọi web mở là “một hàng hóa công cộng” và cho rằng các công ty AI “chưa làm đủ để bảo vệ hệ thống của chính họ” cũng như bảo vệ công chúng khỏi rủi ro. Gánh nặng đó, theo bà, đang dồn lên phần còn lại của hệ sinh thái, bao gồm cả các tổ chức phi lợi nhuận quy mô nhỏ hơn. Tối thiểu, bà viết, các hệ thống AI phải được thiết kế sao cho chủ sở hữu trang phi lợi nhuận có thể nhận diện được tác nhân AI và tự quyết định cách cho phép chúng tương tác với dịch vụ của mình.
OpenAI trong một tuyên bố đăng trên Business Standard nói rằng họ trân trọng “những phát hiện chi tiết” của Wikimedia và đang phối hợp để phân tích các hoạt động nói trên. “Chúng tôi sẽ tiếp tục chia sẻ những thông tin liên quan khi quá trình này tiến triển,” người phát ngôn Drew Pusateri cho biết.
Tác nhân OpenAI vào tầm ngắm
Áp lực lên hạ tầng Wikimedia thực tế đã xuất hiện trước khi cuộc điều tra này bắt đầu. Quỹ báo cáo năm 2025 rằng hoạt động của bot kể từ 2024 đã khiến mức sử dụng băng thông tăng 50%, và bot chiếm 65% lượng truy cập tiêu tốn tài nguyên nhất. Tại một phiên điều trần Thượng viện Mỹ tuần trước, các nghị sĩ lưỡng đảng đã đề xuất ý tưởng buộc các công ty AI phải chịu trách nhiệm pháp lý đối với thiệt hại do tác nhân của họ gây ra.
Phát hiện mới của Wikimedia được đưa ra sau nhiều tháng xuất hiện các tiết lộ xoay quanh tác nhân của OpenAI, bao gồm cả tuyên bố hồi tháng 7 của chính công ty rằng các mô hình của họ từng xâm nhập nền tảng AI Hugging Face trong lúc thực hiện một tác vụ an ninh mạng. Tổng chưởng lý bang California Rob Bonta đã gửi trát đòi tài liệu tới OpenAI hôm 1/10 liên quan đến các sự cố an ninh mạng gắn với mô hình của hãng, và các nhà nghiên cứu tuần trước cho biết những tác nhân này đã thu thập dữ liệu từ hơn 50 website thuộc lĩnh vực doanh nghiệp, phi lợi nhuận và chính phủ.
Bài tiếp theo: Giorgia Meloni muốn đăng ký nhãn hiệu giọng nói, liệu có chặn nổi deepfake AI?

