OpenAI sẽ cài một dạng watermark vô hình vào văn bản do ChatGPT và Codex tạo ra tại Liên minh châu Âu, nhưng ngay trong thử nghiệm nội bộ của hãng, chỉ cần thay khoảng 10% số từ bằng từ đồng nghĩa đã khiến tỷ lệ phát hiện rơi xuống 66% (từ mức khoảng 92% ban đầu).
Điểm chính:
- Watermark sẽ được triển khai tới người dùng ChatGPT và Codex đủ điều kiện ở EU trên mọi gói dịch vụ trong vài tuần tới; với khách hàng API, tính năng này vẫn ở chế độ tự chọn (opt‑in).
- Thay 25% số từ bằng từ đồng nghĩa khiến tỷ lệ phát hiện rơi xuống chỉ còn 17% trong đánh giá nội bộ của công ty.
- Quyền truy cập công cụ phát hiện ban đầu chỉ mở cho các nhà nghiên cứu được phê duyệt và một số tổ chức chuyên môn.
Lộ trình triển khai watermark của OpenAI
Công ty đã thông báo kế hoạch này hôm thứ Hai trong một bài blog, cho biết watermark sẽ được đưa tới người dùng ChatGPT và Codex đủ điều kiện trên mọi gói ở EU trong vài tuần tới. Tính năng này chưa được bật mặc định trên phạm vi toàn cầu khi ra mắt.
Các nhà phát triển dùng API của OpenAI ở bất kỳ đâu trên thế giới có thể bật watermark cho một số mô hình được chọn ngay từ bây giờ, song theo mặc định nó vẫn tắt. Động thái này nhằm đáp ứng Đạo luật AI của EU, trong đó các nghĩa vụ về đánh dấu nội dung đã có hiệu lực từ ngày 2/8, yêu cầu nhà cung cấp phải giúp máy móc nhận diện được văn bản do AI tạo ra. Các doanh nghiệp đang cung cấp dịch vụ tại thị trường EU có thời hạn tới ngày 2/12 để tuân thủ.
Bài liên quan: Binance ra mắt AI Agent xây chiến lược từ câu chữ đơn giản, thu 19,99 USDC mỗi lệnh giao dịch
Giới hạn của hệ thống phát hiện TextGrain
Phương pháp watermark, mang tên textGrain, không chèn ký hiệu dễ thấy mà can thiệp tinh vi vào lựa chọn từ của mô hình, để lại một mẫu thống kê mà công cụ phát hiện có thể nhận diện và vẫn đi kèm ngay cả khi nội dung được sao chép. OpenAI cho biết textGrain đạt kết quả tương đương hoặc tốt hơn các giải pháp đã thử nghiệm, bao gồm SynthID cho văn bản của Google, và công ty có kế hoạch phát hành công nghệ này dưới dạng mã nguồn mở.
Tuy nhiên, chỉnh sửa nội dung làm suy yếu tín hiệu watermark.
Trong bài kiểm thử với các đoạn văn 400 token, việc thay 10% số từ bằng từ đồng nghĩa làm tỷ lệ phát hiện giảm từ khoảng 92% xuống 66%. Khi tăng mức thay thế lên 25% số từ, tỷ lệ phát hiện rơi còn 17%. Các đoạn quá ngắn, lời giải toán học và văn bản dịch cũng khó gắn cờ hơn; với những đoạn khoảng 200 token về các chủ đề như tâm lý học, công cụ chỉ phát hiện được khoảng 80% nếu giữ tỷ lệ cảnh báo nhầm ở mức 1%.
Ai được dùng công cụ phát hiện ChatGPT?
Trước mắt, OpenAI chỉ cung cấp công cụ phát hiện cho các nhà nghiên cứu được phê duyệt và một số tổ chức chuyên môn, với lý do lo ngại rủi ro bỏ sót watermark và cảnh báo sai. Hãng cũng nhấn mạnh việc không phát hiện watermark “không đủ để chứng minh văn bản do con người viết”, đồng thời khẳng định watermark không chứa thông tin định danh về người dùng, tài khoản hay câu lệnh đầu vào (prompt) phía sau đoạn văn.
Động thái này nối bước Anthropic, công ty hồi tháng 8 tuyên bố sẽ watermark mọi văn bản Claude tạo ra trên phạm vi toàn cầu, động thái từng gây bức xúc với một bộ phận người dùng. OpenAI từng phát triển một dạng watermark cho văn bản trước đây nhưng đã trì hoãn triển khai, một phần vì lo ngại người dùng sẽ chuyển sang đối thủ, theo một bản tin năm 2024. Cả hai công ty, cùng với Google, Meta và Microsoft, đều đã cam kết tuân thủ bộ quy tắc thực hành của EU về tính minh bạch đối với nội dung do AI tạo ra.
Đọc tiếp: Giorgia Meloni muốn đăng ký thương hiệu cho giọng nói của mình, liệu có chặn được deepfake AI?

