OpenAI đang thử nghiệm một hệ thống an toàn có khả năng phát hiện lạm dụng mà không cần giữ lại dữ liệu khách hàng, bước đi được xem là “đòn đáp trả” trực tiếp đối với quy định lưu giữ 30 ngày mới của đối thủ Anthropic.
Những điểm chính:
- OpenAI chạy thử Private Safety Processing, công cụ phát hiện hành vi lạm dụng xuyên suốt các phiên liên quan mà không lưu lại prompt hay phản hồi của khách hàng.
- Anthropic yêu cầu khách hàng doanh nghiệp dùng các mô hình mạnh nhất phải chấp nhận lưu dữ liệu 30 ngày, cho rằng log là bắt buộc để phát hiện tấn công nhiều bước.
- Việc triển khai rộng rãi và whitepaper kỹ thuật dự kiến ra mắt vào tháng 9.
Private Safety Processing nhắm vào lạm dụng đa phiên
Công ty đã thông báo bản thử nghiệm vào thứ Tư, giới thiệu đây là phần mở rộng của cơ chế Zero Data Retention, thỏa thuận theo đó OpenAI không lưu lại prompt hoặc phản hồi của mô hình sau khi xử lý xong yêu cầu. Đợt triển khai rộng hơn cùng tài liệu kỹ thuật chi tiết được lên lịch vào tháng 9.
Theo thiết kế mới, nội dung của khách hàng hoặc nằm hoàn toàn trên hạ tầng do chính khách hàng kiểm soát, hoặc được lưu trong hệ thống OpenAI nhưng mã hóa bằng khóa mà chỉ khách hàng nắm giữ. Các công cụ tự động sẽ quét và nhận diện mẫu hành vi lạm dụng trên chuỗi phiên liên quan. Cách tiếp cận này cũng bao trùm các tác vụ mang tính “tự hành”, nơi hệ thống có thể tiếp tục thực hiện hành động sau khi người dùng tưởng rằng đã dừng. Nhân viên OpenAI không trực tiếp xem nội dung này.
Aleah Houze, giám đốc chính sách sản phẩm của OpenAI, nói với báo giới rằng nhiều hành vi nguy hiểm chỉ lộ rõ khi ghép nhiều tương tác lại với nhau. Bà lấy ví dụ một người dùng trước tiên dò xét lỗ hổng phần mềm trong một cuộc hội thoại, rồi ở cuộc khác lại hỏi chi tiết về công cụ truy cập từ xa.
Đọc thêm: Watermark ẩn của Claude bóp méo nghề viết, Gruber nói
Quy định lưu dữ liệu của Anthropic tạo thế đối nghịch
Anthropic đã công bố hướng đi ngược lại từ tháng 7, buộc khách hàng doanh nghiệp sử dụng các mô hình mạnh nhất như Fable 5 và Mythos 5 phải chấp nhận lưu dữ liệu trong 30 ngày.
Phòng thí nghiệm này thừa nhận chính sách có thể gây phản ứng tiêu cực và làm tổn hại hoạt động kinh doanh, nhưng khẳng định log là công cụ không thể thiếu để phát hiện các đợt tấn công cố ý trải dài qua nhiều yêu cầu rời rạc. Việc rà soát thủ công vẫn được duy trì, song thông qua quy trình kiểm soát chặt, chỉ một nhóm nhỏ rà soát viên được cấp quyền. Mỗi phiên tương tác đều được ghi lại trong log chống chỉnh sửa.
Giới phân tích nghi ngờ thời điểm và bằng chứng của OpenAI
Brian Levine, giám đốc điều hành FormerGov, nhận định trong một phát biểu được trích dẫn rằng đây là một cam kết kỹ thuật mạnh mẽ, bởi hai mục tiêu: giám sát lạm dụng và “mù” nội dung khách hàng vốn dĩ đối nghịch nhau.
Ông lưu ý bằng chứng cụ thể sẽ chỉ xuất hiện vài tuần sau. Jason Andersen thuộc Moor Insights and Strategy cho rằng loạt thông báo trong tuần phần nào mang màu sắc “dọn đường” cho một đợt IPO tiềm năng.
Flavio Villanustre, giám đốc an ninh thông tin tại LexisNexis Risk Solutions Group, nhìn đây là nỗ lực “làm mềm” các quy định mà ông dự đoán sẽ siết chặt hơn với ngành AI.
Bản thử nghiệm khép lại một tuần đầy thông điệp xoay quanh an toàn. Hôm thứ Ba, OpenAI cho biết đã giảm tốc độ mở rộng quy mô và tạm dừng huấn luyện reinforcement learning trong lúc củng cố, kiểm thử tấn công (red-team) môi trường nghiên cứu. Công ty cũng ước tính các biện pháp giám sát mở rộng sẽ tiêu thụ khoảng 20% tổng năng lực suy luận (inference compute) nằm trong phạm vi giám sát.
Đọc tiếp: Bitcoin có thể trở lại mốc 100.000 USD trước kỳ halving 2028, theo Scaramucci





