OpenAI đang thử nghiệm một hệ thống an toàn có khả năng phát hiện lạm dụng mà không lưu lại dữ liệu khách hàng, động thái được xem là đòn đáp trả trực diện với quy định giữ dữ liệu 30 ngày mới của Anthropic.
Các điểm chính:
- OpenAI giới thiệu Private Safety Processing, công cụ dò tìm hành vi lạm dụng trên nhiều phiên liên quan mà không lưu lại bất kỳ prompt hay phản hồi nào của khách hàng.
- Anthropic yêu cầu khách hàng doanh nghiệp sử dụng các mô hình mạnh nhất phải chấp nhận lưu dữ liệu 30 ngày, cho rằng log là cần thiết để phát hiện các tấn công nhiều bước.
- OpenAI dự kiến mở rộng triển khai và công bố white paper kỹ thuật vào tháng 9.
Private Safety Processing nhắm vào lạm dụng nhiều phiên
Công ty đã thông báo bản thử nghiệm vào thứ Tư, mô tả đây là bước mở rộng của cơ chế Zero Data Retention – thỏa thuận theo đó OpenAI không giữ lại prompt hay phản hồi của mô hình sau khi xử lý xong yêu cầu. Đợt triển khai rộng rãi hơn cùng tài liệu kỹ thuật chi tiết được lên kế hoạch cho tháng 9.
Với hệ thống mới, nội dung của khách hàng hoặc nằm hoàn toàn trên hạ tầng do chính khách hàng kiểm soát, hoặc được lưu trên hạ tầng OpenAI nhưng mã hóa bằng khóa mà chỉ khách hàng nắm giữ. Các công cụ tự động sẽ rà soát nội dung này để tìm mẫu hình lạm dụng trên nhiều phiên liên quan. Thiết kế cũng bao phủ các tác vụ “tự hành”, nơi hệ thống có thể tiếp tục hành động sau khi người dùng đã yêu cầu dừng. Nhân viên OpenAI không được trực tiếp xem nội dung.
Aleah Houze, lãnh đạo phụ trách chính sách sản phẩm của công ty, nói với phóng viên trong một cuộc trao đổi rằng hành vi nguy hiểm thường chỉ bộc lộ rõ khi ghép nhiều tương tác lại với nhau. Bà nêu ví dụ một người dùng trước hết dò tìm lỗ hổng phần mềm trong một cuộc trò chuyện, rồi sau đó lại hỏi về công cụ truy cập từ xa trong một phiên khác.
Xem thêm: Watermark ẩn của Claude bóp méo nghệ thuật viết lách, Gruber nói
Quy định lưu trữ của Anthropic tạo thế đối nghịch
Anthropic đã chọn hướng tiếp cận đối lập từ tháng 7, yêu cầu khách hàng doanh nghiệp sử dụng các mô hình mạnh nhất như Fable 5 và Mythos 5 phải chấp nhận lưu dữ liệu 30 ngày.
Phòng thí nghiệm này thừa nhận chính sách có thể không được ưa chuộng và gây tổn hại kinh doanh, nhưng khẳng định log là then chốt để phát hiện các cuộc tấn công được cố ý chia nhỏ ra nhiều yêu cầu riêng rẽ. Việc rà soát thủ công vẫn có thể diễn ra, song chỉ qua một quy trình kiểm soát chặt chẽ, dành cho một nhóm nhỏ kiểm duyệt viên đã được phê duyệt. Mọi phiên tương tác đều được ghi lại trong một log chống chỉnh sửa.
Giới phân tích đặt câu hỏi về thời điểm và bằng chứng của OpenAI
Brian Levine, giám đốc điều hành FormerGov, đánh giá trong một bài bình luận rằng đây là một cam kết kỹ thuật rất mạnh, bởi giám sát lạm dụng và “mù nội dung” từ trước đến nay vốn đi ngược chiều nhau.
Ông lưu ý bằng chứng kỹ thuật chỉ xuất hiện vài tuần sau đó. Jason Andersen từ Moor Insights and Strategy nhìn nhận loạt thông báo trong tuần này phần nào là động tác “dàn hàng” trước thềm IPO.
Flavio Villanustre, giám đốc an ninh thông tin tại LexisNexis Risk Solutions Group, cho rằng OpenAI đang tìm cách làm dịu khung quản lý mà ông dự đoán sẽ ngày càng siết chặt.
Bản thử nghiệm khép lại một tuần đậm đặc thông điệp về an toàn. Hôm thứ Ba, công ty cho biết đã chủ động giảm tốc mở rộng quy mô và tạm dừng các bài huấn luyện tăng cường (reinforcement learning) trong lúc gia cố và cho “đội đỏ” thử phá môi trường nghiên cứu. OpenAI cũng ước tính các cơ chế giám sát mở rộng sẽ tiêu tốn khoảng 20% năng lực suy luận (inference compute) nằm trong phạm vi theo dõi.
Đọc tiếp: Bitcoin có thể trở lại mốc 100.000 USD trước kỳ halving 2028, theo Scaramucci





