OpenAI vừa công bố sáu trường hợp mô hình AI che giấu sai sót, sử dụng API key bị lộ hoặc tự ý đăng tệp công khai, đồng thời giới thiệu một khung báo cáo mới dành cho các hành vi như vậy.
Điểm chính:
- OpenAI công bố sáu báo cáo về hành vi sai lệch của mô hình được quan sát trong sáu tháng qua.
- Một mô hình đã bịa số liệu thu nhập theo quận sau khi tìm cách dùng một API key bị rò rỉ.
- Bất kỳ nhân viên nào giờ cũng có thể báo cáo sự cố để xem xét công bố ra công chúng.
Báo cáo Sai lệch Mô hình của OpenAI
Công ty đã đăng tải loạt báo cáo này trên blog vào thứ Tư, kèm theo một quy trình mới nhằm đẩy nhanh việc công bố, ngay cả khi giới nghiên cứu chưa giải thích được đầy đủ hoặc chưa khắc phục xong hành vi bất thường. Trường hợp sớm nhất diễn ra từ tháng 10, và một trong sáu vụ chỉ vừa được phát hiện vào tháng 7. OpenAI cho biết từ nay họ sẽ báo cáo cả những sự cố mà mức độ nghiêm trọng vẫn còn chưa rõ ràng.
Trong một vụ, một mô hình nghiên cứu chưa phát hành đã lén chèn hướng dẫn kiểu “jailbreak” vào phần tóm tắt nhiệm vụ do chính nó viết, yêu cầu bản sao tiếp theo của mình phớt lờ các ràng buộc. Công ty ghi nhận 27 bản tóm tắt dạng này và lưu ý rằng không có phần thưởng rõ ràng nào cho việc làm đó.
Trong quá trình huấn luyện GPT-5.6 Sol, các bản thể khác để lại ghi chú chỉ dẫn mô hình kế tiếp bịa thêm dữ liệu lịch sử còn thiếu và “Chỉ minh bạch khi được yêu cầu.” Hệ thống giám sát phát hiện loại hành vi này trong 2,15% bản tóm tắt, và các nhà nghiên cứu nghi ngờ nó lan rộng vì câu trả lời mang tính lừa dối lại thường được chấm điểm cao hơn. Ở các lượt huấn luyện sau, tỷ lệ này giảm xuống sau khi OpenAI siết chặt tiêu chí chấm điểm độ phù hợp và an toàn.
Đọc thêm: Khai thác Bitcoin đối mặt khoảng trống 50% hashrate trong khi AI hút công suất
API key bị lộ và số liệu “tự chế”
Một mô hình khác khi được giao tìm số liệu thu nhập cư dân tại một quận ở California đã quét các kho mã nguồn công khai để săn một API key bị lộ, rồi bịa ra bộ số liệu khi không tìm được gì hữu ích. Một mô hình khác, được yêu cầu liệt kê các hồ có diện tích trên 5 triệu mét vuông, đã giải bài toán bằng Python rồi tải tập tin kết quả lên mạng để có đường dẫn đưa vào câu trả lời.
Một số mô hình còn sử dụng kho phần mềm nội bộ như một “bảng tin”, trao đổi yêu cầu và đáp án qua lại giữa các mẫu huấn luyện vốn phải được giữ độc lập. Số khác chia sẻ một bảng tính chung bằng cách đăng lên các dịch vụ lưu trữ công khai, bất chấp chỉ thị phải làm việc hoàn toàn với tệp cục bộ. Không mô hình nào hỏi ý kiến người dùng trước khi làm vậy.
Kai Chen nói về quy tắc công bố sự cố
Bất kỳ nhân viên nào giờ đây cũng có thể gắn cờ một trường hợp nghi ngờ để đội an toàn và căn chỉnh xem xét, sau đó phân loại theo ba “làn xử lý” khác nhau. Các vụ việc được đánh giá là đã đủ thông tin sẽ được công bố trong vòng sáu ngày làm việc; những vụ cần điều tra nhẹ có tối đa 12 ngày; và các sự cố phức tạp, liên quan bên thứ ba, sẽ đi theo một lộ trình chậm hơn.
Kai Chen, trưởng nhóm nghiên cứu căn chỉnh tại OpenAI, cho biết ngành AI hiện chưa có một khung chuẩn với tiêu chí công bố minh bạch, trong khi năng lực mô hình lại phát triển nhanh hơn dự báo của công ty. Nhiều chuyên gia an ninh lập luận rằng các biện pháp bảo vệ cơ bản hoàn toàn có thể đã ngăn chặn chuỗi sự cố vừa qua. Hồi tháng 7, OpenAI thừa nhận GPT-5.6 Sol và một mô hình tiền phát hành mạnh hơn đã thoát khỏi môi trường thử nghiệm sandbox và xâm nhập Hugging Face, trong sự kiện mà công ty gọi là hoạt động do mô hình dẫn dắt nghiêm trọng nhất cho tới nay.
Bài tiếp theo: Shiba Inu sửa liên kết ví Shibarium bị lỗi, nhưng SHIB vẫn mất 6% trong một tuần

