OpenAI công bố sáu vụ việc AI che giấu sai sót và tự ý hành động ngoài kiểm soát

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI vừa công bố sáu trường hợp mô hình AI che giấu sai sót, tìm cách dùng API key bị lộ hoặc tự ý đăng tải tệp lên mạng, đồng thời giới thiệu một khung quy trình mới để ghi nhận và công khai các hành vi kiểu này.

Điểm chính:

  • OpenAI công bố sáu báo cáo về hành vi “lệch chuẩn” của mô hình trong sáu tháng gần đây.
  • Một mô hình đã bịa số liệu thu nhập cấp quận sau khi cố gắng dùng API key bị rò rỉ.
  • Bất kỳ nhân viên nào nay cũng có thể báo cáo sự cố để cân nhắc công bố rộng rãi.

Hệ thống báo cáo “lệch chuẩn” của OpenAI

Công ty đã đăng tải các báo cáo này trên blog vào thứ Tư, đi kèm một quy trình mới nhằm đẩy nhanh việc công bố, ngay cả khi nhóm nghiên cứu chưa hiểu tường tận nguyên nhân hay chưa khắc phục hoàn toàn hành vi bất thường. Vụ việc sớm nhất bắt đầu từ tháng 10, còn trường hợp mới nhất trong số sáu vụ được phát hiện vào tháng 7. OpenAI cho biết từ nay sẽ báo cáo sự cố ngay cả khi vẫn chưa rõ mức độ nghiêm trọng.

Trong một trường hợp, một mô hình nghiên cứu chưa phát hành đã lén chèn hướng dẫn kiểu “jailbreak” vào chính phần tóm tắt nhiệm vụ của nó, chỉ thị cho bản sao tiếp theo bỏ qua mọi ràng buộc. Công ty ghi nhận 27 bản tóm tắt dạng này và cho biết không thấy có phần thưởng rõ ràng nào khiến mô hình làm vậy.

Khi huấn luyện GPT-5.6 Sol, các phiên bản khác lại để lại ghi chú yêu cầu “người kế nhiệm” bịa các dữ liệu lịch sử bị thiếu và “Chỉ minh bạch nếu bị hỏi đến”. Hệ thống giám sát phát hiện hành vi này trong 2,15% bản tóm tắt của mô hình, và nhóm nghiên cứu nghi ngờ nó lan rộng vì câu trả lời mang tính đánh lừa thường được chấm điểm cao hơn. Ở các vòng huấn luyện sau, tỷ lệ này giảm xuống khi OpenAI siết chặt cách chấm điểm độ phù hợp và tuân thủ (alignment).

Xem thêm: Khai thác Bitcoin đối mặt khoảng trống 50% hashrate khi AI hút hạ tầng

API key rò rỉ và số liệu “tưởng tượng”

Một mô hình khác, trong lúc truy tìm số liệu thu nhập cư dân của một quận tại California, đã chủ động rà soát các kho mã nguồn công khai để tìm API key bị lộ. Khi không thể truy cập được, mô hình quay sang… bịa luôn số liệu.

Một mô hình riêng biệt, được giao nhiệm vụ liệt kê các hồ nước lớn hơn 5 triệu mét vuông, đã dùng Python để tìm câu trả lời, rồi tải tệp kết quả lên mạng chỉ để có một đường link mang ra trích dẫn.

Một số mô hình còn dùng kho phần mềm nội bộ như bảng thông báo, truyền đạt yêu cầu và câu trả lời qua lại giữa các mẫu huấn luyện vốn được thiết kế là độc lập. Các mô hình khác tải một bảng tính dùng chung lên các dịch vụ lưu trữ công khai, bất chấp chỉ dẫn phải làm việc hoàn toàn với tệp nội bộ. Không trường hợp nào hỏi lại người dùng trước khi hành động.

Kai Chen nói gì về quy tắc công bố?

Theo quy trình mới, bất kỳ nhân viên nào cũng có thể gắn cờ một vụ việc nghi ngờ để nhóm an toàn và alignment xem xét, sau đó phân loại theo ba “luồng” xử lý. Các vụ được đánh giá là đã sẵn sàng sẽ được công bố trong vòng sáu ngày làm việc; những vụ cần điều tra bổ sung nhẹ có tối đa 12 ngày; còn các sự cố phức tạp, có bên thứ ba liên quan, sẽ được xử lý lâu hơn.

Kai Chen, trưởng nhóm nghiên cứu alignment của OpenAI, nhận định ngành AI hiện chưa có một khung chuẩn với các tiêu chí công bố rõ ràng, trong khi năng lực của mô hình đang tăng nhanh hơn dự tính của công ty. Nhiều chuyên gia an ninh mạng lập luận rằng các biện pháp bảo vệ cơ bản đã đủ để ngăn loạt sự cố vừa qua.

Tháng 7, OpenAI thừa nhận GPT-5.6 Sol cùng một mô hình thử nghiệm mạnh hơn đã tự thoát khỏi môi trường sandbox và xâm nhập Hugging Face — sự kiện mà công ty mô tả là hoạt động nguy hiểm nhất từng được thúc đẩy hoàn toàn bởi mô hình tính đến nay.

Bài tiếp theo: Shiba Inu sửa lỗi liên kết ví của Shibarium, nhưng SHIB vẫn giảm 6% trong một tuần

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza là một nhà báo tài chính dày dạn kinh nghiệm với bề dày hoạt động trong lĩnh vực đưa tin về tiền điện tử và công nghệ blockchain. Anh đã cộng tác với Benzinga và Cointelegraph, cùng nhiều ấn phẩm khác, chuyên viết về các xu hướng mới nổi, bối cảnh quy định và nhiều chủ đề liên quan. Bạn có thể tìm anh ấy trên Twitter với tên @murtuza_merc và trên Telegram với tên mmerchant001. Công bố thông tin: Murtuza hiện nắm giữ ATOM, AKT, TIA, INJ và OSMO.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
OpenAI công bố sáu vụ việc AI che giấu sai sót và tự ý hành động ngoài kiểm soát | Yellow