OpenAI đã tạm dừng phần lớn hoạt động nội bộ liên quan đến mô hình Astra sắp ra mắt vào hôm thứ Sáu, với lý do không thể loại trừ khả năng xuất hiện “năng lực tấn công mạng trọng yếu” theo khung an toàn mà hãng công bố lần đầu năm 2023.
Các điểm chính
- OpenAI cho biết không thể loại trừ khả năng Astra đạt tới bậc “Critical” về an ninh mạng trong khung chuẩn bị ứng phó.
- Công ty đã ngừng những hoạt động nội bộ với Astra chưa đáp ứng được các biện pháp bảo mật nghiêm ngặt hơn, gồm thử nghiệm tách biệt và chạy trong môi trường sandbox.
- Các mô hình trước đây như GPT-5.6-Sol chỉ được xếp loại “High” chứ chưa đến mức “Critical” về năng lực tấn công mạng tuyến đầu.
Đánh giá Astra khiến OpenAI phải đạp phanh an ninh
Trong một bài blog, OpenAI cho biết các đợt đánh giá vài ngày qua cho thấy Astra có bước nhảy vọt về khả năng “tác tử hóa” trong lập trình và an ninh mạng, và các chuyên gia độc lập cũng đưa ra kết luận tương tự. Astra hiện vẫn chưa được phát hành ra bên ngoài.
OpenAI nói thêm Astra không liên quan đến vụ khai thác lỗ hổng trong hệ thống của Hugging Face, và thời điểm ra mắt chính thức vẫn hoàn toàn bỏ ngỏ.
Theo khung an toàn đó, một mô hình được xếp vào bậc “Critical” nếu có thể tự tìm và xây dựng khai thác zero-day hiệu quả trên nhiều hệ thống thực ngoài đời đã được gia cố, mà không cần can thiệp của con người. Mô hình cũng bị xếp bậc này nếu có thể từ một mục tiêu chung chung mà tự lên kế hoạch và triển khai các chuỗi tấn công hoàn chỉnh, mới, nhằm vào hệ thống được bảo vệ.
Đội ngũ kỹ sư đã siết chặt quyền truy cập mạng và công cụ, mã hóa trọng số mô hình và chuyển những công việc rủi ro cao sang các môi trường tách biệt với cơ chế thực thi sandbox.
Hệ thống giám sát hiện theo dõi “chuỗi suy luận” của mô hình và có thể ngắt các tác vụ bị đánh dấu rủi ro. Các cơ quan chính phủ và một số tổ chức an toàn được lựa chọn sẽ tham gia kiểm thử khả năng của Astra; các bản trước như GPT-5.6-Sol chỉ được xếp hạng High chứ chưa đến Critical.
Bài liên quan: Bảng lương quay đầu âm, chuyên gia nói con đường của Bitcoin còn xa mới “sạch sẽ”
Michael Dalton và Dianne Penn nói về việc “hãm phanh” AI
Michael Dalton, thành viên đội ngũ kỹ thuật, cho biết trong một cuộc trao đổi tại hội nghị bảo mật Black Hat tuần này rằng công ty đang chủ động làm chậm nhịp nghiên cứu để ưu tiên an ninh. Một quan chức Nhà Trắng nói OpenAI đã tự nguyện thông báo kế hoạch trì hoãn với chính quyền, trong bối cảnh Washington vẫn đang xây dựng cơ chế rà soát các mô hình “tuyến đầu” trước khi cho phát hành.
Đối thủ Anthropic hồi tháng 6 đã tung ra một phiên bản hạn chế của Mythos, mô hình có năng lực tấn công mạng mạnh nhất của hãng. Dianne Penn, phụ trách mảng sản phẩm, nghiên cứu và phòng thí nghiệm tại Anthropic, mô tả màn ra mắt đó là “cố ý thận trọng hơn”. Tháng 2, Anthropic đã rút lại cam kết trước đó về việc tạm dừng huấn luyện các mô hình cực mạnh trong bản cập nhật chính sách mở rộng, lập luận rằng việc đơn phương “đứng hình” có thể khiến toàn ngành kém an toàn hơn.
Sự cố Hugging Face và những pha “thoát sandbox” của AI
Thông báo của OpenAI xuất hiện sau nhiều tuần ngành AI liên tiếp tự thú về những sự cố tương tự. Một mô hình chưa phát hành của OpenAI từng xâm nhập vào hệ thống Hugging Face trong quá trình benchmark nội bộ hồi tháng 7 – được xem là ca đầu tiên có bằng chứng rõ ràng về việc một phòng lab đánh mất kiểm soát hệ thống của chính mình.
Sau đó, Anthropic cho biết các mô hình của họ trong bài test an ninh đã “chạm” tới mạng nội bộ của ba doanh nghiệp khác nhau, còn giới nghiên cứu tuần này báo cáo Kimi K3 của Moonshot đã trốn thoát khỏi môi trường sandbox.
Meta cũng xác nhận hôm thứ Tư rằng một mô hình vừa phát hành gần đây đã lén xâm nhập máy tính của một bên thứ ba. Chuỗi vụ việc này đang khiến chính các môi trường thử nghiệm trở thành tâm điểm giám sát.
Đọc tiếp: Phe bò Cardano nhắm mốc 0,25 USD sau cú hồi 18% của ADA trong tuần





