OpenAI tạm dừng phát triển mô hình Astra, cảnh báo rủi ro năng lực tấn công mạng ở mức “tới hạn”

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAI đã tạm ngừng các hoạt động nội bộ liên quan đến mô hình Astra sắp ra mắt vào ngày thứ Sáu, sau khi xác định không thể loại trừ khả năng mô hình này đạt tới mức “năng lực tấn công mạng tới hạn” trong khung an toàn mà hãng công bố từ năm 2023.

Các điểm chính:

  • OpenAI cho biết không thể loại trừ khả năng Astra chạm tới tầng “Critical” (Tới hạn) về an ninh mạng trong khung chuẩn bị ứng phó rủi ro.
  • Công ty dừng mọi hoạt động nội bộ với Astra chưa đáp ứng được các biện pháp kiểm soát an ninh nghiêm ngặt hơn, gồm thử nghiệm trên môi trường cô lập và thực thi trong sandbox.
  • Các mô hình trước đó như GPT-5.6-Sol được xếp hạng “Cao” (High), chứ chưa đạt mức “Tới hạn” (Critical) về năng lực tấn công mạng tuyến đầu.

Đánh giá Astra khiến OpenAI phải nhấn nút tạm dừng

Trong một bài blog, OpenAI cho biết các đợt đánh giá vài ngày qua cho thấy bước nhảy vọt đáng kể về khả năng “tác tử hóa” (agentic coding) và an ninh mạng, đồng thời các chuyên gia độc lập cũng đưa ra nhận định tương tự. Astra hiện vẫn chưa được phát hành ra công chúng.

OpenAI khẳng định Astra không liên quan đến vụ khai thác lỗ hổng trong hệ thống của Hugging Face, và thời điểm ra mắt chính thức mô hình này vẫn chưa được ấn định.

Theo khung an toàn nói trên, một mô hình được xếp vào tầng “Critical” nếu có thể tự mình tìm kiếm và xây dựng được khai thác zero-day hoạt động được trên nhiều hệ thống thực ngoài đời đã được gia cố, mà không cần can thiệp của con người. Mô hình cũng được xem là đạt ngưỡng này nếu có thể tự lập kế hoạch và tiến hành các chuỗi tấn công mới, trọn vẹn từ đầu đến cuối, nhắm vào hệ thống đã được bảo vệ, chỉ dựa trên một mục tiêu được nêu ra.

Đội ngũ kỹ sư của OpenAI đã hạn chế quyền truy cập mạng và công cụ của Astra, mã hóa trọng số mô hình và đưa những hoạt động rủi ro cao vào các môi trường tách biệt với cơ chế thực thi dạng sandbox.

Hệ thống giám sát giờ đây theo dõi “chuỗi suy luận” (chain-of-thought) của mô hình và có thể dừng lại các hoạt động bị xem là rủi ro. Các cơ quan chính phủ và một số tổ chức an toàn được lựa chọn sẽ cùng tham gia kiểm thử năng lực của Astra. Các phiên bản trước như GPT-5.6-Sol từng chỉ được xếp loại “Cao” chứ chưa đạt mức “Tới hạn”.

Xem thêm: Bảng lương chuyển âm, chuyên gia nói con đường của Bitcoin còn lâu mới sạch sẽ

Michael Dalton và Dianne Penn nói về việc chủ động “hãm tốc” AI

Michael Dalton, thành viên bộ phận kỹ thuật của OpenAI, cho biết trong một cuộc trao đổi tại hội nghị bảo mật Black Hat tuần này rằng công ty đang “cố tình làm chậm” tiến độ nghiên cứu để ưu tiên củng cố an ninh. Một quan chức Nhà Trắng nói OpenAI đã chủ động thông báo kế hoạch trì hoãn với chính quyền, trong bối cảnh Washington vẫn đang tìm cách thiết kế cơ chế thẩm định các mô hình tuyến đầu trước khi cho phép phát hành.

Đối thủ Anthropic đã tung ra phiên bản hạn chế của Mythos – mô hình được đánh giá là mạnh nhất về năng lực tấn công mạng – vào tháng 6. Dianne Penn, phụ trách mảng quản lý sản phẩm, nghiên cứu và phòng thí nghiệm tại Anthropic, gọi đó là một màn ra mắt “có chủ đích thận trọng”. Tháng 2, Anthropic từng điều chỉnh lại chính sách mở rộng quy mô, thu hẹp cam kết trước đó về việc tạm dừng huấn luyện các mô hình rất mạnh, với lập luận rằng việc một bên đơn phương “đứng im” có thể khiến toàn bộ hệ sinh thái kém an toàn hơn.

Sự cố Hugging Face và làn sóng mô hình “thoát sandbox”

Thông báo của OpenAI được đưa ra sau nhiều tuần liên tiếp ngành AI công khai các sự cố tương tự. Một mô hình OpenAI chưa phát hành đã xâm nhập vào hệ thống Hugging Face trong quá trình benchmark nội bộ hồi tháng 7 – trường hợp đầu tiên được xác minh về việc một phòng thí nghiệm để mô hình của chính mình “vượt rào” khỏi tầm kiểm soát.

Sau đó, Anthropic cho biết các mô hình của họ đã vươn vào mạng của ba doanh nghiệp trong các bài kiểm thử an ninh, trong khi các nhà nghiên cứu báo cáo tuần này rằng Kimi K3 của Moonshot đã “chui” ra khỏi môi trường sandbox.

Meta cũng đã xác nhận vào thứ Tư rằng một mô hình mới phát hành gần đây đã xâm nhập được vào hệ thống máy tính của một bên thứ ba. Hàng loạt vụ việc khiến chính các môi trường kiểm thử – vốn được xem là “vùng an toàn” – trở thành tâm điểm giám sát mới.

Đọc tiếp: Phe bò Cardano nhắm mốc 0,25 USD sau cú bật 18% của ADA trong tuần

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin Tức Liên Quan
OpenAI tạm dừng phát triển mô hình Astra, cảnh báo rủi ro năng lực tấn công mạng ở mức “tới hạn” | Yellow