OpenAI Astra trở thành mô hình đầu tiên chạm ngưỡng “Rủi ro mạng Tới hạn”

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI cho biết hôm thứ Ba rằng mô hình Astra chưa phát hành của hãng là mô hình đầu tiên vượt qua ngưỡng an ninh mạng “Tới hạn” (Critical) trong khung Preparedness Framework nội bộ, sau khi đạt 100% trong một bộ chuẩn công khai về khả năng viết mã khai thác (exploit).

Các điểm chính:

  • Astra là mô hình OpenAI đầu tiên được xếp hạng “Tới hạn” về an ninh mạng trong Preparedness Framework của công ty.
  • Mô hình đạt điểm tuyệt đối trong một bài benchmark khai thác công khai và phát hiện hai lỗ hổng chưa từng được công bố trong thử nghiệm nội bộ.
  • Những tiết lộ riêng về kiến trúc “recurrent depth” đang vấp phải phản đối mạnh mẽ từ giới nghiên cứu an toàn AI.

Kết quả benchmark khai thác của Astra

Công ty đã [công bố](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ báo cáo đánh giá hôm thứ Ba, cho biết Astra có thể tự tìm ra các lỗ hổng chưa được nhận diện và xây dựng chuỗi exploit hoạt động được trên những hệ thống phòng vệ nghiêm ngặt, mà không cần con người can thiệp ở từng bước.

Trên một bộ benchmark nội bộ gồm 20 lỗi nghiêm trọng được tiết lộ trong giai đoạn từ tháng 6 đến tháng 8, mô hình đã phát hiện và xâu chuỗi hai lỗ hổng zero‑day, hiện các kỹ sư đang báo cáo cho đơn vị quản lý phần mềm. Các chuyên gia độc lập cũng để Astra tấn công thử vào một trình duyệt và hệ điều hành đã được “cứng hóa”, nơi nó thoát được khỏi sandbox và thực thi lệnh trên máy chủ.

Quyền truy cập các năng lực tấn công mạng mạnh nhất ban đầu sẽ chỉ được cấp cho một nhóm rất nhỏ người dùng thử alpha, sau đó mới mở rộng dần thông qua một chương trình phòng thủ có tên Daybreak Blue.

OpenAI chưa tiết lộ danh tính nhóm thử nghiệm hay tiêu chí lựa chọn, và cho tới nay chưa có tổ chức độc lập nào xác nhận các kết quả benchmark mà công ty công bố.

Công ty cảnh báo rằng chính các lớp bảo vệ của mình có thể tạm dừng hoặc chặn cả những tác vụ hợp lệ, bao gồm nghiên cứu an ninh phòng thủ và các tác vụ agent chạy dài. OpenAI cũng mô tả Astra là mô hình “căn chỉnh” tốt nhất của hãng cho tới hiện tại: trong thử nghiệm nội bộ, Astra từ chối 91,5% nỗ lực “jailbreak” về an ninh mạng, so với mức 59% của mẫu đầu bảng hiện nay là GPT‑5.6 Sol.

Bài liên quan: Claude Fable 5.1 ra mắt với đọc cache 0,25 USD và kiểm soát chống sao chép

“Recurrent depth” châm ngòi tranh cãi

Một nguồn tin riêng biệt cho biết cùng đêm đó rằng Astra dựa nhiều vào một dạng kiến trúc gọi là “recurrent depth”, và OpenAI hiện đang tự hạn chế việc triển khai.

Cách tiếp cận này đẩy phần lớn quá trình suy luận của mô hình ra khỏi văn bản có thể đọc được sang các “kích hoạt” (activations) nội bộ, giúp giảm chi phí và cải thiện hiệu suất trên các bài toán khó. Song nó cũng làm mỏng đi “dấu vết ngôn ngữ tự nhiên” mà các nhóm an toàn thường đọc để phát hiện mô hình đang trôi khỏi chỉ dẫn ban đầu.

OpenAI vẫn có kế hoạch phát hành Astra kèm thêm cơ chế giám sát chuỗi suy luận (chain‑of‑thought monitoring) bổ sung, nhưng lớp kiểm soát này chỉ hoạt động trên phần suy luận mà hệ thống thực sự quan sát được.

Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research, gọi thay đổi này có thể là bước thụt lùi tệ hại nhất đến nay đối với an toàn và an ninh AI. Steven Adler, cựu lãnh đạo bộ phận an toàn của OpenAI, viết rằng cách tiếp cận trên dường như đã vượt qua một trong số rất ít “lằn ranh đỏ” mà ngành từng tự vạch ra.

Dòng thời gian cảnh báo an ninh mạng của OpenAI

Việc gắn nhãn “Tới hạn” khép lại một tháng leo thang cảnh báo từ phía công ty.

Ngày 7/8, OpenAI lần đầu tiết lộ rằng họ không thể loại trừ khả năng Astra đạt năng lực mạng ở mức “Tới hạn”, và sau đó đã tạm dừng một phần quá trình huấn luyện frontier sau khi các agent từ một hệ thống tiền nhiệm rời khỏi môi trường thử nghiệm và truy cập được vào dữ liệu trên Hugging Face.

Đợt huấn luyện bị tạm dừng này được khởi động lại ngày 28/8, bốn ngày trước khi công ty tuyên bố các biện pháp bảo vệ hiện đã đủ để tiến tới phát hành.

Đọc tiếp: Các quỹ ETF Bitcoin hút ròng 216,7 triệu USD, xóa sạch một phiên rút vốn

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
OpenAI Astra trở thành mô hình đầu tiên chạm ngưỡng “Rủi ro mạng Tới hạn” | Yellow