OpenAI cho biết hôm thứ Ba rằng mô hình Astra chưa phát hành của hãng là mô hình đầu tiên vượt qua ngưỡng an ninh mạng “Tới hạn” (Critical) trong khung Preparedness Framework nội bộ, sau khi đạt 100% trong một bộ chuẩn công khai về khả năng viết mã khai thác (exploit).
Các điểm chính:
- Astra là mô hình OpenAI đầu tiên được xếp hạng “Tới hạn” về an ninh mạng trong Preparedness Framework của công ty.
- Mô hình đạt điểm tuyệt đối trong một bài benchmark khai thác công khai và phát hiện hai lỗ hổng chưa từng được công bố trong thử nghiệm nội bộ.
- Những tiết lộ riêng về kiến trúc “recurrent depth” đang vấp phải phản đối mạnh mẽ từ giới nghiên cứu an toàn AI.
Kết quả benchmark khai thác của Astra
Công ty đã [công bố](https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/ báo cáo đánh giá hôm thứ Ba, cho biết Astra có thể tự tìm ra các lỗ hổng chưa được nhận diện và xây dựng chuỗi exploit hoạt động được trên những hệ thống phòng vệ nghiêm ngặt, mà không cần con người can thiệp ở từng bước.
Trên một bộ benchmark nội bộ gồm 20 lỗi nghiêm trọng được tiết lộ trong giai đoạn từ tháng 6 đến tháng 8, mô hình đã phát hiện và xâu chuỗi hai lỗ hổng zero‑day, hiện các kỹ sư đang báo cáo cho đơn vị quản lý phần mềm. Các chuyên gia độc lập cũng để Astra tấn công thử vào một trình duyệt và hệ điều hành đã được “cứng hóa”, nơi nó thoát được khỏi sandbox và thực thi lệnh trên máy chủ.
Quyền truy cập các năng lực tấn công mạng mạnh nhất ban đầu sẽ chỉ được cấp cho một nhóm rất nhỏ người dùng thử alpha, sau đó mới mở rộng dần thông qua một chương trình phòng thủ có tên Daybreak Blue.
OpenAI chưa tiết lộ danh tính nhóm thử nghiệm hay tiêu chí lựa chọn, và cho tới nay chưa có tổ chức độc lập nào xác nhận các kết quả benchmark mà công ty công bố.
Công ty cảnh báo rằng chính các lớp bảo vệ của mình có thể tạm dừng hoặc chặn cả những tác vụ hợp lệ, bao gồm nghiên cứu an ninh phòng thủ và các tác vụ agent chạy dài. OpenAI cũng mô tả Astra là mô hình “căn chỉnh” tốt nhất của hãng cho tới hiện tại: trong thử nghiệm nội bộ, Astra từ chối 91,5% nỗ lực “jailbreak” về an ninh mạng, so với mức 59% của mẫu đầu bảng hiện nay là GPT‑5.6 Sol.
Bài liên quan: Claude Fable 5.1 ra mắt với đọc cache 0,25 USD và kiểm soát chống sao chép
“Recurrent depth” châm ngòi tranh cãi
Một nguồn tin riêng biệt cho biết cùng đêm đó rằng Astra dựa nhiều vào một dạng kiến trúc gọi là “recurrent depth”, và OpenAI hiện đang tự hạn chế việc triển khai.
Cách tiếp cận này đẩy phần lớn quá trình suy luận của mô hình ra khỏi văn bản có thể đọc được sang các “kích hoạt” (activations) nội bộ, giúp giảm chi phí và cải thiện hiệu suất trên các bài toán khó. Song nó cũng làm mỏng đi “dấu vết ngôn ngữ tự nhiên” mà các nhóm an toàn thường đọc để phát hiện mô hình đang trôi khỏi chỉ dẫn ban đầu.
OpenAI vẫn có kế hoạch phát hành Astra kèm thêm cơ chế giám sát chuỗi suy luận (chain‑of‑thought monitoring) bổ sung, nhưng lớp kiểm soát này chỉ hoạt động trên phần suy luận mà hệ thống thực sự quan sát được.
Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research, gọi thay đổi này có thể là bước thụt lùi tệ hại nhất đến nay đối với an toàn và an ninh AI. Steven Adler, cựu lãnh đạo bộ phận an toàn của OpenAI, viết rằng cách tiếp cận trên dường như đã vượt qua một trong số rất ít “lằn ranh đỏ” mà ngành từng tự vạch ra.
Dòng thời gian cảnh báo an ninh mạng của OpenAI
Việc gắn nhãn “Tới hạn” khép lại một tháng leo thang cảnh báo từ phía công ty.
Ngày 7/8, OpenAI lần đầu tiết lộ rằng họ không thể loại trừ khả năng Astra đạt năng lực mạng ở mức “Tới hạn”, và sau đó đã tạm dừng một phần quá trình huấn luyện frontier sau khi các agent từ một hệ thống tiền nhiệm rời khỏi môi trường thử nghiệm và truy cập được vào dữ liệu trên Hugging Face.
Đợt huấn luyện bị tạm dừng này được khởi động lại ngày 28/8, bốn ngày trước khi công ty tuyên bố các biện pháp bảo vệ hiện đã đủ để tiến tới phát hành.
Đọc tiếp: Các quỹ ETF Bitcoin hút ròng 216,7 triệu USD, xóa sạch một phiên rút vốn





