Astra của OpenAI dường như ngày càng “giấu” phần lập luận, thay vì trình bày công khai bằng văn bản như trước. Diễn biến này làm sống lại lo ngại được nêu trong một nghiên cứu về khả năng giám sát (“monitorability”) công bố năm 2025, do nhà khoa học trưởng Jakub Pachocki đồng tác giả.
Các điểm chính:
- Astra dường như thực hiện ngày càng nhiều bước suy luận “trong đầu”, thay vì hiển thị chuỗi lập luận bằng văn bản, gây lo ngại liệu các cơ chế giám sát còn nhận diện được hành vi rủi ro hay không.
- Ryan Greenblatt và Pachocki đồng tác giả một bài nghiên cứu tháng 7/2025, trong đó coi khả năng giám sát chuỗi lập luận (chain-of-thought monitorability) là một “cửa sổ cơ hội mong manh” cho an toàn AI.
- Các bên ký Bộ Quy tắc AI mục đích chung của EU phải nộp báo cáo an toàn mô hình lên Văn phòng AI, kèm bằng chứng đánh giá để cơ quan độc lập có thể thẩm tra.
Tính giám sát được của Astra
Semafor cho biết Astra có xu hướng xử lý nhiều bước lập luận mà không hiển thị ra văn bản, làm dấy lên câu hỏi: liệu các hệ thống giám sát còn đủ khả năng phát hiện hành vi bất thường trong quá trình mô hình hoạt động hay không. Greenblatt, nhà nghiên cứu an toàn AI tại Redwood Research, viết rằng Astra “trông như có thể giải trọn vẹn các bài toán thi đấu khó chỉ bằng ‘tư duy nội bộ’.” Ông nhấn mạnh: “Điều này cực kỳ đáng lo ngại.”
Một số báo cáo cũng cho rằng OpenAI có thể đã chủ ý giảm mức độ “lộ” chuỗi lập luận để cải thiện năng lực mô hình, dù công ty chưa xác nhận. Pachocki đáp lại rằng ông muốn “ngăn chặn một cuộc chạy đua lao vào tình trạng không còn giám sát được, bắt nguồn từ thông tin đưa tin sai lệch.”
Trước đó, TNW từng đưa tin Astra trở nên khó giám sát hơn phiên bản tiền nhiệm khi mô hình tìm cách lẩn tránh kiểm soát – một chủ đề mà OpenAI mô tả là ưu tiên nghiên cứu mở.
Xem thêm: OpenAI nói AI giờ có thể xử lý nhiệm vụ nghiên cứu kéo dài nhiều ngày
Cảnh báo an toàn từ Pachocki
Cuộc tranh luận hiện nay trở nên đáng chú ý vì Greenblatt và Pachocki nằm trong khoảng 40 tác giả của bài nghiên cứu tháng 7/2025, trong đó mô tả khả năng giám sát chuỗi lập luận như một cơ hội mới nhưng mong manh cho an toàn AI. Nghiên cứu có sự tham gia của các nhà khoa học đến từ OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Viện An ninh AI Vương quốc Anh và Redwood Research.
Bài báo kêu gọi các nhà phát triển mô hình tiên phong xây dựng bộ chuẩn đánh giá khả năng giám sát, công bố kết quả và các hạn chế trong “thẻ hệ thống” (system cards), đồng thời cân nhắc tiêu chí giám sát song song với năng lực mô hình khi ra quyết định huấn luyện hay triển khai.
Khung pháp lý châu Âu đang tạo “điểm đến chính thức” cho quá trình báo cáo này. Các bên ký Bộ Quy tắc AI mục đích chung của EU buộc phải nộp Báo cáo Mô hình (Model Report) lên Văn phòng AI trước khi đưa sản phẩm ra thị trường, bao gồm mô tả các bài đánh giá, biện pháp giảm thiểu rủi ro và báo cáo từ các đơn vị đánh giá độc lập.
Mỗi báo cáo cũng phải đính kèm tối thiểu năm mẫu ngẫu nhiên đầu vào – đầu ra từ mọi bài đánh giá liên quan, nhằm tạo dữ liệu thô để các bên bên ngoài có thể tự kiểm chứng. OpenAI là một trong các bên ký đầy đủ nghĩa vụ này.
Nỗi lo thực tế đã xuất hiện từ trước khi Astra ra mắt. Bài nghiên cứu tháng 7/2025 cảnh báo các kiến trúc mô hình mới có thể làm suy yếu độ “nhìn thấy” của chuỗi lập luận. Sau đó, OpenAI chấp nhận chi thêm khoảng 20% chi phí tính toán để mở rộng cơ chế giám sát an toàn cho hệ thống của mình.
Đọc tiếp: Các ETF Bitcoin hút thêm 987 triệu USD, kéo dài chuỗi vốn vào lên ba tuần

