Astra của OpenAI dường như ngày càng che giấu quá trình lập luận nội bộ, thay vì bộc lộ qua văn bản trung gian như trước. Diễn biến này làm sống lại các lo ngại từng được nêu trong một bài nghiên cứu năm 2025 về khả năng giám sát mô hình, do nhà khoa học trưởng Jakub Pachocki đồng tác giả.
Những điểm chính:
- Astra có vẻ thực hiện phần lớn lập luận “trong đầu”, giảm lượng chuỗi suy nghĩ thể hiện ra văn bản, khiến giới quan sát lo ngại khó phát hiện sớm hành vi rủi ro.
- Ryan Greenblatt và Pachocki cùng là đồng tác giả bài nghiên cứu tháng 7/2025, coi khả năng giám sát chuỗi lập luận (chain-of-thought monitorability) là một cơ hội an toàn AI đầy hứa hẹn nhưng rất mong manh.
- Các bên ký Bộ Quy tắc AI mục đích chung của EU buộc phải nộp báo cáo an toàn mô hình cho AI Office, kèm bằng chứng đánh giá để phục vụ thẩm định độc lập.
Mức độ giám sát được Astra cho phép
Semafor đưa tin Astra có xu hướng xử lý lập luận sâu bên trong mà không “nghĩ thành lời” qua văn bản trung gian, từ đó đặt ra câu hỏi: liệu hệ thống giám sát còn đủ khả năng nhận diện hành vi bất thường trong lúc mô hình đang suy nghĩ hay không.
Greenblatt, nhà nghiên cứu an toàn AI tại Redwood Research, viết rằng Astra “trông như có thể giải trọn vẹn các bài toán thi đấu khó chỉ bằng cách tính trong đầu”. Ông nhấn mạnh: “Điều này cực kỳ đáng lo ngại.”
Một số nguồn tin cho rằng OpenAI có thể đã cố ý giảm mức độ hiển thị các bước lập luận để tối ưu năng lực mô hình, dù công ty chưa xác nhận. Pachocki phản hồi rằng ông muốn “ngăn chặn một cuộc chạy đua lao vào trạng thái ‘không thể giám sát’ chỉ vì các thông tin báo cáo bị hiểu sai”.
TNW trước đó từng cho biết Astra khó giám sát hơn thế hệ tiền nhiệm trong những tình huống mô hình chủ động tìm cách né tránh kiểm soát – một chủ đề mà OpenAI công khai xem là ưu tiên nghiên cứu còn bỏ ngỏ.
Bài liên quan: OpenAI nói AI nay có thể xử lý các nhiệm vụ nghiên cứu kéo dài nhiều ngày
Cảnh báo an toàn từ Pachocki
Cuộc tranh luận hiện nay trở nên đáng chú ý bởi Greenblatt và Pachocki nằm trong khoảng 40 tác giả của bài nghiên cứu tháng 7/2025, trong đó mô tả khả năng giám sát chuỗi lập luận (chain-of-thought monitorability) như một cơ hội an toàn AI mới, nhưng rất dễ bị đánh mất.
Nghiên cứu có sự tham gia của các nhà khoa học đến từ OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Viện An ninh AI Vương quốc Anh (UK AI Security Institute) và Redwood Research.
Nhóm tác giả kêu gọi các đơn vị phát triển mô hình tiên phong xây dựng bộ tiêu chuẩn đánh giá khả năng giám sát, công bố kết quả cùng các giới hạn lên “system card”, và cân nhắc yếu tố giám sát song hành với năng lực mô hình khi quyết định chiến lược huấn luyện hay triển khai.
Tại châu Âu, quá trình báo cáo đó đã có địa chỉ tiếp nhận chính thức. Những bên ký Bộ Quy tắc AI Mục đích Chung của EU (General-Purpose AI Code of Practice) phải nộp “Báo cáo Mô hình” (Model Report) cho AI Office trước khi sản phẩm ra mắt thị trường, bao gồm: kết quả đánh giá, biện pháp giảm thiểu rủi ro và báo cáo từ các đơn vị đánh giá độc lập.
Mỗi báo cáo cũng phải đính kèm năm cặp dữ liệu đầu vào – đầu ra được chọn ngẫu nhiên từ mọi đánh giá mô hình có liên quan, nhằm cung cấp thêm chất liệu để giới thẩm định bên ngoài tự kiểm tra. OpenAI hiện là bên ký kết đầy đủ Bộ Quy tắc này.
Mối lo ngại về Astra thực tế đã được đặt ra từ trước khi mô hình ra mắt. Bài nghiên cứu tháng 7/2025 cảnh báo các kiến trúc mới có thể làm suy yếu mức độ “thể hiện ra ngoài” của chuỗi lập luận, trong khi sau đó OpenAI chấp nhận tăng khoảng 20% chi phí tính toán để mở rộng các lớp giám sát an toàn cho hệ thống của mình.
Đọc tiếp: Các quỹ ETF Bitcoin hút 987 triệu USD, kéo dài chuỗi vốn vào lên ba tuần





