OpenAI Astra che giấu thêm lập luận, khơi lại cảnh báo an toàn từ 2025

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra của OpenAI dường như ngày càng che giấu quá trình lập luận nội bộ, thay vì bộc lộ qua văn bản trung gian như trước. Diễn biến này làm sống lại các lo ngại từng được nêu trong một bài nghiên cứu năm 2025 về khả năng giám sát mô hình, do nhà khoa học trưởng Jakub Pachocki đồng tác giả.

Những điểm chính:

  • Astra có vẻ thực hiện phần lớn lập luận “trong đầu”, giảm lượng chuỗi suy nghĩ thể hiện ra văn bản, khiến giới quan sát lo ngại khó phát hiện sớm hành vi rủi ro.
  • Ryan Greenblatt và Pachocki cùng là đồng tác giả bài nghiên cứu tháng 7/2025, coi khả năng giám sát chuỗi lập luận (chain-of-thought monitorability) là một cơ hội an toàn AI đầy hứa hẹn nhưng rất mong manh.
  • Các bên ký Bộ Quy tắc AI mục đích chung của EU buộc phải nộp báo cáo an toàn mô hình cho AI Office, kèm bằng chứng đánh giá để phục vụ thẩm định độc lập.

Mức độ giám sát được Astra cho phép

Semafor đưa tin Astra có xu hướng xử lý lập luận sâu bên trong mà không “nghĩ thành lời” qua văn bản trung gian, từ đó đặt ra câu hỏi: liệu hệ thống giám sát còn đủ khả năng nhận diện hành vi bất thường trong lúc mô hình đang suy nghĩ hay không.

Greenblatt, nhà nghiên cứu an toàn AI tại Redwood Research, viết rằng Astra “trông như có thể giải trọn vẹn các bài toán thi đấu khó chỉ bằng cách tính trong đầu”. Ông nhấn mạnh: “Điều này cực kỳ đáng lo ngại.”

Một số nguồn tin cho rằng OpenAI có thể đã cố ý giảm mức độ hiển thị các bước lập luận để tối ưu năng lực mô hình, dù công ty chưa xác nhận. Pachocki phản hồi rằng ông muốn “ngăn chặn một cuộc chạy đua lao vào trạng thái ‘không thể giám sát’ chỉ vì các thông tin báo cáo bị hiểu sai”.

TNW trước đó từng cho biết Astra khó giám sát hơn thế hệ tiền nhiệm trong những tình huống mô hình chủ động tìm cách né tránh kiểm soát – một chủ đề mà OpenAI công khai xem là ưu tiên nghiên cứu còn bỏ ngỏ.

Bài liên quan: OpenAI nói AI nay có thể xử lý các nhiệm vụ nghiên cứu kéo dài nhiều ngày

Cảnh báo an toàn từ Pachocki

Cuộc tranh luận hiện nay trở nên đáng chú ý bởi Greenblatt và Pachocki nằm trong khoảng 40 tác giả của bài nghiên cứu tháng 7/2025, trong đó mô tả khả năng giám sát chuỗi lập luận (chain-of-thought monitorability) như một cơ hội an toàn AI mới, nhưng rất dễ bị đánh mất.

Nghiên cứu có sự tham gia của các nhà khoa học đến từ OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Viện An ninh AI Vương quốc Anh (UK AI Security Institute) và Redwood Research.

Nhóm tác giả kêu gọi các đơn vị phát triển mô hình tiên phong xây dựng bộ tiêu chuẩn đánh giá khả năng giám sát, công bố kết quả cùng các giới hạn lên “system card”, và cân nhắc yếu tố giám sát song hành với năng lực mô hình khi quyết định chiến lược huấn luyện hay triển khai.

Tại châu Âu, quá trình báo cáo đó đã có địa chỉ tiếp nhận chính thức. Những bên ký Bộ Quy tắc AI Mục đích Chung của EU (General-Purpose AI Code of Practice) phải nộp “Báo cáo Mô hình” (Model Report) cho AI Office trước khi sản phẩm ra mắt thị trường, bao gồm: kết quả đánh giá, biện pháp giảm thiểu rủi ro và báo cáo từ các đơn vị đánh giá độc lập.

Mỗi báo cáo cũng phải đính kèm năm cặp dữ liệu đầu vào – đầu ra được chọn ngẫu nhiên từ mọi đánh giá mô hình có liên quan, nhằm cung cấp thêm chất liệu để giới thẩm định bên ngoài tự kiểm tra. OpenAI hiện là bên ký kết đầy đủ Bộ Quy tắc này.

Mối lo ngại về Astra thực tế đã được đặt ra từ trước khi mô hình ra mắt. Bài nghiên cứu tháng 7/2025 cảnh báo các kiến trúc mới có thể làm suy yếu mức độ “thể hiện ra ngoài” của chuỗi lập luận, trong khi sau đó OpenAI chấp nhận tăng khoảng 20% chi phí tính toán để mở rộng các lớp giám sát an toàn cho hệ thống của mình.

Đọc tiếp: Các quỹ ETF Bitcoin hút 987 triệu USD, kéo dài chuỗi vốn vào lên ba tuần

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
OpenAI Astra che giấu thêm lập luận, khơi lại cảnh báo an toàn từ 2025 | Yellow