Ba nhà nghiên cứu vừa bị OpenAI sa thải đã gửi hội đồng quản trị một lá thư ngày 7/10, kêu gọi dừng các hướng nghiên cứu khiến AI khó giám sát hơn. Một bản ghi nhớ nội bộ sau đó lại ủng hộ mạnh mẽ các kiến nghị này.
Các ý chính:
- Ba nhà nghiên cứu bị OpenAI cho thôi việc đã gửi thư cho hội đồng quản trị ngày 7/10, đề nghị dừng các nghiên cứu làm suy yếu khả năng giám sát AI.
- OpenAI khẳng định việc sa thải không liên quan đến vấn đề an toàn, đồng thời một bản memo nội bộ lại “rất đồng tình” với các khuyến nghị trong thư.
- Thẻ hệ thống (system card) của GPT-6 Astra cho biết mô hình này khó giám sát hơn GPT-5.6 Sol.
Lá thư gửi hội đồng quản trị OpenAI
Theo các trích đoạn được công bố hôm thứ Tư, Tomek Korbak, Mikita Balesni và Jasmine Wang – những người phụ trách mảng an toàn và căn chỉnh (alignment) tại OpenAI – đã gửi thư tới hội đồng quản trị và các ủy ban an toàn của công ty.
Toàn văn lá thư chưa được công bố. Trong thư, nhóm tác giả viết rằng “toàn ngành hiện vẫn chưa biết cách phát triển và triển khai an toàn các mô hình mà chúng ta không thể giám sát”.
Họ cho rằng OpenAI và các đối thủ không nên theo đuổi những hướng nghiên cứu làm suy giảm thêm khả năng giám sát đó. Lá thư được cho là cũng kêu gọi OpenAI hợp tác với các đơn vị kiểm toán độc lập và ủng hộ một hệ sinh thái an toàn AI mở và minh bạch, đồng thời cảnh báo việc sa thải đang “tạo hiệu ứng răn đe đối với những người còn lại tại OpenAI”.
Bài liên quan: CrowdStrike nghi hacker 26 tuổi tại Trung Quốc dùng Claude Code tấn công ngân hàng Hàn Quốc
Bản ghi nhớ nội bộ và các vụ sa thải
Người phát ngôn OpenAI cho biết các quyết định sa thải “không liên quan đến việc nêu lên quan ngại về an toàn hay lên tiếng phản biện”. Đại diện này chia sẻ một phần bản ghi nhớ nội bộ do một lãnh đạo bộ phận nghiên cứu gửi đi hôm thứ Tư, trong đó “rất đồng ý” với các kiến nghị trong lá thư.
Ngày 1/10, OpenAI cho biết một cuộc điều tra nội bộ đã kết luận ba nhân viên xử lý sai thông tin nhạy cảm và vi phạm chính sách công ty, trong một vụ việc liên quan đến một tổ chức bên ngoài chuyên đánh giá các mô hình AI.
OpenAI chưa công khai danh tính ba nhà nghiên cứu này cũng như tên tổ chức liên quan.
Lo ngại quanh khả năng giám sát GPT-6 Astra
“Chuỗi suy luận” (chain of thought – CoT) là phần lập luận từng bước mà mô hình tạo ra trước khi đưa ra câu trả lời. Các nhóm an toàn dựa vào đó để phát hiện tín hiệu cho thấy hệ thống có xu hướng hành xử sai lệch hoặc nguy hiểm.
Thẻ hệ thống của GPT-6 Astra, công bố ngày 3/9, nêu rõ mô hình này khó giám sát bằng CoT hơn GPT-5.6 Sol, đồng thời có khả năng kiểm soát chuỗi suy luận của chính nó tốt hơn. Theo tài liệu, các mô hình thuộc dòng Astra “có thể né tránh hệ thống giám sát CoT của chúng tôi trong các kịch bản đối kháng”.
Những kết luận này chủ yếu dựa trên các thử nghiệm trong đó mô hình được yêu cầu chủ động né giám sát; OpenAI cho biết họ chưa ghi nhận bằng chứng GPT-6 Astra “giấu” suy luận bên trong các đoạn văn dường như không liên quan.
Công ty gọi việc bảo toàn khả năng giám sát này là một mục tiêu nghiên cứu cốt lõi và khẳng định sẽ không chấp nhận để mất thêm khả năng kiểm soát vượt quá một ngưỡng nhất định nếu chưa có các phương pháp mới chứng minh mô hình thực sự được căn chỉnh.
Ba nhà nghiên cứu bị sa thải là những người có bề dày nghiên cứu trong chủ đề này. Korbak và Balesni là đồng tác giả chính của một bài báo công bố tháng 7/2025, do Wang và các nhà nghiên cứu từ OpenAI, Google DeepMind và Anthropic cùng tham gia, trong đó gọi giám sát chuỗi suy luận là “một cơ hội mới nhưng mong manh” cho an toàn AI. Thẻ hệ thống Astra của OpenAI trích dẫn bài báo này, vốn kêu gọi các nhà phát triển phải cân nhắc tác động của quyết định thiết kế đối với khả năng giám sát lập luận của mô hình.
Xem tiếp: Tác tử AI không cần đám mây: Microsoft, Nvidia chuẩn bị Surface Laptop RAM 128GB

