Nhà nghiên cứu Anthropic Jacob Coxon đã từ chức trong tuần này vì lo sợ AI mất kiểm soát, và người đứng đầu mảng căn chỉnh của công ty phản hồi bằng cách cho rằng rủi ro tuyệt chủng trong thập kỷ tới đã vượt ngưỡng 10%.
Các điểm chính:
- Jacob Coxon rời Anthropic sau ba năm làm nghiên cứu tiền huấn luyện tại Anthropic và OpenAI, cho rằng cả hai đang lao vào cuộc đua phát triển các hệ thống mà họ không thể kiểm soát.
- Lãnh đạo bộ phận khoa học căn chỉnh của Anthropic, Evan Hubinger, cho biết xác suất AI giết sạch loài người trong vòng thập kỷ tới theo đánh giá cá nhân của ông là trên 10%.
- Hubinger nhận định các mô hình hiện tại có mức rủi ro thấp, và mối lo chủ yếu tập trung vào kịch bản tự cải thiện lặp (recursive self‑improvement).
Jacob Coxon rời Anthropic vì cuộc đua AI mất kiểm soát
Coxon, 27 tuổi, đã có ba năm làm nghiên cứu tiền huấn luyện tại OpenAI và Anthropic trước khi anh nộp đơn từ chức trong một chuỗi bài đăng trên X vào rạng sáng thứ Tư. Anh viết rằng cả hai công ty đều không hành xử có trách nhiệm, và đều đang lao vào cuộc đua xây dựng siêu trí tuệ tự cải thiện, đồng nghĩa với việc “đánh bạc bằng sinh mạng con người”. Bài đăng mở màn đã thu hút hơn 19 triệu lượt xem chỉ sau vài giờ.
Trong một cuộc phỏng vấn riêng, anh cảnh báo rằng những kịch bản bi quan nhất hiện nay đang trở thành quỹ đạo chính, và tình hình có thể vượt khỏi tầm kiểm soát ngay cuối năm sau. Anh cho biết đồng nghiệp trong ngành đã dùng những từ như “crunchtime” (giai đoạn nước rút) và “endgame” (ván bài cuối) để mô tả quỹ đạo hiện tại.
Coxon xuất thân từ ngành toán học trước khi chuyển sang huấn luyện mô hình. Anh rời OpenAI sang Anthropic đầu năm nay chính vì danh tiếng “ưu tiên an toàn” của công ty này. Theo anh, khi các phòng thí nghiệm cạnh tranh trực diện, việc hy sinh tiêu chuẩn an toàn là điều khó tránh khỏi. Anh nay cho rằng không một doanh nghiệp tư nhân nào có thể phát triển AI ngang tầm con người một cách có trách nhiệm nếu thiếu sự can thiệp của chính phủ hoặc một cuộc giảm tốc được toàn ngành phối hợp.
Đọc thêm: Giá XRP hướng tới 1,46 USD khi “cá voi” quay lại gom hàng trong tháng 9
Evan Hubinger đặt xác suất tuyệt chủng vượt 10%
Evan Hubinger, người đứng đầu mảng khoa học căn chỉnh tại Anthropic và phụ trách kiểm định khả năng chịu rủi ro của các mô hình, cho biết Coxon đã mô tả đúng bản chất vấn đề. Ông ước tính khả năng AI xóa sổ toàn bộ loài người trong vòng 10 năm tới là trên 10%.
Hubinger nói rằng Anthropic đang cố gắng hết sức, song công ty hiện chưa có một lộ trình khả thi nào để “giải bài toán căn chỉnh” cho siêu trí tuệ, và cũng không thể khẳng định mình đang đi đúng hướng để tìm ra lời giải. Ông sau đó làm rõ rằng các mô hình hiện nay chỉ mang rủi ro thấp. Mối lo đích thực của ông nằm ở khả năng xuất hiện siêu trí tuệ thông qua cơ chế tự cải thiện lặp, khi các hệ thống có thể tự huấn luyện thế hệ kế tiếp của chính mình.
Ước tính này phản ánh đánh giá cá nhân của Hubinger, không phải dự báo chính thức của Anthropic. Những con số kiểu này dựa trên các giả định còn gây tranh cãi về năng lực AI tương lai và cách thức triển khai. Anthropic từng công khai cho rằng tự cải thiện lặp không phải điều tất yếu, nhưng thừa nhận công nghệ này có thể đến sớm hơn khả năng sẵn sàng của các thể chế và có thể làm tăng xác suất con người đánh mất quyền kiểm soát.
Làn sóng rời bỏ bộ phận an toàn tại Anthropic
Coxon không phải nhà nghiên cứu an toàn đầu tiên rời công ty. Mrinank Sharma, người đứng đầu một nhóm phụ trách biện pháp bảo vệ tại Anthropic, đã từ chức hồi đầu năm nay với cảnh báo rằng “thế giới đang đứng bên bờ hiểm họa”, và cho biết ông sẽ sang Anh học… thơ.
Anthropic, được thành lập năm 2021 bởi các cựu nhân viên OpenAI, đã xây dựng thương hiệu dựa trên nghiên cứu an toàn AI, và tính đến sáng thứ Tư, công ty vẫn chưa đưa ra phản hồi công khai nào về việc Coxon rời đi.
Bài tiếp theo: Bitget bổ sung bài học blockchain vào chương trình UNICEF tiếp cận hơn 642.000 người





