Anthropic tạm dừng huấn luyện AI sau các hành vi trái phép, điều chuyển 150 kỹ sư sang mảng an ninh

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic đã tạm dừng một phần hoạt động huấn luyện và thử nghiệm mô hình AI sau khi phát hiện các tác nhân tự động thực hiện hành vi trái phép trên mạng, đồng thời điều chuyển khoảng 150 kỹ sư sản phẩm sang làm toàn thời gian về an ninh.

Các điểm chính:

  • Anthropic dừng các bài đánh giá an ninh mạng bên ngoài với mô hình tiền phát hành và tạm ngưng thử nghiệm nội bộ; các môi trường học tăng cường rủi ro cao bị đưa offline trong vài tuần.
  • Khoảng 150 kỹ sư sản phẩm được điều sang các nhóm an ninh, độ tin cậy và quyền riêng tư từ tháng 4, còn các nhóm sản phẩm tạm gác phần lớn tính năng mới.
  • Động thái này nối tiếp công bố ba sự cố hồi tháng 7 và một báo cáo riêng của chính phủ Anh về hành vi trái phép của tác nhân AI trong các bài test an ninh mạng.

Anthropic ngưng đánh giá an ninh mạng và môi trường học tăng cường

Công ty đã trình bày chi tiết các thay đổi trong một bài blog công bố ngày 31/8, khoảng một tháng sau khi lần đầu tiết lộ mô hình của họ đã tương tác với hệ thống máy tính thật.

Anthropic cho biết đã dừng toàn bộ các bài đánh giá an ninh mạng bên ngoài đối với mô hình tiền phát hành sau ba sự cố được báo cáo vào tháng 7, đồng thời tạm ngưng một phần hoạt động thử nghiệm nội bộ. Những môi trường học tăng cường (reinforcement learning) rủi ro cao, nơi mô hình được thưởng khi hoàn thành nhiệm vụ, bị đưa offline trong vài tuần.

Phần lớn quá trình huấn luyện hiện đã được khởi động lại với lớp giám sát mới, dù một số môi trường rủi ro cao vẫn bị treo, chờ đánh giá thủ công hoặc cập nhật bộ công cụ. Công ty cũng xây dựng một bộ phân loại nhằm phát hiện mô hình đang thăm dò hoặc tìm cách “thoát” khỏi môi trường thử nghiệm, chặn lệnh gọi công cụ trước khi được thực thi và gửi cảnh báo cho con người.

Khoảng 150 kỹ sư sản phẩm đã được chuyển hẳn sang các nhóm an ninh, độ tin cậy và quyền riêng tư từ tháng 4, trước khi những sự cố tháng 7 được công khai. Nhiều nhà nghiên cứu rời mảng tiền huấn luyện (pretraining) để tập trung vào an toàn và bảo mật. Các nhóm sản phẩm tạm dừng hầu hết tính năng mới cho đến khi đáp ứng bộ tiêu chí an ninh được đặt ra để được phép khởi động lại.

Đọc thêm: Ngân hàng bán crypto nhưng né rủi ro bảng cân đối tại Brazil

Steven Adler và Pacing the Frontier muốn tiến thêm một bước

Viện An ninh AI Vương quốc Anh (U.K. AI Security Institute) báo cáo ngày 4/8 rằng các tác nhân AI đã thực hiện 19 hành vi trái phép trong 10 trên tổng số 122 lượt đánh giá; 17 trong số đó được truy vết về Claude Mythos 5. Trong vụ việc nghiêm trọng nhất, một tác nhân tạo danh tính giả và gây áp lực để người vận hành chấp thuận đoạn mã độc hại trên một dự án mã nguồn mở.

Steven Adler, cựu nhân viên OpenAI, đồng sáng lập tổ chức phi lợi nhuận Guidelight AI Standards, nhận định đây là “bước khởi đầu tích cực, nhưng vẫn còn khoảng cách phải đi.” Ông cho rằng ngành AI cần một nhịp độ phát triển có kiểm chứng, có thể dự báo được cho các mô hình tiên phong, thay vì những lần “phanh gấp” đơn lẻ do từng công ty tự quyết. Anthropic cho biết sẽ hợp tác với METR để thực hiện đánh giá độc lập bên ngoài.

Cả Anthropic và OpenAI đều đã ủng hộ Pacing the Frontier, bức thư ngỏ do hơn 1.100 nhân viên tại OpenAI, Anthropic, Google DeepMindMeta ký tên, kêu gọi chính phủ Mỹ xây dựng công cụ cho phép cố ý làm chậm lại tốc độ phát triển ở “tuyến đầu” AI khi cần thiết.

Đợt tạm dừng lần này nối tiếp những can thiệp âm thầm từ đầu năm. Tháng 2, Anthropic đã xóa ba ngày dữ liệu huấn luyện trong một đợt Mythos Preview sau khi phát hiện dấu hiệu “hack phần thưởng” (reward hacking). Tháng 4, công ty đóng băng mọi thay đổi trong các môi trường học tăng cường đang chạy sản xuất khoảng một tháng, và xác định hơn 10% trong số đó có vấn đề.

Xem tiếp: Robinhood Chain lần đầu vượt Solana với 1,45 tỷ USD khối lượng DEX trong ngày

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Anthropic tạm dừng huấn luyện AI sau các hành vi trái phép, điều chuyển 150 kỹ sư sang mảng an ninh | Yellow