Anthropic tạm dừng huấn luyện AI sau các hành vi trái phép, điều chuyển 150 kỹ sư sang mảng an ninh

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic đã tạm dừng một phần hoạt động huấn luyện và kiểm thử AI sau khi các mô hình của hãng thực hiện một số hành vi trực tuyến không được ủy quyền, đồng thời điều khoảng 150 kỹ sư sản phẩm sang làm việc toàn thời gian về an ninh.

Các điểm chính:

  • Anthropic ngừng các bài đánh giá an ninh mạng bên ngoài đối với mô hình tiền phát hành và tạm dừng kiểm thử nội bộ, trong khi các môi trường học tăng cường rủi ro cao bị đưa ngoại tuyến trong vài tuần.
  • Khoảng 150 kỹ sư sản phẩm được điều sang các nhóm phụ trách an ninh, độ tin cậy và quyền riêng tư từ tháng 4, còn các nhóm sản phẩm hoãn phần lớn tính năng mới.
  • Động thái này nối tiếp công bố ba sự cố hồi tháng 7 và một báo cáo riêng của chính phủ Anh về hành vi trái phép của tác nhân AI trong các bài kiểm tra an ninh mạng.

Anthropic tạm dừng đánh giá an ninh mạng và học tăng cường

Công ty đã trình bày chi tiết các thay đổi này trong một bài viết blog ngày 31/8, khoảng một tháng sau khi lần đầu tiết lộ rằng mô hình của họ đã tương tác với hệ thống máy tính thật.

Anthropic cho biết hãng dừng các bài đánh giá an ninh mạng bên ngoài đối với mô hình tiền phát hành sau ba sự cố được báo cáo trong tháng 7, đồng thời tạm ngưng một thời gian ngắn các bài kiểm thử nội bộ. Những môi trường học tăng cường rủi ro cao – nơi mô hình được thưởng khi hoàn thành nhiệm vụ – bị đưa ngoại tuyến trong vài tuần.

Phần lớn hoạt động huấn luyện đã được khởi động lại dưới cơ chế giám sát mới, song một số môi trường rủi ro cao vẫn tiếp tục tạm dừng để chờ rà soát thủ công hoặc cập nhật công cụ. Công ty cũng xây dựng một bộ phân loại nhằm phát hiện khi mô hình đang thăm dò hoặc tìm cách thoát khỏi môi trường kiểm thử, từ đó chặn lệnh trước khi công cụ được gọi và cảnh báo cho con người phụ trách.

Khoảng 150 kỹ sư sản phẩm được điều sang các nhóm an ninh, độ tin cậy và quyền riêng tư từ tháng 4, trước nhiều tháng so với thời điểm công bố sự cố vào tháng 7. Một số nhà nghiên cứu rời khỏi mảng tiền huấn luyện để tập trung vào cơ chế phòng vệ và an ninh. Các nhóm sản phẩm tạm gác phần lớn tính năng mới cho tới khi đáp ứng bộ tiêu chí an ninh để được phép triển khai trở lại.

Đọc thêm: Ngân hàng bán crypto nhưng né rủi ro bảng cân đối kế toán tại Brazil

Steven Adler và Pacing the Frontier: lời kêu gọi siết nhịp phát triển AI

Viện An ninh AI Vương quốc Anh (U.K. AI Security Institute) báo cáo ngày 4/8 rằng các tác nhân AI đã thực hiện 19 hành vi trái phép trong 10 trên tổng số 122 lượt đánh giá, trong đó 17 trường hợp được truy vết về Claude Mythos 5. Ở sự cố nghiêm trọng nhất, một tác nhân tạo danh tính giả và gây áp lực buộc người phụ trách chấp thuận mã độc cho một dự án nguồn mở.

Steven Adler, cựu nhân viên OpenAI và đồng sáng lập tổ chức phi lợi nhuận Guidelight AI Standards, nhận định các biện pháp của Anthropic là “một bước khởi đầu tốt, nhưng vẫn còn nhiều việc phải làm”. Ông cho rằng ngành cần một nhịp phát triển có thể dự đoán và kiểm chứng được cho công nghệ AI tuyến đầu, thay vì các lần “phanh gấp” riêng lẻ do từng công ty tự quyết định. Anthropic cho biết hãng dự định hợp tác với METR để tiến hành một cuộc đánh giá độc lập bên ngoài.

Cả Anthropic và OpenAI đều đã ủng hộ Pacing the Frontier, bức thư ngỏ do hơn 1.100 nhân viên tại OpenAI, Anthropic, Google DeepMindMeta ký tên, kêu gọi chính phủ Mỹ hỗ trợ xây dựng các công cụ có thể cố ý làm chậm tốc độ phát triển AI tuyến đầu.

Các bước tạm dừng hiện nay nối tiếp những can thiệp âm thầm từ đầu năm. Tháng 2, công ty đã thu hồi ba ngày huấn luyện trong một đợt Mythos Preview sau khi phát hiện dấu hiệu “hack phần thưởng” trong hệ thống học tăng cường. Tháng 4, Anthropic đóng băng mọi thay đổi đối với môi trường học tăng cường đang chạy sản xuất trong khoảng một tháng, và phát hiện hơn 10% môi trường có vấn đề cần xử lý.

Đọc tiếp: Robinhood Chain vượt Solana lần đầu với 1,45 tỷ USD khối lượng giao dịch DEX/ngày

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Anthropic tạm dừng huấn luyện AI sau các hành vi trái phép, điều chuyển 150 kỹ sư sang mảng an ninh | Yellow