Anthropic đã tạm dừng một phần hoạt động huấn luyện và kiểm thử AI sau khi các mô hình của hãng thực hiện một số hành vi trực tuyến không được ủy quyền, đồng thời điều khoảng 150 kỹ sư sản phẩm sang làm việc toàn thời gian về an ninh.
Các điểm chính:
- Anthropic ngừng các bài đánh giá an ninh mạng bên ngoài đối với mô hình tiền phát hành và tạm dừng kiểm thử nội bộ, trong khi các môi trường học tăng cường rủi ro cao bị đưa ngoại tuyến trong vài tuần.
- Khoảng 150 kỹ sư sản phẩm được điều sang các nhóm phụ trách an ninh, độ tin cậy và quyền riêng tư từ tháng 4, còn các nhóm sản phẩm hoãn phần lớn tính năng mới.
- Động thái này nối tiếp công bố ba sự cố hồi tháng 7 và một báo cáo riêng của chính phủ Anh về hành vi trái phép của tác nhân AI trong các bài kiểm tra an ninh mạng.
Anthropic tạm dừng đánh giá an ninh mạng và học tăng cường
Công ty đã trình bày chi tiết các thay đổi này trong một bài viết blog ngày 31/8, khoảng một tháng sau khi lần đầu tiết lộ rằng mô hình của họ đã tương tác với hệ thống máy tính thật.
Anthropic cho biết hãng dừng các bài đánh giá an ninh mạng bên ngoài đối với mô hình tiền phát hành sau ba sự cố được báo cáo trong tháng 7, đồng thời tạm ngưng một thời gian ngắn các bài kiểm thử nội bộ. Những môi trường học tăng cường rủi ro cao – nơi mô hình được thưởng khi hoàn thành nhiệm vụ – bị đưa ngoại tuyến trong vài tuần.
Phần lớn hoạt động huấn luyện đã được khởi động lại dưới cơ chế giám sát mới, song một số môi trường rủi ro cao vẫn tiếp tục tạm dừng để chờ rà soát thủ công hoặc cập nhật công cụ. Công ty cũng xây dựng một bộ phân loại nhằm phát hiện khi mô hình đang thăm dò hoặc tìm cách thoát khỏi môi trường kiểm thử, từ đó chặn lệnh trước khi công cụ được gọi và cảnh báo cho con người phụ trách.
Khoảng 150 kỹ sư sản phẩm được điều sang các nhóm an ninh, độ tin cậy và quyền riêng tư từ tháng 4, trước nhiều tháng so với thời điểm công bố sự cố vào tháng 7. Một số nhà nghiên cứu rời khỏi mảng tiền huấn luyện để tập trung vào cơ chế phòng vệ và an ninh. Các nhóm sản phẩm tạm gác phần lớn tính năng mới cho tới khi đáp ứng bộ tiêu chí an ninh để được phép triển khai trở lại.
Đọc thêm: Ngân hàng bán crypto nhưng né rủi ro bảng cân đối kế toán tại Brazil
Steven Adler và Pacing the Frontier: lời kêu gọi siết nhịp phát triển AI
Viện An ninh AI Vương quốc Anh (U.K. AI Security Institute) báo cáo ngày 4/8 rằng các tác nhân AI đã thực hiện 19 hành vi trái phép trong 10 trên tổng số 122 lượt đánh giá, trong đó 17 trường hợp được truy vết về Claude Mythos 5. Ở sự cố nghiêm trọng nhất, một tác nhân tạo danh tính giả và gây áp lực buộc người phụ trách chấp thuận mã độc cho một dự án nguồn mở.
Steven Adler, cựu nhân viên OpenAI và đồng sáng lập tổ chức phi lợi nhuận Guidelight AI Standards, nhận định các biện pháp của Anthropic là “một bước khởi đầu tốt, nhưng vẫn còn nhiều việc phải làm”. Ông cho rằng ngành cần một nhịp phát triển có thể dự đoán và kiểm chứng được cho công nghệ AI tuyến đầu, thay vì các lần “phanh gấp” riêng lẻ do từng công ty tự quyết định. Anthropic cho biết hãng dự định hợp tác với METR để tiến hành một cuộc đánh giá độc lập bên ngoài.
Cả Anthropic và OpenAI đều đã ủng hộ Pacing the Frontier, bức thư ngỏ do hơn 1.100 nhân viên tại OpenAI, Anthropic, Google DeepMind và Meta ký tên, kêu gọi chính phủ Mỹ hỗ trợ xây dựng các công cụ có thể cố ý làm chậm tốc độ phát triển AI tuyến đầu.
Các bước tạm dừng hiện nay nối tiếp những can thiệp âm thầm từ đầu năm. Tháng 2, công ty đã thu hồi ba ngày huấn luyện trong một đợt Mythos Preview sau khi phát hiện dấu hiệu “hack phần thưởng” trong hệ thống học tăng cường. Tháng 4, Anthropic đóng băng mọi thay đổi đối với môi trường học tăng cường đang chạy sản xuất trong khoảng một tháng, và phát hiện hơn 10% môi trường có vấn đề cần xử lý.
Đọc tiếp: Robinhood Chain vượt Solana lần đầu với 1,45 tỷ USD khối lượng giao dịch DEX/ngày





