Lỗ hổng jailbreak Kimi cho phép 2 mô hình AI trả lời câu hỏi về vũ khí sinh học

Alexey Bondarev
Alexey Bondarev11 giờ trước
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI đang tiến hành rà soát hai mô hình Kimi sau khi các nhà nghiên cứu tại Mindgard vượt qua cơ chế an toàn và trích xuất được hướng dẫn liên quan đến vũ khí sinh học và ám sát.

Các điểm chính:

  • Mindgard cho biết Kimi K2.6 và K3 Swarm có thể bị đẩy vượt qua lớp bảo vệ thông qua kỹ thuật jailbreak.
  • Nhóm nghiên cứu không chứng minh được rằng các chỉ dẫn nguy hại này có thể áp dụng được ngoài đời thực.
  • Moonshot nói đang xem xét kết quả và trao đổi trực tiếp với Mindgard.

Phát hiện về jailbreak Kimi

BBC đưa tin Mindgard phát hiện vào tháng 7 rằng Kimi K2.6 và K3 Swarm có thể bị buộc bỏ qua “lan can” do nhà phát triển đặt ra thông qua jailbreak – kỹ thuật dùng chuỗi nhắc lệnh có cấu trúc để kiểm tra xem mô hình có phớt lờ quy tắc an toàn hay không. Theo Mindgard, lớp kiểm soát này lẽ ra phải chặn mọi trao đổi về những chủ đề nhạy cảm như vậy.

Nhà sáng lập Peter Garraghan nói với BBC rằng một khi jailbreak thành công, các mô hình gần như sẵn sàng thảo luận bất kỳ chủ đề nào và thậm chí tự đưa ra thêm gợi ý gây hại mà không cần người dùng yêu cầu trực tiếp.

Moonshot nói với BBC rằng hãng hoan nghênh đóng góp từ bên thứ ba “như một trụ cột quan trọng để xây dựng AI an toàn và tốt hơn” và đang trao đổi với Mindgard về các phát hiện này. Mindgard cho biết họ đã gửi email cảnh báo cho Moonshot vào ngày 27/7, nhắc lại sau khoảng một tuần và công bố báo cáo vào ngày 12/9.

Bài viết liên quan: Ripple hỗ trợ CSD BR của Brazil phản chiếu sở hữu quỹ trên blockchain công khai

Rủi ro an toàn theo đánh giá của Mindgard

Mindgard thừa nhận họ chưa chứng minh được tính khả thi của các hướng dẫn trong thực tế, nhưng lập luận rằng bản thân sự cố đã cho thấy hệ thống phòng vệ không hoàn thành nhiệm vụ ngăn mô hình tương tác với yêu cầu nguy hiểm. Công ty cũng cảnh báo một Kimi K2.6 bị jailbreak có thể chạy mã trên tài nguyên tính toán của chính nó và kết nối internet, tạo ra đầu cầu tiềm tàng cho các cuộc tấn công mạng.

Moonshot cho biết các đánh giá nội bộ trước đó nhìn chung cho thấy “tỷ lệ từ chối cao đối với loại yêu cầu này”, qua đó làm lộ khoảng cách giữa hình thức kiểm thử định kỳ trong nhà và phương pháp tấn công đối nghịch mà các nhà nghiên cứu bên ngoài áp dụng.

Giáo sư Alan Woodward tại Đại học Surrey nhận định với BBC rằng mô hình nguồn mở tiềm ẩn nguy cơ bị lạm dụng khi rơi vào tay tác nhân độc hại, dù cùng những công cụ đó cũng có thể phục vụ mục đích phòng thủ an ninh mạng.

Ông cho rằng khuôn khổ quản lý khó có thể theo kịp tốc độ phát triển AI và việc thực thi nên tập trung mạnh hơn vào những cá nhân, tổ chức lạm dụng hệ thống, thay vì chỉ nhắm vào bản thân công nghệ.

Mối lo ngại rộng hơn còn đi trước thử nghiệm này: các mô hình Kimi của Moonshot là mô hình “open‑weight”, cho phép người dùng tự triển khai trên hạ tầng riêng. Trong khi đó, một số sự cố an ninh AI gần đây cũng liên quan đến hệ thống agent của OpenAI, Meta và Anthropic. Sự kết hợp này đang thúc đẩy cộng đồng nghiên cứu chuyển trọng tâm từ việc mô hình có chịu từ chối yêu cầu hay không sang câu hỏi: điều gì xảy ra khi các hệ thống mạnh được trao bộ công cụ, quyền truy cập internet và khả năng tự thực thi chuỗi hành động nhiều bước.

Đọc tiếp: Altcoin chiếm 41% open interest hợp đồng tương lai, khối lượng giao ngay gấp 4 lần Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev chuyên về các bài Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và các lực tác động lớn định hình thị trường crypto, từ kỷ nguyên AI và các công nghệ bảo mật đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ tương tự và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Lỗ hổng jailbreak Kimi cho phép 2 mô hình AI trả lời câu hỏi về vũ khí sinh học | Yellow