Lỗ hổng jailbreak Kimi cho phép 2 mô hình AI trả lời câu hỏi về vũ khí sinh học

Alexey Bondarev
Alexey Bondarev45 phút trước
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI đang rà soát lại hai mô hình Kimi sau khi các nhà nghiên cứu của Mindgard vượt qua lớp bảo vệ an toàn và lấy được hướng dẫn liên quan tới vũ khí sinh học và ám sát.

Các điểm chính:

  • Mindgard cho biết Kimi K2.6 và K3 Swarm có thể bị đẩy vượt qua cơ chế an toàn thông qua jailbreak.
  • Nhóm nghiên cứu không chứng minh được các câu trả lời độc hại đó khả thi ngoài đời thực.
  • Moonshot nói đang xem xét kết quả và trao đổi trực tiếp với Mindgard.

Kết quả jailbreak Kimi

BBC đưa tin Mindgard đã phát hiện hồi tháng 7 rằng Kimi K2.6 và K3 Swarm có thể bị vượt rào qua “jailbreaking” – kỹ thuật dùng chuỗi gợi ý có cấu trúc để kiểm tra liệu mô hình có phớt lờ quy tắc an toàn do nhà phát triển đặt ra hay không. Theo Mindgard, các lớp kiểm soát này lẽ ra phải chặn mọi thảo luận về các chủ đề nhạy cảm như vậy.

Nhà sáng lập Peter Garraghan nói với BBC rằng một khi jailbreak thành công, các mô hình gần như sẵn sàng bàn luận về bất kỳ chủ đề nào và thậm chí tự đưa thêm gợi ý gây hại mà không cần bị “kích” thêm.

Moonshot nói với BBC rằng hãng hoan nghênh đóng góp từ bên thứ ba “như một trụ cột then chốt để xây dựng AI tốt hơn và an toàn hơn” và cho biết đang trao đổi trực tiếp với Mindgard về các phát hiện này. Mindgard nói họ đã email cho Moonshot ngày 27/7, nhắc lại sau đó khoảng một tuần và công bố báo cáo ngày 12/9.

Đọc thêm: Ripple hỗ trợ CSD Brazil BR Mirror ghi nhận sở hữu quỹ trên blockchain công khai

Rủi ro an toàn theo đánh giá của Mindgard

Mindgard chưa chứng minh được các hướng dẫn mà Kimi đưa ra thực sự khả thi về mặt kỹ thuật, song lập luận rằng bản thân việc mô hình sẵn sàng tương tác với các yêu cầu nguy hiểm đã cho thấy sự thất bại của cơ chế bảo vệ. Công ty cũng cảnh báo một phiên bản Kimi K2.6 bị jailbreak có thể thực thi mã trên tài nguyên tính toán được cấp và kết nối Internet, từ đó trở thành bàn đạp tiềm tàng cho các cuộc tấn công mạng.

Moonshot cho biết các bài đánh giá nội bộ “ghi nhận tỷ lệ từ chối cao với các loại yêu cầu này”, qua đó phơi bày khoảng cách đáng kể giữa thử nghiệm thường kỳ và phương pháp tấn công đối kháng mà bên ngoài sử dụng.

Giáo sư Alan Woodward của Đại học Surrey nói với BBC rằng mô hình mã nguồn mở tiềm ẩn rủi ro bị lạm dụng khi rơi vào tay tác nhân độc hại, dù cùng những công cụ đó cũng có thể hỗ trợ mạnh mẽ cho phòng thủ mạng.

Ông cho rằng khung pháp lý khó theo kịp tốc độ phát triển của AI, vì vậy thực thi nên tập trung nhiều hơn vào việc xử lý những người lạm dụng hệ thống.

Mối lo ngại rộng hơn đã xuất hiện từ trước thử nghiệm này: các mô hình Kimi của Moonshot là “open‑weight”, cho phép người dùng triển khai trên hạ tầng riêng, trong khi một loạt sự cố an ninh AI gần đây cũng liên quan tới hệ thống tác tử (agent) của OpenAI, Meta và Anthropic. Sự kết hợp đó khiến giới nghiên cứu chuyển trọng tâm từ việc mô hình có từ chối yêu cầu nguy hiểm hay không, sang câu hỏi lớn hơn: điều gì xảy ra khi các hệ thống mạnh được cấp công cụ, kết nối Internet và quyền tự hành động qua nhiều bước.

Bài tiếp theo: Altcoin chiếm 41% open interest hợp đồng tương lai, khối lượng spot gấp 4 lần Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực tiền mã hóa trong 10 năm qua. Anh chuyên về các bài Nghiên cứu chuyên sâu và Học hỏi, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình thị trường crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ tương tự và đang nỗ lực làm việc để biến điều đó thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Lỗ hổng jailbreak Kimi cho phép 2 mô hình AI trả lời câu hỏi về vũ khí sinh học | Yellow