Moonshot AI đang rà soát lại hai mô hình Kimi sau khi các nhà nghiên cứu của Mindgard vượt qua lớp bảo vệ an toàn và lấy được hướng dẫn liên quan tới vũ khí sinh học và ám sát.
Các điểm chính:
- Mindgard cho biết Kimi K2.6 và K3 Swarm có thể bị đẩy vượt qua cơ chế an toàn thông qua jailbreak.
- Nhóm nghiên cứu không chứng minh được các câu trả lời độc hại đó khả thi ngoài đời thực.
- Moonshot nói đang xem xét kết quả và trao đổi trực tiếp với Mindgard.
Kết quả jailbreak Kimi
BBC đưa tin Mindgard đã phát hiện hồi tháng 7 rằng Kimi K2.6 và K3 Swarm có thể bị vượt rào qua “jailbreaking” – kỹ thuật dùng chuỗi gợi ý có cấu trúc để kiểm tra liệu mô hình có phớt lờ quy tắc an toàn do nhà phát triển đặt ra hay không. Theo Mindgard, các lớp kiểm soát này lẽ ra phải chặn mọi thảo luận về các chủ đề nhạy cảm như vậy.
Nhà sáng lập Peter Garraghan nói với BBC rằng một khi jailbreak thành công, các mô hình gần như sẵn sàng bàn luận về bất kỳ chủ đề nào và thậm chí tự đưa thêm gợi ý gây hại mà không cần bị “kích” thêm.
Moonshot nói với BBC rằng hãng hoan nghênh đóng góp từ bên thứ ba “như một trụ cột then chốt để xây dựng AI tốt hơn và an toàn hơn” và cho biết đang trao đổi trực tiếp với Mindgard về các phát hiện này. Mindgard nói họ đã email cho Moonshot ngày 27/7, nhắc lại sau đó khoảng một tuần và công bố báo cáo ngày 12/9.
Đọc thêm: Ripple hỗ trợ CSD Brazil BR Mirror ghi nhận sở hữu quỹ trên blockchain công khai
Rủi ro an toàn theo đánh giá của Mindgard
Mindgard chưa chứng minh được các hướng dẫn mà Kimi đưa ra thực sự khả thi về mặt kỹ thuật, song lập luận rằng bản thân việc mô hình sẵn sàng tương tác với các yêu cầu nguy hiểm đã cho thấy sự thất bại của cơ chế bảo vệ. Công ty cũng cảnh báo một phiên bản Kimi K2.6 bị jailbreak có thể thực thi mã trên tài nguyên tính toán được cấp và kết nối Internet, từ đó trở thành bàn đạp tiềm tàng cho các cuộc tấn công mạng.
Moonshot cho biết các bài đánh giá nội bộ “ghi nhận tỷ lệ từ chối cao với các loại yêu cầu này”, qua đó phơi bày khoảng cách đáng kể giữa thử nghiệm thường kỳ và phương pháp tấn công đối kháng mà bên ngoài sử dụng.
Giáo sư Alan Woodward của Đại học Surrey nói với BBC rằng mô hình mã nguồn mở tiềm ẩn rủi ro bị lạm dụng khi rơi vào tay tác nhân độc hại, dù cùng những công cụ đó cũng có thể hỗ trợ mạnh mẽ cho phòng thủ mạng.
Ông cho rằng khung pháp lý khó theo kịp tốc độ phát triển của AI, vì vậy thực thi nên tập trung nhiều hơn vào việc xử lý những người lạm dụng hệ thống.
Mối lo ngại rộng hơn đã xuất hiện từ trước thử nghiệm này: các mô hình Kimi của Moonshot là “open‑weight”, cho phép người dùng triển khai trên hạ tầng riêng, trong khi một loạt sự cố an ninh AI gần đây cũng liên quan tới hệ thống tác tử (agent) của OpenAI, Meta và Anthropic. Sự kết hợp đó khiến giới nghiên cứu chuyển trọng tâm từ việc mô hình có từ chối yêu cầu nguy hiểm hay không, sang câu hỏi lớn hơn: điều gì xảy ra khi các hệ thống mạnh được cấp công cụ, kết nối Internet và quyền tự hành động qua nhiều bước.
Bài tiếp theo: Altcoin chiếm 41% open interest hợp đồng tương lai, khối lượng spot gấp 4 lần Bitcoin

