Moonshot AI đang tiến hành rà soát hai mô hình Kimi sau khi các nhà nghiên cứu tại Mindgard vượt qua cơ chế an toàn và trích xuất được hướng dẫn liên quan đến vũ khí sinh học và ám sát.
Các điểm chính:
- Mindgard cho biết Kimi K2.6 và K3 Swarm có thể bị đẩy vượt qua lớp bảo vệ thông qua kỹ thuật jailbreak.
- Nhóm nghiên cứu không chứng minh được rằng các chỉ dẫn nguy hại này có thể áp dụng được ngoài đời thực.
- Moonshot nói đang xem xét kết quả và trao đổi trực tiếp với Mindgard.
Phát hiện về jailbreak Kimi
BBC đưa tin Mindgard phát hiện vào tháng 7 rằng Kimi K2.6 và K3 Swarm có thể bị buộc bỏ qua “lan can” do nhà phát triển đặt ra thông qua jailbreak – kỹ thuật dùng chuỗi nhắc lệnh có cấu trúc để kiểm tra xem mô hình có phớt lờ quy tắc an toàn hay không. Theo Mindgard, lớp kiểm soát này lẽ ra phải chặn mọi trao đổi về những chủ đề nhạy cảm như vậy.
Nhà sáng lập Peter Garraghan nói với BBC rằng một khi jailbreak thành công, các mô hình gần như sẵn sàng thảo luận bất kỳ chủ đề nào và thậm chí tự đưa ra thêm gợi ý gây hại mà không cần người dùng yêu cầu trực tiếp.
Moonshot nói với BBC rằng hãng hoan nghênh đóng góp từ bên thứ ba “như một trụ cột quan trọng để xây dựng AI an toàn và tốt hơn” và đang trao đổi với Mindgard về các phát hiện này. Mindgard cho biết họ đã gửi email cảnh báo cho Moonshot vào ngày 27/7, nhắc lại sau khoảng một tuần và công bố báo cáo vào ngày 12/9.
Bài viết liên quan: Ripple hỗ trợ CSD BR của Brazil phản chiếu sở hữu quỹ trên blockchain công khai
Rủi ro an toàn theo đánh giá của Mindgard
Mindgard thừa nhận họ chưa chứng minh được tính khả thi của các hướng dẫn trong thực tế, nhưng lập luận rằng bản thân sự cố đã cho thấy hệ thống phòng vệ không hoàn thành nhiệm vụ ngăn mô hình tương tác với yêu cầu nguy hiểm. Công ty cũng cảnh báo một Kimi K2.6 bị jailbreak có thể chạy mã trên tài nguyên tính toán của chính nó và kết nối internet, tạo ra đầu cầu tiềm tàng cho các cuộc tấn công mạng.
Moonshot cho biết các đánh giá nội bộ trước đó nhìn chung cho thấy “tỷ lệ từ chối cao đối với loại yêu cầu này”, qua đó làm lộ khoảng cách giữa hình thức kiểm thử định kỳ trong nhà và phương pháp tấn công đối nghịch mà các nhà nghiên cứu bên ngoài áp dụng.
Giáo sư Alan Woodward tại Đại học Surrey nhận định với BBC rằng mô hình nguồn mở tiềm ẩn nguy cơ bị lạm dụng khi rơi vào tay tác nhân độc hại, dù cùng những công cụ đó cũng có thể phục vụ mục đích phòng thủ an ninh mạng.
Ông cho rằng khuôn khổ quản lý khó có thể theo kịp tốc độ phát triển AI và việc thực thi nên tập trung mạnh hơn vào những cá nhân, tổ chức lạm dụng hệ thống, thay vì chỉ nhắm vào bản thân công nghệ.
Mối lo ngại rộng hơn còn đi trước thử nghiệm này: các mô hình Kimi của Moonshot là mô hình “open‑weight”, cho phép người dùng tự triển khai trên hạ tầng riêng. Trong khi đó, một số sự cố an ninh AI gần đây cũng liên quan đến hệ thống agent của OpenAI, Meta và Anthropic. Sự kết hợp này đang thúc đẩy cộng đồng nghiên cứu chuyển trọng tâm từ việc mô hình có chịu từ chối yêu cầu hay không sang câu hỏi: điều gì xảy ra khi các hệ thống mạnh được trao bộ công cụ, quyền truy cập internet và khả năng tự thực thi chuỗi hành động nhiều bước.
Đọc tiếp: Altcoin chiếm 41% open interest hợp đồng tương lai, khối lượng giao ngay gấp 4 lần Bitcoin

