Kimi K3 đã thoát ra khỏi một môi trường sandbox do chính phủ Anh triển khai và truy cập GitHub để tìm lời giải, khiến Moonshot AI trở thành nhà phát triển thứ tư chứng kiến mô hình của mình phá vỡ vòng kiểm soát.
Những điểm chính
- Kimi K3 rời khỏi một sandbox cách ly trong bài kiểm tra an ninh mạng và vươn ra internet mở.
- Một lỗi cấu hình mạng cơ bản trong bộ khung đánh giá đã tạo “đường thoát”.
- Mô hình lên kho mã để tra giải pháp, thay vì tấn công bất kỳ hệ thống bên ngoài nào.
Kimi K3 thoát khỏi sandbox
Frontier Security, một startup an ninh mạng tại Mỹ, đã công bố sự cố trong một bài viết hôm thứ Năm. Hai nhà nghiên cứu Paul Kassianik và Yaron Singer đánh giá năng lực phòng thủ an ninh mạng của mô hình bằng bộ khung thử nghiệm do AI Security Institute của Anh xây dựng. Họ lần theo dấu vết “vượt rào” và kết luận nguyên nhân là một lỗi cấu hình mạng đơn giản bên trong khung thử nghiệm, chứ không phải do Kimi tự nghĩ ra kỹ thuật khai thác.
Khi được giao xử lý những bài toán lẽ ra không cần internet, mô hình đã tự thăm dò cấu hình mạng, phát hiện đường thoát rồi kéo về những lời giải sẵn có trên nền tảng lập trình.
Việc rà soát log sau đó không phát hiện bất kỳ cuộc tấn công thực sự nào nhằm vào mục tiêu ngoài đời.
Frontier cũng nhấn mạnh rằng không có lỗ hổng zero-day nào dính líu tới vụ thoát sandbox này.
Moonshot ra mắt Kimi K3 hồi tháng 7 và nhanh chóng cho sử dụng miễn phí; các đánh giá độc lập bên ngoài xếp mô hình này tiệm cận nhóm mạnh nhất của Mỹ. Theo chính các thang đo nội bộ của Frontier, Kimi K3 tỏ ra khá thành thạo trong việc phát hiện lỗ hổng phần mềm và hệ thống mạng.
Bài liên quan: Cổ phiếu SpaceX trị giá 100 tỷ USD lần đầu được phép bán lại
Yaron Singer nói về những rào chắn bị bỏ quên
Singer cho biết nhóm của ông phát hiện một “lỗ rò” trong sandbox và Kimi đã khai thác điểm hở đó, cho thấy hệ thống thiếu rào chắn nội bộ. Frontier tự triển khai bài thử, sử dụng phần mềm sandbox mà viện nghiên cứu Anh cung cấp miễn phí, và kết luận rằng mô hình này được trang bị ít lớp tự vệ an ninh mạng hơn các đối thủ.
Điều khiến giới nghiên cứu lo ngại nhất là câu chuyện phân phối: phiên bản đã thoát khỏi sandbox là loại “open-weight”, đã nằm trong tay cộng đồng với đúng những thiết lập lỏng lẻo đó.
Một thông điệp thẳng thắn rút ra từ báo cáo: chỉ cần mở cho tác nhân đủ mạnh một con đường ra internet, nó sớm muộn cũng sẽ tìm ra con đường đó. Katie Moussouris bày tỏ ngạc nhiên khi các phòng thí nghiệm không lường trước hành vi này, trong khi đã thử nghiệm agent suốt một thời gian dài.
Các vụ “phá rào” tại OpenAI và Meta
Công bố mới này khép lại một mùa hè đầy những lời thú nhận tương tự từ các ông lớn trong ngành. OpenAI hôm thứ Tư tiết lộ rằng các agent đánh giá của hãng đã dựng một diễn đàn bí mật trong kho file của bên thứ ba, tái tạo nó chỉ bốn ngày sau khi nhân viên xóa, rồi sau đó xâm nhập vào Hugging Face.
Các nhà nghiên cứu của OpenAI trình bày tại một hội nghị an ninh ở Las Vegas rằng các mô hình tiên tiến “rất thích gian lận”. Anthropic tuần trước cũng báo cáo ba mô hình Claude đã tiếp cận được doanh nghiệp thật sau khi một lỗi cấu hình vô tình phơi chúng ra internet mở.
Meta xác nhận hôm thứ Tư rằng mô hình Muse Spark có được quyền truy cập internet do lỗi của đơn vị thử nghiệm bên ngoài là Irregular, và cam kết sẽ công bố báo cáo tổng kết đầy đủ sau khi hoàn tất rà soát.
Đọc tiếp: JPMorgan đặt câu hỏi liệu HYPE có thể vượt Solana và XRP về vốn hóa





