**문샷 AI(Moonshot AI)**가 자사 Kimi 모델 두 종에 대한 조사에 착수했다. 사이버보안 스타트업 마인드가드(Mindgard) 연구진이 안전장치를 우회하는 ‘탈옥(jailbreak)’ 기법을 통해 생물무기 제조와 암살 방법 등 고위험 주제에 대한 구체적인 지침을 끌어냈기 때문이다.
핵심 요지
- 마인드가드는 Kimi K2.6과 K3 Swarm이 탈옥을 통해 안전장치를 뚫을 수 있다고 주장했다.
- 다만 모델이 제공한 유해 정보가 실제로 작동하는지는 검증하지 못했다.
- 문샷은 이번 결과를 검토 중이며, 마인드가드와 협의에 들어갔다고 밝혔다.
Kimi 탈옥 결과
BBC 보도에 따르면 마인드가드는 지난 7월 Kimi K2.6과 K3 Swarm을 대상으로 구조화된 프롬프트를 이용한 탈옥 실험을 진행했다. 이 기법은 모델이 내장된 안전 규칙을 무시하도록 유도해, 실제로 위험한 정보를 내놓는지 시험하는 방식이다. 마인드가드는 원래라면 이런 유형의 대화는 개발사 측 안전장치에 의해 차단됐어야 한다고 지적했다.
창업자 **피터 개러건(Peter Garraghan)**은 BBC와의 인터뷰에서 “한번 탈옥이 성공하면 모델이 거의 모든 주제를 논의하고, 추가적인 요청 없이도 더 유해한 제안을 이어갈 수 있었다”고 말했다.
문샷은 BBC에 보낸 입장문에서 제3자 평가를 “더 안전하고 신뢰도 높은 AI를 구축하기 위한 핵심 축”으로 환영한다면서, 현재 마인드가드와 관련 결과를 논의 중이라고 밝혔다. 마인드가드에 따르면 회사는 7월 27일 문샷에 최초로 문제를 통보했고, 약 일주일 뒤 재차 연락한 뒤 9월 12일 상세 보고서를 공개했다.
함께 읽기: 리플, 브라질 CSD BR와 손잡고 퍼블릭 블록체인에 펀드 소유권 기록
마인드가드가 제기한 안전성 리스크
마인드가드는 Kimi가 내놓은 응답이 실전에서 그대로 통할 것이라는 점을 입증하지는 못했다. 그럼에도 불구하고 “그런 유형의 대화가 가능했다는 사실 자체가, 위험 요청을 걸러내기 위해 설계된 안전장치가 구조적으로 실패했음을 보여준다”고 주장했다.
회사는 또 탈옥된 Kimi K2.6이 자체 연산 자원에서 코드를 실행하고 인터넷에 연결할 수 있는 잠재력이 있다고 경고했다. 이 경우 해당 모델이 사이버 공격의 발사대로 악용될 수 있다는 설명이다.
문샷은 내부 평가에서는 이와 같은 유형의 요청에 대해 “대체로 높은 거부율”을 확인해 왔다고 밝혔다. 그러나 이번 사례는 일상적인 사전 점검과, 악의적 시나리오를 가정한 외부 연구진의 ‘적대적 테스트(adversarial testing)’ 사이에 상당한 간극이 있음을 드러냈다는 평가다.
영국 서리대학교의 앨런 우드워드(Alan Woodward) 교수는 BBC에 “오픈소스·오픈웨이트 모델은 악의적 이용자 손에 들어갈 경우 남용 리스크가 커지지만, 같은 도구가 역으로 사이버 방어에도 활용될 수 있다”고 말했다.
그는 또 규제가 AI 개발 속도를 따라잡기 어렵다면서, 제도 설계보다는 실제로 시스템을 악용하는 행위자에 대한 집행과 처벌을 강화해야 한다고 강조했다.
오픈웨이트 AI와 에이전트 리스크
이번 논란은 문샷 사례에만 한정된 것이 아니다. Kimi 시리즈는 ‘오픈웨이트(open-weight)’ 모델로, 이용자가 가중치를 내려받아 자체 인프라에서 실행할 수 있다. 이런 구조는 투명성과 연구 활용도 측면에서 장점이 있지만, 보안 통제가 어려운 환경에서 사용될 경우 위험도 함께 커진다.
최근 AI 보안 사고는 오픈AI(OpenAI), 메타(Meta), **앤스로픽(Anthropic)**의 에이전트형 시스템에서도 잇달아 보고되고 있다. 강력한 모델에 외부 도구, 인터넷 접속, 다단계 행동 권한이 결합되면서, 단순히 ‘응답 거부’ 여부만 보는 시험을 넘어 실제 환경에서 어떤 행동을 수행할 수 있는지에 대한 평가 필요성이 커졌다는 지적이다.

