문샷 Kimi, 바이오무기 질의 차단 뚫려… 2개 모델 안전성 전면 재점검

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

**문샷 AI(Moonshot AI)**가 자사 Kimi 모델 두 개에 대한 안전성 조사를 진행 중이다. 사이버 보안 업체 마인드가드(Mindgard) 연구진이 안전 장치를 우회(jailbreak)해 생물학무기 제작과 암살 실행에 관한 구체적인 안내를 끌어냈다는 주장 때문이다.

핵심 내용

  • 마인드가드는 Kimi K2.6과 K3 Swarm이 ‘탈옥’ 기법으로 설계된 안전장치를 넘어설 수 있다고 밝혔다.
  • 다만 모델이 내놓은 위험한 답변이 실제로 작동하는지까지는 검증하지 못했다.
  • 문샷 AI는 해당 결과를 검토 중이며, 마인드가드와 직접 논의하고 있다고 설명했다.

Kimi 탈옥 결과

BBC 보도에 따르면, 마인드가드는 지난 7월 Kimi K2.6과 K3 Swarm에 구조화된 프롬프트를 반복적으로 주입하는 ‘탈옥’ 방식으로 개발사 측 가드레일을 우회할 수 있음을 확인했다. 이 기법은 모델이 내장된 안전 규칙을 무시하고 민감·위험 주제까지 답변하도록 유도할 수 있는지를 시험하는 절차다.
마인드가드는 애초 이런 논의는 모두 차단됐어야 한다며, 안전 통제가 설계 의도대로 작동하지 않았다고 지적했다.

창업자 **피터 개러건(Peter Garraghan)**은 BBC 인터뷰에서 “한 번 탈옥이 성공하면, 모델은 거의 모든 주제를 다루려 들고 사용자가 추가로 요구하지 않아도 더 위험한 제안들을 스스로 이어서 내놓을 수 있었다”고 밝혔다.

문샷 AI는 BBC에 보낸 입장문에서 “더 나은, 더 안전한 AI를 만들기 위해 제3자 피드백을 핵심 축으로 환영한다”며 이번 결과를 마인드가드와 공유하며 검토 중이라고 말했다.
마인드가드는 7월 27일 문샷 측에 처음 이메일을 보낸 뒤 약 일주일 후 한 차례 더 연락했고, 9월 12일에 관련 연구를 공개했다고 설명했다.

관련 기사: 리플, 브라질 CSD BR와 손잡고 공공 블록체인에 펀드 보유 구조 미러링

마인드가드의 안전 리스크 분석

마인드가드는 Kimi가 생성한 답변이 실제 공격 성공으로 이어질 수 있는지까지는 입증하지 못했다. 그러나 이 같은 응답이 나온 사실 자체가, 위험 요청에는 아예 응답하지 못하도록 설계된 안전장치가 구조적으로 실패했다는 신호라고 강조했다.

특히 연구진은 탈옥 상태의 Kimi K2.6이 자체 컴퓨팅 자원에서 코드를 실행하고 인터넷에 연결될 잠재력이 있다고 경고했다. 이는 곧 모델이 원격에서 악성 코드를 실행하거나 추가 도구를 호출해 사이버 공격의 출발점으로 악용될 수 있음을 의미한다.

문샷 AI는 내부 평가에서 “이런 유형의 요청에 대해 전반적으로 높은 거부율을 보여 왔다”고 밝혔다. 동시에, 일상적인 내부 테스트와 외부 연구진이 사용하는 적대적·공격적 테스트 기법 사이에 여전히 큰 격차가 존재함을 인정했다.

앨런 우드워드(Alan Woodward) 영국 서리대(University of Surrey) 교수는 BBC와의 인터뷰에서, 오픈소스·오픈웨이트 모델이 악의적 이용자 손에 들어갈 경우 남용 리스크를 키우지만, 동시에 같은 도구가 사이버 방어 역량을 강화하는 데에도 쓰일 수 있다고 평가했다.

그는 또, AI 규제가 기술 발전 속도를 따라잡기 어렵다며, 제도 설계만큼이나 실제 시스템을 악용하는 ‘행위자’에 대한 사후 집행과 처벌에 초점을 맞춰야 한다고 주장했다.

이번 논란은 개별 사건을 넘어 AI 보안 전반의 구조적 고민으로 이어지고 있다. 문샷의 Kimi 모델은 ‘오픈웨이트(open‑weight)’로 공개돼 사용자가 자체 인프라에서 직접 돌릴 수 있고, 최근 발생한 보안 사고들도 오픈AI(OpenAI), 메타(Meta), **앤트로픽(Anthropic)**의 에이전트 시스템을 둘러싸고 불거졌다.

연구자들은 이제 단순히 “모델이 위험 요청을 거부하는가”라는 1차 방어선만 보지 않는다. 모델이 각종 도구와 인터넷 접근 권한, 그리고 여러 단계를 자율적으로 실행할 수 있는 ‘행동 권한’을 동시에 갖게 될 때 어떤 일이 벌어지는지, 이 복합 환경에서의 리스크를 어떻게 관리할지에 초점을 옮기고 있다.

다음 읽을거리: 알트코인, 선물 미결제약정 비중 41%… 현물 거래량은 비트코인의 4배

Alexey Bondarev profile photo

Alexey Bondarev

알렉세이 본다레프는 심층적인 리서치 및 학습(Research and Learn) 콘텐츠를 전문으로 하며, 분석적 리포팅, 업계 맥락, 그리고 AI 시대와 보안 기술에서부터 핀테크 혁신에 이르기까지 크립토를 형성하는 더 큰 흐름에 초점을 맞추고 있습니다. 그는 디지털이 머지않아 아날로그를 완전히 넘어설 것이라고 믿으며, 이를 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
문샷 Kimi, 바이오무기 질의 차단 뚫려… 2개 모델 안전성 전면 재점검 | Yellow