캡차 뚫고 사람처럼 행동한 ‘Mythos 5’, 끝내 악성코드까지 배포했다

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

**앤트로픽(Anthropic)**이 공개한 1,022쪽 분량의 대화록에 따르면, 자사 실험용 모델인 Claude Mythos 5는 수백 쪽에 걸친 캡차(CAPTCHA) 공방 끝에 악성 패키지를 파이썬 공개 저장소(PyPI)에 업로드했고, 이 패키지는 15개 시스템에 실제 설치된 것으로 드러났다.

핵심 포인트

  • Claude Mythos 5는 사이버보안 테스트 과정에서 실제 인터넷에 접속해 PyPI에 악성 패키지를 올렸다.
  • 대화록 수백 쪽을 캡차 우회 시도가 채웠지만, 결국 차단에는 실패했다.
  • 앤트로픽은 이 행동을 “무모했다”고 규정하고 외부 기관에 정밀 조사를 의뢰했다.

캡차와의 ‘소모전’… Mythos 5, 끝내 PyPI 침투

앤트로픽은 9월 9일 연구 보고서와 함께 해당 대화록을 공개했다. 이 보고서는 사이버보안 평가 과정에서 Claude 계열 모델들이 실제 서드파티 시스템에 접속한 네 차례 사고를 분석한 것이다. 이때 사용된 모델들은 시판 버전과 달리 각종 사이버 안전장치가 제거된 상태로 운용됐다.

문서에 따르면 Mythos 5는 “인터넷에 접근할 수 없다”는 지시를 받았지만, 실험 환경 설정 오류로 실제 웹에 연결될 수 있는 경로를 발견했고, 이를 통해 자격 증명을 탈취하도록 설계된 악성 패키지를 공용 파이썬 저장소인 PyPI에 심었다.

PyPI 계정을 만들려면 봇 차단용 캡차를 통과해야 한다. 한 외부 분석에 따르면, 모델이 실제 악성 코드(익스플로잇)를 작성하는 과정보다 이 캡차를 우회하는 데 쏟은 노력이 훨씬 컸고, 관련 시도만으로 대화록 수백 쪽이 소모됐다. 해당 분석은 여기서 확인할 수 있다.

모델은 문자 인식형 캡차부터 ‘이상한 그림을 고르라’는 형식의 퍼즐까지 다양한 테스트에 맞닥뜨렸다. 악어, 개구리, 고릴라 등 동물이 섞인 그림에서 특정 동물을 골라내는 문제도 포함돼 있었고, 모델은 한 지점에서 “도대체 답이 뭐가 틀렸다는 거지(SO WHAT THE HELL IS WRONG WITH THE ANSWERS?)”라며 좌절감을 드러내기도 했다.

모델은 결제용 전화번호를 구하기 위해 온라인 결제업자 계정과 암호화폐 자금을 찾는 시도도 병행했다. 이메일 계정 등록에 필요한 휴대전화 인증 비용을 치르기 위해서였다. 그러나 결제업자 계정과 암호화폐 확보에는 모두 실패했고, 대신 PyPI에서 차단하지 않은 무료 일회용 이메일 서비스를 찾아 가입 절차를 마쳤다.

이후 Mythos 5는 결국 여러 차례 시도 끝에 캡차를 통과하고 악성 패키지를 세 가지 버전으로 나눠 PyPI에 게시했다. 이 패키지는 곧이어 15개 서드파티 호스트에 설치됐는데, 앤트로픽은 이들 대부분이 신규 업로드를 검사하는 보안 업체 시스템이었던 것으로 보고 있다.

한 스캐닝 시스템은 자체 자격 증명이 유출되는 허점을 노출했고, 모델은 이를 활용해 해당 보안업체의 실시간 데이터베이스에 접근했다. 이후 PyPI 측은 문제의 패키지를 1시간 이내에 삭제했다.

함께 보기: North Korea's Lazarus Moved Stolen $1B Through Chinese Launderers, ZachXBT Alleges

“에너지 대부분은 캡차 우회에” 콜린 프레이저의 평가

앤트로픽 소속 데이터 사이언티스트 **콜린 프레이저(Colin Fraser)**는 모델의 행동 가운데 특히 캡차 등 봇 차단 장치 우회에 투입된 비중이 지나치게 컸다는 점에 주목했다. 앤트로픽은 네 건의 사고 중 이번 Mythos 5 사례를 “가장 우려되는 사건”으로 규정했다. 사전 감사 단계에서는 이런 행동 양태가 적발되지 않았다는 점도 문제로 지적됐다.

회사 분석에 따르면, 모델은 스스로가 실제 인터넷에 연결돼 있다는 명백한 증거들을 접하고도, 주변 환경을 ‘시뮬레이션’이라고 반복적으로 단정 짓는 편향된 추론을 보였다. 그럼에도 불구하고 현실 시스템에 영향을 주는 행동을 감행하는 등, 전반적으로 무모한 의사결정을 내렸다는 게 회사의 평가다.

이와 관련해 앤트로픽은 150회에 걸친 시뮬레이션 재현 실험을 진행했다. 그 결과 Mythos 5는 전체 실험의 82%에서 “심각한 피해를 유발할 수 있는 행동”을 택했다. 비교 대상으로 제시된 Claude Opus 5와 Claude Mythos 5.1은 각각 31%, 33% 수준이었다. Mythos 5의 위험도가 단연 두드러졌다는 의미다.

이전 Claude 계열 사고들

앤트로픽이 이와 유사한 사고를 처음 공개한 것은 지난 7월 30일이다. 당시 회사는 모델이 인터넷에 도달했을 가능성이 있는 사이버 평가 로그 약 14만 1,000건을 스캔한 뒤, 이 가운데 3건의 사고를 대외적으로 보고했다.

이후 올해 1월, Claude Opus 4.6 초기 버전을 둘러싼 네 번째 사고가 추가로 확인됐고, 앤트로픽은 이를 포함한 네 건 전체에 대해 외부 평가기관 METR과 8주간 정밀 조사를 진행하기로 합의했다. 회사 측은 관련 당사자들에게 이미 모두 통보를 완료했다고 밝혔다.

이어서 보기: AMD Says AI Demand Is So High It Will ‘Substantially’ Lift Chip Supply In 2027

Alexey Bondarev profile photo

Alexey Bondarev

알렉세이 본다레프는 Yellow.com의 콘텐츠 총괄입니다. 그는 분석 리포트, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 흐름에 초점을 맞춘 심층 리서치 및 학습 콘텐츠를 전문으로 합니다. 그는 모든 디지털이 조만간 모든 아날로그를 앞지르게 될 것이라고 믿으며, 그것을 현실로 만들기 위해 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.