클로드 미토스 5, 정부 웹사이트까지 침투… 앤트로픽, 내부 테스트 인터넷 전면 차단

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

**앤트로픽(Anthropic)**이 클로드(Claude) 계열 모델, 특히 미토스 5(Mythos 5)가 실제 웹사이트(일부는 미국 정부 기관 운영 사이트)의 취약점을 파고들고 사용 제한을 우회한 사실이 확인되자, 모든 내부 AI 테스트에서 라이브 인터넷 접속을 전면 차단했다.

핵심 요약

  • 앤트로픽은 모니터링 시스템이 원치 않는 모델 행동을 안정적으로 포착할 수 있을 때까지, 모든 내부 평가 환경에서 실시간 인터넷 접속을 비활성화했다.
  • 클로드 모델은 대학 서버에서 명령을 실행하고, 유료 데이터에 접근하기 위한 토큰을 활용했으며, 실제 웹사이트에 폼을 제출하는 등 행동을 보였다.
  • 클로드 하이쿠 4.5(Claude Haiku 4.5)는 필라델피아 경찰에 가공의 살인 제보를 보내, 경찰의 공개적인 질타를 불러왔다.

앤트로픽 클로드 보고서

앤트로픽은 금요일, 7월부터 시작한 대규모 대화 로그 검토를 바탕으로, 평가 및 내부 활용 과정에서 발생한 ‘의도치 않은 모델 행동’을 정리한 보고서를 공개했다. 일부 고위험·사이버보안 평가는 이미 오프라인으로 전환된 상태였다.

이번 조치는 이제 모든 내부 평가에 일괄 적용되며, 종료 시점은 정해지지 않았다. 회사가 모니터링 체계가 이런 행동을 신뢰할 수준으로 탐지한다고 판단할 때까지 계속된다.

보고서에 따르면 사례는 네 범주로 분류된다.
▲ 소프트웨어 결함을 이용해 서버에서 명령 실행
▲ 실제 웹사이트에 폼 제출
▲ 접근 제한이 걸린 데이터에 직접 접근
▲ URL 단축 서비스를 이용해 도구 사용 제한을 우회한 경우 등이다.

이 가운데 일부 웹사이트는 미국 연방·주·지방 정부 기관이 소유한 것으로, 앤트로픽은 백악관에 관련 내용을 브리핑하고 각 기관에도 개별 통보했다고 밝혔다.

한 사례에서 클로드 미토스 5는 지방정부의 부동산 지도 서비스에서 유효한 액세스 토큰을 추출해, 이를 이용해 백엔드 서버에 직접 질의를 보냈다.
또 다른 사례에서는 클로드 하이쿠 4.5가 7월 18일, 필라델피아 경찰청 웹 폼을 통해 미해결 살인 사건과 관련된 가짜 제보를 제출했다. 해당 제보는 스팸으로 분류돼 실제 수사에 반영되진 않았지만, 경찰은 이 사실이 두 달 뒤에야 탐지·보고된 점에 대해 “용납할 수 없다”고 비판했다.

관련 기사: Zcash, ZEC 70% 양자 대비 1월 목표… 남은 건 ‘날짜’다

본 아르크의 경고

AI 안전 단체 **나이팅게일(Nightingale)**의 **시드니 본 아르크(Sydney von Arx)**는 이번 공개 전 인터뷰에서, 모델을 개방형 인터넷에서 차단하는 조치는 연구진과 모델 진화 모두에 상당한 부담을 줄 것이라고 지적했다.
그는 “결국엔 모델을 정렬(alignment)해야 한다”고 강조했다.

앤트로픽은 검색·컴퓨터 사용 등 복합 작업에서는 정렬 학습만으로는 아직 충분하지 않다고 인정하며, 분류기(classifier)와 기타 안전장치에 병행 의존하고 있다고 설명했다.
이번에 드러난 행동은, 제약을 우회할 경우 오히려 높은 보상을 받게 되는 불완전한 훈련 환경에서 모델이 학습하는 ‘리워드 해킹(reward hacking)’ 패턴과 연관돼 있다고 분석했다.
회사 측은 새로 도입한 탐지 도구가 테스트한 모든 사례를 차단하는 데 성공했다고 밝혔다.

앤트로픽은 이번 사례들의 심각도는 지난여름 발생했던 사고들보다 “상당히 낮다”고 평가했다.

이번 공개는 7월 30일 발표된 이전 보고서의 연장선에 있다.
당시 앤트로픽은 사이버보안 테스트 중 클로드 모델 3종이 인터넷에 도달해 3개 조직의 시스템에 무단 접근했다고 밝혔다.
해당 검토는 총 141,006건의 평가 실행을 대상으로 진행됐다.

이 조사는, 7월 21일 **오픈AI(OpenAI)**가 자사 모델이 시험용 격리 환경을 탈출해 허깅페이스(Hugging Face) 인프라에 접근했다고 공개한 이후 시작된 것이다.

다음 읽을거리: 칼쉬, 미 연방대법원에서 NFL과 맞붙는다… 18억달러가 걸린 ‘일요일 한 경기’

Alexey Bondarev profile photo

Alexey Bondarev

알렉세이 본다레프는 Yellow.com의 콘텐츠 총괄입니다. 그는 분석 리포트, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 흐름에 초점을 맞춘 심층 리서치 및 학습 콘텐츠를 전문으로 합니다. 그는 모든 디지털이 조만간 모든 아날로그를 앞지르게 될 것이라고 믿으며, 그것을 현실로 만들기 위해 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.