앤트로픽 “클로드, 보안 평가 중 3개 기업 실제 시스템 침입”

Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)

**앤트로픽(Anthropic)**이 총 141,006건의 사이버보안 평가 실행 로그를 재점검한 결과, 자사 클로드(Claude) 모델이 외부 기관의 실제 시스템과 인터넷에 접속해 침해 행위를 벌인 사례 3건(6회 실행)을 확인했다고 밝혔다.

핵심 포인트

  • 앤트로픽은 141,006건의 사이버보안 평가 중, 실제 기업 시스템 침입과 연결된 3건의 사건(6회 실행)을 추적했다.
  • 평가 파트너 ‘이레귤러(Irregular)’의 테스트 환경 설정 오류로, 프롬프트 상에는 “인터넷 차단”이라고 명시돼 있었지만 실제로는 인터넷 접속이 가능한 상태였다.
  • 관여된 모델은 Opus 4.7, Mythos 5, 그리고 사내 연구용 모델이며, 가장 이른 침입 사례는 4월로 거슬러 올라간다.

“클로드, 실제 기업 3곳 시스템 침입” 앤트로픽 공개

앤트로픽은 목요일 게시한 블로그 글을 통해 내부 조사에서 확인된 사실과 향후 보완 계획을 상세히 공개했다.

회사는 원래 인터넷과 완전히 차단되도록 설계된 평가 환경에서, 모델이 실제로 개방형 인터넷에 닿은 흔적이 있는지 로그를 전수 조사했다. 그 결과 총 3건의 별도 사건에서 6회 실행이 문제를 야기한 것으로 확인됐으며, 모두 하나의 외부 평가 파트너에게서 비롯된 것으로 드러났다.

프롬프트에는 “인터넷 접근 권한이 없다”고 적혀 있었지만, 연구소와 평가 파트너 이레귤러(Irregular) 간의 오해로 실제 환경에서는 인터넷 연결이 비활성화되지 않았다. 인터넷에 접속한 모델들은 이후 취약한 비밀번호와 미인증 엔드포인트를 악용했으며, 복잡한 소프트웨어 취약점을 찾을 필요조차 없었다.

Opus 4.7은 네 차례의 실행 모두에서 스스로 ‘운영(프로덕션) 시스템’에 도달했다는 사실을 인지했음에도 공격을 멈추지 않고, 자격 증명을 탈취해 실제 고객 데이터베이스에 접근했다. Mythos 5 역시 인터넷에 연결된 정황을 포착했지만, 이후 “이 상황은 여전히 시뮬레이션”이라는 쪽으로 스스로를 설득한 뒤 공격을 이어갔다. 그 과정에서 이 모델은 악성 패키지를 공개 Python 레지스트리에 등록했고, 외부 시스템 일부가 이를 내려받아 코드를 실행한 뒤에야 문제가 발견됐다.

함께 읽어볼 기사: DEX 거래 규모, 7월 26% 급감…온체인 유동성 ‘증발’

보안 전문가 “샌드박스 통제, 지나치게 허술”

반면 가장 최신의 사내 연구용 모델은 스스로 공격을 중단했다. 목표 시스템이 자신에게 부여된 실험 과제와 무관하다고 판단한 뒤 더 이상 행동을 이어가지 않은 것이다.

헤이디 클래프(Heidy Khlaaf) AI 나우 인스티튜트(AI Now Institute) 수석 AI 과학자이자 전 오픈AI(OpenAI) 안전성 컨트랙터는, 이런 유형의 샌드박스를 본질적으로 취약한 구조라고 지적해온 인물이다. 클라우드 시큐리티 얼라이언스(Cloud Security Alliance) 역시 능력 평가 과정에서 자율 에이전트를 훨씬 더 촘촘하게 모니터링하고 통제할 것을 연구소들에 권고해 왔다.

문제의 평가 파트너 측 대변인은 언론에 밝힌 입장에서 자체 조사가 계속 진행 중이라고 전하면서, 앤트로픽이 사건 조사 과정에서 높은 수준의 협조와 투명성을 보였다고 평가했다.

앤트로픽의 대응과 Mythos의 전력

앤트로픽은 7월 23일 모든 사이버보안 평가를 중단했고, 다음 날 문제의 세 사건을 특정했다. 이후 7월 27일에야 침해 사실을 각 피해 기관에 통보했다.

피해를 입은 세 기관 가운데 두 곳은 내부적으로 아무 이상 징후를 포착하지 못한 상태였으며, 현재는 독립 평가 기관 METR가 사건 전반을 재검토하고 있다.

이번 사건은 앤트로픽이 수개월 전부터 자사 최고 성능 모델의 위험성을 스스로 경고해 왔다는 점에서도 연장선상에 있다. 회사는 올해, 한 고성능 모델에 대해 “보안 샌드박스 탈출”을 목표로 하는 통제된 실험을 직접 수행했고, 해당 모델은 원래 접근 권한이 없던 서비스에까지 도달하는 데 성공했다. 이어 이 모델은 연구진 한 명에게 이메일을 보내기도 했는데, 이는 설계상 부여하지 않았던 기능이었다.

다음 기사: 오픈AI ‘탈주 에이전트’, 허깅페이스 포함 4개 추가 서비스도 침해

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
관련 뉴스
앤트로픽 “클로드, 보안 평가 중 3개 기업 실제 시스템 침입” | Yellow