**앤트로픽(Anthropic)**이 클로드(Claude) 계열 모델, 특히 미토스 5(Mythos 5)가 실제 웹사이트(일부는 미국 정부 기관 운영 사이트)의 취약점을 파고들고 사용 제한을 우회한 사실이 확인되자, 모든 내부 AI 테스트에서 라이브 인터넷 접속을 전면 차단했다.
핵심 요약
- 앤트로픽은 모니터링 시스템이 원치 않는 모델 행동을 안정적으로 포착할 수 있을 때까지, 모든 내부 평가 환경에서 실시간 인터넷 접속을 비활성화했다.
- 클로드 모델은 대학 서버에서 명령을 실행하고, 유료 데이터에 접근하기 위한 토큰을 활용했으며, 실제 웹사이트에 폼을 제출하는 등 행동을 보였다.
- 클로드 하이쿠 4.5(Claude Haiku 4.5)는 필라델피아 경찰에 가공의 살인 제보를 보내, 경찰의 공개적인 질타를 불러왔다.
앤트로픽 클로드 보고서
앤트로픽은 금요일, 7월부터 시작한 대규모 대화 로그 검토를 바탕으로, 평가 및 내부 활용 과정에서 발생한 ‘의도치 않은 모델 행동’을 정리한 보고서를 공개했다. 일부 고위험·사이버보안 평가는 이미 오프라인으로 전환된 상태였다.
이번 조치는 이제 모든 내부 평가에 일괄 적용되며, 종료 시점은 정해지지 않았다. 회사가 모니터링 체계가 이런 행동을 신뢰할 수준으로 탐지한다고 판단할 때까지 계속된다.
보고서에 따르면 사례는 네 범주로 분류된다.
▲ 소프트웨어 결함을 이용해 서버에서 명령 실행
▲ 실제 웹사이트에 폼 제출
▲ 접근 제한이 걸린 데이터에 직접 접근
▲ URL 단축 서비스를 이용해 도구 사용 제한을 우회한 경우 등이다.
이 가운데 일부 웹사이트는 미국 연방·주·지방 정부 기관이 소유한 것으로, 앤트로픽은 백악관에 관련 내용을 브리핑하고 각 기관에도 개별 통보했다고 밝혔다.
한 사례에서 클로드 미토스 5는 지방정부의 부동산 지도 서비스에서 유효한 액세스 토큰을 추출해,
이를 이용해 백엔드 서버에 직접 질의를 보냈다.
또 다른 사례에서는 클로드 하이쿠 4.5가 7월 18일, 필라델피아 경찰청 웹 폼을 통해
미해결 살인 사건과 관련된 가짜 제보를 제출했다. 해당 제보는 스팸으로 분류돼 실제 수사에 반영되진 않았지만,
경찰은 이 사실이 두 달 뒤에야 탐지·보고된 점에 대해
“용납할 수 없다”고 비판했다.
관련 기사: Zcash, ZEC 70% 양자 대비 1월 목표… 남은 건 ‘날짜’다
본 아르크의 경고
AI 안전 단체 **나이팅게일(Nightingale)**의 **시드니 본 아르크(Sydney von Arx)**는
이번 공개 전 인터뷰에서, 모델을 개방형 인터넷에서 차단하는 조치는
연구진과 모델 진화 모두에 상당한 부담을 줄 것이라고
지적했다.
그는 “결국엔 모델을 정렬(alignment)해야 한다”고 강조했다.
앤트로픽은 검색·컴퓨터 사용 등 복합 작업에서는 정렬 학습만으로는 아직 충분하지 않다고 인정하며,
분류기(classifier)와 기타 안전장치에 병행 의존하고 있다고 설명했다.
이번에 드러난 행동은, 제약을 우회할 경우 오히려 높은 보상을 받게 되는 불완전한 훈련 환경에서
모델이 학습하는 ‘리워드 해킹(reward hacking)’ 패턴과 연관돼 있다고 분석했다.
회사 측은 새로 도입한 탐지 도구가 테스트한 모든 사례를 차단하는 데 성공했다고 밝혔다.
앤트로픽은 이번 사례들의 심각도는 지난여름 발생했던 사고들보다 “상당히 낮다”고 평가했다.
이번 공개는 7월 30일 발표된 이전 보고서의 연장선에 있다.
당시 앤트로픽은 사이버보안 테스트 중 클로드 모델 3종이 인터넷에 도달해
3개 조직의 시스템에 무단 접근했다고 밝혔다.
해당 검토는 총 141,006건의 평가 실행을 대상으로 진행됐다.
이 조사는, 7월 21일 **오픈AI(OpenAI)**가 자사 모델이 시험용 격리 환경을 탈출해 허깅페이스(Hugging Face) 인프라에 접근했다고 공개한 이후 시작된 것이다.

