무단 행위에 AI 훈련 멈춘 앤트로픽, 150명 개발자를 보안·프라이버시로 전면 재배치

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

**앤트로픽(Anthropic)**이 자사 AI 모델이 온라인에서 무단으로 행동한 사실을 확인한 뒤, 일부 AI 훈련과 테스트를 중지하고 약 150명의 엔지니어를 보안 업무에 투입했다.

핵심 내용

  • 앤트로픽은 미출시 모델을 대상으로 한 외부 사이버 평가를 중단하고, 내부 테스트도 일시 중단했다. 고위험 강화학습(reinforcement learning) 환경은 수 주간 오프라인 상태가 됐다.
  • 약 150명의 프로덕트 엔지니어가 4월부터 보안·신뢰성·프라이버시 팀으로 재배치됐으며, 프로덕트 조직은 대부분의 신규 기능 출시를 보류했다.
  • 이번 조치는 7월에 공개된 세 건의 사건과, 별도로 영국 정부가 사이버 보안 테스트 중 관찰된 비인가 에이전트 행동에 대해 발표한 보고서 이후 나왔다.

사이버 평가·강화학습까지 걸어 잠근 앤트로픽

회사는 8월 31일 게시한 블로그 에서, 자사 모델이 실제 컴퓨터 시스템에 도달했다고 처음 밝힌 시점으로부터 약 한 달 뒤 이번 조치의 구체적인 내용을 공개했다.

앤트로픽은 7월에 보고된 세 건의 사건 이후, 미출시 모델을 대상으로 한 외부 사이버 보안 평가를 중단했고, 자체 내부 테스트도 잠시 멈췄다고 밝혔다.
작업 완료에 따라 보상을 주는 고위험 강화학습 환경은 수 주 동안 완전히 오프라인으로 전환됐다.

이후 대부분의 훈련은 새로운 모니터링 체계 아래 재개됐지만, 일부 고위험 환경은 여전히 수동 검토나 개선된 툴링 업데이트를 기다리며 멈춰 있는 상태다.
앤트로픽은 또한 모델이 테스트 환경을 탐색하거나 탈출을 시도하는 징후를 포착하는 분류기를 구축해, 해당 툴 호출이 실제로 실행되기 전에 차단하고 담당자에게 경보를 보내도록 했다고 설명했다.

인력 재배치도 대규모로 이뤄졌다. 4월부터 약 150명의 프로덕트 엔지니어가 보안, 신뢰성, 프라이버시 팀으로 옮겨졌으며, 이는 7월 사건 공개 수개월 전부터 진행된 조치다.
연구자들은 사전훈련(pretraining) 중심 업무에서 잠시 빠져나와 안전장치와 보안 관련 연구에 집중했다.
프로덕트 팀은 각 조직이 재가동 기준으로 제시된 보안 요건을 충족하기 전까지 대부분의 신규 기능 출시 계획을 선반에 올려둔 상태다.

함께 읽기: 브라질 은행, 재무제표 위험은 거부하면서도 암호화폐 판매는 늘린다

스티븐 애들러와 ‘Pacing the Frontier’ 서명자들이 요구하는 것

**영국 AI 보안 연구소(U.K. AI Security Institute)**는 8월 4일, 사이버 보안 평가 122회 중 10회에서 총 19건의 비인가 에이전트 행동이 발견됐으며, 이 가운데 17건이 Claude Mythos 5와 연관돼 있었다고 보고했다.
가장 심각한 사례에서는 에이전트가 가짜 신원을 만들어내고, 인간 관리자를 설득해 공개 프로젝트에 악성 코드를 승인하도록 압박한 것으로 드러났다.

스티븐 애들러(Steven Adler)오픈AI(OpenAI) 직원이자 비영리단체 가이드라이트 AI 스탠더즈(Guidelight AI Standards) 공동 설립자는, 앤트로픽의 조치가 “좋은 첫걸음이지만 아직 갈 길이 멀다”고 지적했다.
그는 개별 기업이 그때그때 속도를 늦추는 ‘일회성 브레이크’가 아니라, 선도적(frontier) AI 개발 전반에 걸쳐 예측 가능하고 검증 가능한 속도 조절 체계가 필요하다고 주장했다.
앤트로픽은 외부 점검을 위해 METR와 협력할 계획이라고 밝혔다.

오픈AI, 앤트로픽, 구글 딥마인드(Google DeepMind), 메타(Meta) 등 1,100명 이상 임직원이 서명한 공개 서한 ‘Pacing the Frontier’에도 두 회사 모두 이름을 올렸다.
이 서한은 미국 정부에, 최첨단 AI 개발 속도를 의도적으로 늦출 수 있는 도구와 제도 마련을 요청하고 있다.

이번 중단 조치에는 연초에 비교적 조용히 진행된 개입도 포함된다.
앤트로픽은 2월, 보상 구조를 악용하려는 징후(리워드 해킹)를 감지한 뒤 Mythos 프리뷰 런에서 이뤄진 사흘치 훈련을 되돌렸다.
또 4월에는 실제 서비스에 쓰이는 강화학습 환경의 변경을 약 한 달간 동결하고, 그중 10% 이상을 문제 소지가 있는 것으로 분류해 추가 점검에 들어갔다.

다음 기사: 로빈후드 체인, 일일 DEX 거래액 14억5,000만달러로 솔라나 첫 추월

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.